IMPACT:注意力是可扩展交互感知世界模型训练的交互图

arXiv cs.AI 论文

摘要

IMPACT是一个可扩展的框架,用于训练交互感知世界模型,通过使用交叉注意力作为内部交互图来重新加权去噪监督,在无需外部表示或推理时更改的情况下提升性能。

arXiv:2609.00161v1 公告类型:新 摘要:世界模型在具身智能体的行动条件未来预测方面取得了显著进展,但在建模物理上合理的交互时仍然面临挑战。现有方法通过使用编码运动、几何或语义的外部表示来约束生成过程,从而解决这一局限性。获取这些时空密集的表示通常需要辅助估计器或手动标注,限制了训练的可扩展性。相反,我们重新审视训练目标,并在全局平均均方误差(MSE)去噪目标下识别出监督分配不匹配问题:普遍存在的静态内容主导了优化信号,导致对交互生成至关重要的稀疏动态对象区域受到不成比例的欠监督。基于这一观察,我们引入了IMPACT,一个可扩展的交互感知模型训练框架,具有先验引导的注意力校准和定位。IMPACT使用与操纵对象令牌相关的交叉注意力作为行动条件变化的内部时空先验。它从该先验中采样候选区域,使用分离的局部预测误差进行校准以构建交互图,并使用该图重新加权去噪监督,既不需要外部表示,也不需要推理时修改。在机械臂和人手操作上的广泛实验,涵盖多种控制模态和DiT骨干,表明IMPACT始终优于相应的MSE训练基线,提升了交互保真度、物理合理性和视觉质量。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:57

# 注意力:可扩展交互感知世界模型训练的交互映射

来源:https://arxiv.org/html/2609.00161  
\aaai@corrmultitrue

唐荣泽1,2, 方建杰3, 王昭璐3, 王梓悠3, 刘旭远3, 苏海生4, 张鑫4, 吴巍4, 高陈2,3\corresponding, 李勇3, 陈志博1,2\corresponding

###### 摘要

世界模型在面向具身智能体的条件动作未来预测方面已取得显著进展,但在建模物理上合理的交互方面仍面临挑战。现有方法通过施加外部表征(编码运动、几何或语义)来约束生成过程以解决此局限性。获取这些时空密集的表征通常需要辅助估计器或人工标注,限制了训练的可扩展性。我们转而重新审视训练目标,并发现在全局平均均方误差(MSE)去噪目标下存在**监督分配失衡**:普遍存在的静态内容主导了优化信号,而对交互生成至关重要的稀疏动态物体区域则被不成比例地监督不足。受此观察启发,我们提出了**IMPACT**——一个具有先验引导注意力校准与目标定向的可扩展交互感知模型训练框架。IMPACT使用与被操作物体标记相关联的交叉注意力作为动作条件变化的内部时空先验。它从该先验中采样候选区域,利用分离的局部预测误差对其进行校准以构建交互映射,并使用该映射重新加权去噪监督,既不需要外部表征,也不需要在推理时进行修改。在机器人手臂和人手操作上的大量实验,涵盖多种控制模态和DiT骨干网络,表明IMPACT一致优于相应的MSE训练基线,提升了交互保真度、物理合理性和视觉质量。

1 中国科学技术大学  
2 中关村学院  
3 清华大学  
4 Manifold AI

[email protected], [email protected]

[项目页面](https://embodiedcity.github.io/IMPACT/)  
[代码](https://github.com/EmbodiedCity/IMPACT.code)

图 1:IMPACT 概览。(a) 现有方法依赖于昂贵且不可扩展的外部密集表征。(b) 使用均匀平均 MSE 的标准世界模型训练遭受监督分配失衡之苦,对稀疏的交互区域监督不足。(c) IMPACT 使用预测误差校准物体条件交叉注意力,生成交互映射,以实现高效且可扩展的交互目标定向训练。

## 引言

世界模型在预测未来观测和支持具身模拟方面已取得显著进展 (Zhang et al. 2026a; Kim et al. 2026; Fang et al. 2026b)。基于大规模预训练视频生成骨干网络 (Yang et al. 2024; Kong et al. 2024; Wan Team et al. 2025; NVIDIA et al. 2025),它们可以模拟环境在指令动作下的演变,在交互式环境中生成动作响应 (AlayaWorld Team et al. 2026; Hu et al. 2026; Fang et al. 2026a) 以及机器人操作任务 (Zhang et al. 2026a; Bi et al. 2026; Zhang et al. 2026b)。它们想象的未来为长期规划 (Wang et al. 2026a; Gao et al. 2025)、策略学习 (Hu et al. 2025; Zhen et al. 2025; Su et al. 2026) 和策略评估 (Shang et al. 2026; Zhu et al. 2025) 提供了可扩展的经验。在此角色中,世界模型应超越视觉连贯性,模拟物理上合理的交互,但仍然遭受物体变形、运动不连续、动作耦合弱和接触不一致等问题 (Zhang et al. 2026b)。如图 1a 所示,现有方法通常通过利用交互动力学的外部表征来约束生成,以解决这些失败。基于运动的方法使用光流或点轨迹来描述物体动力学 (Gao et al. 2025; Zhang et al. 2026b),基于几何的方法则引入深度、表面法线、重建的场景或关节式手部网格 (Zhen et al. 2025; Kim et al. 2026)。然而,通过辅助估计器或人工标注获取这些时空密集的表征成本高昂,且由此产生的监督受限于这些外部信号的准确性,限制了训练的可扩展性和可实现的交互质量。

我们转而重新审视视频世界模型的标准训练目标,并识别出一个**监督分配失衡**,如图 1b 所示。这种全局平均均方误差(MSE)去噪目标继承自通用视频生成,均匀加权所有时空位置 (Po et al. 2025; Zhu et al. 2025; Kim et al. 2026)。在均匀加权下,每个区域根据其空间范围而非功能重要性对优化做出贡献。因此,普遍存在的静态内容主导了训练信号,而携带动作条件变化的稀疏动态物体区域则被不成比例地监督不足。结果是,模型可能降低了全局去噪损失并生成视觉连贯的视频,却让交互区域得不到充分优化。

我们的关键洞察是,基于大规模预训练视频生成骨干网络构建的世界模型已经包含了交互区域的时空先验。对于操作指令,交叉注意力将语言标记与时空视频表示对齐,使得与被操作物体标记相关联的注意力地图可作为可能经历动作条件变化区域的时空先验。这个细化的先验为重新加权去噪监督提供了自然基础,允许稀疏的交互区域根据其功能重要性(而非空间范围)对梯度优化做出贡献,从而改善交互生成。因为这个先验是从模型的标准前向传播中获得的,它不需要外部的密集表征,可以随训练数据轻易扩展,并且不改变推理过程。

基于此洞察,我们提出了 **IMPACT**——一个具有**先验引导注意力校准与目标定向**的可扩展**交互感知模型训练框架**。如图 1c 所示,核心思想是将物体条件交叉注意力视为交互先验,将其转化为交互映射,并使用此映射将去噪监督重新加权到交互区域,从而缓解监督分配失衡并改善交互生成。IMPACT 通过两个互补组件在单个训练步骤中实现这一点。

在前向传播中,**注意力分布采样(ADS)** 将被操作物体标记的交叉注意力聚合为提议分布,采样多个候选区域,并使用分离的局部预测误差对每个区域进行加权,从而用模型当前的预测难度校准注意力先验,形成精确的交互映射。在反向传播中,**交互加权监督(IWS)** 使用此映射加强交互区域上的去噪监督,同时保留全局目标,并通过梯度路由使交互加权目标更新非交叉注意力的 DiT 参数,而注意力产生参数遵循全局目标,防止先验坍缩到其自身信号上。

我们在两种设置下评估 IMPACT:在 WorldArena 上的机器人手臂操作 (Shang et al. 2026) 和在 EgoDex 上的人手操作 (Hoque et al. 2025)。在这两种设置中,IMPACT 在相同骨干网络下均超越了标准均匀监督训练(MSE)以及各种基线,在多样化的具身场景和动作条件下提供了更高的交互保真度和物理合理性。

总之:
- • 我们识别了世界模型训练中的监督分配失衡,并引入了 IMPACT,一个可扩展的训练框架,它利用物体条件交叉注意力先验将去噪监督重新加权到交互区域,而无需任何外部密集表征。
- • 我们通过两个互补设计实现了 IMPACT:ADS 使用分离的局部预测误差评估物体条件注意力提议,并将这些误差转换为权重以形成交互映射;IWS 使用此映射定向去噪监督,保留全局目标,并将区域估计与区域优化解耦。
- • 我们在具有不同控制信号和 DiT 骨干网络的机器人手臂和人手操作上证明,IMPACT 一致优于均匀 MSE 训练,提升了生成视频的物理一致性和视觉质量。

## 相关工作

### 交互式视频生成与世界模型
基于大规模预训练视频生成骨干网络,包括 CogVideoX、HunyuanVideo、Wan 和 Cosmos (Yang et al. 2024; Kong et al. 2024; Wan Team et al. 2025; NVIDIA et al. 2025),近期的世界模型继承了丰富的视觉外观和时间动态表征,能够实现高保真预测和连贯的运动建模,但仅凭这些能力不足以使其成为有用的具身模拟器。为了弥合这一差距,近期工作引入了多样化的控制条件使世界模型具有交互性,包括自然语言指令 (Xiang et al. 2024; Zhang et al. 2026a; Zhao et al. 2025; Zhao et al. 2026)、游戏和相机控制 (Bruce et al. 2024; He et al. 2025)、机器人动作轨迹 (NVIDIA et al. 2025; Zhu et al. 2025),以及关节式手部或身体控制 (Wang et al. 2026b; Gao et al. 2026)。然而,这些方法主要针对整体视觉质量和可控生成,对交互动力学的约束有限,导致交互区域内出现物理上不合理的行为。

### 外部表征先验
为了解决这一局限性,近期方法引入了时空密集的表征,如光流、深度图或重建的 3D 结构,以显式地约束生成过程。基于运动的方法利用光流、点轨迹或潜在时间差异来强调动态区域 (Fang et al. 2025; Zhang et al. 2026b; Wu et al. 2026)。基于几何的方法引入深度、跨视角 3D 结构或投影的机器人运动学作为辅助目标或结构化条件 (Tian et al. 2026; Yang et al. 2026; Liu et al. 2025)。然而,构建这些表征通常需要外部的运动、深度、分割和视频理解模型,有时还需要人工验证的标注 (Fang et al. 2025; Zhang et al. 2026b; Yan et al. 2025; Luo et al. 2026)。这些预处理成本随着训练语料库的规模和时长而增长,从而限制了训练的可扩展性。

## 方法

图 2 展示了 **IMPACT** 的概览。给定一个训练样本,IMPACT 识别被操作物体标记,并使用它们的交叉注意力作为空间先验。**注意力分布采样(ADS)** 从该先验中采样候选区域,并使用分离的局部预测误差对其进行加权,构建交互映射,**交互加权监督(IWS)** 使用该映射将去噪监督定向到与交互相关的标记。梯度路由使用原始全局目标优化交叉注意力参数,使用交互加权目标优化其余 DiT 参数,而所有额外操作仅在训练时进行,不会带来推理时的开销。

图 2:IMPACT 框架。物体标记定位(左):冻结的 Qwen2.5-0.5B 从指令中提取被操作物体短语,并将其与相应的物体标记对齐。训练流程(右):在 DiT 块内,这些物体标记的交叉注意力形成提议分布(交叉注意力图),从中采样 M1,...,M8 M1,...,M8 个候选区域,并通过其分离的局部预测误差校准为交互映射。该映射将去噪监督定向到交互区域,梯度路由使用全局目标 L MSE 优化交叉注意力参数,使用交互加权目标 L IWS 优化其余 DiT 参数。

相似文章

INTACT:面向无搜索世界模型的同构意图-动作学习

Hugging Face Daily Papers

INTACT 是一个端到端的统一 JEPA,直接学习意图到动作的映射,从而实现无搜索的世界模型控制。它在四个视觉控制任务上实现了 95.33% 的直接宏观成功率,测试时零搜索,规划延迟降低约 300 倍。

TaskSense:专注于世界模型中的关键要素

arXiv cs.AI

TaskSense 提出了一种以任务为中心的世界建模框架,利用基于先前潜在状态的条件随机空间注意力以及辅助逆动力学目标,聚焦于与控制相关的区域,相比 DreamerV3,在视觉干扰下具有更强的鲁棒性。

Interdomain Attention: 超越令牌级键值记忆

arXiv cs.LG

提出了Interdomain Attention,一种通过核方法将状态空间模型集成到注意力中的新方法,实现了固定大小状态的高效长上下文建模,并在参数规模达13亿的语言建模实验中超越了SSM和softmax注意力。

World in World: 用世界模型探索世界

Hugging Face Daily Papers

本文介绍了 World in World,这是一个无需训练的接口,可以通过使用对应引导查询和基于证据的注意力指导,在冻结的自回归视频世界模型中实现灵活的相机和时间控制。