τ_0-WM: 用于机器人操作的统一视频-动作世界模型
摘要
τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。
查看缓存全文
缓存时间: 2026/06/02 15:34
论文页面 - τ₀-WM: 一种面向机器人操作的统一视频-动作世界模型
来源:https://huggingface.co/papers/2606.01027 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
一种统一的视频-动作世界模型,通过共享的视频扩散主干网络,将策略学习、视频预测和动作评估整合在一起,用于机器人操作任务。
机器人操作(https://huggingface.co/papers?q=Robotic%20manipulation)要求模型能够生成可执行的动作,同时在实际执行前预测并评估其未来后果。我们提出了 τ₀-World Model(τ₀-WM),这是一个统一的视频-动作世界模型,将策略学习(https://huggingface.co/papers?q=policy%20learning)、视频预测(https://huggingface.co/papers?q=video%20prediction)和动作评估(https://huggingface.co/papers?q=action%20evaluation)整合在一个统一的未来预测框架内。τ₀-WM 基于共享的视频扩散主干网络(https://huggingface.co/papers?q=video%20diffusion%20backbone),提供两种互补的接口。首先,视频动作模型(https://huggingface.co/papers?q=video%20action%20model)能够从多视角观测、语言指令和机器人状态中联合预测未来的视觉潜在表示和连续动作片段。其次,动作条件视频模拟器(https://huggingface.co/papers?q=action-conditioned%20video%20simulator)将候选动作片段展开成多视角的未来画面,并预测密集的任务进度分数。该模型在大约27,300小时的真实机器人遥操作、UMI风格交互、第一人称人类视频以及执行轨迹或失败轨迹数据上进行训练,利用模态特定的监督掩码。在推理时,τ₀-WM 使用测试时计算(https://huggingface.co/papers?q=test-time%20computation)来采样动作候选,通过重降噪一致性(https://huggingface.co/papers?q=re-denoising%20consistency)进行排序,并对低质量候选调用基于模拟器的修正。在具有挑战性的长时域和细粒度机器人操作(https://huggingface.co/papers?q=robotic%20manipulation)任务中,τ₀-WM 展示了优于其他相关基线的性能。
查看 arXiv 页面(https://arxiv.org/abs/2606.01027)查看 PDF(https://arxiv.org/pdf/2606.01027)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.01027)
在你的 Agent 中获取这篇论文:
hf papers read 2606.01027
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 0
没有模型链接到本论文
请在模型的 README.md 中引用 arxiv.org/abs/2606.01027 以从此页面链接。
引用本论文的数据集 0
没有数据集链接到本论文
请在数据集的 README.md 中引用 arxiv.org/abs/2606.01027 以从此页面链接。
引用本论文的 Spaces 0
没有 Space 链接到本论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2606.01027 以从此页面链接。
包含本论文的收藏集 0
没有收藏集包含本论文
请将本论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型
ST-WAM提出了一种语义-时间世界动作模型,使用DINOv3特征作为共享语义表示,以提高视觉分布偏移下机器人操作的鲁棒性,在LIBERO上达到98.7%,在RoboTwin 2.0上达到92.8%,在零样本设置下相较于Fast-WAM有显著提升。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
Zero-WAM:基于人类视频的上下文世界-动作建模,用于开放任务泛化
Zero-WAM 是一个因果视频-动作模型,通过基于上下文的人类视频指导,实现对未见过任务的零样本机器人操作,并利用 HumanGen 数据集和未来块预测目标来提高泛化能力。
ABot-M0.5: 统一移动与操作的世界动作模型
ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。
WEAVER:更好、更快、更长 —— 一种有效的机器人操作世界模型
WEAVER是一种用于机器人操作的多视角世界模型,通过流匹配损失实现了高保真度、一致性和效率,在策略评估、策略改进和测试时规划中表现出色,并在真实世界中取得了显著改进。