Zero-WAM:基于人类视频的上下文世界-动作建模,用于开放任务泛化
摘要
Zero-WAM 是一个因果视频-动作模型,通过基于上下文的人类视频指导,实现对未见过任务的零样本机器人操作,并利用 HumanGen 数据集和未来块预测目标来提高泛化能力。
查看缓存全文
缓存时间: 2026/08/28 03:23
论文页面 - Zero-WAM:基于人类视频的上下文内世界-动作建模,用于开放式任务泛化
来源:https://huggingface.co/papers/2608.26103 作者:
,
,
,
,
,
,
,
,
,
,
摘要
Zero-WAM 通过将因果视频-动作模型(causal video-action model)建立在上下文内人类视频引导的条件下,结合自动生成的数据集和未来-块预测目标,实现了对未见任务的机器人操作。
零样本跨任务泛化(https://huggingface.co/papers?q=Zero-shot%20cross-task%20generalization)(即策略必须执行训练期间从未见过的操作任务)仍然是机器人学习中的一个核心挑战。在大语言模型中,新任务只需在上下文中进行指定,而无需任何参数更新即可执行。这种上下文内学习(in-context learning)(https://huggingface.co/papers?q=in-context%20learning)的形式将泛化转化为任务指定问题。为了实现跨任务泛化,我们将这一范式引入机器人操作,并主张操作的自然任务指定形式是人类视频:与语言不同,它提供了关于预期任务演变的丰富视觉线索。我们提出了 Zero-WAM,一个因果视频-动作模型(causal video-action model)(https://huggingface.co/papers?q=causal%20video-action%20model),它通过遵循上下文内人类视频引导来执行未见任务。为了解决任务丰富的配对人类-机器人数据的稀缺问题,我们提出了一种自动流水线,将任务采样的机器人轨迹转换为语义匹配的人类视频,从而生成了 HumanGen(https://huggingface.co/papers?q=HumanGen),一个包含 74.2K 个跨 8.6K 个任务的上下文内学习人类-机器人配对的数据集。在模型训练方面,我们进一步引入了上下文内未来块预测(in-context future chunk prediction)(https://huggingface.co/papers?q=in-context%20future%20chunk%20prediction)(IFP)目标,该目标抑制了从已见任务中学到的捷径,并迫使策略从视频提示中提取任务信息。在 RoboTwin 2.0 仿真中的七个未见任务上,Zero-WAM 实现了 47.0% 的平均成功率,相对于最强的视频-动作基线(video-action baseline)(https://huggingface.co/papers?q=video-action%20baseline)绝对提升了 29.5 个百分点。在真实世界评估中,它遵循人类视频引导,成功泛化到涉及多物体场景、长程操作和精细插入的未见任务配置。
查看 arXiv 页面 (https://arxiv.org/abs/2608.26103)查看 PDF (https://arxiv.org/pdf/2608.26103)项目页面 (https://robbyant-research.github.io/Zero-WAM)GitHub100 (https://github.com/robbyant-research/Zero-WAM)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.26103)
在你的代理中获取此论文:
hf papers read 2608\.26103
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.26103 以从本页面链接它。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.26103 以从本页面链接它。
引用此论文的空间0
无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2608.26103 以从本页面链接它。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页面链接它。
相似文章
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
τ_0-WM: 用于机器人操作的统一视频-动作世界模型
τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。
ZimaBlue: 通过可扩展的视频预训练进化可泛化的世界行动模型
ZimaBlue 引入了一个可扩展框架,从大规模自我中心视频中学习可泛化的世界行动模型,通过三阶段课程和慢-快架构,显著提升了零样本机器人操作能力。
ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型
ST-WAM提出了一种语义-时间世界动作模型,使用DINOv3特征作为共享语义表示,以提高视觉分布偏移下机器人操作的鲁棒性,在LIBERO上达到98.7%,在RoboTwin 2.0上达到92.8%,在零样本设置下相较于Fast-WAM有显著提升。
零样本世界模型是发展高效的学习者 [R]
研究人员引入了零样本世界模型(Zero-shot World Models, ZWM),该方法在仅使用极少数据(单个幼儿的视觉经验)且无需特定任务训练的情况下,即可达到与最先进模型相当的视觉能力。这项工作展示了通往数据效率可与人类发展学习效率匹敌的AI系统的路径。