Zero-WAM:基于人类视频的上下文世界-动作建模,用于开放任务泛化

Hugging Face Daily Papers 论文

摘要

Zero-WAM 是一个因果视频-动作模型,通过基于上下文的人类视频指导,实现对未见过任务的零样本机器人操作,并利用 HumanGen 数据集和未来块预测目标来提高泛化能力。

零样本跨任务泛化,即策略必须执行训练期间从未见过的操作任务,仍然是机器人学习中的核心挑战。在大型语言模型中,只需在上下文中指定新任务,无需任何参数更新,即可执行该任务。这种形式的上下文学习(ICL)将泛化转化为任务指定的问题。为了实现跨任务泛化,我们将此范式引入机器人操作,并认为操作的自然任务指定是人类视频:与语言不同,它提供了关于预期任务演化的丰富视觉线索。我们提出 Zero-WAM,一个因果视频-动作模型,通过遵循上下文人类视频指导执行未见过的任务。为了解决任务丰富的配对人类-机器人数据的稀缺性,我们提出一个自动管道,将任务采样的机器人轨迹转换为语义匹配的人类视频,产生 HumanGen,一个包含 8.6K 个任务的 74.2K 人类-机器人 ICL 配对的数据集。对于模型训练,我们进一步引入上下文未来块预测(IFP)目标,抑制从见过的任务中学到的捷径,并强制策略从视频提示中提取任务信息。在 RoboTwin 2.0 模拟中的七个未见任务上,Zero-WAM 达到了 47.0% 的平均成功率,比最强的视频-动作基线绝对提升 29.5 个百分点。在真实世界评估中,它遵循人类视频指导泛化到涉及多对象场景、长期操作和精细插入的未见任务配置。
查看原文
查看缓存全文

缓存时间: 2026/08/28 03:23

论文页面 - Zero-WAM:基于人类视频的上下文内世界-动作建模,用于开放式任务泛化

来源:https://huggingface.co/papers/2608.26103 作者:

,

,

,

,

,

,

,

,

,

,

摘要

Zero-WAM 通过将因果视频-动作模型(causal video-action model)建立在上下文内人类视频引导的条件下,结合自动生成的数据集和未来-块预测目标,实现了对未见任务的机器人操作。

零样本跨任务泛化(https://huggingface.co/papers?q=Zero-shot%20cross-task%20generalization)(即策略必须执行训练期间从未见过的操作任务)仍然是机器人学习中的一个核心挑战。在大语言模型中,新任务只需在上下文中进行指定,而无需任何参数更新即可执行。这种上下文内学习(in-context learning)(https://huggingface.co/papers?q=in-context%20learning)的形式将泛化转化为任务指定问题。为了实现跨任务泛化,我们将这一范式引入机器人操作,并主张操作的自然任务指定形式是人类视频:与语言不同,它提供了关于预期任务演变的丰富视觉线索。我们提出了 Zero-WAM,一个因果视频-动作模型(causal video-action model)(https://huggingface.co/papers?q=causal%20video-action%20model),它通过遵循上下文内人类视频引导来执行未见任务。为了解决任务丰富的配对人类-机器人数据的稀缺问题,我们提出了一种自动流水线,将任务采样的机器人轨迹转换为语义匹配的人类视频,从而生成了 HumanGen(https://huggingface.co/papers?q=HumanGen),一个包含 74.2K 个跨 8.6K 个任务的上下文内学习人类-机器人配对的数据集。在模型训练方面,我们进一步引入了上下文内未来块预测(in-context future chunk prediction)(https://huggingface.co/papers?q=in-context%20future%20chunk%20prediction)(IFP)目标,该目标抑制了从已见任务中学到的捷径,并迫使策略从视频提示中提取任务信息。在 RoboTwin 2.0 仿真中的七个未见任务上,Zero-WAM 实现了 47.0% 的平均成功率,相对于最强的视频-动作基线(video-action baseline)(https://huggingface.co/papers?q=video-action%20baseline)绝对提升了 29.5 个百分点。在真实世界评估中,它遵循人类视频引导,成功泛化到涉及多物体场景、长程操作和精细插入的未见任务配置。

查看 arXiv 页面 (https://arxiv.org/abs/2608.26103)查看 PDF (https://arxiv.org/pdf/2608.26103)项目页面 (https://robbyant-research.github.io/Zero-WAM)GitHub100 (https://github.com/robbyant-research/Zero-WAM)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.26103)

在你的代理中获取此论文:

hf papers read 2608\.26103

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.26103 以从本页面链接它。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.26103 以从本页面链接它。

引用此论文的空间0

无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2608.26103 以从本页面链接它。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页面链接它。

相似文章

τ_0-WM: 用于机器人操作的统一视频-动作世界模型

Hugging Face Daily Papers

τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。

零样本世界模型是发展高效的学习者 [R]

Reddit r/MachineLearning

研究人员引入了零样本世界模型(Zero-shot World Models, ZWM),该方法在仅使用极少数据(单个幼儿的视觉经验)且无需特定任务训练的情况下,即可达到与最先进模型相当的视觉能力。这项工作展示了通往数据效率可与人类发展学习效率匹敌的AI系统的路径。