World Pilot: 使用世界动作先验引导视觉-语言-动作模型
摘要
World Pilot 通过融入来自世界动作模型的动态场景演变和轨迹先验来增强视觉-语言-动作模型,在操作任务上实现了最先进的零样本性能。
查看缓存全文
缓存时间: 2026/06/11 13:41
论文页面 - World Pilot:利用世界动作先验引导视觉-语言-动作模型
来源:https://huggingface.co/papers/2606.12403
摘要
World Pilot 通过将动态场景演化与轨迹先验融入世界动作模型,增强了视觉-语言-动作模型,在零样本分布外操作任务中取得了优异性能。
视觉-语言-动作(VLA)模型继承了大规模预训练带来的语义基础,并在各类分布内操作任务(https://huggingface.co/papers?q=manipulation%20tasks)上表现良好。然而,这一语义基础建立在静态图像-文本对之上,而操作是一个连续的、接触丰富的动态过程,此类预训练无法捕获其动态特性。我们提出 World Pilot,这是一个 VLA 框架,通过两条互补通路将世界动作模型(WAM)的先验融入决策链:潜在引导(https://huggingface.co/papers?q=Latent%20Steering)将感知层条件建立在场景演化潜在变量(https://huggingface.co/papers?q=scene-evolution%20latent)之上;动作引导(https://huggingface.co/papers?q=Action%20Steering)则提供一个预期轨迹(https://huggingface.co/papers?q=anticipated%20trajectory)作为运动先验(https://huggingface.co/papers?q=motion%20prior)输入动作生成器。两者结合,使 VLA 在语义条件之外,获得了场景的预期视角和轨迹级运动提示;并且,即使场景演化先验由未经动作后训练的、仅视频预训练的世界模型提供,该先验依然有效。World Pilot 在 LIBERO-Plus 零样本 OOD 基准(https://huggingface.co/papers?q=zero-shot%20OOD%20benchmark)上达到了 84.7% 的总成功率(state-of-the-art),并在四项操作任务(https://huggingface.co/papers?q=manipulation%20tasks)的所有实际机器人设置中均取得最高成功率,尤其在视角、几何、变形状态和位姿变化下的提升幅度最大。项目网站:https://world-pilot.github.io/
查看 arXiv 页面(https://arxiv.org/abs/2606.12403)查看 PDF(https://arxiv.org/pdf/2606.12403)项目页面(https://world-pilot.github.io/)GitHub9(https://github.com/ZefuLin/WorldPilot)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.12403)
在你的代理中获取此论文:
hf papers read 2606\.12403
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型 (1 个)
Chedan86/WorldPilot-LIBERO 机器人学 • 更新于约 12 小时前 • 1 (https://huggingface.co/Chedan86/WorldPilot-LIBERO)
引用本论文的数据集 (1 个)
Chedan86/WorldPilot-LIBERO-precompute 更新于约 12 小时前 • 841 • 1 (https://huggingface.co/datasets/Chedan86/WorldPilot-LIBERO-precompute)
引用本论文的 Space (0 个)
没有链接此论文的 Space
请在 Space 的 README.md 中引用 arxiv.org/abs/2606.12403,以将其链接到此页面。
包含本论文的合集 (1 个)
相似文章
AtlasVLA:视觉-语言-动作模型的持久世界-自我状态建模
AtlasVLA 引入了具有持久世界-自我状态建模的双记忆架构,以克服视觉-语言-动作模型中的感知遗忘和任务进度遗忘问题,仅通过单个腕部相机即可实现最先进的长时程操作。
WCM:一种用于视觉-语言-行动强化学习的世界评论模型
介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。
APT:动作专家预训练提升视觉-语言-动作策略的指令泛化能力
研究人员提出APT,一种两阶段训练方法,先在视觉-动作对上预训练动作专家,再整合语言条件,显著提升视觉-语言-动作策略在分布外指令上的泛化能力。
从动作到世界建模的可迁移动态先验学习
本文介绍了A2World,一种基于扩散的世界模型,在大规模机器人操作数据上预训练,以学习可迁移的动态先验。该模型可适配为真实世界模拟器(A2World-sim)用于策略评估,或视频-动作联合预测模型(A2World-policy)用于动作预测,展示了在模拟器中心和策略中心的机器人学习中的优势。
World-Language-Action模型:统一世界建模、语言推理与动作合成
本文介绍了World-Language-Action(WLA)模型,这是一种具身基础模型,能够从文本、图像和机器人状态中联合预测文本子任务、子目标图像和机器人动作,在模拟和真实环境中实现了最先进的多任务与长周期学习能力。