World-Language-Action模型:统一世界建模、语言推理与动作合成

Hugging Face Daily Papers 论文

摘要

本文介绍了World-Language-Action(WLA)模型,这是一种具身基础模型,能够从文本、图像和机器人状态中联合预测文本子任务、子目标图像和机器人动作,在模拟和真实环境中实现了最先进的多任务与长周期学习能力。

我们提出World-Language-Action(WLA)模型,作为一种新的具身基础模型类别。WLA以文本指令、图像和机器人状态为输入,联合预测文本子任务、子目标图像和机器人动作,融合了世界建模接口(如世界-动作模型WAM那样从大量第一人称视频中学习)和语言推理能力(如视觉-语言-动作VLA模型那样解决复杂长周期任务)。WLA的核心是一个自回归(AR)Transformer主干,而非WAM中的双向扩散Transformer,用于预测下一状态,该状态包含语义级的文本意图以及互补的细粒度物理动态。物理动态由基于专用World Expert的世界建模目标进行监督,并用于简化Action Expert对状态-动作相关性的刻画。WLA利用meta-queries使世界预测隐式地影响动作生成,从而在推理时可以禁用世界预测。世界预测也可以被激活,以实现测试时缩放,从而改善机器人控制。我们的WLA-0原型拥有20亿活跃参数,在NVIDIA RTX 5090上每次推理仅需40毫秒。在模拟和真实环境中的评估表明,WLA-0实现了最先进的多任务和长周期学习能力,例如在RoboTwin2.0 Clean上成功率为92.94%,在RMBench上成功率为56.5%。WLA-0还有望直接从未标注动作的跨实体机器人视频中学习新任务。
查看原文
查看缓存全文

缓存时间: 2026/06/05 06:07

论文页面 - 用于统一世界建模、语言推理与动作合成的世界-语言-动作模型

来源:https://huggingface.co/papers/2606.05979 作者:

,

,

,

,

,

,

,

,

,

,

摘要

世界-语言-动作模型通过自回归Transformer主干将文本指令处理与机器人状态预测相结合,实现了高效的长时域任务执行与跨具身学习。

我们提出世界-语言-动作(WLA)模型作为具身基础模型的新类别。WLA以文本指令、图像和机器人状态为输入,联合预测文本子任务、子目标图像和机器人动作,将世界建模接口与语言推理能力相结合,从而借助大量的自我中心视频进行学习(如同在世界-动作模型(WAM)中那样),并解决复杂的长期任务(如同在视觉-语言-动作(VLA)模型中那样)。WLA的核心是自回归(AR)Transformer主干,而非WAM中的双向扩散Transformer,用于预测下一状态,该状态包含语义层面的文本意图和互补的细粒度物理动力学。物理动力学由基于专用世界专家的世界建模目标监督,并用于简化动作专家刻画状态-动作相关性。WLA利用元查询使世界预测隐式影响动作生成,从而在推理时可禁用世界预测。世界预测也可被激活以支持测试时缩放,从而改进机器人控制。我们的WLA-0原型拥有2B活跃参数,在NVIDIA RTX 5090上每次推理仅需40毫秒。在仿真和真实环境中的评估表明,WLA-0达到了最先进的多任务与长时域学习能力,例如在RoboTwin2.0 Clean上成功率为92.94%,在RMBench上成功率为56.5%。WLA-0还有望直接从跨具身机器人视频中学习新任务,无需动作标注。

查看 arXiv 页面 (https://arxiv.org/abs/2606.05979) 查看 PDF (https://arxiv.org/pdf/2606.05979) GitHub (https://github.com/SJTU-DENG-Lab/WLA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.05979)

在您的智能体中获取此论文:

hf papers read 2606.05979

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

暂无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.05979 以链接到此页面。

引用此论文的数据集0

暂无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.05979 以链接到此页面。

引用此论文的 Space0

暂无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.05979 以链接到此页面。

包含此论文的收藏集0

暂无收藏集包含此论文

请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以链接到此页面。

相似文章

世界行动模型:具身智能的下一个前沿

Hugging Face Daily Papers

本综述论文介绍了世界行动模型(World Action Models,WAMs),这是一种将预测性状态建模与行动生成相结合的具身智能统一框架。该文提供了现有方法的分类体系,分析了数据生态系统,并概述了这一新兴范式的评估协议。

通过残差潜在动作学习基于视觉特征的世界模型

Hugging Face Daily Papers

本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。

世界-动作交互模型的DAWN

Hugging Face Daily Papers

本文介绍了DAWN,一种用于世界-动作交互模型(WAIMs)的潜在生成基线,通过递归细化联合建模场景演化与动作生成,在自动驾驶场景中实现了强大的长时域规划性能。