Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模

Hugging Face Daily Papers 论文

摘要

Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。

我们介绍了Qwen-RobotWorld,一个用于具身智能的语言条件视频世界模型。它以自然语言作为统一动作接口,从当前观测中预测物理上合理的未来视觉轨迹,涵盖机器人操作、自动驾驶、室内导航和人机迁移。这种统一表述提供了三个有前景的应用方向:用于策略训练增强的合成数据生成、用于策略评估的可扩展虚拟环境、以及用于下游机器人控制的语言引导规划信号。这通过三部分设计实现:a) 带MLLM动作编码的双流MMDiT,其中60层双流扩散变换器通过逐层联合注意力将冻结的Qwen2.5-VL语义与视频-VAE潜变量耦合;b) 具身世界知识(EWK),一个拥有860万视频-文本语料库(超过2亿帧)的数据集,包含20多种具身形态和500多种动作类别的动作-语言映射;c) 通用+专家渐进式课程,这是一种两阶段训练策略,先学习通用视觉先验,然后在共享语言接口下注入具身专长。大量结果显示出强大竞争力:在EWMBench和DreamGen Bench上总体排名第一,在WorldModelBench和PBench上优于所有开源模型。在RoboTwin-IF基准上的额外零样本分析进一步支持了鲁棒的泛化能力和多视图一致性。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:34

论文页面 - Qwen-RobotWorld 技术报告:通过语言条件视频生成统一具身世界建模

来源:https://huggingface.co/papers/2606.17030 作者:

摘要

Qwen-RobotWorld 是一个语言条件视频世界模型,通过双流扩散Transformer和具身世界知识语料库,预测跨多个机器人领域的未来视觉轨迹。

我们提出 Qwen-RobotWorld,一个面向具身智能的语言条件视频世界模型 (https://huggingface.co/papers?q=language-conditioned%20video%20world%20model)。它以自然语言作为统一动作接口,基于当前观测,预测机器人操作、自动驾驶、室内导航以及人-机迁移等场景中物理上合理的未来视觉轨迹。这一统一范式提供了三个有前景的应用方向:用于策略训练增强的合成数据生成、用于策略评估的可扩展虚拟环境,以及用于下游机器人控制的语言引导规划信号。这是通过三个部分的设计实现的:a) 带 MLLM 动作编码 (https://huggingface.co/papers?q=MLLM%20Action%20Encoding) 的双流 MMDiT,其中 60 层双流扩散Transformer (https://huggingface.co/papers?q=double-stream%20diffusion%20transformer) 通过层级联合注意力 (https://huggingface.co/papers?q=layer-wise%20joint%20attention) 将冻结的 Qwen2.5-VL 语义与视频 VAE 潜变量 (https://huggingface.co/papers?q=video-VAE%20latents) 耦合起来;b) 具身世界知识 (https://huggingface.co/papers?q=Embodied%20World%20Knowledge) (EWK),一个 860 万条视频-文本对 (https://huggingface.co/papers?q=video-text%20corpus)(超过 2 亿帧)的语料库,涵盖 20 多种具身形态和 500 多个动作类别,并带有动作-语言映射;c) 通用+专家渐进课程 (https://huggingface.co/papers?q=Progressive%20Curriculum),一种两阶段训练策略,先学习通用视觉先验,再在共享语言接口下注入具身专长。大量结果表明其具有很强的竞争力:在 EWMBench 和 DreamGen Bench 上总体排名第一,在 WorldModelBench 和 PBench 上优于所有开源模型。在 RoboTwin-IF 基准上的额外零样本分析进一步验证了其鲁棒的泛化能力和多视图一致性。

查看 arXiv 页面 (https://arxiv.org/abs/2606.17030)查看 PDF (https://arxiv.org/pdf/2606.17030)项目页面 (https://pre.qwen.ai/blog?id=qwen-robotworld)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.17030)

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.17030 以链接到此页面。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.17030 以链接到此页面。

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.17030 以链接到此页面。

包含此论文的合集0

没有包含此论文的合集

将此论文添加到一个合集 (https://huggingface.co/new-collection) 中以链接到此页面。

相似文章

Qwen的具身世界建模 (28分钟阅读)

TLDR AI

Qwen-RobotWorld技术报告提出了一种统一的、语言条件化的视频世界模型,用于具身智能,能够从当前观测中预测未来视频,涵盖机器人、自动驾驶、导航等多个领域,并应用于合成数据生成、策略评估和规划。

Qwen-RobotManip技术报告:对齐实现机器人操控基础模型规模化

Hugging Face Daily Papers

介绍Qwen-RobotManip,一个用于机器人操控的视觉-语言-动作基础模型,通过在表征、运动和行为维度上的统一对齐实现泛化,从而能够在多样化的数据源上进行大规模训练。它在多个分布外基准测试中优于先前的最先进模型,并展现出涌现能力,如零样本指令跟随和跨本体迁移。

Qwen/Qwen-AgentWorld-35B-A3B

Hugging Face Models Trending

Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。