RynnWorld-4D: 面向机器人操作的4D具身世界模型

Hugging Face Daily Papers 论文

摘要

RynnWorld-4D是一个生成式世界模型,它通过统一的扩散过程,从单张RGB-D图像和语言指令中联合生成未来的RGB、深度和光流,通过逆动力学策略学习实现高效的机器人操作。该模型在真实世界的双手操作任务上达到了最先进水平。

开放世界中的机器人操作不仅需要识别场景外观,还需要预测其三维结构在交互中如何运动。我们认为,同步的RGB、深度和光流(即RGB-DF)提供了一种物理上有依据的表示,能够捕捉场景的底层4D动态。与二维像素视频相比,这种多模态协同将视觉外观与几何结构和时域运动对齐,创建了一个更接近机器人系统所需的低级末端执行器动作的表示空间,从而缩小了世界预测与策略学习之间的差距。基于这一见解,我们提出了RynnWorld-4D,这是一个生成式模型,通过统一的扩散过程,从单张RGB-D图像和一条语言指令中联合生成未来的RGB帧、深度图和光流。该4D世界模型采用三分支架构,集成了跨模态注意力与逐帧3D旋转位置编码(RoPE),确保外观、几何和运动一致性演化。为了大规模提供训练数据,我们整理了一个包含超过2.544亿帧的大规模数据集Rynn4DDataset 1.0,涵盖第一人称视角的人类和机器人操作视频,并配有高质量深度和光流伪标签。此外,我们提出了RynnWorld-4D-Policy,这是一个逆动力学头,通过单次前向传播消耗RynnWorld-4D的内部4D表示,绕过昂贵的多步去噪过程,以闭环方式输出机器人动作。实验表明,RynnWorld-4D能够生成时空一致的4D预测,而RynnWorld-4D-Policy在真实世界的灵巧双手操作任务上达到了最先进性能,特别是在需要空间精度和时间协调的任务中表现出色。
查看原文
查看缓存全文

缓存时间: 2026/07/08 02:47

论文页面 - RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

来源:https://huggingface.co/papers/2607.06559

摘要

多模态4D世界模型能够从单张RGB-D图像和语言指令中同步生成RGB、深度图和光流数据,通过统一的扩散过程和逆动力学策略学习,实现高效的机器人操作。

开放世界中的机器人操作不仅需要识别场景的外观,还需要预测其三维结构在交互下如何运动。我们认为,同步的RGB、深度图和光流(即RGB-DF,RGB-深度-光流)提供了一种物理上有依据的表征,能够捕捉场景底层的4D动态。与2D像素视频相比,这种多模态协同将视觉外观与几何结构和时间运动对齐,创造了一个更接近机器人系统所需低级末端执行器动作的表征空间,从而缩小了世界预测与策略学习之间的差距。基于这一洞察,我们提出了RynnWorld-4D,这是一个生成模型,能够在统一的扩散过程中,从单张RGB-D图像和一条语言指令协同生成未来的RGB帧、深度图和光流。该4D世界模型采用三分支架构,结合了跨模态注意力与逐帧3D RoPE,确保外观、几何和运动的一致性演化。为了提供大规模训练数据,我们精心构建了Rynn4DDataset 1.0,这是一个包含超过2.544亿帧的大规模数据集,涵盖以自我为中心的人类和机器人操作视频,并带有高质量的深度图和光流伪标签。我们进一步提出了RynnWorld-4D-Policy,这是一个逆动力学头,能够通过单次前向传播消耗RynnWorld-4D的内部4D表征,绕过昂贵的多步去噪过程,以闭环方式输出机器人动作。实验表明,RynnWorld-4D能够产生时空一致的4D预测,并且RynnWorld-4D-Policy在真实世界的灵巧双手操作任务中达到了最先进的性能,特别是在需要空间精度和时间协调的任务中表现突出。

查看arXiv页面 (https://arxiv.org/abs/2607.06559)查看PDF (https://arxiv.org/pdf/2607.06559)项目页面 (https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io/)GitHub11 (https://github.com/alibaba-damo-academy/RynnWorld-4D)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.06559)

在您的智能体中获取此论文:

hf papers read 2607.06559

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型的README.md中引用arxiv.org/abs/2607.06559,即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2607.06559,即可从此页面链接。

引用此论文的Space0

没有Space链接此论文

在Space的README.md中引用arxiv.org/abs/2607.06559,即可从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection)中,即可从此页面链接。

相似文章

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模

Hugging Face Daily Papers

Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。