RynnWorld-4D: 面向机器人操作的4D具身世界模型
摘要
RynnWorld-4D是一个生成式世界模型,它通过统一的扩散过程,从单张RGB-D图像和语言指令中联合生成未来的RGB、深度和光流,通过逆动力学策略学习实现高效的机器人操作。该模型在真实世界的双手操作任务上达到了最先进水平。
查看缓存全文
缓存时间: 2026/07/08 02:47
论文页面 - RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
来源:https://huggingface.co/papers/2607.06559
摘要
多模态4D世界模型能够从单张RGB-D图像和语言指令中同步生成RGB、深度图和光流数据,通过统一的扩散过程和逆动力学策略学习,实现高效的机器人操作。
开放世界中的机器人操作不仅需要识别场景的外观,还需要预测其三维结构在交互下如何运动。我们认为,同步的RGB、深度图和光流(即RGB-DF,RGB-深度-光流)提供了一种物理上有依据的表征,能够捕捉场景底层的4D动态。与2D像素视频相比,这种多模态协同将视觉外观与几何结构和时间运动对齐,创造了一个更接近机器人系统所需低级末端执行器动作的表征空间,从而缩小了世界预测与策略学习之间的差距。基于这一洞察,我们提出了RynnWorld-4D,这是一个生成模型,能够在统一的扩散过程中,从单张RGB-D图像和一条语言指令协同生成未来的RGB帧、深度图和光流。该4D世界模型采用三分支架构,结合了跨模态注意力与逐帧3D RoPE,确保外观、几何和运动的一致性演化。为了提供大规模训练数据,我们精心构建了Rynn4DDataset 1.0,这是一个包含超过2.544亿帧的大规模数据集,涵盖以自我为中心的人类和机器人操作视频,并带有高质量的深度图和光流伪标签。我们进一步提出了RynnWorld-4D-Policy,这是一个逆动力学头,能够通过单次前向传播消耗RynnWorld-4D的内部4D表征,绕过昂贵的多步去噪过程,以闭环方式输出机器人动作。实验表明,RynnWorld-4D能够产生时空一致的4D预测,并且RynnWorld-4D-Policy在真实世界的灵巧双手操作任务中达到了最先进的性能,特别是在需要空间精度和时间协调的任务中表现突出。
查看arXiv页面 (https://arxiv.org/abs/2607.06559)查看PDF (https://arxiv.org/pdf/2607.06559)项目页面 (https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io/)GitHub11 (https://github.com/alibaba-damo-academy/RynnWorld-4D)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.06559)
在您的智能体中获取此论文:
hf papers read 2607.06559
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型的README.md中引用arxiv.org/abs/2607.06559,即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2607.06559,即可从此页面链接。
引用此论文的Space0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2607.06559,即可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection)中,即可从此页面链接。
相似文章
RynnWorld-Teleop:一种用于数字遥操作的动作条件世界模型
介绍使用动作条件世界模型进行数字遥操作,为机器人技术生成多样化训练数据,将数据收集与物理硬件解耦。该系统实现实时生成,并支持零样本Sim2Real迁移。
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模
Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。
RynnBrain 1.1:迈向更强大、更具泛化能力的具身基础模型
RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。
PAIWorld: 面向机器人操作的三维一致世界基础模型
PAIWorld 通过几何感知和跨视图注意力机制增强扩散变换器世界模型,提升机器人操作任务中的多视图三维一致性,在基准测试上达到最优结果。
DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型
DreamX-Phi 1.0 是一个面向机器人操作的动作条件视频世界模型,利用几何注意力编码、深度估计和蒸馏来预测未来的观察结果,在 WorldArena 2.0 挑战赛中取得了顶尖成绩。