GRAIL: 基于3D资产和视频先验的人形机器人运动操控生成

Hugging Face Daily Papers 论文

摘要

GRAIL利用3D资产和视频基础模型生成多样的人形机器人操作与移动数据,实现了有效的仿真到现实迁移,在真实世界中取得了高成功率。

扩展人形机器人运动操控需要涵盖多样物体、全身动作和场景几何的机器人兼容演示,但遥操作和动作捕捉难以规模化,因为每次采集都依赖于物理设置、穿戴设备的演员和机器人操作。我们提出GRAIL,一个完全虚拟的数字生成管线,直到部署前都保持虚拟化:它组合3D资产、仿真就绪场景以及来自视频基础模型(VFM)的先验,以合成交互,无需重建物理环境或遥操作机器人。GRAIL并非重建无约束的野外视频,而是从完全指定的3D配置开始,其中物体几何、相机参数、度量尺度、环境深度和与机器人比例匹配的角色在视频生成前已知,并在重建过程中复用。这种特权条件更好地支持4D恢复,能够通过基于模型的物体跟踪、人体运动估计和交互感知优化,重建度量4D人-物交互(HOI)轨迹,减少深度模糊性和形态不匹配。我们将恢复的运动重定向到人形机器人,并训练互补的任务通用跟踪器:一个用于操作的物体感知潜在适配器,以及一个用于地形穿越的场景感知跟踪器。GRAIL生成超过20,000个序列,涵盖拾取、物体操作、坐下和地形穿越。仅使用GRAIL生成的数据,我们通过仿真到现实管线训练自我中心视觉策略,并将其部署在Unitree G1人形机器人上,在多样物体拾取上实现了84\%的真实世界成功率,在爬楼梯上实现了90\%的成功率。
查看原文
查看缓存全文

缓存时间: 2026/06/04 03:41

论文页面 - GRAIL:利用3D资产和视频先验生成类人机器人的操作与移动数据

来源:https://huggingface.co/papers/2606.05160 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

GRAIL通过3D资产组合和视频基础模型生成多样化的类人机器人操作与移动数据,实现了有效的仿真到现实迁移,用于机器人控制。

扩展类人机器人的操作与移动能力需要跨多样物体、全身运动和场景几何的机器人兼容演示,但遥操作和动作捕捉难以规模化,因为每次采集都依赖于物理设备、穿戴装备的演员和机器人操作。我们提出GRAIL,一个全虚拟的数字生成流水线(仅在部署阶段进入现实世界):它组合3D资产、模拟器就绪场景以及来自视频基础模型(VFMs)的先验知识,无需重建物理环境或遥操作机器人即可合成交互。与从无约束的真实视频中进行重建不同,GRAIL从完全指定的3D配置出发——在视频生成之前,物体几何、相机参数、度量尺度、环境深度以及一个按机器人比例调整的角色均已知,并在重建过程中重复使用。这种特权设置更好地支撑了4D恢复,通过基于模型的物体跟踪、人体运动估计和交互感知优化,能够以更小的深度模糊性和形态不匹配来重建度量的4D人-物交互(HOI)轨迹。我们将恢复的动作重新映射到类人机器人上,并训练了互补的任务通用追踪器:一个用于操作的物体感知潜在适配器,以及一个用于地形穿越的场景感知追踪器。GRAIL生成了超过20,000个序列,涵盖拾取、物体操作、坐下和地形穿越。仅使用GRAIL生成的数据,我们通过仿真到现实流水线训练以自我为中心的视觉策略,并将其部署在Unitree G1类人机器人上,在实际世界中实现了84%的多样化物体拾取成功率和90%的爬楼梯成功率。

查看arXiv页面(https://arxiv.org/abs/2606.05160)查看PDF(https://arxiv.org/pdf/2606.05160)项目页面(https://research.nvidia.com/labs/dair/grail/)GitHub1(https://github.com/NVlabs/GRAIL)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05160)

在你的Agent中获取此论文:

hf papers read 2606\.05160

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接到此论文

在模型README.md中引用arxiv.org/abs/2606.05160,即可从本页链接。

引用此论文的数据集0

暂无数据集链接到此论文

在数据集README.md中引用arxiv.org/abs/2606.05160,即可从本页链接。

引用此论文的Space0

暂无Space链接到此论文

在Space README.md中引用arxiv.org/abs/2606.05160,即可从本页链接。

包含此论文的收藏0

暂无收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection),即可从本页链接。

相似文章

人类通用抓取

Hugging Face Daily Papers

一种流匹配模型可从RGB-D图像生成多样化的人类抓取动作,实现零样本机器人抓取,性能优于现有方法。该模型在大规模自我中心数据集上训练,在新基准测试中显著超越当前最先进的基线方法。

Ego2Robot:从第一人称人类数据规模化合成机器人数据

Hugging Face Daily Papers

Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。