GRAIL: 基于3D资产和视频先验的人形机器人运动操控生成
摘要
GRAIL利用3D资产和视频基础模型生成多样的人形机器人操作与移动数据,实现了有效的仿真到现实迁移,在真实世界中取得了高成功率。
查看缓存全文
缓存时间: 2026/06/04 03:41
论文页面 - GRAIL:利用3D资产和视频先验生成类人机器人的操作与移动数据
来源:https://huggingface.co/papers/2606.05160 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
GRAIL通过3D资产组合和视频基础模型生成多样化的类人机器人操作与移动数据,实现了有效的仿真到现实迁移,用于机器人控制。
扩展类人机器人的操作与移动能力需要跨多样物体、全身运动和场景几何的机器人兼容演示,但遥操作和动作捕捉难以规模化,因为每次采集都依赖于物理设备、穿戴装备的演员和机器人操作。我们提出GRAIL,一个全虚拟的数字生成流水线(仅在部署阶段进入现实世界):它组合3D资产、模拟器就绪场景以及来自视频基础模型(VFMs)的先验知识,无需重建物理环境或遥操作机器人即可合成交互。与从无约束的真实视频中进行重建不同,GRAIL从完全指定的3D配置出发——在视频生成之前,物体几何、相机参数、度量尺度、环境深度以及一个按机器人比例调整的角色均已知,并在重建过程中重复使用。这种特权设置更好地支撑了4D恢复,通过基于模型的物体跟踪、人体运动估计和交互感知优化,能够以更小的深度模糊性和形态不匹配来重建度量的4D人-物交互(HOI)轨迹。我们将恢复的动作重新映射到类人机器人上,并训练了互补的任务通用追踪器:一个用于操作的物体感知潜在适配器,以及一个用于地形穿越的场景感知追踪器。GRAIL生成了超过20,000个序列,涵盖拾取、物体操作、坐下和地形穿越。仅使用GRAIL生成的数据,我们通过仿真到现实流水线训练以自我为中心的视觉策略,并将其部署在Unitree G1类人机器人上,在实际世界中实现了84%的多样化物体拾取成功率和90%的爬楼梯成功率。
查看arXiv页面(https://arxiv.org/abs/2606.05160)查看PDF(https://arxiv.org/pdf/2606.05160)项目页面(https://research.nvidia.com/labs/dair/grail/)GitHub1(https://github.com/NVlabs/GRAIL)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05160)
在你的Agent中获取此论文:
hf papers read 2606\.05160
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型链接到此论文
在模型README.md中引用arxiv.org/abs/2606.05160,即可从本页链接。
引用此论文的数据集0
暂无数据集链接到此论文
在数据集README.md中引用arxiv.org/abs/2606.05160,即可从本页链接。
引用此论文的Space0
暂无Space链接到此论文
在Space README.md中引用arxiv.org/abs/2606.05160,即可从本页链接。
包含此论文的收藏0
暂无收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection),即可从本页链接。
相似文章
OASIS:从仿真数据收集到现实世界人形机器人全身操控
OASIS是一个仿真数据驱动的框架,用于人形机器人全身操控,它使用3D生成模型和分层视运动策略。通过利用仿真中的域随机化,它在零样本迁移上取得了比真实机器人训练更好的性能。
LUCID:基于想象动力学的潜在技能统一控制,用于长时域人形机器人移动操作
本文介绍了LUCID,一种用于长时域人形机器人移动操作的分层基于模型的强化学习框架。它学习可复用的潜在技能和宏动力学世界模型,通过想象展开实现高层规划,并提高模拟多物体重排任务中的成功率。
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。
人类通用抓取
一种流匹配模型可从RGB-D图像生成多样化的人类抓取动作,实现零样本机器人抓取,性能优于现有方法。该模型在大规模自我中心数据集上训练,在新基准测试中显著超越当前最先进的基线方法。
Ego2Robot:从第一人称人类数据规模化合成机器人数据
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。