Niantic Spatial、Flexion 和 NVIDIA:弥合人形机器人的 Sim2Real 差距
摘要
Niantic Spatial、Flexion 和 NVIDIA 展示了基于数字孪生和强化学习的人形机器人 sim2real 流程,实现了从仿真到真实办公室导航的零样本迁移。
暂无内容
查看缓存全文
缓存时间: 2026/07/22 10:25
# Niantic Spatial、Flexion 与 NVIDIA:弥合人形机器人的 Sim2Real 差距
来源:https://nianticspatial.com/blog/flexion-humanoid-real2sim-sim2real
教导人形机器人掌握移动和导航等基础技能的最可扩展方式是通过强化学习(RL)。在现实世界中运行 RL 非常困难,因为机器人没有太多试错机会。一次判断失误的跨越或与玻璃门的碰撞,代价高昂、复位缓慢,并且可能损坏硬件。因此,大多数学习过程都是在模拟中进行的。
每个公司都应该问一个问题:在机器人真正踏入部署地点之前,你如何知道在模拟中训练的策略在那里会奏效?答案是:在该地点的精确数字孪生中训练、测试和评估它,这也使得能够快速为每个新地点调整技能。
以下是愿景:团队使用标准 RGB 摄像头扫描预期的部署地点。Niantic Spatial 重建出高保真数字孪生。然后,开发者使用 NVIDIA Isaac Sim 和 Isaac Lab 开源模拟与学习框架来模拟和训练他们的机器人。Flexion 提供针对特定硬件调整的策略和部署软件,这些策略可零样本迁移到现实世界。
Niantic Spatial 和 Flexion 联合展示了这一端到端流程:一个仅使用 RGB 的局部导航策略,完全在模拟中通过高斯泼溅(Gaussian splatting)的光照渲染进行训练,并零样本迁移到真实的办公室中。结果突显了渲染的速度和质量足以在数小时内训练基于 RL 的策略,并有望在未来训练完整的垂直系统,包括推理和操作。
## 机器人必须在模拟中失败才能学习
模拟是机器人能够承担失败的地方。在强化学习中,策略通过试错来改进:采取行动、观察奖励,并在数百万次尝试中调整,其中大部分在行为可靠运行之前都是错误的。虽然真实机器人永远无法承受这些,但模拟为机器人提供了一个快速、安全且高度并行的训练环境,使得数千台虚拟机器人能够同时练习,速度超过实时,且没有任何损坏。但是,只有当这些行为能够迁移回物理世界时,模拟训练才创造真正的价值——这是 sim2real 机器人技术的核心挑战。
### 通向当今模拟优先机器人训练之路
现代用于机器人技术的强化学习依赖于 GPU 加速的模拟,这使得物理引擎和训练循环能够在数千个并行环境中扩展 [Rudin et al., 2022 (https://proceedings.mlr.press/v164/rudin22a.html)]。像 NVIDIA Isaac Sim 和 Isaac Lab 这样的平台为此类大规模机器人训练提供了核心基础设施。
在这些模拟环境中,随着传感器输入的日益丰富,机器人策略也在不断进步。早期的强化学习系统主要依赖本体感觉,利用关节反馈和接触力来穿越地形 [Lee et al., 2020 (https://www.science.org/doi/abs/10.1126/scirobotics.abc5986)]。
下一波浪潮增加了外部感知——高度扫描、深度图和激光雷达——使得策略能够在接触前预判地形。这一转变实现了在不规则地形上的稳健运动 [Miki et al., 2022 (https://www.science.org/doi/abs/10.1126/scirobotics.abk2822)]、高速敏捷机动 [Hoeller et al., 2024 (https://journals.sagepub.com/doi/abs/10.1177/02783649261455067)] 以及模拟中的端到端导航 [Yang et al., 2025 (https://journals.sagepub.com/doi/abs/10.1177/02783649251401926)]。
一个典型的大规模并行训练环境,用于从原始深度信息进行人形机器人导航。导航目标位置用红色箭头可视化。模拟完全依赖于随机化的无纹理结构。
RGB 是下一步,也是人形机器人已经配备的传感器。摄像头成本低、无处不在、视野宽广,并且隐式编码了几何和语义信息,比立体深度的硬失败情况更少。这些额外信息是扩展的潜力所在。
限制在于,这些训练世界仍然是由随机的、无纹理的几何场景构建的。这仍然是标准做法,因为深度相对容易精确模拟。但这也将机器人限制在结构轮廓中,使其对材料、语义和物体的真实身份视而不见。这就是为什么 RGB 是感知机器人策略的下一步:它使人形机器人导航系统能够同时访问几何和场景含义,前提是模拟图像足够真实,能够迁移到现实世界。
### 两部分的解决方案
**第一部分是 real2sim:** 忠实地将现实世界带入模拟器,包括世界的外观和物理行为。我们的优势是将真实地点的捕捉转化为高保真、可渲染、可模拟的副本。
**第二部分是 sim2real:** 将在那个不完美模拟环境中训练的策略,使其能够在物理机器人上稳健运行。弥合这一差距是 Flexion 的优势所在。
视觉是 real2sim 和 sim2real 中最困难的部分。历史上,深度更容易模拟,因为无论渲染还是测量,深度图像大致相似,并且其噪声可以直接建模。RGB 要求更高:颜色、光照或纹理的微小误差都可能使场景看起来完全不同,这使得逼真的模拟和稳健的策略迁移都更加困难。
那么,为什么要在重建的场景内训练 RGB 机器人策略?首先,RGB 是机器人越来越多携带的传感器。摄像头成本低、广泛可用,通常比立体深度传感器提供更宽的视野,并且 RGB 隐式编码了几何和语义。这为基于 RGB 的机器人策略提供了比仅用深度更大的扩展空间,尤其是在语义和形状同等重要的现实环境中。
其次,专精化解锁了能力。在实际部署地点的数字孪生内训练策略,使其能够适应将运行环境的视觉结构、材料和约束,从而实现通用策略难以实现的行为。
但要使 sim2real 迁移有效,训练图像必须看起来真实。在实践中,这意味着要么使用照片级逼真的合成资产,要么更直接地,使用真实场景的忠实重建。这就是重建成为 RGB 策略自然归属的原因。它也定义了两个部分的问题:构建一个足够逼真以从中学习的训练世界,以及训练一个足够稳健以从中迁移的策略。本博客的其余部分将详细阐述这两个部分,以局部导航作为具体示例:首先介绍 Niantic Spatial 构建的世界,然后介绍 Flexion 如何在其内部训练和部署一个 RGB 导航策略。
## 第一部分:Niantic Spatial 的 real2sim – 一次巡视即可构建值得训练的世界
策略的好坏取决于其学习所依据的世界提供的观察数据。要使 sim2real 迁移有效,重建的场景必须在两个方面同时忠实:既看起来像真实的地方(几何、材质、光照),又必须在物理作用下行为一致。满足这两个要求通常意味着需要照片级逼真的渲染层和用于物理的碰撞网格,而重建的质量取决于它们的一致性程度。如果渲染的墙壁和碰撞网格的墙壁相差几厘米,视觉策略就会学会穿过它看到的障碍物,或者避开实际上不存在的障碍物,并将这种错误校准带到真实机器人上。Niantic Spatial 的流程从相同的重建中导出这两个层,因此它们默认保持一致。
### 通过单次巡视捕获真实场地
几分钟的 360° 摄像头视频就足以创建一个真实部署地点的、可立即训练的数字孪生。操作员只需在空间中走一次,无需激光雷达、三脚架或专门的捕获工作流程。从该视频中,流程以公制比例重建场景,使机器人以米为单位学习距离和速度,避免了尺度误差,否则这些误差会传播到每一个动作中。
然后,相同的捕获内容成为模拟的视觉层。Niantic Spatial 估计相机姿态并训练一个 3D 高斯泼溅,提供任意视点的照片级逼真 RGB 视图,保留了捕获时真实环境的光照、材质和杂讯。这对于 RGB 机器人训练至关重要:与通用的合成资产不同,忠实的场景重建为策略提供了 sim2real 迁移所需的视觉真实感。它在运营上也具有可扩展性,因为捕获真实的仓库或办公室比手动为每个新场地构建高保真合成模型要重复性强得多。
### 从同一重建中导出几何
从同一个重建中,Niantic Spatial 还导出了物理层。不同于在单独的流程中构建几何,它使用重建本身来生成碰撞网格,包括使用 MVSAnywhere (https://nianticlabs.github.io/mvsanywhere/) 估计的深度,这是一个零样本的多视图立体模型,旨在跨域和深度范围泛化。相比单纯的光度重建,这能产生更平坦、更清洁的表面,特别是在白色墙壁和其他低纹理区域,传统的多视图方法在这些区域通常会留下空洞、噪声几何,甚至完全丢失相机姿态。
由于视觉层和碰撞网格来自相同的重建,它们默认保持对齐。模拟中机器人看到的东西和它碰撞的东西之间没有单独的交叉配准步骤,这消除了 sim2real 错误的一个主要来源。即使渲染的墙壁和碰撞网格之间存在微小的不匹配,也可能教会人形机器人滑过它看到的障碍物,或避开其实不存在的障碍物。单一重建设计最大限度地减少了这种故障模式,而不是试图在事后纠正它。
比较 NerfStudio 泼溅(左)与 Niantic Spatial 泼溅(右)。
### 导出可直接用于 NVIDIA Isaac Sim 的 USDZ
泼溅和网格被打包成一个符合 NVIDIA NuRec (https://developer.nvidia.com/omniverse/nurec) 体积规范的单一 USDZ (https://www.nianticspatial.com/blog/usdz-scaniverse),并直接加载到 NVIDIA Isaac Sim (https://developer.nvidia.com/isaac/sim) 和 Isaac Lab (https://developer.nvidia.com/isaac/lab) 中。在该工作流程中,泼溅通过 RTX 管道渲染为视觉场景,而网格则作为机器人站立和碰撞的隐形物理代理。导出的文件重力对齐、公制缩放、碰撞体就绪,因此无需手动转换、重新定向或碰撞体创建即可开始训练。
### 端到端工作流程:从 360° 捕获到可用于机器人模拟的、可训练的数字孪生
1. **捕获:** 使用市售的 360° 摄像头在真实部署地点巡视一次,收集重建所需的视觉数据。
2. **重建:** 流程估计相机姿态,训练照片级逼真的 3D 高斯泼溅,并导出一个对齐的碰撞网格,以创建环境的忠实数字孪生。
3. **导出:** 视觉泼溅和物理网格被打包成一个符合 NuRec 体积规范的 USDZ 文件,该文件重力对齐、公制缩放,并应用了碰撞体设置,准备好进行模拟。
4. **训练:** USDZ 文件直接加载到 NVIDIA Isaac Sim 和 Isaac Lab 中,在其中可用作大规模机器人模拟训练的舞台。
### 重建捕获了什么 – 以及没有捕获什么
像任何重建一样,这个重建也有其局限性,在训练之前了解这些局限性很重要。它捕获了一个时间点,因此光照、反射和物体位置都如同捕获时观察到的那样被固定下来。它也捕获了一个静态场景:人物、机器人和其他动态代理稍后会在模拟中添加。此外,其保真度取决于覆盖范围,这意味着在巡视过程中跳过的区域重建效果可能较差。然而在实践中,这些限制并未阻止在接下来的结果中实现到真实机器人的零样本迁移。
在你熟悉的场景上试试
在 Scaniverse 中捕获一个场景,运行流程,并将 USDZ 加载到 Isaac Sim。新用户使用代码 FLEXYOURSCAN 可兑换 105,000 点充值积分。
## 第二部分:Flexion 的 sim2real 配方 – 从模拟中的像素到可工作的机器人
拥有了值得训练的世界,就为广泛的机器人任务打开了大门。在本博客中,Flexion 专注于局部机器人导航:即从机器人当前位置移动到附近目标同时避开障碍物的短距离技能,且不依赖预先构建的全局地图。该策略接收机载摄像头视图、本体感觉传感器数据以及以其自身坐标系表示的目标,并输出速度命令。一个独立的、循环中的预训练移动策略将该命令转换为运动。由于策略直接根据摄像头看到的内容行动,因此模拟中的视觉真实感至关重要。如今大多数基于摄像头的机器人策略仍使用深度作为主要输入,但 Flexion 采用了不同的方法:在特定部署地点的重建内训练一个 RGB 策略,以便策略专门针对其实际运行的真实环境。
### 在数字孪生内进行大规模并行机器人训练
作为 NuRec 体积加载到 Isaac Lab 中后,重建的 RGB 渲染效率足以在单一 GPU 上的同一个数字孪生内支持大规模并行机器人训练。每个机器人从一个采样的生成姿态开始,并被分配一个随机目标姿态。然后,导航策略通过强化学习进行学习:达到目标并避开障碍物会获得奖励,而碰撞和摔倒会受到惩罚。
为了弥合 sim2real 差距,Flexion 将对模拟参数的域随机化与大规模、离线训练的图像编码器相结合,这些编码器能在真实图像上产生稳健的特征。这些编码器设计为既能在多个并行训练环境中运行,也能在部署时在机器人上运行。与训练设置相结合,可在目标地点的数字孪生内实现数百万次 rollout,为策略提供足够经验以学习特定部署地点的机器人导航行为。
以下两个视频展示了在伦敦 Niantic Spatial 办公室和苏黎世 Flexion 办公室的重建内直接训练的策略。
在 Niantic Spatial 办公室重建内的训练过程视频。机器人朝向红色的目标姿态标记导航。
在 Flexion 办公室重建内的训练过程可视化。机器人朝向红色的目标姿态标记导航。
### 在真实机器人上:重建训练的 RGB 策略零样本迁移
完全在模拟中训练的纯 RGB 策略,在真实办公室中导航至三个命令目标姿态。
该策略并非停留在模拟中。完全在重建内训练的 RGB 网络迁移到了物理机器人上,并在真实办公室中导航,能够应对场景变化,例如重新布置的家具以及与捕获世界的其他差异。在测试区域内的标称导航过程中,其性能与基于深度的策略相当,突显了仅需在模拟中训练的纯 RGB 策略能够提取成功导航所需的空间理解。
### 在模拟中比较替代方案
我们在两个不同的重建场景下对相同任务进行了模拟比较,评估了四种局部导航策略。
相似文章
Image2Sim: 通过生成式神经模拟器实现具身导航规模化
Image2Sim是一个神经模拟框架,它能从RGB-D图像创建高保真交互环境,为具身导航智能体提供可扩展的训练。该框架生成了近20K场景和超过1000万训练样本,在基准测试上展现了显著改进,并实现了有效的真实世界零样本迁移。
这个人形机器人是一名能力惊人的办公室实习生
Flexion Robotics,一家由前Nvidia研究人员创立的瑞士初创公司,开发了一种AI系统,通过结合仿真、强化学习和视频观察,训练人形机器人执行复杂的办公室任务,实现自主操作,例如取包裹和使用电梯。
无需动手,AI先行:NVIDIA XR AI 将智能体带入 AR 眼镜
NVIDIA 已公开发布 XR AI 测试版,这是一个开发者库,用于在 AR 眼镜和 XR 设备上构建多模态 AI 智能体,支持实时空间理解和企业集成。
走进 Omniverse:NVIDIA GTC 展示赋能物理智能时代的虚拟世界
NVIDIA GTC 2026 展示了物理智能领域的重大突破,包括全新前沿模型(Cosmos 3、Isaac GR00T N1.7、Alpamayo 1.5)以及用于扩展机器人、车辆和工厂部署的基础设施蓝图。本届大会重点突出了虚拟世界与数字孪生技术如何推动各行业的跨企业级物理智能落地应用。
有史以来首次,8个Codex-AutoResearch代理赋予机器人舰队生命,实现端到端成功解决物理世界任务,中间无需人工桥梁……在Nvidia Gear Lab中自我改进一部分
Nvidia Gear Lab的研究人员实现了一个里程碑:8个Codex-AutoResearch代理自主控制一支机器人舰队,在无人干预的情况下完成了一项物理世界任务,展示了自我改进的能力。