SceneBot:接触提示的通用人形全身追踪与场景交互

arXiv cs.AI 论文

摘要

SceneBot 是一个统一的运动追踪框架,通过参考运动和每连杆接触标签来指导单一的人形策略,从而实现在接触密集环境中的自由空间移动、地形穿越和全身操控。

arXiv:2606.27581v1 公告类型:交叉 摘要:当前的人形强化学习策略在自由空间运动中表现出色,但在处理接触密集任务时面临困难,因为纯运动学追踪无法解决与物体和不平坦地形交互时的物理歧义。为解决这一问题,我们提出了 SceneBot,一个统一的运动追踪框架,能够处理自由空间移动、地形穿越和全身操控。SceneBot 将单一策略同时基于参考运动和每连杆接触标签进行条件化,明确定义了预期的环境交互。为了克服缺乏标注交互数据的问题,我们提出了一种事后场景重建方法,从重定向的人体运动中推断场景交互图。基于 7.5 小时的这种重建接触密集数据进行训练后,SceneBot 成功泛化到未见过的运动和场景。我们的结果表明,SceneBot 是首个无缝统一自由空间与接触密集行为的通用框架,能执行搬箱子上楼等复杂的长期任务,并将接触条件化建立为人形控制的一个强大接口。所有代码和数据将开源。更多演示和信息请访问:https://ericcsr.github.io/scenebot/
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:29

# SceneBot:基于接触提示的通用人形全身场景交互跟踪  
来源:https://arxiv.org/html/2606.27581  
斯坦福大学 Sirui Chen,亚马逊 FAR 美国 ericcsr@stanford\.edu &Shibo Zhao 亚马逊 FAR 美国 shiboxx@amazon\.com &Zhen Wu 亚马逊 FAR 美国 zhenwuuu@amazon\.com Jiaman Li 亚马逊 FAR 美国 jiamanli@amazon\.com &Guanya Shi† 卡内基梅隆大学、亚马逊 FAR 美国 guanyas@amazon\.com &C\. Karen Liu† 斯坦福大学、亚马逊 FAR 美国 karenliu@cs\.stanford\.edu  

###### 摘要  

当前基于强化学习的人形机器人策略在自由空间运动方面表现出色,但在需要丰富接触的任务中却力不从心,因为纯运动学跟踪无法解决与物体及不平坦地形交互时的物理歧义性问题。为此,我们提出了 SceneBot,这是一种统一的运动跟踪框架,能够处理自由空间移动、地形穿越以及全身操作。SceneBot 将单个策略同时以参考运动和每连杆接触标签为条件,明确规定了预期的环境交互。为了克服缺乏带注释交互数据的难题,我们提出了一种事后场景重建方法,从重定向后的人体运动中推断出场景交互图。SceneBot 在 7.5 小时的重建接触丰富数据上进行训练,成功泛化到未见过的运动和环境。我们的结果表明,SceneBot 是第一个无缝统一自由空间和接触丰富行为的通用框架——能够执行诸如抱箱子上楼等复杂的长时域任务,并将接触条件化建立为人形机器人控制的一种强大接口。所有代码和数据将开源。更多演示和信息可访问:https://ericcsr.github.io/scenebot/  

参考图标 图 1:SceneBot 使单一运动跟踪策略能够准确完成自由形态移动、不平坦地形穿越以及物体操作。  

> 关键词:人形机器人、移动操作、从人类数据学习  

## 1 引言  

物理智能要求机器人有意地利用与世界的接触来获得支撑、进行操纵和移动。想象一下,一个家用机器人拿起篮子,在保持平衡的同时爬楼梯,然后将篮子放在洗衣机附近。完成这样一项需要丰富接触的任务,需要长时间协调与物体和地形的交互。  

最近人形机器人控制的进展一直由强化学习策略驱动,这些策略经过训练以跟踪大量参考运动。这些通用运动跟踪器可以用单个策略执行多样的自由空间行为,例如行走、跑步、跳舞和踢腿。然而,它们的成功在很大程度上局限于那些无需推理外部接触即可跟踪参考运动的环境。一旦机器人与大型物体或非平坦地形交互,仅凭运动学就会变得模糊不清。将两个手腕移到箱子两侧可能对应于伸手够向箱子、轻轻触碰它,或者施加足够的力量将其提起。同样,将脚放在楼梯边缘附近并不能保证机器人产生足够的地面反作用力来向上迈步。因此,成功执行任务不仅取决于达到期望的姿势,还取决于知道哪些身体部位应该建立、维持和利用与环境接触的力。  

我们引入了 SceneBot,这是一种接触条件化的运动跟踪框架,使得单个策略能够跟踪人形机器人的自由形态移动、地形穿越(例如楼梯)以及全身操作。SceneBot 将通用的全身策略同时以参考运动和*每连杆接触标签*为条件。参考运动指定期望的运动学行为,而接触标签则明确指示哪些身体连杆应该预期并利用来自场景不同部分的接触力。与现有的运动跟踪器相比,SceneBot 要求高层决策者提供一个额外的指令:机器人的哪些连杆应主动与场景建立接触。然而,这些标签仅定义在机器人身体上,而不是场景物体或地形上。这种设计使 SceneBot 保持为低层运动跟踪策略,仅做最小的扩展以适应场景交互,而无需变成一个基于视觉的任务策略。  

训练这样一个接触感知的控制器面临重大的数据挑战:它需要与相应的物体几何、地形几何以及接触注释配对的运动轨迹。不幸的是,同时包含运动和场景交互信息的大规模数据集十分稀缺,且可扩展的场景感知重定向仍然困难。SceneBot 通过事后场景重建解决了这个数据瓶颈。给定重定向后的机器人运动,我们推断出一个场景交互图,该图标识了哪些机器人连杆应随时间与地形或可移动物体产生接触。然后,我们重建与这些推断出的接触一致的合理地形和物体资产。这将普通的人体运动数据转化为适合训练的、富含接触的机器人-场景交互数据。  

我们证明,据我们所知,SceneBot 是第一个能够在单个策略内处理自由空间移动、不平坦地形穿越以及全身物体操作的通用运动跟踪框架。SceneBot 能够泛化到未见过的运动和未见过的环境,同时在自由空间设置中保持与最先进运动跟踪器相当的性能。我们进一步演示了需要同时进行地形和物体交互的长时域任务,例如拿起一个大箱子,搬运它,然后走上楼梯。我们的结果表明,接触条件化为将通用人形机器人运动跟踪从自由空间运动扩展到接触丰富的场景交互提供了一种有效的接口。  

## 2 相关工作  

### 2.1 通用运动跟踪  

近期基于强化学习的运动跟踪已从特定任务策略[12 (https://arxiv.org/html/2606.27581#bib.bib24),18 (https://arxiv.org/html/2606.27581#bib.bib25),8 (https://arxiv.org/html/2606.27581#bib.bib26)] 发展到能够跟踪多样轨迹的统一控制器[15 (https://arxiv.org/html/2606.27581#bib.bib9),5 (https://arxiv.org/html/2606.27581#bib.bib13),34 (https://arxiv.org/html/2606.27581#bib.bib14),28 (https://arxiv.org/html/2606.27581#bib.bib10),14 (https://arxiv.org/html/2606.27581#bib.bib7),4 (https://arxiv.org/html/2606.27581#bib.bib8)]。在大规模数据集[15 (https://arxiv.org/html/2606.27581#bib.bib9),16 (https://arxiv.org/html/2606.27581#bib.bib28)]、可扩展重定向[20 (https://arxiv.org/html/2606.27581#bib.bib27),1 (https://arxiv.org/html/2606.27581#bib.bib12)]以及 GPU 模拟器[17 (https://arxiv.org/html/2606.27581#bib.bib29),27 (https://arxiv.org/html/2606.27581#bib.bib30)]的支持下,这些通用策略作为鲁棒的低层控制器用于遥操作和视觉-语言-动作架构等下游任务[28 (https://arxiv.org/html/2606.27581#bib.bib10),29 (https://arxiv.org/html/2606.27581#bib.bib11),15 (https://arxiv.org/html/2606.27581#bib.bib9),4 (https://arxiv.org/html/2606.27581#bib.bib8)]。然而,一个关键的差距依然存在:当前流水线主要针对自由空间运动。现有数据集和重定向方法从根本上缺乏复杂人机环境交互所需的场景感知能力。  

### 2.2 地形感知的全身控制  

掌握复杂地形穿越已经从基于模型的脚印规划和模型预测控制(MPC)[6 (https://arxiv.org/html/2606.27581#bib.bib1),10 (https://arxiv.org/html/2606.27581#bib.bib2)] 转变为利用根关节速度命令和步态奖励塑造的强化学习策略[2 (https://arxiv.org/html/2606.27581#bib.bib31),32 (https://arxiv.org/html/2606.27581#bib.bib32),30 (https://arxiv.org/html/2606.27581#bib.bib3)]。诸如跑酷之类的敏捷动作已经通过场景感知重定向[26 (https://arxiv.org/html/2606.27581#bib.bib22)]、策略蒸馏[23 (https://arxiv.org/html/2606.27581#bib.bib18)]和 AMP 风格奖励[19 (https://arxiv.org/html/2606.27581#bib.bib20),37 (https://arxiv.org/html/2606.27581#bib.bib19)]得以实现。尽管取得了这些进展,大多数地形穿越策略仅依赖根关节速度控制,严重限制了它们作为用于移动操作的通用全身控制器的效用。虽然近期工作[25 (https://arxiv.org/html/2606.27581#bib.bib17),33 (https://arxiv.org/html/2606.27581#bib.bib4)]尝试通过联合训练控制器与地形感知运动学生成器来弥合这一差距,但它们对运动学生成数据的依赖显著限制了灵巧的上半身运动。  

### 2.3 人形机器人物体交互  

除了移动之外,人形机器人的物体操作大多局限于单手、轻量级的抓取放置任务[3 (https://arxiv.org/html/2606.27581#bib.bib5),15 (https://arxiv.org/html/2606.27581#bib.bib9),21 (https://arxiv.org/html/2606.27581#bib.bib6)]。对于重型物体的双手抓取,现有的阻抗控制器[4 (https://arxiv.org/html/2606.27581#bib.bib8)]仍然依赖于高层策略或人类远程操作员手动调节力。尽管近期方法利用人-物数据集[11 (https://arxiv.org/html/2606.27581#bib.bib15),13 (https://arxiv.org/html/2606.27581#bib.bib16)]实现了大型物体的单轨迹跟踪[22 (https://arxiv.org/html/2606.27581#bib.bib21),26 (https://arxiv.org/html/2606.27581#bib.bib22),24 (https://arxiv.org/html/2606.27581#bib.bib23)],但该领域缺乏一种能够零样本部署于复杂操作的通用全身控制器。为了解决这个问题,我们的工作提出了一种通用运动跟踪控制器,专为零样本部署而设计,无缝实现未见过的地形穿越和鲁棒的物体交互。  

| 跟踪单次运动 | 跟踪多样运动 | 地形交互 | 物体交互 |
|------------|------------|---------|---------|
| BeyondMimic[12 (https://arxiv.org/html/2606.27581#bib.bib24)] | ✓ | ✗ | ✗ | ✗ |
| OmniRetarget[26 (https://arxiv.org/html/2606.27581#bib.bib22)] | ✓ | ✗ | ✓ | ✓ |
| HDMI[22 (https://arxiv.org/html/2606.27581#bib.bib21)] | ✓ | ✗ | ✗ | ✓ |
| ResMimic[36 (https://arxiv.org/html/2606.27581#bib.bib34)] | ✓ | ✗ | ✗ | ✓ |
| SONIC[15 (https://arxiv.org/html/2606.27581#bib.bib9)] | ✓ | ✓ | ✗ | ✗ |
| CHIP[4 (https://arxiv.org/html/2606.27581#bib.bib8)] | ✓ | ✓ | ✗ | ✓ |
| TWIST[28 (https://arxiv.org/html/2606.27581#bib.bib10)] | ✓ | ✓ | ✗ | ✗ |
| Any2Track[34 (https://arxiv.org/html/2606.27581#bib.bib14)] | ✓ | ✓ | ✗ | ✗ |
| PHP[23 (https://arxiv.org/html/2606.27581#bib.bib18)] | ✗ | ✗ | ✓ | ✗ |
| RPL[32 (https://arxiv.org/html/2606.27581#bib.bib32)] | ✗ | ✗ | ✓ | ✗ |
| WoCoCo[31 (https://arxiv.org/html/2606.27581#bib.bib35)] | ✗ | ✗ | ✓ | ✓ |
| Gallent[2 (https://arxiv.org/html/2606.27581#bib.bib31)] | ✗ | ✗ | ✓ | ✗ |
| HikeWild[37 (https://arxiv.org/html/2606.27581#bib.bib19)] | ✗ | ✗ | ✓ | ✗ |
| SceneBot | ✓ | ✓ | ✓ | ✓ |

表 1:全身控制器对比。SceneBot 可以跟踪多样的参考运动以及接触标签,以实现不同的场景交互,例如地形交互和搬运大型物体。  

## 3 方法  

SceneBot 是一个旨在训练通用跟踪策略的框架,该策略能够实现鲁棒的地形和物体交互。如图 2 (https://arxiv.org/html/2606.27581#S3.F2) 所示,SceneBot 包含几个关键组件。训练统一的场景交互控制器需要将机器人运动与场景资产配对的成对数据。为了生成这些训练数据,我们引入了一个场景重建流水线,直接从人体运动学运动合成合理的地形和物体。利用这些重建的环境,我们通过强化学习(RL)训练一个全身控制器,以跟踪目标运动学运动以及期望的接触标签。在部署期间,该全身控制器能够成功跟踪带有接触标签的参考运动以促进场景交互,以及不带接触标签的运动以实现标准的平坦地形移动。  

参考图标 图 2:场景重建:SceneBot 使用重定向后的人体运动来重建场景资产。它首先构建机器人-场景交互图,然后重建合理的地形和物体。训练:SceneBot 通过基于接触的奖励,使用强化学习训练运动和接触跟踪策略。部署:SceneBot 依赖 SuperOdometry[35 (https://arxiv.org/html/2606.27581#bib.bib36)] 和机载 IMU 来估计根关节位置 x_root,t、方向 r_root,t 与线速度 v_root,t,使机器人能够执行复杂的场景交互,例如同时进行地形穿越和物体搬运。  

### 3.1 从人体运动生成场景  

参考图标 图 3:不同交互的场景交互图。  

为了便于训练,需要成对的机器人参考运动和合理的场景资产(例如地形和物体)。然而,大多数现有数据集仅提供人体或机器人运动学运动,缺少任何场景上下文。受 [9 (https://arxiv.org/html/2606.27581#bib.bib33)] 启发,我们直接从运动中重建场景资产。给定运动学捕捉的人体运动,场景重建模块首先使用运动学运动重定向 [1 (https://arxiv.org/html/2606.27581#bib.bib12)] 将其重定向到机器人。然后场景重建分两个阶段进行:首先,我们基于接触准则和时间一致性构建机器人-场景交互图;其次,我们以该交互图为条件生成地形和物体资产。  

场景交互图:场景交互图是一个异构图,捕捉了机器人与场景之间随时间变化的交互。如图 3 (https://arxiv.org/html/2606.27581#S3.F3) 所示,机器人的关键连杆被定义为 K ∈ {left-wrist, right-wrist, left-foot, right-foot, pelvis}。每个关键连杆对应交互图中的一个机器人节点 N_robot = {n_robot^i | i ∈ K}。另外两个场景类型节点 N_scene = {n_scene^j | j ∈ {terrain, object}} 分别代表不可移动的地形和可移动的物体。时间边 e: {t_s, {n_robot^i}, {n_scene^j}, p} 记录了机器人连杆与场景在特定空间位置 p 和时间步 t_s 处的交互。交互图最初通过向机器人运动添加候选边来构建,只要机器人连杆相对于场景节点显示出较低的速度和加速度,表明可能存在接触。随后,如果边会导致在指定交互区间外的碰撞,或者在物体交互期间违反力闭合约束,则剔除不可行的边。  

场景重建:在获得场景交互图后,根据其拓扑结构重建地形和物体。地形表示为 2.5D 高程图。对于与地形相关的每个交互边,向高程图中添加一个方形平台,其高度为 h = p_z,中心为 (p_x, p_y)。在初始地图构建之后,合并高度相近的孤立平台,并剔除会导致机器人与地形碰撞的区域。物体表示为一组平行于相应机器人接触表面的平板。补

相似文章

HumanTracker:迈向全面且与人类对齐的运动追踪基准

Hugging Face Daily Papers

HumanTracker 引入了一个大规模基准和一个称为 HumanScore 的偏好对齐指标,用于评估类人机器人运动追踪,重点关注感知质量和物理接触稳定性,以更好地预测人类偏好并识别传统运动学指标遗漏的失败情况。

ReferTrack: 先指代后追踪的具身视觉追踪方法

Hugging Face Daily Papers

ReferTrack 提出了一种用于具身视觉追踪的“先指代后追踪”范式,在 EVT-Bench 上取得了单视角成功率高达 89.4% 的最先进性能,并在腿式机器人和人形机器人上展示了强大的仿真到现实迁移能力。