从被动视频到可编辑体验:面向具身智能的物理接地体验合成
摘要
介绍Pegasus,一种低资源框架,利用基于图的任务表示、分层可供性潜在空间和闭环物理验证,将人类示范视频转换为机器人可执行数据,旨在将硬件数据收集转变为可规模化的知识迁移。
arXiv:2607.26903v1 公告类型:新
摘要:具身智能的关键瓶颈不在于模型架构,而在于数据。尽管互联网上有数十亿的人类操作视频,但由于人类形态与机器人硬件之间存在具身差距,机器人无法直接从中学习。我们提出了Pegasus,一种低资源框架,通过结构化知识迁移将人类示范转换为机器人可学习的数据,从而弥合这一差距。Pegasus不依赖原始视频提示,而是构建了一种基于图的中间表示:从人类视频中提取的任务图,通过可供性图和约束图转换为用于机器人条件视频生成的机器人规划图。分层可供性潜在空间对对象状态、可供性和任务之间的关系进行建模,从而能够超越对象身份进行泛化。闭环物理验证器进一步利用运动学可行性、碰撞约束和关节限制过滤无效生成。我们在多种第一人称操作基准(包括GTEA Gaze+和EPIC-KITCHENS-100)以及多种机器人形态上评估了Pegasus,以任务正确性、可执行性、状态一致性和可学习性为指标。结果表明,Pegasus实现了可靠的跨具身转换,并表明机器人数据生成可以从硬件收集问题重新定义为一种可规模化、低资源的知识迁移问题。
查看缓存全文
缓存时间: 2026/07/31 04:01
# 从被动视频到可编辑体验:面向具身智能的物理接地经验合成
来源:https://arxiv.org/html/2607.26903
###### 摘要
具身智能的核心瓶颈不在于模型架构,而在于数据。尽管互联网上存在数十亿的人类操作视频,但由于人类形态与机器人硬件之间的具身鸿沟,机器人无法直接从中学习。我们提出 Pegasus,一个低资源框架,通过结构化知识迁移将人类演示转化为机器人可学习的数据,从而弥合这一鸿沟。Pegasus 不依赖原始视频提示,而是构建一种基于图的中间表示:从人类视频中提取的任务图,通过可供性与约束图,转化为用于机器人条件视频生成的机器人规划图。一个层级化的可供性潜在空间建模对象状态、可供性与任务之间的关系,从而超越对象身份实现泛化。一个闭环物理验证器进一步利用运动学可行性、碰撞约束和关节限位过滤无效生成。我们在包括 GTEA Gaze+ 和 EPIC-KITCHENS-100 在内的多种第一人称操作基准以及多种机器人形态上评估了 Pegasus,衡量任务正确性、可执行性、状态一致性和可学习性。结果表明,跨形态翻译是可靠的,并表明机器人数据生成可以从硬件采集问题重新定义为一种可扩展、低资源的知识迁移问题。
## 1 引言
学习通用机器人操作需要多样化、大规模的训练数据。当前的数据获取范式各有其关键局限。真实机器人采集(Brohan et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib1);Vuong et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib2))能产生高质量示范,但成本高昂且难以扩展。物理仿真(Todorov et al. 2012 (https://arxiv.org/html/2607.26903#bib.bib3);Makoviychuk et al. 2021 (https://arxiv.org/html/2607.26903#bib.bib4))提供无限数据,但对基于视觉的策略存在仿真到现实的差距问题(Aljalbout et al. 2025 (https://arxiv.org/html/2607.26903#bib.bib5))。从人类视频学习(Nair et al. 2022 (https://arxiv.org/html/2607.26903#bib.bib6);Ma et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib7))利用了互联网规模的丰富数据,但现有方法主要学习视觉表示,而非可执行的机器人示范。
与此同时,诸如 EPIC-Kitchens(Damen et al. 2022 (https://arxiv.org/html/2607.26903#bib.bib8))、Ego4D(Grauman et al. 2024 (https://arxiv.org/html/2607.26903#bib.bib9))、DexYCB(Chao et al. 2021 (https://arxiv.org/html/2607.26903#bib.bib11))和 H2O(Kwon et al. 2021 (https://arxiv.org/html/2607.26903#bib.bib10))等大型人类视频数据集捕获了任务目标、对象交互和状态转换。根本挑战在于*具身鸿沟*:人类和机器人在形态、运动学和动作空间上存在差异,因此人类示范无法直接迁移到机器人执行。
我们认为,弥合这一鸿沟需要迁移*结构化经验*,而非像素。系统不应匹配人类与机器人的外观,而应提取任务语义、建模对象可供性、施加机器人约束,并生成可供下游策略学习执行的示范。
为此,我们提出 Pegasus,一个从人类视频到机器人示范的跨形态翻译框架。Pegasus 用结构化图表示人类操作,学习层级化的可供性潜在表示(Affordance Latent),以捕获对象交互语义而非对象身份,并集成闭环物理验证以确保运动学可行性。这些组件使得从互联网视频可扩展地合成机器人可学习示范成为可能,同时在不同形态间保留任务语义。
我们的实验表明,与强基线相比,Pegasus 持续提升了任务正确性、物理可执行性、对未见对象的可供性泛化能力以及下游机器人策略学习。这些结果共同验证了结构化经验迁移是替代在物理硬件上采集每条示范的一种实用方案。
我们的贡献总结如下:
- •迁移问题形式化。我们将互联网人类视频重新定义为机器人训练数据的可扩展来源,并将数据获取形式化为跨形态知识迁移。
- •我们提出一个**图结构跨形态翻译框架**,显式建模任务语义、可供性、具身约束和机器人规划。
- •我们引入一个**层级化可供性潜在表示(Hierarchical Affordance Latent)**,通过按对象状态、可供性和任务组织表示来提升泛化能力。
- •我们开发了一种**闭环物理验证机制**,通过迭代验证和重新生成来强制运动学可行性。
- •大量实验表明,与现有方法相比,任务正确性、未见对象泛化能力和下游策略学习均得到提升。
## 2 相关工作
### 2.1 具身数据获取
机器人学习一直由其数据范式所定义。仿真(Todorov et al. 2012 (https://arxiv.org/html/2607.26903#bib.bib3);Makoviychuk et al. 2021 (https://arxiv.org/html/2607.26903#bib.bib4))推动了强化学习的进展,但仿真到现实的差距依然存在。真实机器人采集(Brohan et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib1);Vuong et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib2);Collaboration et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib13))取得了令人瞩目的成果,但硬件成本过高。从人类视频学习(Nair et al. 2022 (https://arxiv.org/html/2607.26903#bib.bib6);Ma et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib7);Bahl et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib14))提取可复用表示,但无法生成可执行的机器人轨迹。Pegasus 引入了第四种范式:通过结构化跨形态知识迁移,将人类经验转化为机器人可学习的数据。
### 2.2 面向机器人的视频生成
视频扩散模型(Ho et al. 2022 (https://arxiv.org/html/2607.26903#bib.bib15);Blattmann et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib16))和视频修复方法(Zhou et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib17);Ouyang et al. 2024 (https://arxiv.org/html/2607.26903#bib.bib18))实现了照片级真实感。近期工作将生成应用于具身数据:EgoScale 使用视频扩散进行数据增强(依赖 GPU);GenAug 在仿真内运行。UniPi(Du et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib19))和 Susie(Black et al. 2024 (https://arxiv.org/html/2607.26903#bib.bib20))探索了视频作为策略接口,但并未解决跨形态迁移问题。Pegasus 有本质不同:生成以任务结构的**图表示**为条件,而非原始像素或文本提示;我们的质量指标是**策略提升**,而非视觉保真度。
### 2.3 跨形态迁移
跨形态学习(Wang et al. 2024 (https://arxiv.org/html/2607.26903#bib.bib21);Zhu et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib22))研究策略在不同机器人形态间的迁移。Octo(Mees et al. 2024 (https://arxiv.org/html/2607.26903#bib.bib23))和 OpenVLA(Kim et al. 2024 (https://arxiv.org/html/2607.26903#bib.bib24))构建跨形态的通用策略,但训练需要机器人数据。VRB(Bahl et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib14))从人类视频中提取可供性,但并未将其转化为可执行的机器人轨迹。Pegasus 独辟蹊径,通过图结构任务翻译和以可供性为中心的表示,将**人类视频**与**机器人可执行数据**连接起来。
### 2.4 操作用的图表示
基于图的表示已成为机器人操作的基本抽象,为任务规划、场景理解和动作推理提供结构化先验。任务图(Konidaris et al. 2018 (https://arxiv.org/html/2607.26903#bib.bib26))为长时程规划编码高层过程结构,而场景图(Krishna et al. 2017 (https://arxiv.org/html/2607.26903#bib.bib27))和可供性图(Bahl et al. 2023 (https://arxiv.org/html/2607.26903#bib.bib14))捕获环境中的对象关系与可交互动作。近期工作进一步将这些表示扩展到 3D 场景图,从而能够对复杂室内环境进行空间-语义推理(Roberts et al. 2021 (https://arxiv.org/html/2607.26903#bib.bib28))。在这些进展之上,Pegasus 利用图表示作为跨形态翻译的中间抽象,桥接人类示范与机器人可执行轨迹。与以往主要将图用于感知、规划或语义推理的工作不同,Pegasus 在视频生成流程中使用图结构表示来促进具身迁移。
## 3 方法:Pegasus
### 3.1 问题形式化
给定人类第一人称示范 V_h = {I_1, ..., I_T},以及一个目标机器人形态 R(由其运动学结构、关节限位、末端执行器规格和工作空间约束参数化),我们的目标是合成机器人示范
D_r = f(V_h, R),(1)
该示范需满足三个要求。首先,生成的示范应保留底层任务语义,包括人类示范中观察到的子目标顺序、对象交互和因果依赖。其次,所有生成的运动必须满足形态特定的运动学和几何约束。最后,合成的示范应能作为下游视觉运动策略学习的有效监督。
与以往直接使用文本提示条件化视频生成模型的工作不同,Pegasus 将跨形态翻译形式化为结构化图推理,随后进行物理约束渲染。这一分解显式地区分了形态不变的任务表示与形态相关的执行过程。
### 3.2 概述
Pegasus 包含五个阶段:
V_h → G_T → Z → G_P → D_r,(2)
其中 G_T 表示从人类示范中提取的任务图,Z 是层级化的可供性潜在表示,G_P 是可执行的机器人规划图。
Pegasus 不是将视频直接映射到机器人轨迹,而是逐步将人类示范转化为具身感知的表示。任务结构和对象可供性被认为在不同形态间保持不变,而运动轨迹则取决于机器人形态。因此,具身迁移变成了一个结构化图变换问题,而非外观生成问题。
图 1 (https://arxiv.org/html/2607.26903#S3.F1) 展示了完整的 Pegasus 框架。
参见图注 图 1:Pegasus 架构。人类示范被转化为任务图,在层级化可供性潜在空间中进行编码,翻译为特定形态的机器人规划图,经物理约束验证后,渲染为机器人学习经验。
### 3.3 任务图提取
给定一个人类示范,Pegasus 首先构建任务图
G_T = (V, E),(3)
其中节点表示语义实体:
V = {g_i, o_j, r_k},(4)
包括子目标、被操作对象和空间区域。边编码三种互补的关系:
E = {e_temp, e_cause, e_spatial},(5)
分别对应时间顺序、因果依赖和空间交互。
Pegasus 不是直接在图像像素上进行推理,而是在这个结构化图上执行所有后续推理,该图显式保留任务拓扑,同时保持与机器人形态无关。该图通过一个结构化视觉-语言解析器提取,该解析器从视频观测中联合预测语义动作、被操作对象、空间关系和时间依赖。
### 3.4 层级化可供性潜在表示
一个核心问题是确定哪种表示应跨形态保持不变。机器人位姿是形态相关的。人体骨架同样具有形态特异性。仅靠对象身份无法泛化到未见实例。Pegasus 因此引入层级化的可供性潜在表示
Z = {Z_s, Z_a, Z_t},(6)
从对象状态组织到可供性,最后到任务语义。
对象状态层级捕获环境的物理状态:
Z_s = Φ_s(G_T),(7)
编码对象是否被抓取、打开或移动等属性。可供性层级将对象特定的观测抽象为操作能力:
Z_a = Φ_a(Z_s),(8)
包括可抓取性、可容纳性、可支撑性或可倾倒性。最后,任务层级表示形态无关的意图:
Z_t = Φ_t(Z_a),(9)
例如搬运、堆叠或倾倒。这一层级逐步剔除形态特定的信息,同时保留因果任务语义。
#### 跨形态对齐。
为了在共享的可供性空间中对齐人类和机器人示范,Pegasus 优化一个对比学习目标:
L_align = -log exp(sim(z_h, z_r)/τ) / Σ_j exp(sim(z_h, z_j)/τ),(10)
其中正样本对对应在不同形态下完成相同任务的示范。与基于外观的对齐不同,该目标鼓励可供性空间中的几何一致性,使得语义上等效的操作尽管存在视觉差异也能收敛。
### 3.5 跨形态图翻译
一旦建立了共享潜在表示,Pegasus 逐步将任务图转化为可执行的机器人规划。该变换不是直接预测机器人轨迹,而是分解为三个图算子:
G_T → G_A → G_C → G_P。(11)
可供性图为语义节点补充操作可供性。约束图融入形态相关的可行性,包括抓取类型、逆运动学、碰撞约束和工作空间限制。最后,规划图将可行的操作原语转化为可执行的机器人轨迹,表示为运动路点与时间转换。
完整的翻译参数化为
G_P = g_φ(G_T, R),(12)
其中
g_φ = g_emb ∘ g_con ∘ g_aff。(13)
这种模块化设计显式地将语义推理与形态适应解耦,使得同一任务图可以在异构机器人平台上实例化。相似文章
EgoPhys:从第一人称视频学习可变形物体的通用物理模型
EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。
PhysBrain 1.0 技术报告
PhysBrain 1.0 是一份技术报告,提出了一种利用人类自我中心视频为视觉-语言-动作模型生成物理常识监督的方法,在ERQA、PhysBench、SimplerEnv-WidowX、LIBERO和RoboCasa等具身控制基准上取得了最先进的结果。
具身操作的数据金字塔
本文将有具身数据源组织成一个五级金字塔(真实机器人、UMI、自我中心/外部中心、仿真、通用视觉语言),分析它们在可扩展性和机器人对齐之间的权衡,并回顾了近期具身基础模型的数据策略。还讨论了构建下一代具身系统的开放性挑战。
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。
PhysisForcing:面向机器人操作的物理增强世界模拟器
PhysisForcing 是一种训练框架,通过基于 DiT 架构的像素级轨迹对齐和语义级关系对齐损失来强制物理一致性,从而增强机器人操作的具身视频生成,在基准测试上取得了显著改进。