具身操作的数据金字塔
摘要
本文将有具身数据源组织成一个五级金字塔(真实机器人、UMI、自我中心/外部中心、仿真、通用视觉语言),分析它们在可扩展性和机器人对齐之间的权衡,并回顾了近期具身基础模型的数据策略。还讨论了构建下一代具身系统的开放性挑战。
查看缓存全文
缓存时间: 2026/07/28 06:33
论文页面 - 具身操作的数据金字塔
来源:https://huggingface.co/papers/2607.24744 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
多模态基础模型通过学习整个互联网的视觉与语言数据,实现了“看”与“说”的能力。具身智能体则没有这样的捷径,因为它们需要将观测与物理状态和动作耦合的数据。这些信号可以由多种数据源以不同程度提供。在这项工作中,我们将具身数据生态系统组织成一个“金字塔”,涵盖五个互补的数据源:真实机器人数据、UMI风格数据、自我中心与外部视角数据、仿真数据,以及通用视觉语言数据。我们围绕可扩展性与机器人对齐之间的张力来组织这个金字塔,并进一步从数据质量、多样性、可复用性和物理保真度等维度刻画每个数据源。然后,我们通过数据配方的视角分析近期具身基础模型,考察这些模型在预训练过程中如何选择、对齐和混合不同的数据源。对于具身大脑模型、视觉-语言-动作模型和世界-动作模型,我们将数据构成与感知、推理、规划、动作生成和世界预测等能力联系起来。最后,我们讨论了六个开放性挑战:构建大规模触觉数据集、收集失败与恢复数据、开发可扩展的数据收集流程、跨具身形态对齐动作、利用自我中心数据进行灵巧操作,以及为机器人学习设计有原则的数据配方。我们希望这项工作能为下一代具身系统的设计奠定基础。
查看 arXiv 页面 (https://arxiv.org/abs/2607.24744)
查看 PDF (https://arxiv.org/pdf/2607.24744)
项目页面 (https://jasper-aaa.github.io/embodied-data-pyramid/)
GitHub9 (https://github.com/worldbench/awesome-embodied-data-pyramid)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.24744)
在您的智能体中获取本文:
hf papers read 2607.24744
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
暂无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.24744 以从本页面链接它。
引用本文的数据集0
暂无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.24744 以从本页面链接它。
引用本文的 Spaces0
暂无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.24744 以从本页面链接它。
包含本文的收藏集0
暂无收藏集包含此论文
添加此论文到一个收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
从被动视频到可编辑体验:面向具身智能的物理接地体验合成
介绍Pegasus,一种低资源框架,利用基于图的任务表示、分层可供性潜在空间和闭环物理验证,将人类示范视频转换为机器人可执行数据,旨在将硬件数据收集转变为可规模化的知识迁移。
ACE-Data-0:以人为中心的环境采集作为具身数据引擎
介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。
Embodied-R1.5: 通过具身基础模型进化物理智能
Embodied-R1.5 是一个统一的具身基础模型,通过多任务平衡强化学习在 24 个具身视觉-语言基准测试中的 16 个上取得了最先进性能。它引入了一个规划器-接地器-校正器闭环框架用于长视界任务,并且已开源以促进未来研究。
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
Open-AoE:面向具身学习的开放自我中心操作数据集与工具链
Open-AoE 是一个开放、面向社区的自我中心操作数据集与工具链,覆盖从智能手机采集到模型训练的完整流程,提供约2000小时的操作视频及标注,并包含用于具身学习的下游工具。