具身操作的数据金字塔

Hugging Face Daily Papers 论文

摘要

本文将有具身数据源组织成一个五级金字塔(真实机器人、UMI、自我中心/外部中心、仿真、通用视觉语言),分析它们在可扩展性和机器人对齐之间的权衡,并回顾了近期具身基础模型的数据策略。还讨论了构建下一代具身系统的开放性挑战。

多模态基础模型通过消费整个互联网学会了看和说。具身智能体没有这样的捷径,因为它们需要将观察与物理状态和动作耦合的数据。这些信号可以由多种数据源在不同程度上提供。在这项工作中,我们将具身数据生态系统组织成一个跨越五种互补来源的“金字塔”:真实机器人数据、UMI风格数据、自我中心和外部中心数据、仿真数据以及通用视觉语言数据。我们围绕可扩展性和机器人对齐之间的张力来组织这个金字塔,并进一步从数据质量、多样性、可重用性和物理保真度等方面描述每个来源。然后,我们通过数据策略的视角分析近期的具身基础模型,研究在预训练过程中如何选择、对齐和混合不同来源。对于具身大脑模型、视觉-语言-动作模型以及世界-动作模型,我们将数据组成与感知、推理、规划、动作生成和世界预测等能力联系起来。最后,我们讨论了六个开放性挑战:构建大规模触觉数据集、收集失败和恢复数据、开发可扩展的数据收集管线、跨实体对齐动作、利用自我中心数据进行灵巧操作,以及为机器人学习设计有原则的数据策略。我们希望这项工作为下一代具身系统的设计奠定基础。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:33

论文页面 - 具身操作的数据金字塔

来源:https://huggingface.co/papers/2607.24744 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

多模态基础模型通过学习整个互联网的视觉与语言数据,实现了“看”与“说”的能力。具身智能体则没有这样的捷径,因为它们需要将观测与物理状态和动作耦合的数据。这些信号可以由多种数据源以不同程度提供。在这项工作中,我们将具身数据生态系统组织成一个“金字塔”,涵盖五个互补的数据源:真实机器人数据、UMI风格数据、自我中心与外部视角数据、仿真数据,以及通用视觉语言数据。我们围绕可扩展性与机器人对齐之间的张力来组织这个金字塔,并进一步从数据质量、多样性、可复用性和物理保真度等维度刻画每个数据源。然后,我们通过数据配方的视角分析近期具身基础模型,考察这些模型在预训练过程中如何选择、对齐和混合不同的数据源。对于具身大脑模型、视觉-语言-动作模型和世界-动作模型,我们将数据构成与感知、推理、规划、动作生成和世界预测等能力联系起来。最后,我们讨论了六个开放性挑战:构建大规模触觉数据集、收集失败与恢复数据、开发可扩展的数据收集流程、跨具身形态对齐动作、利用自我中心数据进行灵巧操作,以及为机器人学习设计有原则的数据配方。我们希望这项工作能为下一代具身系统的设计奠定基础。

查看 arXiv 页面 (https://arxiv.org/abs/2607.24744)
查看 PDF (https://arxiv.org/pdf/2607.24744)
项目页面 (https://jasper-aaa.github.io/embodied-data-pyramid/)
GitHub9 (https://github.com/worldbench/awesome-embodied-data-pyramid)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.24744)

在您的智能体中获取本文:

hf papers read 2607.24744

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

暂无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.24744 以从本页面链接它。

引用本文的数据集0

暂无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.24744 以从本页面链接它。

引用本文的 Spaces0

暂无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.24744 以从本页面链接它。

包含本文的收藏集0

暂无收藏集包含此论文

添加此论文到一个收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

ACE-Data-0:以人为中心的环境采集作为具身数据引擎

Hugging Face Daily Papers

介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。

Embodied-R1.5: 通过具身基础模型进化物理智能

Hugging Face Daily Papers

Embodied-R1.5 是一个统一的具身基础模型,通过多任务平衡强化学习在 24 个具身视觉-语言基准测试中的 16 个上取得了最先进性能。它引入了一个规划器-接地器-校正器闭环框架用于长视界任务,并且已开源以促进未来研究。