ACE-Data-0:以人为中心的环境采集作为具身数据引擎

Hugging Face Daily Papers 论文

摘要

介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。

具身智能面临根本性的数据瓶颈。模型必须捕捉当人类随时间追求目标时,第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉如何协同演化。现有数据集将这些经验分散在不同的视角、模态或空间尺度上,导致完整的感知-行动环路只能被部分观测。我们引入了环境采集引擎(ACE),一个以人为中心的数据引擎,将真实家庭环境转变为空间校准、时间同步的录制工作室。ACE以两种互补的尺度运行:桌面级配置解析手-物操作,而房间级配置捕捉整个家具化家庭中的全身运动、移动和交互。ACE将自我中心和多视角外部视频、全身和关节化手部运动、物体几何与6自由度轨迹、音频和触觉信号记录为统一的多感官流。利用ACE,我们构建了ACE-Data-0,包含150小时、1700万帧视频、覆盖200个任务类别,由50名参与者在2个环境中执行,共75,000个交互片段。数据集涵盖原子操作、长时程家庭活动链以及人-场景交互,同时通过目标级而非逐步指令保留自然的行为变异。我们进一步引入了一个分层基准,从信号逐步推进到场景组件,再到交互。对最先进方法的评估揭示了在接触、遮挡、自我运动和长时程时间跨度下的显著差距。ACE-Data-0提供了具有对齐的感知、运动和接触监督的同步人类演示,为模仿学习、世界模型、视觉-语言-行动系统和具身AI提供了可扩展的基础。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - ACE-Data-0:以人为中心的环境捕捉作为具身数据引擎

Source: https://huggingface.co/papers/2607.28625 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

具身智能面临一个根本性的数据瓶颈。模型必须捕捉人类在追求目标的过程中,第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉如何随时间共同演化。现有数据集在视角、模态或空间尺度上割裂了这种体验,使得完整的感知-行动环路只能被部分观测。我们提出了环境捕捉引擎(Ambient Capture Engine, ACE),一个以人为中心的数据引擎,可将真实家庭环境转化为空间校准、时间同步的录制影棚。ACE 在两种互补尺度上运行:桌面尺度构型可解析手-物体操作,而房间尺度构型可捕捉整套家具住宅中的全身运动、位移及交互。ACE 将自我中心及多视角外部视频、全身与关节手部运动、物体几何与 6-DoF 轨迹、音频和触觉信号记录为统一的多感官流。利用 ACE,我们构建了 ACE-Data-0,包含 150 小时、1700 万视频帧,覆盖 200 个任务类别,由 50 名参与者在 2 个环境中完成,共 75,000 个交互片段。该数据集涵盖原子操作、长时程家务活动链以及人-场景交互,同时通过目标级而非逐步指令保留自然行为差异。我们还引入了一个分层基准,从信号逐步推进到场景组件,再到交互。对最先进方法的评估揭示了在接触、遮挡、自我运动及长时间跨度下的显著差距。ACE-Data-0 提供同步的人类演示,并配准了感知、运动学和接触监督,为模仿学习、世界模型、视觉-语言-动作系统以及具身 AI 提供了可扩展的基础。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28625)查看 PDF (https://arxiv.org/pdf/2607.28625)项目页面 (https://ace-data-engine.github.io/ACE-Data-0/)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.28625)

在你的 agent 中获取此论文:

hf papers read 2607\.28625

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.28625,即可从此页面链接到该模型。

引用此论文的数据集 1

ACERobotics/ACE-Data-0 更新于约 3 小时前 • 22 (https://huggingface.co/datasets/ACERobotics/ACE-Data-0)

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.28625,即可从此页面链接到该 Space。

收录此论文的收藏集 0

没有收藏集收录此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到它。

相似文章

HumanNet:将以人为本的视频学习扩展至百万小时规模

Hugging Face Daily Papers

HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。

具身操作的数据金字塔

Hugging Face Daily Papers

本文将有具身数据源组织成一个五级金字塔(真实机器人、UMI、自我中心/外部中心、仿真、通用视觉语言),分析它们在可扩展性和机器人对齐之间的权衡,并回顾了近期具身基础模型的数据策略。还讨论了构建下一代具身系统的开放性挑战。