ACE-Data-0:以人为中心的环境采集作为具身数据引擎
摘要
介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - ACE-Data-0:以人为中心的环境捕捉作为具身数据引擎
Source: https://huggingface.co/papers/2607.28625 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
具身智能面临一个根本性的数据瓶颈。模型必须捕捉人类在追求目标的过程中,第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉如何随时间共同演化。现有数据集在视角、模态或空间尺度上割裂了这种体验,使得完整的感知-行动环路只能被部分观测。我们提出了环境捕捉引擎(Ambient Capture Engine, ACE),一个以人为中心的数据引擎,可将真实家庭环境转化为空间校准、时间同步的录制影棚。ACE 在两种互补尺度上运行:桌面尺度构型可解析手-物体操作,而房间尺度构型可捕捉整套家具住宅中的全身运动、位移及交互。ACE 将自我中心及多视角外部视频、全身与关节手部运动、物体几何与 6-DoF 轨迹、音频和触觉信号记录为统一的多感官流。利用 ACE,我们构建了 ACE-Data-0,包含 150 小时、1700 万视频帧,覆盖 200 个任务类别,由 50 名参与者在 2 个环境中完成,共 75,000 个交互片段。该数据集涵盖原子操作、长时程家务活动链以及人-场景交互,同时通过目标级而非逐步指令保留自然行为差异。我们还引入了一个分层基准,从信号逐步推进到场景组件,再到交互。对最先进方法的评估揭示了在接触、遮挡、自我运动及长时间跨度下的显著差距。ACE-Data-0 提供同步的人类演示,并配准了感知、运动学和接触监督,为模仿学习、世界模型、视觉-语言-动作系统以及具身 AI 提供了可扩展的基础。
查看 arXiv 页面 (https://arxiv.org/abs/2607.28625)查看 PDF (https://arxiv.org/pdf/2607.28625)项目页面 (https://ace-data-engine.github.io/ACE-Data-0/)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.28625)
在你的 agent 中获取此论文:
hf papers read 2607\.28625
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.28625,即可从此页面链接到该模型。
引用此论文的数据集 1
ACERobotics/ACE-Data-0 更新于约 3 小时前 • 22 (https://huggingface.co/datasets/ACERobotics/ACE-Data-0)
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.28625,即可从此页面链接到该 Space。
收录此论文的收藏集 0
没有收藏集收录此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到它。
相似文章
Open-AoE:面向具身学习的开放自我中心操作数据集与工具链
Open-AoE 是一个开放、面向社区的自我中心操作数据集与工具链,覆盖从智能手机采集到模型训练的完整流程,提供约2000小时的操作视频及标注,并包含用于具身学习的下游工具。
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
HumanNet:将以人为本的视频学习扩展至百万小时规模
HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。
Embodied-BenchClaw:一种用于具身空间智能基准构建的自主多智能体系统
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。
具身操作的数据金字塔
本文将有具身数据源组织成一个五级金字塔(真实机器人、UMI、自我中心/外部中心、仿真、通用视觉语言),分析它们在可扩展性和机器人对齐之间的权衡,并回顾了近期具身基础模型的数据策略。还讨论了构建下一代具身系统的开放性挑战。