ACE-Data-0:以人为中心的环境采集作为具身数据引擎
摘要
介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - ACE-Data-0:以人为中心的环境捕捉作为具身数据引擎
Source: https://huggingface.co/papers/2607.28625 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
具身智能面临一个根本性的数据瓶颈。模型必须捕捉人类在追求目标的过程中,第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉如何随时间共同演化。现有数据集在视角、模态或空间尺度上割裂了这种体验,使得完整的感知-行动环路只能被部分观测。我们提出了环境捕捉引擎(Ambient Capture Engine, ACE),一个以人为中心的数据引擎,可将真实家庭环境转化为空间校准、时间同步的录制影棚。ACE 在两种互补尺度上运行:桌面尺度构型可解析手-物体操作,而房间尺度构型可捕捉整套家具住宅中的全身运动、位移及交互。ACE 将自我中心及多视角外部视频、全身与关节手部运动、物体几何与 6-DoF 轨迹、音频和触觉信号记录为统一的多感官流。利用 ACE,我们构建了 ACE-Data-0,包含 150 小时、1700 万视频帧,覆盖 200 个任务类别,由 50 名参与者在 2 个环境中完成,共 75,000 个交互片段。该数据集涵盖原子操作、长时程家务活动链以及人-场景交互,同时通过目标级而非逐步指令保留自然行为差异。我们还引入了一个分层基准,从信号逐步推进到场景组件,再到交互。对最先进方法的评估揭示了在接触、遮挡、自我运动及长时间跨度下的显著差距。ACE-Data-0 提供同步的人类演示,并配准了感知、运动学和接触监督,为模仿学习、世界模型、视觉-语言-动作系统以及具身 AI 提供了可扩展的基础。
查看 arXiv 页面 (https://arxiv.org/abs/2607.28625)查看 PDF (https://arxiv.org/pdf/2607.28625)项目页面 (https://ace-data-engine.github.io/ACE-Data-0/)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.28625)
在你的 agent 中获取此论文:
hf papers read 2607\.28625
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.28625,即可从此页面链接到该模型。
引用此论文的数据集 1
ACERobotics/ACE-Data-0 更新于约 3 小时前 • 22 (https://huggingface.co/datasets/ACERobotics/ACE-Data-0)
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.28625,即可从此页面链接到该 Space。
收录此论文的收藏集 0
没有收藏集收录此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到它。
相似文章
Open-AoE:面向具身学习的开放自我中心操作数据集与工具链
Open-AoE 是一个开放、面向社区的自我中心操作数据集与工具链,覆盖从智能手机采集到模型训练的完整流程,提供约2000小时的操作视频及标注,并包含用于具身学习的下游工具。
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
HumanNet:将以人为本的视频学习扩展至百万小时规模
HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。
@DataScienceHarp: 最著名的自我中心数据集是人们在自家厨房做饭的场景。我们正在训练的机器人正在朝向……
APAC-Egocentric-Stereo数据集提供第一人称视角的录制,展示了人们从事工业及其他工作的场景,包括立体视频、深度图、动作跟踪和字幕,现已在Hugging Face平台以FiftyOne格式发布。
@LeRobotHF:100,000小时的人类双手进行真实工作。LeRobot格式,完全标注且开放。EgoSuite-Open100K来自@LightwheelAI
LightwheelAI和Hugging Face发布了EgoSuite-Open100K,这是一个包含100,000小时第一人称视角人类活动的大规模开放数据集,完全标注并以LeRobot格式提供,用于AI研究和训练。