Open-AoE:面向具身学习的开放自我中心操作数据集与工具链

Hugging Face Daily Papers 论文

摘要

Open-AoE 是一个开放、面向社区的自我中心操作数据集与工具链,覆盖从智能手机采集到模型训练的完整流程,提供约2000小时的操作视频及标注,并包含用于具身学习的下游工具。

人类操作的自我中心视频为具身智能提供了可扩展的监督信号,然而现有资源很少将低成本连续采集、操作级别的结构化标注和可重用的机器人学习工具结合起来。我们提出 Open-AoE,一个开放、面向社区的自我中心操作数据集与工具链,覆盖从智能手机采集到模型训练的完整流程。其首次发布包含约2000小时的操作视频,这些视频由500多名贡献者使用400多部智能手机在自然环境中采集。该数据集提供文本标注、基于MANO的手部姿态、相机轨迹以及时间定位的原子操作。Open-AoE 还包含一条数据处理流水线,通过时间动作分割、语义标注、手部重建和相机轨迹重建,将原始录制内容转换为结构化样本。同时,我们提供一套独立的下游工具链,支持可视化、跨具身重定位、模型特定数据转换,以及针对VLA策略、WAMs和World Models的训练方案。通过整合可扩展采集、结构化处理和下游适配,Open-AoE 降低了数据贡献和复用的门槛,为具身模型训练、人机迁移和世界建模提供了实用的开放基础设施。
查看原文
查看缓存全文

缓存时间: 2026/07/21 14:37

Paper page - Open-AoE:用于具身学习的开放第一人称操作数据集与工具链

来源:https://huggingface.co/papers/2607.14183 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

人类操作的第一人称视频为具身智能提供了可扩展的监督信号,然而现有资源很少能兼顾低成本连续采集、操作级结构化标注以及可用于机器人学习的可复用工具。我们提出 Open-AoE,一个面向社区的开放第一人称操作数据集与工具链,覆盖从手机拍摄到模型训练的完整流程。其首个版本包含约 2,000 小时的操作视频,由 500 多位贡献者使用 400 多部智能手机在自然环境中采集。数据集提供文本标注、基于 MANO 的手部姿态、相机轨迹以及时间定位的原子动作。Open-AoE 还包含一个数据处理流水线,通过时间动作分割、语义标注、手部重建和相机轨迹重建将原始录制转化为结构化样本。同时,我们提供独立的下游工具链,支持可视化、跨具身重定向、特定模型的数据转换,以及用于 VLA 策略、WAM 和世界模型的训练配方。通过整合可扩展采集、结构化处理和下游适配,Open-AoE 降低了数据贡献和复用的门槛,为具身模型训练、人机迁移和世界建模提供实用的开放基础设施。

查看 arXiv 页面 (https://arxiv.org/abs/2607.14183)查看 PDF (https://arxiv.org/pdf/2607.14183)GitHub79 (https://github.com/ant-research/Open-AoE)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14183)

在你的智能体中获取此论文:

hf papers read 2607\.14183

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.14183 即可从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.14183 即可从此页面链接。

引用此论文的 Space0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.14183 即可从此页面链接。

包含此论文的合集1

相似文章

ACE-Data-0:以人为中心的环境采集作为具身数据引擎

Hugging Face Daily Papers

介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。

Ego2Robot:从第一人称人类数据规模化合成机器人数据

Hugging Face Daily Papers

Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。

robbyant/lingbot-video-moe-30b-a3b

Hugging Face Models Trending

LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。