HumanNet:将以人为本的视频学习扩展至百万小时规模

Hugging Face Daily Papers 论文

摘要

HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。

具身智能的进展日益依赖于可扩展的数据基础设施。尽管视觉和语言领域已通过互联网语料实现了规模化发展,但物理交互的学习仍受限于缺乏大规模、多样化且标注丰富的人类活动数据。我们提出了 HumanNet,这是一个包含百万小时视频的人为本的视频语料库,旨在大规模捕捉人类与物理世界的交互方式。HumanNet 涵盖了第一人称和第三人称视角,涉及细粒度活动、人-物交互、工具使用以及在多样化真实环境中的长时程行为。除了原始视频,该数据集还提供了以交互为中心的标注,包括字幕、动作描述以及与手部和身体相关的信号,从而支持感知动作和交互的学习。除了规模优势,HumanNet 还为具身学习引入了一种系统性的数据策展范式,其中以人为本的筛选、时间结构、视角多样性和标注丰富化被视为首要的设计原则。这种设计将非结构化的互联网视频转化为表征学习、活动理解、动作生成以及人-机器人迁移的可扩展基础。我们通过受控的视觉-语言-动作消融实验,对该设计的价值进行了初步验证:在固定验证集下,基于 HumanNet 中 1000 小时第一人称视频继续训练的 Qwen VLM 模型,其性能超越了基于 Magic Cobot 100 小时真实机器人数据继续训练的模型,这表明第一人称人类视频可以作为机器人数据的可扩展且具成本效益的替代品。通过构建该项目,我们旨在探索利用以人为本的视频来扩展具身基础模型的机会,而不再仅依赖特定的机器人数据。
查看原文
查看缓存全文

缓存时间: 2026/05/11 02:42

论文页面 - HumanNet: 将以人为本的视频学习扩展到一百万小时

来源: https://huggingface.co/papers/2605.06747

摘要

HumanNet 提出了一个大规模的以人为本(human-centric)视频数据集,包含丰富的标注,专为具身智能(embodied intelligence)设计,证明了第一人称人类视频可以有效替代机器人数据来训练视觉-语言-动作(vision-language-action)模型。

具身智能的进展日益依赖于可扩展的数据基础设施。尽管视觉和语言领域已经通过互联网语料库实现了规模化扩展,但物理交互的学习仍然受限于缺乏大规模、多样化且标注丰富的人类活动数据。我们提出了 HumanNet,这是一个包含一百万小时以人为本视频的大型语料库,旨在捕捉人类如何大规模地与物理世界互动。HumanNet 涵盖了第一人称和第三人称视角,并包含在多样真实环境中的细粒度活动、人与物体的交互、工具使用以及长视野行为。除了原始视频外,该数据集还提供以交互为中心的标注,包括字幕、运动描述以及手部与身体相关信号,从而支持感知运动和感知交互的学习。除了规模优势外,HumanNet 还为具身学习引入了一种系统化的数据策划范式,其中以人为本的过滤、时间结构构建、视角多样性以及标注增强被视为首要设计原则。这种设计将非结构化的互联网视频转化为用于表征学习、活动理解、运动生成以及人-机器人迁移(human-to-robot transfer)的可扩展基础。我们通过受控的视觉-语言-动作消融实验,对该设计的价值进行了初步验证:在固定的验证集下,基于 HumanNet 中抽取的 1000 小时第一人称视频对 Qwen VLM 模型进行持续训练,其表现优于使用 Magic Cobot 中 100 小时真实机器人数据的持续训练结果,这表明第一人称人类视频可以作为机器人数据的可扩展且具成本效益的替代品。通过构建本项目,我们旨在探索使用以人为本的视频来扩展具身基础模型的机会,而不仅仅依赖特定的机器人数据。

查看 arXiv 页面 (https://arxiv.org/abs/2605.06747)查看 PDF (https://arxiv.org/pdf/2605.06747)项目主页 (https://dagroup-pku.github.io/HumanNet/)GitHub (https://github.com/DAGroup-PKU/HumanNet)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.06747)

在您的代理中获取这篇论文:

hf papers read 2605\.06747

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有链接到这篇论文的模型

请在模型的 README.md 中引用 arxiv.org/abs/2605.06747 以从本页建立链接。

引用此论文的数据集0

没有链接到这篇论文的数据集

请在数据集的 README.md 中引用 arxiv.org/abs/2605.06747 以从本页建立链接。

引用此论文的 Spaces0

没有链接到这篇论文的 Space

请在 Space 的 README.md 中引用 arxiv.org/abs/2605.06747 以从本页建立链接。

包含此论文的合集0

没有包含这篇论文的合集

请将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页建立链接。

相似文章

ACE-Data-0:以人为中心的环境采集作为具身数据引擎

Hugging Face Daily Papers

介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。