HumanNet:将以人为本的视频学习扩展至百万小时规模
摘要
HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。
查看缓存全文
缓存时间: 2026/05/11 02:42
论文页面 - HumanNet: 将以人为本的视频学习扩展到一百万小时
来源: https://huggingface.co/papers/2605.06747
摘要
HumanNet 提出了一个大规模的以人为本(human-centric)视频数据集,包含丰富的标注,专为具身智能(embodied intelligence)设计,证明了第一人称人类视频可以有效替代机器人数据来训练视觉-语言-动作(vision-language-action)模型。
具身智能的进展日益依赖于可扩展的数据基础设施。尽管视觉和语言领域已经通过互联网语料库实现了规模化扩展,但物理交互的学习仍然受限于缺乏大规模、多样化且标注丰富的人类活动数据。我们提出了 HumanNet,这是一个包含一百万小时以人为本视频的大型语料库,旨在捕捉人类如何大规模地与物理世界互动。HumanNet 涵盖了第一人称和第三人称视角,并包含在多样真实环境中的细粒度活动、人与物体的交互、工具使用以及长视野行为。除了原始视频外,该数据集还提供以交互为中心的标注,包括字幕、运动描述以及手部与身体相关信号,从而支持感知运动和感知交互的学习。除了规模优势外,HumanNet 还为具身学习引入了一种系统化的数据策划范式,其中以人为本的过滤、时间结构构建、视角多样性以及标注增强被视为首要设计原则。这种设计将非结构化的互联网视频转化为用于表征学习、活动理解、运动生成以及人-机器人迁移(human-to-robot transfer)的可扩展基础。我们通过受控的视觉-语言-动作消融实验,对该设计的价值进行了初步验证:在固定的验证集下,基于 HumanNet 中抽取的 1000 小时第一人称视频对 Qwen VLM 模型进行持续训练,其表现优于使用 Magic Cobot 中 100 小时真实机器人数据的持续训练结果,这表明第一人称人类视频可以作为机器人数据的可扩展且具成本效益的替代品。通过构建本项目,我们旨在探索使用以人为本的视频来扩展具身基础模型的机会,而不仅仅依赖特定的机器人数据。
查看 arXiv 页面 (https://arxiv.org/abs/2605.06747)查看 PDF (https://arxiv.org/pdf/2605.06747)项目主页 (https://dagroup-pku.github.io/HumanNet/)GitHub (https://github.com/DAGroup-PKU/HumanNet)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.06747)
在您的代理中获取这篇论文:
hf papers read 2605\.06747
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有链接到这篇论文的模型
请在模型的 README.md 中引用 arxiv.org/abs/2605.06747 以从本页建立链接。
引用此论文的数据集0
没有链接到这篇论文的数据集
请在数据集的 README.md 中引用 arxiv.org/abs/2605.06747 以从本页建立链接。
引用此论文的 Spaces0
没有链接到这篇论文的 Space
请在 Space 的 README.md 中引用 arxiv.org/abs/2605.06747 以从本页建立链接。
包含此论文的合集0
没有包含这篇论文的合集
请将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页建立链接。
相似文章
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
ACE-Data-0:以人为中心的环境采集作为具身数据引擎
介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。
@BitRobotNetwork: 1/ 介绍 HIW-500 (Humanoids-in-the-Wild 500):在真实家庭环境中收集的最大开源人形机器人遥操作数据集……
介绍 HIW-500,在真实家庭中收集的最大开源人形机器人遥操作数据集,包含东南亚12个家庭的500多小时和23K+个任务片段。
小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型规模化
小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。