HumanNet:将以人为本的视频学习扩展至百万小时规模
摘要
HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。
查看缓存全文
缓存时间: 2026/05/11 02:42
论文页面 - HumanNet: 将以人为本的视频学习扩展到一百万小时
来源: https://huggingface.co/papers/2605.06747
摘要
HumanNet 提出了一个大规模的以人为本(human-centric)视频数据集,包含丰富的标注,专为具身智能(embodied intelligence)设计,证明了第一人称人类视频可以有效替代机器人数据来训练视觉-语言-动作(vision-language-action)模型。
具身智能的进展日益依赖于可扩展的数据基础设施。尽管视觉和语言领域已经通过互联网语料库实现了规模化扩展,但物理交互的学习仍然受限于缺乏大规模、多样化且标注丰富的人类活动数据。我们提出了 HumanNet,这是一个包含一百万小时以人为本视频的大型语料库,旨在捕捉人类如何大规模地与物理世界互动。HumanNet 涵盖了第一人称和第三人称视角,并包含在多样真实环境中的细粒度活动、人与物体的交互、工具使用以及长视野行为。除了原始视频外,该数据集还提供以交互为中心的标注,包括字幕、运动描述以及手部与身体相关信号,从而支持感知运动和感知交互的学习。除了规模优势外,HumanNet 还为具身学习引入了一种系统化的数据策划范式,其中以人为本的过滤、时间结构构建、视角多样性以及标注增强被视为首要设计原则。这种设计将非结构化的互联网视频转化为用于表征学习、活动理解、运动生成以及人-机器人迁移(human-to-robot transfer)的可扩展基础。我们通过受控的视觉-语言-动作消融实验,对该设计的价值进行了初步验证:在固定的验证集下,基于 HumanNet 中抽取的 1000 小时第一人称视频对 Qwen VLM 模型进行持续训练,其表现优于使用 Magic Cobot 中 100 小时真实机器人数据的持续训练结果,这表明第一人称人类视频可以作为机器人数据的可扩展且具成本效益的替代品。通过构建本项目,我们旨在探索使用以人为本的视频来扩展具身基础模型的机会,而不仅仅依赖特定的机器人数据。
查看 arXiv 页面 (https://arxiv.org/abs/2605.06747)查看 PDF (https://arxiv.org/pdf/2605.06747)项目主页 (https://dagroup-pku.github.io/HumanNet/)GitHub (https://github.com/DAGroup-PKU/HumanNet)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.06747)
在您的代理中获取这篇论文:
hf papers read 2605\.06747
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有链接到这篇论文的模型
请在模型的 README.md 中引用 arxiv.org/abs/2605.06747 以从本页建立链接。
引用此论文的数据集0
没有链接到这篇论文的数据集
请在数据集的 README.md 中引用 arxiv.org/abs/2605.06747 以从本页建立链接。
引用此论文的 Spaces0
没有链接到这篇论文的 Space
请在 Space 的 README.md 中引用 arxiv.org/abs/2605.06747 以从本页建立链接。
包含此论文的合集0
没有包含这篇论文的合集
请将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页建立链接。
相似文章
@LeRobotHF:100,000小时的人类双手进行真实工作。LeRobot格式,完全标注且开放。EgoSuite-Open100K来自@LightwheelAI
LightwheelAI和Hugging Face发布了EgoSuite-Open100K,这是一个包含100,000小时第一人称视角人类活动的大规模开放数据集,完全标注并以LeRobot格式提供,用于AI研究和训练。
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
Ego2Robot:从第一人称人类数据规模化合成机器人数据
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
@seclink:视频里是加速了的,实际上动作慢很多...
Lightwheel AI 和 Hugging Face 已开源 EgoSuite-Open100K,这是目前最大的全标注第一人称视角人类行为数据集,包含 100,000 小时的数据,重点强调物理AI的规模定律。
LAION-BVD:用于多模态预训练的千万小时开放视频数据集
LAION-BVD是一个大规模开放视频数据集,包含1000万小时的视频数据,用于多模态预训练,具有合成字幕和竞争力的基准性能。