HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
摘要
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
查看缓存全文
缓存时间: 2026/06/20 14:28
论文页面 - HumanScale:第一人称人类视频在具身预训练中可超越真实机器人数据
来源:https://huggingface.co/papers/2606.20521
发布于 6月18日
·
由 yfdeng 于6月19日提交
作者: , , , , , , , , , , , , , , , , , , , ,
摘要
第一人称人类视频可以有效替代遥操作机器人轨迹用于具身模型预训练,在降低数据采集成本的同时实现更优性能。
具身基础模型(https://huggingface.co/papers?q=Embodied%20foundation%20models)有望像大语言模型一样从数据扩展(https://huggingface.co/papers?q=data%20scaling)中获益,但却面临更严重的数据瓶颈。遥操作真实机器人轨迹(https://huggingface.co/papers?q=Teleoperated%20real-robot%20trajectories)因其精确的动作监督和具身对齐而成为主要的预训练(https://huggingface.co/papers?q=pretraining)数据源,但其可扩展性受限于高采集成本、获取难度以及较低的行为和环境多样性(https://huggingface.co/papers?q=environmental%20diversity)。这些局限性引发了人们对第一人称人类视频(https://huggingface.co/papers?q=egocentric%20human%20video)的兴趣,将其视为一种可扩展、成本极低且更多样化的具身模型预训练(https://huggingface.co/papers?q=pretraining)替代方案。然而,与传统遥操作真实机器人数据相比,其有效性尚未得到充分探索。为回答这一问题,我们在固定的后训练与验证协议下,系统比较了第一人称人类视频(https://huggingface.co/papers?q=egocentric%20human%20video)和遥操作真实机器人轨迹(https://huggingface.co/papers?q=teleoperated%20real-robot%20trajectories)作为具身基础模型(https://huggingface.co/papers?q=embodied%20foundation%20models)预训练(https://huggingface.co/papers?q=pretraining)数据源的效果。令人惊讶的是,我们发现经过精心设计的过滤与标注流水线(https://huggingface.co/papers?q=labeling%20pipeline)处理后,第一人称数据不仅可作为模型预训练(https://huggingface.co/papers?q=pretraining)的可行替代方案,还能带来更优性能。在使用相同量级预训练(https://huggingface.co/papers?q=pretraining)数据的情况下,基于第一人称数据预训练的模型在真实机器人动作预测(https://huggingface.co/papers?q=action%20prediction)上的验证损失降低了24%,在分布内和分布外真实机器人任务执行(https://huggingface.co/papers?q=task%20execution)上的成功率分别高出52.5%和90%。这一发现验证了一种可扩展的具身基础模型(https://huggingface.co/papers?q=embodied%20foundation%20models)范式:使用第一人称人类视频(https://huggingface.co/papers?q=egocentric%20human%20video)预训练以学习多样化的世界表征,然后利用少量标注的真实机器人数据进行动作空间对齐(https://huggingface.co/papers?q=action-space%20alignment)微调。我们希望这项研究能鼓励对第一人称数据的更广泛探索,并在进行代价高昂的机器人数据采集之前为数据质量评估提供指导。
查看 arXiv 页面(https://arxiv.org/abs/2606.20521)
查看 PDF(https://arxiv.org/pdf/2606.20521)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.20521)
引用该论文的模型(0)
无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.20521 以链接至此页面。
引用该论文的数据集(1)
cy0307/awesome-egocentric-atlas
更新于约2小时前 • 335 • 1(https://huggingface.co/datasets/cy0307/awesome-egocentric-atlas)
引用该论文的 Spaces(0)
无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.20521 以链接至此页面。
包含该论文的收藏集(0)
无收藏集包含此论文
添加此论文至收藏集(https://huggingface.co/new-collection)以链接至此页面。
相似文章
Ego2Robot:从第一人称人类数据规模化合成机器人数据
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
@macrodata_labs: 大家都在押注用第一人称视角数据来扩展机器人技术,但要将这些影像转化为训练数据,需要恢复……
Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
HumanNet:将以人为本的视频学习扩展至百万小时规模
HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。
为何第一人称视频对机器人学习可能很重要[D]
本文讨论了使用第一人称视频进行机器人学习的潜在优势和挑战,指出虽然直接模仿有限,但视觉注意序列可能得以迁移。文章引用了LingBot-VLA 2.0,并呼吁进行控制实验以分离视角效应和数据量影响。