HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据

Hugging Face Daily Papers 论文

摘要

本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。

具身基础模型有望像大型语言模型一样从数据扩展中获益,但面临更严峻的数据瓶颈。遥操作真实机器人轨迹因其精确的动作监督和具身对齐,仍然是主要的预训练数据源,但其可扩展性受到高采集成本、获取难度大以及行为和环境多样性低的限制。这些限制激发了对自我中心人类视频的兴趣,将其作为具身模型预训练的一种可扩展、成本显著更低且更多样化的替代方案。然而,与遥操作真实机器人数据相比,其有效性尚未得到充分探索。为解决这一问题,我们进行了系统性研究,在固定的后训练和验证协议下,比较了自我中心人类视频和遥操作真实机器人轨迹作为具身基础模型预训练数据源的效果。令人惊讶的是,我们发现,经过精心设计的过滤和标注流水线处理后,自我中心数据不仅是模型预训练的可行替代方案,还能带来更优的性能。在相同预训练数据量下,基于自我中心数据预训练的模型在真实机器人动作预测上实现了24%更低的验证损失,并在分布内和分布外真实机器人任务执行中分别实现了52.5%和90%更高的成功率。这一发现验证了具身基础模型的一种可扩展范式:先在自我中心人类视频上预训练以学习多样的世界表示,然后使用少量标注的真实机器人数据进行动作空间对齐的适应。我们希望这项研究能鼓励更广泛地探索自我中心数据,并在进行昂贵的机器人数据收集之前为数据质量评估提供指导。
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:28

论文页面 - HumanScale:第一人称人类视频在具身预训练中可超越真实机器人数据

来源:https://huggingface.co/papers/2606.20521
发布于 6月18日

·

yfdeng 于6月19日提交

作者: , , , , , , , , , , , , , , , , , , , ,

摘要

第一人称人类视频可以有效替代遥操作机器人轨迹用于具身模型预训练,在降低数据采集成本的同时实现更优性能。

具身基础模型(https://huggingface.co/papers?q=Embodied%20foundation%20models)有望像大语言模型一样从数据扩展(https://huggingface.co/papers?q=data%20scaling)中获益,但却面临更严重的数据瓶颈。遥操作真实机器人轨迹(https://huggingface.co/papers?q=Teleoperated%20real-robot%20trajectories)因其精确的动作监督和具身对齐而成为主要的预训练(https://huggingface.co/papers?q=pretraining)数据源,但其可扩展性受限于高采集成本、获取难度以及较低的行为和环境多样性(https://huggingface.co/papers?q=environmental%20diversity)。这些局限性引发了人们对第一人称人类视频(https://huggingface.co/papers?q=egocentric%20human%20video)的兴趣,将其视为一种可扩展、成本极低且更多样化的具身模型预训练(https://huggingface.co/papers?q=pretraining)替代方案。然而,与传统遥操作真实机器人数据相比,其有效性尚未得到充分探索。为回答这一问题,我们在固定的后训练与验证协议下,系统比较了第一人称人类视频(https://huggingface.co/papers?q=egocentric%20human%20video)和遥操作真实机器人轨迹(https://huggingface.co/papers?q=teleoperated%20real-robot%20trajectories)作为具身基础模型(https://huggingface.co/papers?q=embodied%20foundation%20models)预训练(https://huggingface.co/papers?q=pretraining)数据源的效果。令人惊讶的是,我们发现经过精心设计的过滤与标注流水线(https://huggingface.co/papers?q=labeling%20pipeline)处理后,第一人称数据不仅可作为模型预训练(https://huggingface.co/papers?q=pretraining)的可行替代方案,还能带来更优性能。在使用相同量级预训练(https://huggingface.co/papers?q=pretraining)数据的情况下,基于第一人称数据预训练的模型在真实机器人动作预测(https://huggingface.co/papers?q=action%20prediction)上的验证损失降低了24%,在分布内和分布外真实机器人任务执行(https://huggingface.co/papers?q=task%20execution)上的成功率分别高出52.5%和90%。这一发现验证了一种可扩展的具身基础模型(https://huggingface.co/papers?q=embodied%20foundation%20models)范式:使用第一人称人类视频(https://huggingface.co/papers?q=egocentric%20human%20video)预训练以学习多样化的世界表征,然后利用少量标注的真实机器人数据进行动作空间对齐(https://huggingface.co/papers?q=action-space%20alignment)微调。我们希望这项研究能鼓励对第一人称数据的更广泛探索,并在进行代价高昂的机器人数据采集之前为数据质量评估提供指导。

查看 arXiv 页面(https://arxiv.org/abs/2606.20521)
查看 PDF(https://arxiv.org/pdf/2606.20521)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.20521)

引用该论文的模型(0)

无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.20521 以链接至此页面。

引用该论文的数据集(1)

cy0307/awesome-egocentric-atlas

更新于约2小时前 • 335 • 1(https://huggingface.co/datasets/cy0307/awesome-egocentric-atlas)

引用该论文的 Spaces(0)

无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.20521 以链接至此页面。

包含该论文的收藏集(0)

无收藏集包含此论文

添加此论文至收藏集(https://huggingface.co/new-collection)以链接至此页面。

相似文章

Ego2Robot:从第一人称人类数据规模化合成机器人数据

Hugging Face Daily Papers

Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。

HumanNet:将以人为本的视频学习扩展至百万小时规模

Hugging Face Daily Papers

HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。

为何第一人称视频对机器人学习可能很重要[D]

Reddit r/MachineLearning

本文讨论了使用第一人称视频进行机器人学习的潜在优势和挑战,指出虽然直接模仿有限,但视觉注意序列可能得以迁移。文章引用了LingBot-VLA 2.0,并呼吁进行控制实验以分离视角效应和数据量影响。