Ego2Robot:从第一人称人类数据规模化合成机器人数据
摘要
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
查看缓存全文
缓存时间: 2026/08/06 05:49
论文页面 - Ego2Robot: 从第一人称人类数据到可扩展的机器人数据合成
来源:https://huggingface.co/papers/2608.02580 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
学习可泛化的机器人操作策略需要大规模且多样化的演示数据。第一人称人类操作视频提供了丰富的场景和任务多样性,先前的工作已经表明,将这些视频重定向并渲染为机器人格式的数据,可以在小规模上生成有效的逐任务策略。然而,这种方法能否在大规模上为视觉-语言-动作(VLA)模型带来预训练收益,仍然未被探索。我们提出了 Ego2Robot,一个可扩展的流水线,通过动作重定向、机器人手臂视觉合成和多级质量筛选,将第一人称人类操作视频转换为机器人训练数据。Ego2Robot 既支持精选数据集,也支持非受控环境视频,生成了 18,561 小时的机器人训练数据,涵盖 15 种机器人形态,使其成为迄今为止最大的 ego-to-robot 数据集。为了评估泛化能力,我们扩展了 RoboTwin 2.0,加入了解耦的扰动轴,涵盖视觉外观、场景布局、具身形态和任务语义。实验表明,在 Ego2Robot 合成数据和真实机器人数据上进行联合预训练,能够持续提升跨多种扰动类型的分布外泛化能力,并在真实机器人部署中得到了验证。项目页面:https://www-ye.github.io/ego2robot_blog/
查看 arXiv 页面 (https://arxiv.org/abs/2608.02580) 查看 PDF (https://arxiv.org/pdf/2608.02580) 项目页面 (https://www-ye.github.io/ego2robot_blog/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02580)
在您的 agent 中获取此论文:
hf papers read 2608\.02580
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型
0
没有链接到此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2608.02580,即可从本页面链接到该模型。
引用此论文的数据集
0
没有链接到此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.02580,即可从本页面链接到该数据集。
引用此论文的 Space
0
没有链接到此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2608.02580,即可从本页面链接到该 Space。
包含此论文的收藏集
0
没有包含此论文的收藏集
将此论文添加到收藏集,即可从本页面链接到它。
相似文章
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
@AdinaYakup: Gen-HumanEgo 来自 @GenrobotAI 的新机器人学习数据集 - 超过1,800小时的自我中心人类数据 - 超过10,000个独特任务…
Gen-HumanEgo 是 GenrobotAI 发布的新机器人学习数据集,包含超过1,800小时的自我中心人类数据、超过10,000个独特任务以及同步的相机视图,包括3D手部关键点和结构化注释。
EgoPhys:从第一人称视频学习可变形物体的通用物理模型
EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。
@macrodata_labs: 大家都在押注用第一人称视角数据来扩展机器人技术,但要将这些影像转化为训练数据,需要恢复……
Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。