Ego2Robot:从第一人称人类数据规模化合成机器人数据

Hugging Face Daily Papers 论文

摘要

Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。

学习具有泛化能力的机器人操作策略需要大规模、多样化的示范数据。第一人称人类操作视频提供了丰富的场景和任务多样性,先前研究已表明,将此类视频重定向并渲染为机器人格式数据,可以在小规模下生成有效的单任务策略。然而,这种方法能否在大规模下为视觉-语言-动作模型提供预训练收益,仍未被探索。我们提出Ego2Robot,一个可扩展的流水线,通过动作重定向、机械臂视觉合成和多层级质量筛选,将第一人称人类操作视频转换为机器人训练数据。Ego2Robot同时支持精选数据集和野外视频,共生成18,561小时的机器人训练数据,涵盖15种机器人形态,是迄今为止最大规模的ego-to-robot数据集。为评估泛化能力,我们对RoboTwin2.0进行了扩展,引入了解耦的扰动维度,涵盖视觉外观、场景布局、具身形态和任务语义。实验表明,在Ego2Robot合成数据与真实机器人数据上联合预训练,能够在多种扰动类型下持续提升分布外泛化性能,且该收益已在真实机器人部署中得到验证。项目主页:https://www-ye.github.io/ego2robot_blog/
查看原文
查看缓存全文

缓存时间: 2026/08/06 05:49

论文页面 - Ego2Robot: 从第一人称人类数据到可扩展的机器人数据合成

来源:https://huggingface.co/papers/2608.02580 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

学习可泛化的机器人操作策略需要大规模且多样化的演示数据。第一人称人类操作视频提供了丰富的场景和任务多样性,先前的工作已经表明,将这些视频重定向并渲染为机器人格式的数据,可以在小规模上生成有效的逐任务策略。然而,这种方法能否在大规模上为视觉-语言-动作(VLA)模型带来预训练收益,仍然未被探索。我们提出了 Ego2Robot,一个可扩展的流水线,通过动作重定向、机器人手臂视觉合成和多级质量筛选,将第一人称人类操作视频转换为机器人训练数据。Ego2Robot 既支持精选数据集,也支持非受控环境视频,生成了 18,561 小时的机器人训练数据,涵盖 15 种机器人形态,使其成为迄今为止最大的 ego-to-robot 数据集。为了评估泛化能力,我们扩展了 RoboTwin 2.0,加入了解耦的扰动轴,涵盖视觉外观、场景布局、具身形态和任务语义。实验表明,在 Ego2Robot 合成数据和真实机器人数据上进行联合预训练,能够持续提升跨多种扰动类型的分布外泛化能力,并在真实机器人部署中得到了验证。项目页面:https://www-ye.github.io/ego2robot_blog/

查看 arXiv 页面 (https://arxiv.org/abs/2608.02580) 查看 PDF (https://arxiv.org/pdf/2608.02580) 项目页面 (https://www-ye.github.io/ego2robot_blog/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02580)

在您的 agent 中获取此论文:

hf papers read 2608\.02580

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型

0

没有链接到此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2608.02580,即可从本页面链接到该模型。

引用此论文的数据集

0

没有链接到此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2608.02580,即可从本页面链接到该数据集。

引用此论文的 Space

0

没有链接到此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2608.02580,即可从本页面链接到该 Space。

包含此论文的收藏集

0

没有包含此论文的收藏集

将此论文添加到收藏集,即可从本页面链接到它。

相似文章

EgoPhys:从第一人称视频学习可变形物体的通用物理模型

Hugging Face Daily Papers

EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。