EgoSteer: 从第一人称视频实现可引导灵巧操作的全栈系统

Hugging Face Daily Papers 论文

摘要

EgoSteer提出一个全栈系统,从第一人称人类视频预训练视觉-语言-动作模型,实现可引导的灵巧操作,在40多个多样化任务上展现鲁棒泛化能力,复杂长时任务成功率超过75%。

可引导性是通用机器人策略的关键能力,但在灵巧手系统中仍然普遍缺失,原因是缺乏大规模、语言对齐且动作准确的演示数据。为了解决这一瓶颈,我们提出一个全栈系统,该系统从第一人称人类视频扩展灵巧VLA(视觉-语言-动作)预训练,并实现数据高效的真实机器人后训练。它集成了EgoSmith(一个数据管道,将野外第一人称视频整理为9600小时的高质量预训练数据,吞吐量比先前SOTA高9倍,准确性更高)、一个用于遥操作和人机交互修正的统一机器人栈,以及EgoSteer(一个在优化基础设施上训练、增强世界模型的VLA)。人类数据预训练为EgoSteer提供了语言引导的操作先验,这些先验通过机器人后训练进行落地,并通过DAgger改进进行优化。实验表明,EgoSteer能在40多个多样化任务上鲁棒地执行自由形式指令,展现出故障恢复、灵巧性和泛化能力。预训练模型还能以少量样本适应复杂长时任务,包括折叠盒子,在两种机器人平台上成功率超过75%。我们在https://egosteer.github.io/开源了系统、数据和模型。
查看原文
查看缓存全文

缓存时间: 2026/07/14 12:14

论文页面 - EgoSteer: 一种基于自我中心视频实现可操控灵巧操作的全栈系统

来源: https://huggingface.co/papers/2607.09701 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

可操控性是通用机器人策略的关键能力,但在灵巧手系统中仍基本缺失,原因在于缺乏大规模、与语言对齐且动作精确的演示数据。为解决这一瓶颈,我们提出了一种全栈系统,该系统从自我中心人类视频中扩展灵巧VLA预训练,并实现数据高效的实物机器人后训练。它集成了EgoSmith(一个数据管道,将野外自我中心视频整理为9.6K小时的高质量预训练数据,吞吐量比先前SOTA高9倍且精度更高)、用于遥操作和人在回路修正的统一机器人栈,以及EgoSteer(一个基于优化基础设施训练的、世界模型增强的VLA)。人类数据预训练为EgoSteer提供了语言引导的操作先验,这些先验通过机器人后训练得到巩固,并通过DAgger改进来增强。实验表明,EgoSteer能够在40+种不同任务中稳健执行自由形式指令,展现出故障恢复、灵巧性和泛化能力。预训练模型还能在两种具身形态上以75%以上的成功率,通过少样本适应完成复杂的长期任务,包括折纸盒。我们已在https://egosteer.github.io/开源了系统、数据和模型。

查看 arXiv 页面 (https://arxiv.org/abs/2607.09701)查看 PDF (https://arxiv.org/pdf/2607.09701)项目页面 (https://egosteer.github.io/#/)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09701)

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.09701 以从此页面链接该模型。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.09701 以从此页面链接该数据集。

引用此论文的 Spaces0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.09701 以从此页面链接该 Space。

包含此论文的收藏0

没有包含此论文的收藏

请将本论文添加至收藏 (https://huggingface.co/new-collection) 以从此页面链接该论文。

相似文章

EgoPhys:从第一人称视频学习可变形物体的通用物理模型

Hugging Face Daily Papers

EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。

Ego2Robot:从第一人称人类数据规模化合成机器人数据

Hugging Face Daily Papers

Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。