EgoSteer: 从第一人称视频实现可引导灵巧操作的全栈系统
摘要
EgoSteer提出一个全栈系统,从第一人称人类视频预训练视觉-语言-动作模型,实现可引导的灵巧操作,在40多个多样化任务上展现鲁棒泛化能力,复杂长时任务成功率超过75%。
查看缓存全文
缓存时间: 2026/07/14 12:14
论文页面 - EgoSteer: 一种基于自我中心视频实现可操控灵巧操作的全栈系统
来源: https://huggingface.co/papers/2607.09701 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
可操控性是通用机器人策略的关键能力,但在灵巧手系统中仍基本缺失,原因在于缺乏大规模、与语言对齐且动作精确的演示数据。为解决这一瓶颈,我们提出了一种全栈系统,该系统从自我中心人类视频中扩展灵巧VLA预训练,并实现数据高效的实物机器人后训练。它集成了EgoSmith(一个数据管道,将野外自我中心视频整理为9.6K小时的高质量预训练数据,吞吐量比先前SOTA高9倍且精度更高)、用于遥操作和人在回路修正的统一机器人栈,以及EgoSteer(一个基于优化基础设施训练的、世界模型增强的VLA)。人类数据预训练为EgoSteer提供了语言引导的操作先验,这些先验通过机器人后训练得到巩固,并通过DAgger改进来增强。实验表明,EgoSteer能够在40+种不同任务中稳健执行自由形式指令,展现出故障恢复、灵巧性和泛化能力。预训练模型还能在两种具身形态上以75%以上的成功率,通过少样本适应完成复杂的长期任务,包括折纸盒。我们已在https://egosteer.github.io/开源了系统、数据和模型。
查看 arXiv 页面 (https://arxiv.org/abs/2607.09701)查看 PDF (https://arxiv.org/pdf/2607.09701)项目页面 (https://egosteer.github.io/#/)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09701)
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.09701 以从此页面链接该模型。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.09701 以从此页面链接该数据集。
引用此论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.09701 以从此页面链接该 Space。
包含此论文的收藏0
没有包含此论文的收藏
请将本论文添加至收藏 (https://huggingface.co/new-collection) 以从此页面链接该论文。
相似文章
EgoPhys:从第一人称视频学习可变形物体的通用物理模型
EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
Ego2Robot:从第一人称人类数据规模化合成机器人数据
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。
EgoForce: 前臂引导的相机空间3D手部姿态——来自单目第一人称相机
EgoForce是一个单目3D手部重建框架,使用统一网络,包含可微分前臂表示、手臂-手部变换器和射线空间求解器,能够在不同相机模型下恢复绝对手部姿态和位置,在多个第一人称基准测试中达到了最先进的精度。