ActiveMimic: 基于主动感知的自我中心视频预训练
摘要
ActiveMimic 是一个预训练框架,它从自我中心人体视频中恢复相机和手腕轨迹,将主动感知建模为视角动作,从而使机器人预训练能够达到与直接在机器人数据上训练的模型相当的性能。
查看缓存全文
缓存时间: 2026/06/15 12:58
论文页面 - ActiveMimic:基于主动感知的第一人称视频预训练
来源:https://huggingface.co/papers/2606.06194 发布于6月4日
·
由 Leo 于6月15日提交
摘要
ActiveMimic 预训练框架从第一人称视频中恢复相机和手腕轨迹,以实现与机器人数据性能相匹配的主动感知学习。
第一人称人类视频为预训练提供了一种可扩展的机器人数据替代方案,然而在此类视频上预训练的模型始终表现不如在机器人数据上预训练的模型。我们将这一差距归因于缺失的信号——第一人称视频中的主动感知行为,其中人类在操作过程中不断调整视角,导致标准流水线将相机运动视为噪声。为此,我们提出 ActiveMimic,一个预训练框架,能从单个穿戴式 RGB 相机中恢复同步的相机和手腕轨迹,将相机运动建模为视角动作,并联合学习来自野外第一人称人类视频的主动感知和操作,随后适应目标机器人。实验结果表明,在具有不同主动感知需求的各种任务中,ActiveMimic 始终优于在人类视频上预训练的基线,并达到在机器人数据上预训练的最先进模型水平。进一步分析提供了证据,表明主动感知能力源自第一人称人类视频预训练而非机器人特定的微调,从而确认主动感知是解锁第一人称人类视频用于机器人预训练的关键。
查看 arXiv 页面 (https://arxiv.org/abs/2606.06194)
查看 PDF (https://arxiv.org/pdf/2606.06194)
项目页面 (https://activemimic.github.io/)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06194)
在你的智能体中获取此论文:
hf papers read 2606.06194
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.06194 即可从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.06194 即可从此页面链接。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.06194 即可从此页面链接。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到一个收藏集中即可从此页面链接。
相似文章
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
EgoPhys:从第一人称视频学习可变形物体的通用物理模型
EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
Mirror Learning
This paper proposes 'Mirror Learning', a framework for imitation learning from third-person observation that uses a fine-tuned video diffusion model for perspective transformation and an inverse dynamics model to synthesize pseudo first-person expert data, showing that this mirror data alone can train effective policies and improve behavior cloning.