ActiveMimic: 基于主动感知的自我中心视频预训练

Hugging Face Daily Papers 论文

摘要

ActiveMimic 是一个预训练框架,它从自我中心人体视频中恢复相机和手腕轨迹,将主动感知建模为视角动作,从而使机器人预训练能够达到与直接在机器人数据上训练的模型相当的性能。

自我中心的人体视频为机器人预训练提供了一种可扩展的替代数据源,然而,在此类视频上预训练的模型始终不如在机器人数据上预训练的模型。我们将这一差距归因于缺失的信号——自我中心视频中的主动感知行为,即人类在操作过程中不断重新调整视角,由此产生的相机运动被标准流程视为噪声。为了解决这个问题,我们提出了 ActiveMimic,这是一个预训练框架,它从单个身体佩戴的 RGB 相机中恢复同步的相机和手腕轨迹,将相机运动建模为视角动作,并从现实场景中的自我中心人体视频中联合学习主动感知和操作,然后适应目标机器人。实验结果表明,在具有不同主动感知需求的任务中,ActiveMimic 始终优于在人体视频上预训练的基线,并且与在机器人数据上预训练的最先进模型性能相当。进一步的分析表明,主动感知能力源于自我中心人体视频预训练,而非机器人特定的微调,从而证实了主动感知是解锁自我中心人体视频用于机器人预训练的关键。
查看原文
查看缓存全文

缓存时间: 2026/06/15 12:58

论文页面 - ActiveMimic:基于主动感知的第一人称视频预训练

来源:https://huggingface.co/papers/2606.06194 发布于6月4日

·

Leo 于6月15日提交

摘要

ActiveMimic 预训练框架从第一人称视频中恢复相机和手腕轨迹,以实现与机器人数据性能相匹配的主动感知学习。

第一人称人类视频为预训练提供了一种可扩展的机器人数据替代方案,然而在此类视频上预训练的模型始终表现不如在机器人数据上预训练的模型。我们将这一差距归因于缺失的信号——第一人称视频中的主动感知行为,其中人类在操作过程中不断调整视角,导致标准流水线将相机运动视为噪声。为此,我们提出 ActiveMimic,一个预训练框架,能从单个穿戴式 RGB 相机中恢复同步的相机和手腕轨迹,将相机运动建模为视角动作,并联合学习来自野外第一人称人类视频的主动感知和操作,随后适应目标机器人。实验结果表明,在具有不同主动感知需求的各种任务中,ActiveMimic 始终优于在人类视频上预训练的基线,并达到在机器人数据上预训练的最先进模型水平。进一步分析提供了证据,表明主动感知能力源自第一人称人类视频预训练而非机器人特定的微调,从而确认主动感知是解锁第一人称人类视频用于机器人预训练的关键。

查看 arXiv 页面 (https://arxiv.org/abs/2606.06194)
查看 PDF (https://arxiv.org/pdf/2606.06194)
项目页面 (https://activemimic.github.io/)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06194)

在你的智能体中获取此论文:

hf papers read 2606.06194

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.06194 即可从此页面链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.06194 即可从此页面链接。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.06194 即可从此页面链接。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到一个收藏集中即可从此页面链接。

相似文章

EgoPhys:从第一人称视频学习可变形物体的通用物理模型

Hugging Face Daily Papers

EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。

原生主动感知作为全模态理解的推理方式

Hugging Face Daily Papers

介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。

Mirror Learning

arXiv cs.LG

This paper proposes 'Mirror Learning', a framework for imitation learning from third-person observation that uses a fine-tuned video diffusion model for perspective transformation and an inverse dynamics model to synthesize pseudo first-person expert data, showing that this mirror data alone can train effective policies and improve behavior cloning.