@macrodata_labs: 大家都在押注用第一人称视角数据来扩展机器人技术,但要将这些影像转化为训练数据,需要恢复……
摘要
Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。
查看缓存全文
缓存时间: 2026/08/07 14:57
所有人都在押注自我中心(Egocentric)数据来扩展机器人技术 🤖
但将这些视频片段转化为训练数据,需要恢复缺失的动作信号:手如何在3D空间中移动。
我们发布了一篇新的研究博客 📜,探讨仅使用开源模型能达到什么程度。https://t.co/5yVPiycCeB
相似文章
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
Ego2Robot:从第一人称人类数据规模化合成机器人数据
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
EgoPhys:从第一人称视频学习可变形物体的通用物理模型
EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
@RekaAILabs: CS2-10k 现已在 @huggingface 上发布。60万+ 第一人称游戏视频。1万+ 小时。每帧都配有相应的键盘、鼠标和3D位置数据。
Reka AI Labs 发布了 CS2-10k 大型数据集,包含超过 60 万个第一人称游戏视频,总计超过 1 万小时,每帧都配有键盘、鼠标和 3D 位置数据。该数据集已在 Hugging Face 上开放,可用于世界模型、基于动作的视频生成以及第一人称导航研究。