@macrodata_labs: 大家都在押注用第一人称视角数据来扩展机器人技术,但要将这些影像转化为训练数据,需要恢复……

X AI KOLs Following 论文

摘要

Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。

每个人都在押注用第一人称视角数据来扩展机器人技术 🤖 但要将这些影像转化为训练数据,需要恢复缺失的动作信号:手如何在三维空间中移动。 我们发布了一篇新的研究博客 📜,探讨仅使用开源模型能做到什么程度。https://t.co/5yVPiycCeB
查看原文
查看缓存全文

缓存时间: 2026/08/07 14:57

所有人都在押注自我中心(Egocentric)数据来扩展机器人技术 🤖

但将这些视频片段转化为训练数据,需要恢复缺失的动作信号:手如何在3D空间中移动。

我们发布了一篇新的研究博客 📜,探讨仅使用开源模型能达到什么程度。https://t.co/5yVPiycCeB

相似文章

Ego2Robot:从第一人称人类数据规模化合成机器人数据

Hugging Face Daily Papers

Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。

EgoPhys:从第一人称视频学习可变形物体的通用物理模型

Hugging Face Daily Papers

EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。