@seclink:视频里是加速了的,实际上动作慢很多...
摘要
Lightwheel AI 和 Hugging Face 已开源 EgoSuite-Open100K,这是目前最大的全标注第一人称视角人类行为数据集,包含 100,000 小时的数据,重点强调物理AI的规模定律。
查看缓存全文
缓存时间: 2026/08/21 19:15
视频里是加速了的, 实际上动作慢很多 …
Lightwheel (@LightwheelAI): 最大的全标注开放式第一人称视角人类数据集。
今天我们与 @huggingface 共同开源了 EgoSuite-Open100K:包含 10 万小时的第一人称视角人类数据,供所有人免费使用。
现在,物理人工智能已拥有其自身的扩展规律,而人类数据正是其关键输入。这正
相似文章
@LeRobotHF:100,000小时的人类双手进行真实工作。LeRobot格式,完全标注且开放。EgoSuite-Open100K来自@LightwheelAI
LightwheelAI和Hugging Face发布了EgoSuite-Open100K,这是一个包含100,000小时第一人称视角人类活动的大规模开放数据集,完全标注并以LeRobot格式提供,用于AI研究和训练。
@RekaAILabs: CS2-10k 现已在 @huggingface 上发布。60万+ 第一人称游戏视频。1万+ 小时。每帧都配有相应的键盘、鼠标和3D位置数据。
Reka AI Labs 发布了 CS2-10k 大型数据集,包含超过 60 万个第一人称游戏视频,总计超过 1 万小时,每帧都配有键盘、鼠标和 3D 位置数据。该数据集已在 Hugging Face 上开放,可用于世界模型、基于动作的视频生成以及第一人称导航研究。
HumanNet:将以人为本的视频学习扩展至百万小时规模
HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。
@macrodata_labs: 大家都在押注用第一人称视角数据来扩展机器人技术,但要将这些影像转化为训练数据,需要恢复……
Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。
Ego2Robot:从第一人称人类数据规模化合成机器人数据
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。