@RekaAILabs: CS2-10k 现已在 @huggingface 上发布。60万+ 第一人称游戏视频。1万+ 小时。每帧都配有相应的键盘、鼠标和3D位置数据。
摘要
Reka AI Labs 发布了 CS2-10k 大型数据集,包含超过 60 万个第一人称游戏视频,总计超过 1 万小时,每帧都配有键盘、鼠标和 3D 位置数据。该数据集已在 Hugging Face 上开放,可用于世界模型、基于动作的视频生成以及第一人称导航研究。
查看缓存全文
缓存时间: 2026/07/01 04:01
CS2-10k 现已在 @huggingface 上线
超过 60 万段第一人称游戏视频,总计超过 1 万小时。
每一帧都配有生成该帧的精确键盘、鼠标和 3D 位置数据。
如果你正在研究世界模型、动作条件视频生成或第一人称导航,今天即可下载使用。
相似文章
EgoCS-400K:一个面向世界模型的第一人称游戏数据集
EgoCS-400K 是一个大规模的第一人称反恐精英数据集,包含超过40万段第一人称视频和10,000小时的游戏玩法,为世界模型研究提供了时间对齐的视频-动作-语言轨迹。
Ego2Robot:从第一人称人类数据规模化合成机器人数据
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
@macrodata_labs: 大家都在押注用第一人称视角数据来扩展机器人技术,但要将这些影像转化为训练数据,需要恢复……
Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。
HumanNet:将以人为本的视频学习扩展至百万小时规模
HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。
@HuggingPapers: NVIDIA 刚刚在 Hugging Face 上发布了 Anchor Lab 数据集——真实世界的机器人测量数据,用于校准模拟以…
NVIDIA 在 Hugging Face 上发布了 Anchor Lab 数据集,该数据集包含真实机器人测量数据,用于校准仿真,以实现零样本的 sim-to-real 部署。