EgoCS-400K:一个面向世界模型的第一人称游戏数据集
摘要
EgoCS-400K 是一个大规模的第一人称反恐精英数据集,包含超过40万段第一人称视频和10,000小时的游戏玩法,为世界模型研究提供了时间对齐的视频-动作-语言轨迹。
查看缓存全文
缓存时间: 2026/06/17 15:52
论文页面 - EgoCS-400K:面向世界模型的自我中心游戏数据集
来源:https://huggingface.co/papers/2606.18180 发布于 6 月 16 日
·
由 https://huggingface.co/Rongjin03 的 Guo 提交
摘要
EgoCS-400K 是一个大规模自我中心反恐精英(Counter-Strike)数据集,它通过提供包含详细玩家状态和游戏事件的时间对齐视频-动作-语言轨迹,在被动网络视频与昂贵的真实世界具身数据之间架起桥梁。
从视频生成到交互式世界建模的转变对数据提出了新要求:除了配有字幕的视频,世界模型(https://huggingface.co/papers?q=world%20models)还需要以驱动未来场景变化的动作、相机运动、状态和事件为基础,实现时间对齐的视频-动作-语言轨迹(https://huggingface.co/papers?q=video-action-language%20trajectories)。然而,大规模获取此类数据非常困难。网络视频数据集能提供广泛的视觉覆盖,但缺乏可执行的动作和可靠的状态;机器人数据集提供动作和状态监督,但成本高昂且场景多样性有限;现有模拟器通常缺乏大规模人类驱动的交互轨迹。本文中,我们提出了 EgoCS-400K,这是一个基于回放(https://huggingface.co/papers?q=replay-grounded)的大规模自我中心(https://huggingface.co/papers?q=egocentric)反恐精英(Counter-Strike)数据集,专为世界模型(https://huggingface.co/papers?q=world%20models)构建。它利用公开的职业 CS 和 CS2 比赛回放录像,保留了人类游戏轨迹,并支持解析、回放、渲染和时间对齐(https://huggingface.co/papers?q=temporal%20alignment)。我们提取了玩家状态(https://huggingface.co/papers?q=player%20states)、视角方向、移动、键盘/按钮输入、视角变化、武器使用、游戏事件(https://huggingface.co/papers?q=game%20events)以及回合级上下文,并从相同轨迹渲染出干净的第一人称视频(https://huggingface.co/papers?q=first-person%20videos)。EgoCS-400K 包含超过 40 万个第一人称视频(https://huggingface.co/papers?q=first-person%20videos)和 10,000 小时的游戏内容,来自 1,000 多场比赛和 40,000 个回合,涵盖 13 张地图,每回合提供 10 个玩家视角。它支持多种交互式视觉建模任务,包括基于动作的未来预测(https://huggingface.co/papers?q=action-conditioned%20future%20prediction)、状态与事件感知的场景推演、基于回放的字幕生成(https://huggingface.co/papers?q=replay-grounded%20captioning)以及智能体自我中心动作理解(https://huggingface.co/papers?q=agent%20egocentric%20action%20understanding)。通过大规模地将视觉观察与人类动作、相机运动、游戏状态和事件关联起来,EgoCS-400K 在被动网络视频、可控游戏仿真和昂贵的真实世界具身数据之间架起了一座实用的桥梁。
查看 arXiv 页面(https://arxiv.org/abs/2606.18180)查看 PDF(https://arxiv.org/pdf/2606.18180)项目页面(https://egocs-400k.github.io/)GitHub16(https://github.com/EgoCS-400K/Dataset)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.18180)
将这篇论文放入你的智能体:
hf papers read 2606\.18180
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.18180 即可从此页面链接。
引用该论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.18180 即可从此页面链接。
引用该论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.18180 即可从此页面链接。
包含该论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
@RekaAILabs: CS2-10k 现已在 @huggingface 上发布。60万+ 第一人称游戏视频。1万+ 小时。每帧都配有相应的键盘、鼠标和3D位置数据。
Reka AI Labs 发布了 CS2-10k 大型数据集,包含超过 60 万个第一人称游戏视频,总计超过 1 万小时,每帧都配有键盘、鼠标和 3D 位置数据。该数据集已在 Hugging Face 上开放,可用于世界模型、基于动作的视频生成以及第一人称导航研究。
Ego2Robot:从第一人称人类数据规模化合成机器人数据
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
CG-World:面向世界模型的大规模世界状态数据集与协议
CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。
Open-AoE:面向具身学习的开放自我中心操作数据集与工具链
Open-AoE 是一个开放、面向社区的自我中心操作数据集与工具链,覆盖从智能手机采集到模型训练的完整流程,提供约2000小时的操作视频及标注,并包含用于具身学习的下游工具。
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。