EgoCS-400K:一个面向世界模型的第一人称游戏数据集

Hugging Face Daily Papers 论文

摘要

EgoCS-400K 是一个大规模的第一人称反恐精英数据集,包含超过40万段第一人称视频和10,000小时的游戏玩法,为世界模型研究提供了时间对齐的视频-动作-语言轨迹。

从视频生成到交互式世界建模的转变对数据提出了新的要求:除了带字幕的视频之外,世界模型还需要基于驱动未来场景变化的动作、摄像机运动、状态和事件的时间对齐的视频-动作-语言轨迹。然而,大规模获取此类数据十分困难。网络视频数据集提供了广泛的视觉覆盖,但缺乏可执行的动作和可靠的状态;机器人数据集提供了动作和状态监督,但成本高昂且场景多样性有限;现有的模拟器通常缺乏大规模的人机交互轨迹。在本文中,我们介绍了 EgoCS-400K,这是一个基于重放的大规模第一人称反恐精英数据集,专为世界模型构建,源自公开的职业 CS 和 CS2 比赛回放,保留了人类游戏轨迹,并支持解析、重放、渲染和时间对齐。我们提取了玩家状态、视角方向、移动、键盘/按钮输入、视角变化、武器使用、游戏事件和回合级上下文,并从相同的轨迹中渲染出干净的第一人称视频。EgoCS-400K 包含超过40万段第一人称视频和10,000小时的游戏玩法,来自1000多场比赛和40,000个回合,覆盖13张地图,每回合10个玩家视角。它支持一系列交互式视觉建模任务,包括动作条件下的未来预测、状态和事件感知的场景展开、基于重放的字幕生成以及智能体第一人称动作理解。通过大规模地将视觉观察与人类动作、摄像机运动、游戏状态和事件联系起来,EgoCS-400K 成为了被动的网络视频、可控的游戏模拟和昂贵的现实世界具身数据之间的实用桥梁。
查看原文
查看缓存全文

缓存时间: 2026/06/17 15:52

论文页面 - EgoCS-400K:面向世界模型的自我中心游戏数据集

来源:https://huggingface.co/papers/2606.18180 发布于 6 月 16 日

·

由 https://huggingface.co/Rongjin03 的 Guo 提交

于 6 月 17 日

摘要

EgoCS-400K 是一个大规模自我中心反恐精英(Counter-Strike)数据集,它通过提供包含详细玩家状态和游戏事件的时间对齐视频-动作-语言轨迹,在被动网络视频与昂贵的真实世界具身数据之间架起桥梁。

从视频生成到交互式世界建模的转变对数据提出了新要求:除了配有字幕的视频,世界模型(https://huggingface.co/papers?q=world%20models)还需要以驱动未来场景变化的动作、相机运动、状态和事件为基础,实现时间对齐的视频-动作-语言轨迹(https://huggingface.co/papers?q=video-action-language%20trajectories)。然而,大规模获取此类数据非常困难。网络视频数据集能提供广泛的视觉覆盖,但缺乏可执行的动作和可靠的状态;机器人数据集提供动作和状态监督,但成本高昂且场景多样性有限;现有模拟器通常缺乏大规模人类驱动的交互轨迹。本文中,我们提出了 EgoCS-400K,这是一个基于回放(https://huggingface.co/papers?q=replay-grounded)的大规模自我中心(https://huggingface.co/papers?q=egocentric)反恐精英(Counter-Strike)数据集,专为世界模型(https://huggingface.co/papers?q=world%20models)构建。它利用公开的职业 CS 和 CS2 比赛回放录像,保留了人类游戏轨迹,并支持解析、回放、渲染和时间对齐(https://huggingface.co/papers?q=temporal%20alignment)。我们提取了玩家状态(https://huggingface.co/papers?q=player%20states)、视角方向、移动、键盘/按钮输入、视角变化、武器使用、游戏事件(https://huggingface.co/papers?q=game%20events)以及回合级上下文,并从相同轨迹渲染出干净的第一人称视频(https://huggingface.co/papers?q=first-person%20videos)。EgoCS-400K 包含超过 40 万个第一人称视频(https://huggingface.co/papers?q=first-person%20videos)和 10,000 小时的游戏内容,来自 1,000 多场比赛和 40,000 个回合,涵盖 13 张地图,每回合提供 10 个玩家视角。它支持多种交互式视觉建模任务,包括基于动作的未来预测(https://huggingface.co/papers?q=action-conditioned%20future%20prediction)、状态与事件感知的场景推演、基于回放的字幕生成(https://huggingface.co/papers?q=replay-grounded%20captioning)以及智能体自我中心动作理解(https://huggingface.co/papers?q=agent%20egocentric%20action%20understanding)。通过大规模地将视觉观察与人类动作、相机运动、游戏状态和事件关联起来,EgoCS-400K 在被动网络视频、可控游戏仿真和昂贵的真实世界具身数据之间架起了一座实用的桥梁。

查看 arXiv 页面(https://arxiv.org/abs/2606.18180)查看 PDF(https://arxiv.org/pdf/2606.18180)项目页面(https://egocs-400k.github.io/)GitHub16(https://github.com/EgoCS-400K/Dataset)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.18180)

将这篇论文放入你的智能体:

hf papers read 2606\.18180

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.18180 即可从此页面链接。

引用该论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.18180 即可从此页面链接。

引用该论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.18180 即可从此页面链接。

包含该论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

Ego2Robot:从第一人称人类数据规模化合成机器人数据

Hugging Face Daily Papers

Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。

CG-World:面向世界模型的大规模世界状态数据集与协议

arXiv cs.AI

CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。