Game2World引擎:解锁真实游戏视频以用于世界模型训练

Hugging Face Daily Papers 论文

摘要

本文介绍了Game2World Engine,一个用于从游戏视频中移除UI的框架,旨在为视频世界模型创建更干净的训练数据。其中,GameCleaner模型在UI移除方面达到了最先进的成果。

视频游戏为视频世界模型提供了可扩展的训练数据来源,提供了多样化的环境、复杂的交互以及丰富的真实游戏视频。然而,原始游戏画面将游戏世界与屏幕空间界面纠缠在一起,引入了特定游戏的偏差和无关动态,阻碍了世界模型的训练。为了解决这个问题,我们引入了GameUI-Taxonomy和G2WEngine,一个全栈框架,用于形式化游戏UI的定位和移除。G2WEngine能够自动从真实游戏视频中提取可复用的UI资产,并在干净画面上合成为时间连贯的UI叠加层。利用该引擎,我们构建了Game2World,包含96K个合成配对视频,具有精确的重建目标,以及来自303款游戏的1,079个真实片段,用于现实评估。其资产库包含5,132个经过验证的UI元素,涵盖21个分类类别,收集自1,010个代表性游戏帧。基于Game2World,我们提出了GameCleaner,一种无需掩码的游戏UI移除模型,结合了多模态语义理解和视频编辑能力。与基于掩码的方法不同,GameCleaner直接识别和移除各种HUD元素,同时保留底层场景内容和时间动态。在一项受控试点中,在无UI游戏数据上训练的世界模型,相比于在叠加UI数据上训练的模型,整体VideoReward提高了6.83%。在UI移除评估中,GameCleaner在合成视频上平均AAR达到95.36,比最强的时序掩码基线高出57.3%,并且在真实场景中AAR达到80.05,背景保留率为99.8。这些结果证明了将互联网游戏视频转化为高质量世界模型训练数据的可扩展潜力。代码、数据集和模型将在 https://github.com/Dongping-Chen/Game2World 上提供。
查看原文
查看缓存全文

缓存时间: 2026/08/26 07:13

论文页面 - Game2World引擎:解锁真实游戏视频用于世界模型训练

来源:https://huggingface.co/papers/2608.24680

摘要

一套从视频中移除游戏UI的框架,可为视频世界模型提供更干净的训练数据,提升奖励指标并优于基于掩码的移除方法。

视频游戏为视频世界模型(https://huggingface.co/papers?q=video%20world%20models)提供了可扩展的训练数据来源,提供多样化的环境、复杂的交互以及大量真实游戏视频。然而,原始游戏画面将游戏世界与屏幕空间界面混杂在一起,引入了游戏特定的偏差和无关动态,阻碍了世界模型的训练。为解决此问题,我们推出了GameUI-Taxonomy(https://huggingface.co/papers?q=GameUI-Taxonomy)和G2WEngine(https://huggingface.co/papers?q=G2WEngine),一个将游戏UI定位与移除形式化的全栈框架。G2WEngine(https://huggingface.co/papers?q=G2WEngine)能从真实游戏视频中自动提取可重复使用的UI资产,并在干净的画面上合成时间连贯的UI覆盖层。利用该引擎,我们构建了Game2World(https://huggingface.co/papers?q=Game2World),包含96,000对具有精确重建目标的合成配对视频,以及来自303款游戏的1,079个真实片段用于现实评估。其资产库包含经验证的5,132个UI元素,涵盖21个分类类别,收集自1,010个代表性游戏画面帧。基于Game2World(https://huggingface.co/papers?q=Game2World),我们提出了GameCleaner(https://huggingface.co/papers?q=GameCleaner),一个无需掩码的游戏UI移除模型,结合了多模态语义理解(https://huggingface.co/papers?q=multimodal%20semantic%20understanding)与视频编辑(https://huggingface.co/papers?q=video%20editing)能力。与基于掩码的方法不同,GameCleaner(https://huggingface.co/papers?q=GameCleaner)能直接识别并移除各类HUD元素,同时保留底层场景内容和时序动态(https://huggingface.co/papers?q=temporal%20dynamics)。在一项对照实验中,基于无UI游戏视频训练的世界模型,其整体VideoReward(https://huggingface.co/papers?q=VideoReward)比使用带UI覆盖数据训练的模型提升了6.83%。在UI移除评估中,GameCleaner(https://huggingface.co/papers?q=GameCleaner)在合成视频上达到了平均95.36的AAR,比最强的时序掩码基线高出57.3%,并在真实场景中取得了80.05的最佳AAR,同时保持了99.8%的背景保真度。这些结果证明了将互联网游戏视频转化为高质量世界模型训练数据的可扩展潜力。代码、数据集和模型将在https://github.com/Dongping-Chen/Game2World (https://huggingface.co/papers?q=Game2World)发布。

查看arXiv页面 (https://arxiv.org/abs/2608.24680)查看PDF (https://arxiv.org/pdf/2608.24680)GitHub0 (https://github.com/Dongping-Chen/Game2World)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24680)

通过您的代理获取此论文:

hf papers read 2608\.24680

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型关联此论文

在模型的README.md中引用arxiv.org/abs/2608.24680以从本页面关联。

引用此论文的数据集0

无数据集关联此论文

在数据集的README.md中引用arxiv.org/abs/2608.24680以从本页面关联。

引用此论文的Space0

无Space关联此论文

在Space的README.md中引用arxiv.org/abs/2608.24680以从本页面关联。

包含此论文的集合0

无集合包含此论文

将此论文添加到集合 (https://huggingface.co/new-collection)以从本页面关联。

相似文章

GameWAM:视频游戏的世界动作模型

arXiv cs.AI

GameWAM引入了首个用于视频游戏原生闭环游戏玩法和GUI控制的世界动作模型,联合生成视觉观察和可执行动作,具有竞争力的任务成功率,并揭示了源敏感性故障模式。

MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。

Wonder:更优的视频世界模型

Hugging Face Daily Papers

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。

从像素到状态:重新思考作为游戏引擎的交互式世界模型

Hugging Face Daily Papers

本文通过考察四个关键维度——动作控制、状态动态、状态-观测持久性和实时生成——重新思考了交互式世界模型作为游戏引擎的角色,并介绍了为《黑神话:悟空》构建的可扩展数据引擎,包含超过90小时的游戏数据,以推进状态感知的游戏世界建模。