从像素到状态:重新思考作为游戏引擎的交互式世界模型

Hugging Face Daily Papers 论文

摘要

本文通过考察四个关键维度——动作控制、状态动态、状态-观测持久性和实时生成——重新思考了交互式世界模型作为游戏引擎的角色,并介绍了为《黑神话:悟空》构建的可扩展数据引擎,包含超过90小时的游戏数据,以推进状态感知的游戏世界建模。

构建能够对玩家动作做出连贯响应的交互式世界一直是计算机图形学、游戏和人工智能的共同目标。最近的视频生成模型通过预测以用户动作为条件的未来观测,提供了一条实现该目标的数据驱动途径,并日益被视为潜在的下一代游戏引擎。然而,实现真正的交互式游戏世界需要交互结果遵循游戏状态演变的规则,需要后果在长时间跨度内持续存在,并且生成循环能够实时运行。传统游戏引擎通过一个循环的“动作-状态-观测”循环来实现这些性质:玩家动作根据预定义规则更新显式游戏状态,然后从该状态渲染出观测。本文以这一循环为组织视角,沿四个维度审视交互式游戏世界建模:玩家动作控制、游戏状态动态、状态-观测持久性和实时交互生成。针对每个维度,我们从交互式游戏世界所需的能力出发,将现有方法归类为若干代表性系列,并讨论每个系列的优势和权衡。作为这一分析的补充,我们为《黑神话:悟空》介绍了一个可扩展的数据引擎,收集了超过90小时的游戏玩法,包括帧对齐的玩家动作、真实游戏状态和视觉观测,以及结构化和语义注释,作为状态感知游戏世界建模的资资源。我们希望本文能清晰呈现该领域的研究现状,并推动交互式游戏世界的进步。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:42

论文页面 - 从像素到状态:重新思考交互式世界模型作为游戏引擎

来源:https://huggingface.co/papers/2607.14076

摘要

构建能够根据玩家动作连贯响应的交互式世界,长期以来一直是计算机图形学、游戏和人工智能的共同目标。近期视频生成模型通过预测用户动作条件下的未来观察结果,提供了一条通往这一目标的数据驱动路径,并日益被视为潜在的下一代游戏引擎。然而,要实现真正的交互式游戏世界,需要满足多个条件:交互结果需遵循不断演化的游戏条件规则、后果能在长时间跨度内持续存在,以及生成循环需实时运行。传统游戏引擎通过一种递归的“动作-状态-观察”循环来实现这些特性,即玩家动作按照预定义规则更新明确的游戏状态,并从更新后的状态渲染观察结果。本文以此循环作为组织框架,从四个维度审视交互式游戏世界建模:玩家动作控制、游戏状态动态、状态-观察持久性以及实时交互生成。针对每个维度,我们从交互式游戏世界所需的能力出发,将现有方法归纳为代表性类别,并讨论每类方法的优势与权衡。作为分析的补充,我们为《黑神话:悟空》构建了一个可扩展的数据引擎,收集了超过90小时的游戏过程数据,包含帧对齐的玩家动作、真实游戏状态和视觉观察,以及结构化和语义注释,作为状态感知游戏世界建模的资源。我们希望本文能清晰呈现该领域的现状,并推动交互式游戏世界的进展。

查看 arXiv 页面 (https://arxiv.org/abs/2607.14076)查看 PDF (https://arxiv.org/pdf/2607.14076)GitHub409 (https://github.com/AlayaLab/WildWorld)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14076)

在你的 agent 中获取此论文:

hf papers read 2607.14076

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2607.14076 可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2607.14076 可从此页面链接。

引用此论文的 Space0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.14076 可从此页面链接。

包含此论文的收藏2

相似文章

MASS:具有权威共享状态的多玩家世界模型

Hugging Face Daily Papers

本文介绍了MASS,一种多玩家世界模型方法,通过使用权威共享状态将世界动态与视图渲染解耦,从而实现可扩展且一致的多智能体模拟,支持多达1,024个并发玩家。

GameWAM:视频游戏的世界动作模型

arXiv cs.AI

GameWAM引入了首个用于视频游戏原生闭环游戏玩法和GUI控制的世界动作模型,联合生成视觉观察和可执行动作,具有竞争力的任务成功率,并揭示了源敏感性故障模式。