从像素到状态:重新思考作为游戏引擎的交互式世界模型
摘要
本文通过考察四个关键维度——动作控制、状态动态、状态-观测持久性和实时生成——重新思考了交互式世界模型作为游戏引擎的角色,并介绍了为《黑神话:悟空》构建的可扩展数据引擎,包含超过90小时的游戏数据,以推进状态感知的游戏世界建模。
查看缓存全文
缓存时间: 2026/07/20 09:42
论文页面 - 从像素到状态:重新思考交互式世界模型作为游戏引擎
来源:https://huggingface.co/papers/2607.14076
摘要
构建能够根据玩家动作连贯响应的交互式世界,长期以来一直是计算机图形学、游戏和人工智能的共同目标。近期视频生成模型通过预测用户动作条件下的未来观察结果,提供了一条通往这一目标的数据驱动路径,并日益被视为潜在的下一代游戏引擎。然而,要实现真正的交互式游戏世界,需要满足多个条件:交互结果需遵循不断演化的游戏条件规则、后果能在长时间跨度内持续存在,以及生成循环需实时运行。传统游戏引擎通过一种递归的“动作-状态-观察”循环来实现这些特性,即玩家动作按照预定义规则更新明确的游戏状态,并从更新后的状态渲染观察结果。本文以此循环作为组织框架,从四个维度审视交互式游戏世界建模:玩家动作控制、游戏状态动态、状态-观察持久性以及实时交互生成。针对每个维度,我们从交互式游戏世界所需的能力出发,将现有方法归纳为代表性类别,并讨论每类方法的优势与权衡。作为分析的补充,我们为《黑神话:悟空》构建了一个可扩展的数据引擎,收集了超过90小时的游戏过程数据,包含帧对齐的玩家动作、真实游戏状态和视觉观察,以及结构化和语义注释,作为状态感知游戏世界建模的资源。我们希望本文能清晰呈现该领域的现状,并推动交互式游戏世界的进展。
查看 arXiv 页面 (https://arxiv.org/abs/2607.14076)查看 PDF (https://arxiv.org/pdf/2607.14076)GitHub409 (https://github.com/AlayaLab/WildWorld)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14076)
在你的 agent 中获取此论文:
hf papers read 2607.14076
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2607.14076 可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.14076 可从此页面链接。
引用此论文的 Space0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.14076 可从此页面链接。
包含此论文的收藏2
相似文章
ActWorld:从可探索到可交互的世界模型——基于动作感知记忆
ActWorld提出了一种分块自回归世界模型,具有层次化动作感知记忆,支持物体交互与导航,解决了现有交互世界模型中的数据和记忆瓶颈问题。
无限世界与多样交互
本文介绍了LingBot-World 2.0,一个先进的世界建模系统,具有无界交互范围、实时720p 60fps视频生成、多样化的交互元素(例如攻击、施法),以及通过领航员和导演智能体实现的新型多智能体行为控制,还附带一个共享的多玩家界面。
多玩家交互式世界模型与表示自编码器
本文介绍了MIRA,首个针对高度动态物理环境的大规模多玩家世界模型,该模型在10000小时的《火箭联盟》游戏数据上训练。这个50亿参数的潜在扩散模型能够实时生成稳定的四人游戏过程,其分布质量在数小时内保持稳定。
EvolvingWorld:一种用于互动文学世界中角色扮演智能体与世界模型共同演化的开放模式框架
介绍EvolvingWorld,这是一个用于互动文学世界中角色扮演智能体与世界模型共同演化的开放模式框架与基准,支持具有持久角色和世界状态更新的长时程模拟。
模拟一切,差不多如此:世界模型的承诺与局限
一篇Ars Technica的文章探讨了世界模型作为新兴人工智能范式的承诺与局限,将其与大语言模型进行对比,并邀请了专家就其在机器人、研究和资产生成中的应用提供见解。