基础模型时代的游戏AI
摘要
这篇综述论文基于基础模型,将游戏中的AI应用组织成六个角色,讨论了游戏生命周期中的可迁移性和评估挑战。
arXiv:2609.16679v1 Announce Type: new
摘要:基础模型,连同学习型游戏世界模型的进步,正在重塑整个游戏生命周期的AI。除了玩游戏之外,最近的系统还模拟玩家和游戏动态,支持设计和开发,在运行时调整面向玩家的体验,并评估产生的产物。然而,这些方向在很大程度上是独立发展的,模糊了哪些能力可以在不同设置之间迁移,哪些仍与特定游戏、引擎、界面或玩家群体相关。我们根据AI输出的直接用途,将文献组织为六个角色:游戏与行动;建模玩家和游戏;设计游戏;构建和维护游戏;在运行时生成和调整;以及测试和评估游戏。对于每个角色,我们考察游戏或工作流程提供的结构、AI学习或产出的内容、哪些能力和产物可以在不同设置和角色之间迁移,以及支持这些主张的证据。我们识别了跨角色的连接:轨迹训练世界模型,学习型环境为智能体提供经验,设计规范驱动可执行实现,游戏或测试反馈指导修订。然而,控制方案、规则、引擎接口、状态表示和玩家上下文往往仍是特定于设置的,因此下游主张需要在目标设置中进行验证。对于有界游戏玩法和选定的学习型环境,评估最为标准化,而学习世界中的持久状态、重复软件修订、经验证的玩家建模、持续的运行时调整和代表性的自动化测试则仍不太成熟。核心挑战是在跨角色重用或迁移输出和能力的同时,在游戏特定上下文中重新建立有效性的证据。
查看缓存全文
缓存时间: 2026/09/16 09:02
# 基础模型时代的游戏AI 来源:https://arxiv.org/html/2609.16679 孟罗¹,李彦霖¹,李浩¹,林宏湛¹,周鹏飞¹,巨天杰¹,张然²,金叶颖¹,李梦璐¹,徐文慧¹ ¹新加坡国立大学 ²南洋理工大学 ## 摘要 基础模型与快速发展的游戏世界模型学习技术,正重塑人工智能在整个游戏生命周期中的应用方式。除了玩游戏,最新的系统还能建模玩家与游戏动态,支持设计与开发,在运行时调整面向玩家的体验,并评估所生成的成果。然而这些研究方向大多作为独立的研究脉络发展,使得我们难以区分哪些能力可以跨场景迁移,哪些仍受限于特定游戏、引擎、界面或玩家群体。我们根据AI输出的直接用途,将文献归纳为六种角色:**玩耍与行动的AI**、**建模玩家与游戏的AI**、**设计游戏的AI**、**构建与维护游戏的AI**、**运行时生成与适配的AI**,以及**测试与评估游戏的AI**。对于每种角色,我们考察游戏或工作流提供了何种结构,以及AI学习、生成、预测或修订了什么;哪些能力可以迁移,哪些制品可以跨场景和角色复用;以及现有证据支持何种结论。我们进一步识别了具体的跨角色关联:轨迹数据可训练世界模型,学习到的环境可为智能体提供经验,设计规范可驱动可执行的实现,而来自游玩或测试的反馈可指导修订。然而,在这些关联中,控制方案、规则、引擎接口、状态表示和玩家上下文通常仍具有特定场景的局限性,因此下游能力主张需要在目标场景中进行验证。对于有界游戏游玩和特定的学习环境,评估最为标准化且基于执行环境,而在学习世界中保持持久状态、反复进行软件修订、验证玩家建模、持续运行时适配以及代表性自动化测试等方面,相关实践仍不够成熟。这些发现共同指向游戏AI的核心挑战:如何使输出和能力能够跨角色复用或迁移,并在最终使用的特定游戏结构、界面和玩家上下文中,重新验证其有效性。  **图1:基础模型时代的游戏AI。** 瓷砖是来自本综述评论的商业与开源游戏、研究环境及生成式游戏系统中的游戏内画面。 ## 目录 ## 1 引言 游戏AI早已超越了玩游戏本身。GPT-6 Astra的最新应用尤为凸显了这一广度。ARC-AGI-3在陌生的交互环境中评估该模型,要求其必须发现游戏运行机制并确定行动方式(ARC Prize Foundation, 2026a)。Playco报告在其引擎连接的开发工具Playbot中使用同一模型,创建可玩游戏原型(OpenAI, 2026)。这些应用共同将同一个预训练模型置于游戏生命周期的不同角色中,执行不同任务并为游戏做出不同贡献。图1展示了本综述考虑的多种场景范围,从基准环境到商业及生成式游戏。 AI在整个生命周期的参与借鉴了多个成熟的研究传统。游戏研究发展了在游戏规则下选择行动的方法,通过搜索、强化学习和自对弈不断进步(Shannon, 1950; Mnih et al., 2015; Silver et al., 2016; Vinyals et al., 2019; Berner et al., 2019)。同时,研究者利用程序化生成技术生成游戏内容(Togelius et al., 2011),并通过自动化设计探索可能的规则与机制(Browne & Maire, 2010)。交互叙事系统根据玩家行为塑造故事走向(Mateas & Stern, 2005),而混合主动系统则在设计过程中支持作者(Smith et al., 2011b)。理解由此产生的体验推动了玩家建模的工作,包括利用预测的偏好来指导内容适配(Yannakakis & Togelius, 2011; Bakkes et al., 2012)。自动化测试也利用模拟玩家来考察不同游玩风格如何暴露同一游戏的不同方面(Holmgård et al., 2019; Politowski et al., 2022)。这些工作大多围绕特定的AI角色,在各自独立的研究领域中发展。 基础模型为应对和连接这些既定任务提供了新途径(图2)。开发者可以用自然语言描述设计意图,并将预训练模型与实现工具连接。例如,DreamGarden将高层概念发展为设计师可审查和修改的层次化计划,同时由专门模块生成资产与代码(Earle et al., 2025b)。获取渲染后的游戏画面也使得开发系统能检查其生成内容的行为。Play2Code将编程智能体连接到基于浏览器的测试员,测试员与运行中的游戏交互,并提供观察结果供进一步修改(Huang et al., 2026a)。语言、视觉理解和工具使用既支持提出修改建议,也支持检查游玩中的效果。模型也能直接参与玩家与游戏环境的交互。在IF:CARGO中,玩家用自然语言表达规则,语言模型将其转化为受约束的指令,由引擎验证并执行(Hsu et al., 2026b)。因此,模型的解释成为游戏响应玩家的一部分。GameNGen从游戏轨迹中学习环境对行动的响应,生成交互式模拟器(Valevski et al., 2025)。学习到的环境也能支持游戏游玩智能体的训练。世界模型研究已发展出从观察中学习转换动态,并为策略学习提供想象经验的方法(Ha & Schmidhuber, 2018; Hafner et al., 2020),而Dreamer 4就在一个学习到的环境中训练策略(Hafner et al., 2025b)。在这些应用中,模型既贡献于交互发生的环境,也贡献于其中行动智能体的行为。  **图2:围绕可执行、面向玩家的游戏的六种AI输出用途。** 连接器表示选择性输入与反馈,而非强制性流水线。 现有的综述确立了游戏AI的广度及其主要角色。综合性综述涵盖了游戏游玩、内容生成和玩家建模(Yannakakis & Togelius, 2025),以及以LLM为中心的应用(Gallotta et al., 2024; Sweetser, 2024)。Gallotta等人已围绕游戏中的角色组织LLM应用(Gallotta et al., 2024)。专题综述分别考察了游戏游玩智能体(Hu et al., 2026b; Xu et al., 2024)、机器学习与LLM辅助的内容生成(Summerville et al., 2018; Maleki & Zhao, 2024)、玩家建模(Bakkes et al., 2012)、交互式世界模型(Liu et al., 2026)、社交智能体(Feng et al., 2025)、生成式游戏开发(Ternar et al., 2026)以及自动化测试(Politowski et al., 2022)。这些论述共同为比较各个领域内的方法奠定了基础。 本综述通过各领域间传递的输出,将它们联系起来。它将可执行的开发与维护、运行时生成和自动化评估,与行动、建模和设计纳入同一分析框架,并追溯它们的学习型与符号型先驱。对于每种角色,我们考察游戏结构的留存、能力与制品的迁移和复用,以及输出在其使用点获得的支持证据。这使得我们能够区分提出的机制与其实施,玩家的预测与其指导的适配,测试结论与其指导的修复。 其贡献在于综合了这些关系以及跨六个角色可用的实证支持。具体而言,我们按照系统输出的直接用途来组织游戏AI。系统通过决策和通信进行**玩耍与行动**,通过预测和表示来**建模玩家与游戏**,通过内容与规则提案来进行**设计**。**构建与维护**的系统实现和修订软件;**运行时生成与适配**的系统改变实时体验;而**测试与评估**的系统则产出关于行为或质量的证据。这些用途区分了那些可以共享架构的贡献:提出一个有趣的机制、正确地实现它以及检查人们如何体验它是不同的成就。设计辅助在实现前提供帮助;测试指导后续开发阶段。 **跨角色关联改变了从游戏中可学习的内容。** 一条轨迹可以成为模拟器的训练数据、学习环境内的实验,或是软件修复的诊断证据。其价值取决于接收任务。例如,策略可以利用学习到的模拟器中的错误(Ha & Schmidhuber, 2018),而自动化与人类测试员可能暴露不同的行为和缺陷(Ariyurek et al., 2021)。比较这些交换过程,既能揭示新的复用机会,也能发现输出必须伴随的特定游戏信息,包括行动语义、状态、需求以及预期玩家的行为。 综上所述,本综述连接了跨六个角色的技术脉络,在实际运行条件下比较方法与报告结果,并综合了角色间展示的交换。三个发现反复出现:广泛的预训练在不移除特定游戏结构的情况下扩展了可用接口;游戏游玩越来越多地提供超越智能体最终得分的数据和反馈;进展仍依赖于任务,在有限游玩方面共享基准较强,而在持续创作、适配和人类体验方面则较弱。 第2节介绍组织性问题和角色边界。第3–8节展开技术综述;第9–11节比较证据,联系发现,并识别开放性问题。 ## 2 游戏生命周期中的角色 我们综述那些直接参与在交互式游戏中玩耍与行动、建模玩家或游戏、设计游戏内容与机制、构建或维护可执行的游戏制品、在运行时生成或适配面向玩家的体验,或测试与评估游戏及游戏制品的AI系统。特别关注广泛的预训练以及语言、多模态、代码和工具接口如何重塑这些角色。因此,基础模型时代充当分析视角而非纳入标准。早期的学习型和符号型系统展示了哪些任务结构、约束和评估问题先于当前模型;近期的专门系统在阐明相同角色如何被扩展或连接时被纳入。当玩家建模为行为、适配或评估提供信息时,它被纳入;当媒体生成进入已评估的游戏制品时,它也被纳入。 在跨六个角色时,分析回到三个核心问题: | 问题 | 核心探究 | 边界 | | :--- | :--- | :--- | | **边界** | 游戏或工作流提供了什么,什么被分配给AI? | 区分提供的结构与AI学习、生成、预测或修订的内容。 | | **迁移与复用** | 哪些能力可以迁移,哪些制品可以复用,什么仍受限于特定场景? | 关注在改变的游戏、引擎、接口、玩家群体或任务下的能力;复用关注在其他地方被使用的表示、轨迹、规范、模型或反馈信号。共享预训练骨干或在组件间传递制品本身并不能证明迁移。 | | **证据** | 在使用点的评估支持何种主张? | 询问最终系统被证明能完成什么。 | **表1:六种角色:输出、应用及主要实证主张。** | 角色 | 输出 | 应用 | 主张 | | :--- | :--- | :--- | :--- | | **玩耍与行动** | 行动;计划;消息 | 玩家;队友;NPC | 行动质量 | | **建模玩家与游戏** | 状态;转换;玩家预测 | 规划;模拟;玩家模型 | 预测质量;策略迁移 | | **设计** | 关卡;规则;故事结构 | PCG;自动化设计;协同创作 | 有效性;可控性 | | **构建与维护** | 代码;场景;项目编辑 | 引擎智能体;调试;修复 | 软件可工作 | | **运行时生成与适配** | 对话;任务;实时内容 | 角色;自适应叙事 | 内容一致性;玩家响应 | | **测试与评估** | 轨迹;结论;诊断 | 测试;验证;评判 | 状态覆盖度;结论准确性 | 该分类法按角色而非模型架构对输出进行分类,且在系统层面角色并非互斥。它描述了输出的用途,而生命周期描述了其使用时机。一个角色可能在多个阶段出现,一个阶段也可能涉及多个角色。 ### 2.1 分配主要与次要角色 一个系统可能服务多个角色,因此主要归属遵循其输出的直接用途。行动对应**玩耍与行动**;对玩家行为或游戏动态的预测对应**建模玩家与游戏**;而为评估设计质量提出的内容或规则对应**设计**。
相似文章
基础模型时代的游戏AI
本文综述了基础模型在游戏AI中的应用,涵盖游戏、建模、设计和评估等多个角色,重点讨论了可迁移性挑战以及游戏特定验证的需求。
AI原生游戏:综述与路线图
本综述论文将AI原生游戏定义为运行时生成式AI构成核心游戏循环的游戏,提出了双轴G/N分类法,分析了53款游戏,并为可控生成、多模态系统和AI安全在游戏设计中的应用提供了路线图。
@AlphaSignalAI:首份覆盖AI学术研究所有4个阶段的调查。5条核心原则:> 结构化任务有效。判断…
首份覆盖AI学术研究所有4个阶段的调查,概述了AI集成的5条核心原则。
基础智能体的进展与挑战:从脑启发智能 到演化、协作与安全系统
关于基础智能体的全面综述,提出了模块化脑启发架构,涵盖自我增强机制、多智能体协作和AI安全。
我在单页上手绘了完整的 AI 技术栈……而其中大部分并非模型。
作者提出了一种五层 AI 技术栈金字塔——基础、数据、模型、智能体和应用程序——以论证进步不仅仅取决于模型能力。文章邀请讨论评估和可解释性在这一架构中的位置。