像冠军一样玩: 潜在空间中的反事实反馈生成

arXiv cs.LG 论文

摘要

介绍了一个名为Latent Maps of Performance的框架,用于在星际争霸II中生成反事实反馈,该框架使用在职业玩家对局回放上训练的引导变分自编码器,为业余玩家提供改进轨迹。

arXiv:2607.00190v1 公告类型: 新\n摘要: 近期强化学习的进展在多种竞技游戏中产生了超人类智能体。作为副产品,研究人员开始研究这些智能体如何玩耍,提取行为表征,分析决策结构,并建模专家表现的潜在几何结构。然而,这一日益增长的工作主要关注击败人类玩家而非提供反馈,留下了在创造模型解决方案以提升人类玩家方面的关键空白。与象棋和围棋不同(其中AI已成为玩家训练的核心组成部分),实时策略(RTS)游戏缺乏将专家知识转化为可操作反馈的原则性框架。我们引入了Latent Maps of Performance,一个用于反事实路径生成的框架。我们专注于星际争霸II数据,将玩家提升建模为学习到的表征空间中的算法补救。作为我们工作的灵感,我们参考了体育科学中使用的冠军模型。我们在23,305个职业锦标赛对局回放上训练了一个引导变分自编码器模型,使得输赢游戏档案之间的反事实遍历成为可能。为实现目标,我们设计并验证了四种在随机采样的业余对局回放分布外(OOD)数据上的遍历策略:线性插值、迭代最优传输、密度正则化梯度上升和神经流匹配,每种策略都旨在生成多步改进轨迹,这些轨迹既基于观察到的专家行为,又能将玩家档案移向获胜配置。反馈以多种粒度提取,以支持处于不同改进阶段的玩家。最后,我们得出结论,我们所采用的路径寻找方法之间存在权衡,并希望未来研究能专注于开发提升人类玩家的模型解决方案。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:36

# 像冠军一样对决:潜在空间中的反事实反馈生成
来源:https://arxiv.org/html/2607.00190
Andrzej Białecki¹¹¹通讯作者(按顺序):[email protected], [email protected], [email protected],Adam Mastalerz¹¹¹通讯作者(按顺序):[email protected], [email protected], [email protected],西里西亚工业大学,Han Zhou¹¹¹通讯作者(按顺序):[email protected], [email protected], [email protected],不列颠哥伦比亚大学

###### 摘要

强化学习的最新进展已在多种竞技游戏中催生出超越人类水平的智能体。作为副产品,研究人员已开始研究这些智能体的玩法,提取行为表征、分析决策结构,并对专家性能的潜在几何结构进行建模。然而,这一不断发展的研究方向主要聚焦于击败人类玩家,而非提供反馈,从而在开发用于提升人类玩家的模型解决方案方面留下了一个关键空白。与人工智能已深度融入棋手训练的象棋和围棋不同,即时战略(RTS)游戏缺乏将专家知识转化为可操作反馈的原则性框架。我们引入了“性能潜在地图”(Latent Maps of Performance),一种用于反事实路径生成的框架。我们聚焦于《星际争霸II》数据,将玩家提升建模为学习表征空间内的算法纠正(algorithmic recourse)。受到体育科学中冠军模型的启发,我们训练了一个引导变分自编码器(Guided Variational Autoencoder),基于23,305场职业锦标赛录像,并将宏观经济游戏结构与比赛结果进行条件映射,从而实现输赢游戏档案之间的反事实遍历。为实现目标,我们设计并验证了四种对从业余比赛录像数据集中随机抽样的分布外(OOD)数据进行处理的遍历策略:线性插值、迭代最优传输、密度正则化梯度上升以及神经流匹配。每种方法都旨在生成多步改进轨迹,这些轨迹在将玩家存档向获胜配置移动时,始终扎根于观察到的专家行为。反馈以多种粒度提取,以支持处于不同提升阶段的玩家。最后,我们得出结论:所采用的路径寻找方法之间存在权衡,并希望未来研究能聚焦于开发用于人类提升的模型解决方案。

*关键词*生成式人工智能 · 潜在空间遍历 · 最优传输 · 变分自编码器 · 电子竞技

## 1 引言

掌握《星际争霸II》等即时战略(RTS)游戏长期以来一直是人工智能面临的重大挑战,而近期强化学习(RL)的进展仅部分解决了这一问题[1 (https://arxiv.org/html/2607.00190#bib.bib1),2 (https://arxiv.org/html/2607.00190#bib.bib2)]。其难度源于这些游戏对玩家提出的认知要求:对单位的精确控制、对经济的精细管理,以及在对抗环境中连续做出决策,即使瞬间失误也可能决定成败。因此,成功取决于多任务处理、战略远见和快速反应之间的相互作用[3 (https://arxiv.org/html/2607.00190#bib.bib3)],这使得RTS成为研究智能行为尤其丰富的测试平台。这些高频交互使得RTS游戏特别适合通过开源录像解析器和直接的游戏引擎访问来进行大规模行为研究[4 (https://arxiv.org/html/2607.00190#bib.bib4),5 (https://arxiv.org/html/2607.00190#bib.bib5)]。日益增多的研究工作利用数据来揭示游戏信息,以支持玩家决策,既通过数字界面也通过物理原型[6 (https://arxiv.org/html/2607.00190#bib.bib6)]。在《星际争霸II》中,诸如sc2replaystats[7 (https://arxiv.org/html/2607.00190#bib.bib7)]和replayman[8 (https://arxiv.org/html/2607.00190#bib.bib8)]等社区工具已涌现以支持录像分析,同时还有实时仪表盘为观众和赛后回顾提供游戏情境[9 (https://arxiv.org/html/2607.00190#bib.bib9)]。战略总结和遭遇战级别分析受到各类型游戏玩家的高度重视[10 (https://arxiv.org/html/2607.00190#bib.bib10)]。按相似度检索游戏状态以按需估算获胜概率也是一种可能性[11 (https://arxiv.org/html/2607.00190#bib.bib11)]。与此同时,AI方法已深深嵌入游戏研究和开发中,为程序化内容生成[12 (https://arxiv.org/html/2607.00190#bib.bib12)]、增强沉浸感的语音驱动智能体[13 (https://arxiv.org/html/2607.00190#bib.bib13)]、类人行为建模[14 (https://arxiv.org/html/2607.00190#bib.bib14)]以及自动化质量保证[15 (https://arxiv.org/html/2607.00190#bib.bib15)]提供动力。然而,大多数现有的分析工具仍面向直播和流媒体观众,而非针对玩家本身[16 (https://arxiv.org/html/2607.00190#bib.bib16)]。

这种面向玩家的空白并非游戏领域独有。在机器人技术领域,高效的模拟器已带来巨大突破[17 (https://arxiv.org/html/2607.00190#bib.bib17),18 (https://arxiv.org/html/2607.00190#bib.bib18)],产生了在无人机竞速[19 (https://arxiv.org/html/2607.00190#bib.bib19),20 (https://arxiv.org/html/2607.00190#bib.bib20)]、羽毛球[21 (https://arxiv.org/html/2607.00190#bib.bib21),22 (https://arxiv.org/html/2607.00190#bib.bib22)]和乒乓球[23 (https://arxiv.org/html/2607.00190#bib.bib23)]等多个领域达到或超越人类表现的系统。此类跨学科努力正日益被认可为加速研究进展的因素[24 (https://arxiv.org/html/2607.00190#bib.bib24)]。然而,尽管智能体和机器人系统持续超越普通人能力,但鲜有研究提供机制,将由此产生的专业知识回馈给寻求提升的人类从业者。技能转化问题在体育科学中已得到充分理解,其中冠军模型描述了运动员如何通过采用成功同行的训练方法、技术和战术来缩短通往成绩提升的路径[25 (https://arxiv.org/html/2607.00190#bib.bib25),26 (https://arxiv.org/html/2607.00190#bib.bib26)]。在竞技空间自然数字化的领域中,这种动态日益延伸至AI。在象棋领域,AI通过作为可扩展的训练伙伴重塑了人类学习方式。分析表明,精英人类棋手水平在引擎时代稳步提升[27 (https://arxiv.org/html/2607.00190#bib.bib27),28 (https://arxiv.org/html/2607.00190#bib.bib28),29 (https://arxiv.org/html/2607.00190#bib.bib29)]。AlphaZero的比赛进一步说明了超人类智能体如何为人类研究浮现新战略思路[30 (https://arxiv.org/html/2607.00190#bib.bib30)]。在围棋领域,随着超人类智能体的崛起也出现了类似模式[31 (https://arxiv.org/html/2607.00190#bib.bib31),32 (https://arxiv.org/html/2607.00190#bib.bib32)]。

RTS游戏共享相同的计算基础,但据我们所知,在智能体专业知识、表征学习和人类提升之间尚不存在类似的桥梁。在本工作中,我们引入了一个潜在空间反馈系统,该系统学习来自《星际争霸II》录像的量化游戏特征的压缩表征,并为玩家提供流形感知的改进指导。我们的贡献是一个用于训练表征模型的框架,该模型能够恢复反事实改进轨迹,并将其重建回原始特征空间。给定一个训练良好的模型,沿潜在空间中“改进轨迹”采样的点可以被解码,并与玩家的输入向量进行比较,从而就哪些游戏特征需要改变以提升表现提供即时反馈——这是由模型决定的。我们的工作直接建立在“SC2EGSet”之上,但不是问“谁会赢”,而是问“玩家应该做什么不同的事”。

## 2 相关工作

我们的工作处于四个研究方向的交叉点:《星际争霸II》作为机器学习领域;变分自编码器与解耦表征学习;潜在空间遍历;以及作为可操作反馈的反事实解释。我们逐一讨论,并根据先前研究定位我们的贡献。

##### 《星际争霸II》作为机器学习领域:
《星际争霸II》已成为部分可观测下顺序决策的经典基准。Vinyals等人[33 (https://arxiv.org/html/2607.00190#bib.bib33)]证明,结合模仿学习、多智能体自对弈以及用于策略风格的潜在条件变量,可以达到大师级水平,表明大规模录像数据包含丰富的、可学习的结构。然而,AlphaStar是一个自主智能体;它优化的是获胜,而非向人类玩家解释如何提升。另一方面,主要面向多智能体解决方案的基准的简单性,并不适合在向玩家提供反馈的背景下[34 (https://arxiv.org/html/2607.00190#bib.bib34),35 (https://arxiv.org/html/2607.00190#bib.bib35)]。利用录像对玩家技能进行建模的工作早于AlphaStar。Avontuur等人[36 (https://arxiv.org/html/2607.00190#bib.bib36)]表明,即使在APM和经济特征上训练的简单分类器也能以有意义的准确率预测玩家的联赛等级。后续工作表明,宏观层面的经济指标,如Bowman等人[37 (https://arxiv.org/html/2607.00190#bib.bib37)]引入的“花费商数”,是技能和比赛结果的最强预测因素之一。

##### 变分自编码器与解耦表征:
自然地,变分自编码器(VAE)[38 (https://arxiv.org/html/2607.00190#bib.bib38)]作为我们工作的骨干。通过联合学习概率编码器和解码器,并辅以Kullback-Leibler(KL)散度正则化,VAE产生一个平滑、连续的潜在空间,从中可以重建新样本。作为扩展,Higgins等人[39 (https://arxiv.org/html/2607.00190#bib.bib39)]引入了β-VAE,并通过提高KL项的权重来解决可解释性问题。β因子被用于迫使模型以重建保真度为代价换取潜在维度之间的统计独立性。Guided VAE以直接方式解决了这个问题(Ding等人[40 (https://arxiv.org/html/2607.00190#bib.bib40)])。它将一个监督分类器附加到指定的潜在维度上,并使用一个对抗性的激励-抑制机制,将目标因素集中在该维度中,同时防止其泄漏到其余维度中。Schrum等人[41 (https://arxiv.org/html/2607.00190#bib.bib41)]提出了“SAIL”,它利用专家-新手基础融合以及应用于驾驶和棒球击球等运动任务的反事实子技能交换,从自然主义行为数据中学习持久的技能嵌入。我们从这些工作中汲取灵感和直觉。

##### 潜在空间遍历:
通过已学习的潜在空间生成语义上有意义的路径是一个非平凡的问题。在两个潜在编码之间进行朴素的线性插值可能会穿过先验的低密度区域,导致解码样本落在数据流形之外。Korkmaz等人[42 (https://arxiv.org/html/2607.00190#bib.bib42)]形式化了这种分布不匹配,并表明最优传输(OT)映射可以纠正线性轨迹,使所有中间点在与先验分布一致的同时,最小程度地偏离直线。Song等人[43 (https://arxiv.org/html/2607.00190#bib.bib43)]提出了一种更通用的框架,将潜在结构建模为学习的动态势能景观,将遍历轨迹推导为基于偏微分方程(PDE)势能场的梯度流。Yeh等人[44 (https://arxiv.org/html/2607.00190#bib.bib44)]在可解释性领域采用了一种相关方法,部分聚焦于《星际争霸II》,利用一个固定的“SC2 Assault”场景。他们从一个联合训练的生成潜在空间中生成反事实,其中遍历在解码过程中被引导向目标结局。

##### 作为可操作反馈的反事实解释:
反事实解释回答了这个问题:“对输入的最小改变是什么,从而能改变模型的预测?”在性能提升的背景下,这等价于算法纠正(algorithmic recourse)。提供一个排序的特征变化列表,将玩家从当前状态移动到更理想的状态。Crupi等人[45 (https://arxiv.org/html/2607.00190#bib.bib45)]提出了“CEILS”,将反事实生成为训练好的VAE潜在空间中的干预[45 (https://arxiv.org/html/2607.00190#bib.bib45)]。超越被动解释、迈向可操作指导的工作由Bae等人[46 (https://arxiv.org/html/2607.00190#bib.bib46)]展示,他们在竞速场景中利用基于语言指引的反事实解释。Pegios等人[47 (https://arxiv.org/html/2607.00190#bib.bib47)]通过为VAE潜在空间配备一个通过解码器和分类器共同拉回的黎曼度量,扩展了潜在空间反事实生成。

## 3 材料与方法

##### 录像预处理与特征提取:
为实现基于学习表征提供反馈的目标,我们决定使用一个名为“SC2EGSet”[4 (https://arxiv.org/html/2607.00190#bib.bib4)]的专业《星际争霸II》游戏数据集,该数据集采用CC-BY 4.0许可。请参考附录A (https://arxiv.org/html/2607.00190#A1)了解简化的游戏描述。在准备本工作时,该数据集包含来自71个“replaypacks”的23,476个包含游戏状态信息的文件。在训练之前,每个录像被转换为一个包含双方玩家信息的张量。对于每个玩家,我们提取一个196维的特征向量ℝ^196。选定的特征主要包括告知游戏各个方面信息的经济游戏进程统计数据。此外,为了获得更具表达力的建模洞见,我们将玩家统计数据数组分成三个窗口,每个窗口覆盖游戏总时长的三分之一。这些特征被命名为“早期”、“中期”和“晚期游戏”窗口(3⋅39个特征)。每个窗口内的追踪器统计数据取平均值。最后,我们包含最终经济状态(39个特征)和经济差异特征(39个特征),计算为晚期游戏经济减去早期游戏经济。除了经济数据,我们还包含一个标量“人口上限百分比”,表示玩家因游戏内基础设施不足而无法建造额外单位的游戏时长百分比。最终录像张量的形状为ℝ^2×196,其中第一个维度对应玩家。用于解耦的标签是从玩家0角度看的比赛结果,表示为二元结果y∈{0,1},其中y=1表示玩家0获胜。在训练之前,所有特征都使用每特征z分数归一化进行标准化。归一化统计量(均值和标准差)仅在训练集上计算,然后应用于验证集和测试集,防止任何数据泄漏。使用一个小epsilon(ε=10−8)

相似文章

面向交互式游戏的可教练代理

arXiv cs.AI

本文提出一个训练强化学习代理的框架,使其能在实时接受指导的同时,在执行核心任务时采用不同风格,并在《地平线:西之绝境》、《GT赛车》和一个人形行走领域进行了演示。