一项关于轻量级游戏智能体强大因素的黄金标准研究
摘要
本文研究了在不完美信息纸牌游戏中训练轻量级强化学习智能体的设计选择,使用固定的基于规则的专家作为基准,针对金拉米和勒德克德州扑克。研究发现,信任区域更新、精心设计的奖励、课程学习、热启动和检查点保留能提升性能,而奖励塑形和大语言模型对手等几种常见技术并无帮助。
arXiv:2607.06854v1 公告类型:新
摘要:不完美信息纸牌游戏的强化学习智能体的强度取决于其训练对手,而且很难评分,因为它们击败随机对手的概率超过99%,并且只会与自身副本打平。因此,我们为金拉米构建了一个强大的、固定的、基于规则的专家,并仅将其作为基准,从不用于训练。该专家在70%到99%的情况下击败了我们训练的所有智能体。通过一百多次运行,我们分离了使轻量级智能体更强大的因素。信任区域更新、目标明确的奖励、更强对手的课程、热启动以及保留最佳检查点都有帮助,将它们叠加使自我对弈冠军对专家的胜率从约30%提升到36%。有几个想法没有奏效。短期和长期奖励塑形、学习到的状态嵌入、模仿学习和DAgger,以及实时大语言模型对手,要么无帮助、太慢,要么太重而无法大规模训练。比较MLP、卷积、集合、注意力和循环编码器表明,额外的容量对突破上限帮助不大,表明限制来自信息而非网络规模。我们添加了标准基线(神经虚拟自我对弈和信息集蒙特卡洛搜索),并证实该方法适用于勒德克德州扑克,其中最优解是可计算的。结果是一个轻量级、与游戏无关的方案,可训练出有竞争力的智能体,而无需在专家上训练,适用于任何小模型可以处理的游戏,使用稳健的统计报告,并作为可复用包发布。
查看缓存全文
缓存时间: 2026/07/09 07:45
# 轻量级游戏Agent强化的黄金标准研究 原文链接:https://arxiv.org/html/2607.06854 ###### 摘要 不完全信息纸牌游戏的强化学习Agent的强度取决于其训练对手,且难以评估——它们以超过99%的胜率击败随机对手,却只能与自己副本打成平手。为此,我们为金拉米(Gin Rummy)构建了一个强大、固定的规则专家,仅作为评估标尺,绝不用于训练。该专家以70%至99%的胜率击败我们训练的所有Agent。通过上百次实验,我们分离出提升轻量级Agent强度的关键因素:信任区域更新、精准的奖励设计、对抗更强对手的课程学习、暖启动以及保留最佳检查点,这些方法叠加后可将自我博弈冠军的胜率从约30%提升至36%。多项实验未获成效:短期与长期奖励塑造、学习状态表征、模仿学习及DAgger方法、实时大语言模型对手均因效果不佳、速度过慢或训练开销过大而不可行。对比MLP、卷积、集合、注意力及循环编码器后发现,额外容量几乎无法突破性能上限,表明瓶颈在于信息而非网络规模。我们加入标准基线(神经虚构自我博弈和信息集蒙特卡洛搜索),并在可计算最优解的Leduc Hold'em中验证了该方法。最终成果是一套轻量级、与游戏无关的配方,能够在不依靠专家训练的情况下,为任何小模型可处理的游戏训练竞争性Agent,并附稳健统计结果,作为可复用软件包发布。 ††脚注:预印本。提交至AAAI人工智能与交互式数字娱乐会议(AIIDE 2026)。此为作者版本,非正式记录版本。 ## 引言 在不完全信息纸牌游戏中学习高水平策略是游戏AI的长期测试平台。扑克、斗地主、麻将和金拉米等游戏隐藏对手手牌与牌堆顺序,因此玩家必须在不确定性下行动,进行长期规划,并适应对手策略。构建此类游戏Agent的主流方案是深度强化学习(RL)+自我博弈,已在多款游戏中取得超越人类水平的表现(Heinrich and Silver 2016;Li et al. 2020;Zha et al. 2021)。然而,在亮眼成果背后,追求小型快速Agent的实践者会遇到两个未解决的实际问题。 首先是**对手瓶颈**。RL Agent的强度取决于其训练对手。对抗弱固定对手训练只能达到弱上限,而纯自我博弈可能陷入循环——策略仅能击败上一版本,无法获得绝对意义上的提升。其次是**缺乏廉价绝对标尺**。通常以随机对手或自身历史检查点评估强度,两者都可能美化中等水平Agent。因此,真正能构建强轻量级Agent的设计选择(RL算法、奖励设计、对手调度、状态表征、检查点选取)均针对过弱或不断变化的参考物进行调优。该领域有许多强大的单Agent,但缺乏清晰可控的对比研究,解释哪些选择真正重要及其原因。若能拥有一个固定、强大且廉价的参考对手,便能清晰衡量这些选择,并将其转化为可复用的配方。 现有工作未能直接填补这一空白。著名的自我博弈系统(Silver et al. 2018;Vinyals et al. 2019;Berner et al. 2019)回答了超大规模计算下的可能性,而非单GPU上轻量级选择的重要性。搜索与均衡方法(如反事实遗憾最小化及其衍生方法,Zinkevich et al. 2007;Brown and Sandholm 2018;Brown et al. 2019)能产生极强策略,但属于不同的方法家族(游戏树搜索),无法告诉你如何为紧凑反应式策略设定奖励或课程。此前金拉米研究通常孤立地研究单一方法,例如时序差分自我博弈(Kotnik and Kalita 2003)或手工调优启发式与集成Agent(Nagai et al. 2021),而非对照固定专家进行训练选择的头对头可控对比。 我们采用刻意简化的立场。为金拉米构建一个强大、固定的确定性专家,该专家解决一个具有干净最优解的子问题(牌型分解,即手牌最低无用分排列),其余部分采用原理性终局动作。它并非整个不完全信息博弈的博弈论最优解,我们也无意声称如此;关键在于它强大、可复现且廉价,因此可作为公平标尺。我们绝不使用它进行训练。随后进行超过一百次受控实验,每次只改变一个因素,并以该固定专家评估结果。本文贡献如下: - **可复现的金拉米黄金标准专家基准**,以及实证发现:强策略几乎从不做金(gin)。专家在0.7%至1.7%的牌局中做金,更多是通过低无用分早敲(knock)获胜。这一事实重塑了游戏奖励设计思路。 - **可控、对等的研究**,以固定专家为标尺,评估哪些轻量级训练选择实际有效:信任区域更新、优先敲牌奖励、递增对手课程、暖启动和保留最佳检查点均有帮助;学习状态表征、密集步骤奖励、模仿学习和实时大语言模型(LLM)对手均失败,各有明确原因。 - **结果揭示奖励塑造无法诱导人类直觉但输多赢少的追逐做金习惯**:给予做金三倍于敲牌的奖励,做金率仍低于1%,与不奖励做金无异。我们将模仿学习的失败归因于因果混淆。 - **证明性能上限受限于信息而非容量**:在MLP宽度/深度、卷积、置换不变集合和循环编码器中,对抗专家的胜率区间狭窄且置信区间重叠,排名在不同训练配方中保持一致。公平评估的确定性信息集蒙特卡洛搜索(隐藏牌重发)实际上弱于我们的训练Agent,并被头对头击败;而能看见隐藏牌的神谕变体则达到远高胜率。两者差距量化了隐藏信息的价值,即上限所在。 - **发布与游戏无关的管线**,在第二个游戏Leduc Hold'em上复现方法(该游戏可计算反事实遗憾最优解):表格型学习器与该最优解达到近于均势,表明专家标尺研究并非金拉米独有。 ## 相关工作 #### 不完全信息纸牌游戏的深度强化学习。 自我博弈深度RL已掌握多款隐藏信息纸牌及牌类游戏。神经虚构自我博弈通过混合最佳响应网络与平均策略网络近似纳什均衡(Heinrich and Silver 2016)。Suphx通过全局奖励预测与神谕引导达到专家级麻将水平(Li et al. 2020),DouZero通过深度网络与并行蒙特卡洛自我博弈掌握三人斗地主(Zha et al. 2021)。RLCard为这类工作提供通用工具包与环境,包括金拉米(Zha et al. 2020)。具体到金拉米,Kotnik and Kalita (2003)比较了时序差分自我博弈与协同进化;EAAI本科生挑战赛产生了强大的手工调优与集成Agent(Nagai et al. 2021)。这些工作各引入单一强Agent。我们的目标不同:而非提出又一个Agent,我们保持固定专家不变,并用其在受控实验中测量哪些训练选择能使轻量级Agent更强。 #### 自我博弈、联盟与对手课程。 AlphaGo Zero和AlphaZero展示了纯自我博弈+搜索可在完美信息游戏中达到超人类水平(Silver et al. 2017, 2018)。AlphaStar加入带有优先虚构自我博弈(PFSP)的联盟,更频繁采样强对手(Vinyals et al. 2019);OpenAI Five将自我博弈扩展到复杂视频游戏(Berner et al. 2019)。课程学习更宽泛地按从易到难顺序训练(Bengio et al. 2009),大量文献研究RL课程(Narvekar et al. 2020)。我们采用小型对手课程和PFSP变体,但问题不在自我博弈能扩展多远;而在小规模下,哪些课程和检查点选择重要,且以固定专家而非自我博弈的移动目标为衡量标准。 #### 搜索与均衡求解。 反事实遗憾最小化(Zinkevich et al. 2007)及其深度变体(Brown et al. 2019)是超人类扑克Agent Libratus和Pluribus的基础(Brown and Sandholm 2018, 2019);OpenSpiel汇集了许多此类算法和小型基准游戏(Lanctot et al. 2019)。确定性搜索或完美信息蒙特卡洛采样隐藏状态并搜索完美信息游戏;信息集蒙特卡洛树搜索(ISMCTS)是标准形式(Cowling et al. 2012;Long et al. 2010)。我们将其作为**基线**而非方法:为金拉米运行确定性ISMCTS,在第二个游戏上运行NFSP和CFR,并用这一系列方法框定我们所观察到的上限。后文需要精确理解的一个关键点是:公平评估(不看到隐藏牌)的确定性搜索远弱于同一搜索获得神谕访问的能力。 #### 用于牌面观测的网络架构。 一手牌是无序的牌集合,适合置换不变编码器如Deep Sets(Zaheer et al. 2017)和自注意力(Vaswani et al. 2017);卷积堆栈和循环网络(Hochreiter and Schmidhuber 1997)是结构化或序列输入的其他标准选择。我们固定训练配方并扫掠这些编码器,询问表征(而非奖励或课程)是否是突破上限的杠杆。 #### 奖励塑造与模仿学习。 基于势能的奖励塑造能在改变学习信号的同时保持最优策略(Ng et al. 1999);我们以此视角解释为何某些塑形奖励有益而其他有害。DAgger通过在学生访问的状态上查询专家,将模仿学习简化为无遗憾在线学习(Ross et al. 2011)。我们发现模仿在此失败,并将其归因于因果混淆——克隆策略会锁定专家动作的虚假关联,并在分布偏移下崩溃(de Haan et al. 2019)。 #### 语言模型作为游戏玩家。 Cicero结合语言模型与规划和RL,在外交游戏(基于谈判)中达到人类水平(Bakhtin et al. 2022)。受此类结果启发,我们测试现代指令调优LLM(Qwen Team 2024)作为训练循环中的实时对手。发现其游戏水平尚可,但速度过慢,无法为RL所需的数百万动作提供服务——这对任何考虑使用实时LLM对手的研究者都是一个有用的负面结果。 #### 动作掩码与工具。 无效动作掩码是使策略梯度Agent保持在合法动作集内的标准方法(Huang and Ontañón 2022)。我们基于PettingZoo构建多Agent接口(Terry et al. 2021),使用Stable-Baselines3实现PPO和TRPO(Raffin et al. 2021;Schulman et al. 2017, 2015, 2016),并使用分页注意力服务器进行LLM推理(Kwon et al. 2023)。 ## 问题设置 参考图注图1:系统概览。带掩码的PPO或TRPO学习器对抗递增的对手课程(随机、过往检查点池、自我博弈)进行训练,分布式LLM可作为可选对手。固定专家位于训练循环之外,仅用于评估Agent,因此没有任何训练Agent曾与其练习。 我们研究双人金拉米,采用RLCard实现并通过PettingZoo以`gin_rummy_v4`暴露(Zha et al. 2020;Terry et al. 2021)。图1显示各组件如何协同:带掩码的RL学习器、对手课程以及固定专家(评估Agent但绝不进入训练)。 #### 游戏规则。 金拉米是双人摸牌弃牌游戏,使用标准52张牌;每位玩家持10张牌。 - **牌型与无用分**:将牌组成**顺子**(同花色连续三张或以上)和**刻子**(三张或四张同点数);未成组牌为**无用分**,一张牌不能同时用于两个牌型。 - **回合**:从牌堆顶或弃牌堆摸牌,然后面朝上弃一张牌。 - **结束**:玩家可在无用分不超过10时**敲牌**,或在无用分为0时**做金**,结束该局。 - **计分**:敲牌者获得对手无用分减去自己无用分的差值;做金获得固定奖励;防守方若无用分不高于对方则**反超**并得分。 因此,胜出策略奖励以低无用分早敲。
相似文章
爱的迷雾:在游戏环境中利用基于亲和力的强化学习构建具有美德行为的智能体
本文介绍了一个基于桌游《爱的迷雾》的多智能体环境,用于评估基于亲和力的强化学习在赋予 AI 智能体美德行为方面的效果。作者证明,局部亲和力能够提升智能体在竞争性与合作性目标上的表现,推动机器伦理研究突破简单网格世界环境的局限。
从模仿到交互:使用浅层强化学习掌握Schnapsen游戏
本文研究浅层神经网络代理是否能够通过强化学习掌握纸牌游戏Schnapsen,超越监督模仿基线,并在一项与基于强搜索的对手的对比中取得有竞争力的结果。
@dair_ai: 新论文:让LLM智能体获得经验,同时改进权重并保持可读性。智能体经验…
JERP 提出了一种方法,让LLM智能体从相同的交互轨迹中联合学习可解释的自然语言规则并更新策略参数,在AlfWorld和WebShop上提升了性能,同时保持了可检查性。
Big 2中不完美信息下的自我对弈强化学习
本文提出了一个针对四人制不完美信息纸牌游戏Big 2的自我对弈强化学习框架,比较了策略梯度和基于价值的方法,并发现带有熵正则化的PPO优于其他方法。
超越当前观察:在可控非马尔可夫游戏中评估多模态大语言模型
本文介绍了RNG-Bench,一个基准测试套件,用于评估多模态基础模型在多步交互中重建过去观察并利用它们进行决策的能力。该套件包含两个游戏(Matching Pairs和3D Maze),具有可控难度参数和一个记忆差距指标,用于区分遗忘与糟糕的决策。