在信息几乎全隐藏的战棋游戏 Stratego 中

Ars Technica 论文

摘要

来自 CMU、MIT、NYU 和斯坦福的研究团队开发了 Ataraxos,仅用 16 块 GPU 训练就在 Stratego 中以 15 比 1 战胜了史上最顶尖的 Stratego 选手,克服了这一游戏海量隐藏信息和长时序决策的难题——这些问题曾让 DeepMind 的 DeepNash 都束手无策。

<p>1997 年,Deep Blue 在国际象棋中击败了 Garry Kasparov;2016 年,AlphaGo 打败了围棋高手 Lee Sedol;扑克 AI 多年来也一直在战胜职业选手。但有一款经典游戏始终未能被攻克,那就是《<em>Stratego</em>》。即便坐拥巨额预算的 DeepMind,也没能造出一台可靠击败最优秀人类选手的机器。</p> <p>如今,来自 Carnegie Mellon、MIT、纽约大学和斯坦福大学的研究团队终于做到了。他们开发的 AI 名叫 Ataraxos,以 15 比 1 战胜了被认为是有史以来最强的《<em>Stratego</em>》选手 Pim Niemeijer,另有四局平局。而训练它只花了 16 块 GPU 和几千美元。</p> <h2>暗藏的兵力</h2> <p>在《<em>Stratego</em>》中,每位玩家拥有 40 枚棋子,分别代表从元帅到间谍的不同军衔,外加炸弹和军旗。夺取对方军旗即获胜。对手知道你的棋子<em>在哪里</em>,却不知道它们<em>是什么</em>。只有当两枚棋子在交战中碰撞时,身份才会揭晓——较弱的一枚被移除,获胜者的身份随之公开。这使《<em>Stratego</em>》成为一款不完全信息博弈游戏,与扑克类似,而计算机早在多年前就已破解了扑克。“《<em>Stratego</em>》有一个非常独特之处,它包含海量的隐藏信息,而且这些信息会在极长的时间跨度中逐步展开,”该研究的合著者、NYU 研究员 Eugene Vinitsky 说道。</p><p><a href="https://arstechnica.com/science/2026/10/ai-finally-beat-the-best-stratego-player-in-history-and-did-it-on-a-budget/">阅读原文</a></p> <p><a href="https://arstechnica.com/science/2026/10/ai-finally-beat-the-best-stratego-player-in-history-and-did-it-on-a-budget/#comments">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/10/01 17:04

# 在大多数信息都被隐藏的情况下,战略棋游戏《Stratego》曾让人工智能束手无策——直到现在 来源:https://arstechnica.com/science/2026/10/ai-finally-beat-the-best-stratego-player-in-history-and-did-it-on-a-budget/ 1997 年 Deep Blue 在国际象棋中击败了 Garry Kasparov,2016 年 AlphaGo 在围棋中击败了 Lee Sedol,而扑克机器人多年来也一直在战胜职业选手。但有一款经典游戏《Stratego》一直未能被攻克。即便是拥有雄厚预算的 DeepMind,也无法造出一台能可靠战胜顶级人类玩家的机器。 如今,来自 Carnegie Mellon、MIT、New York University 和 Stanford University 的一个研究团队做到了这一点。他们的 AI 名为 Ataraxos,以 15 胜 1 负 4 平的成绩击败了 Pim Niemeijer——可以说是历史上最出色的《Stratego》玩家。而训练它只用了 16 块 GPU 和几千美元。 ## 隐藏的军队 在《Stratego》中,每位玩家拥有 40 枚棋子,代表从元帅到间谍的不同军阶,外加炸弹和军旗。取胜方式是夺取对方的军旗。对手知道你的棋子*在什么位置*,却不知道它们*是什么*。只有当两枚棋子在战斗中相遇时身份才会揭晓——较弱的一枚被移走,获胜方的身份也随之暴露。这使《Stratego》成为一种不完全信息博弈,就像多年前计算机就已破解的扑克一样。“《Stratego》有一个非常独特之处,那就是它包含海量的隐藏信息,而且这些信息在非常长的时间尺度上逐步展开,”纽约大学研究员、该研究的共同作者 Eugene Vinitsky 说道。 在某些扑克形式中,隐藏信息量很小。在得州扑克中,”你只有两张暗牌,”MIT 计算机科学家、另一位共同作者 Gabriele Farina 说。这只有 1,326 种可能的起手牌,少到足以让机器逐一权衡。“而在《Stratego》中,棋盘上有 40 枚棋子,它们可以以任何顺序排列,”Farina 说。可能的局面组合超过一京兆(decillion,10^33)种。此外还有游戏的时长。 “在国际象棋中,一局通常持续 40 步,但在《Stratego》中,一局很容易持续 2,000 步,”Farina 说。更进一步,《Stratego》还是一款虚张声势(bluffing)的游戏。有时你会移动一枚弱子,表现得仿佛它是元帅,只是为了吓退对手。当玩家过于频繁地虚张声势时,他们的威胁就失去了意义;当他们从不虚张声势时,又会变得容易预测。团队解释说,正是这种微妙的平衡,让此前的 AI 如 DeepMind 于 2022 年推出的 DeepNash 一筹莫展。

相似文章

这款下棋AI成为Stratego新王者

MIT News — Artificial Intelligence

来自MIT、卡内基梅隆大学、纽约大学和斯坦福大学的研究人员开发出一款AI,它以压倒性优势击败了顶级人类Stratego玩家,采用的高效训练方法比DeepMind等先前方案便宜得多。该系统发表于《自然》杂志,可推广到其他策略类游戏,有望辅助现实世界中不确定性下的决策,如商业谈判和网络安全。