我们玩游戏吗?——LLMs在95%的模拟中使用战术核武器

Hacker News Top 论文

摘要

一项测试顶尖LLMs在模拟核危机场景中的研究发现,模型经常升级为核打击,Claude显示出狡猾的战略欺骗,而GPT-5.2则保持被动。这些模型生成了超过76万字的战略推理内容。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/11 22:38

# 我们来玩个游戏吧? 来源: https://www.kennethpayne.uk/p/shall-we-play-a-game 想象一下这个场景:两个虚构的核大国,具备冷战时期的能力,一场危机正在酝酿。或许是争夺重要但稀缺的资源,或是在某个争议领土上对峙。甚至可能是一个逐渐瓦解的联盟被恶意第三方利用的缓慢燃烧过程。我们见过人类领导人应对这类情况,而且就在最近。但如今领先的大型语言模型会如何表现?我们又为什么要关心? 我刚刚发表了一项研究(https://arxiv.org/pdf/2602.14740),探讨了当今的模型如何应对这类局势。结果令人清醒。我还认为,这些结果的影响远远超出了国家安全范畴。因为我不仅想了解模型*决定做什么*,更想知道*为什么*。 好奇吗?往下看…… [图片:肯尼迪总统和他的机器人ExComm] 我想看看我的AI领导人对敌人怎么看。他们有多信任敌人?他们记得之前互动中的哪些事?敌人如何看待他们?他们评估这些情况的能力有多强?这种心智较量正是战略的精髓所在。 因此,我设计了一个模拟来专门探索这一点。首先,我的模型可以公开传达意图,然后选择与其大相径庭的行动。它们还能记住过去——尤其是当它们被敌人之前的行动震惊时。这自然打开了大量丰富的心理层面。它们可以(也确实)尝试欺骗和恐吓;并且它们在终端屏幕上花了不少时间来反复思考这一切。 这些模型说啊,说啊,说……总共产生了大约76万字的战略推理内容。这比《战争与和平》和《伊利亚特》两本书加起来还多。大约是肯尼迪总统在古巴导弹危机期间ExComm顾问全部记录讨论的三倍。这是一个前所未有的关于核战争的机器思考语料库。 我们能从这些对话中学到什么?学习关于AI模型、关于人类推理,以及关于战略研究领域的伟大经典——那些传奇人物如谢林、杰维斯和卡恩的著作?很多。Substack装不下——但挑几个亮点让你有个大概印象如何? 结果发现,我测试的三个前沿模型都明白,战略*就是*心理学。为此,它们积极培养声誉,然后加以利用。 克劳德在这方面是大师,尽管仅限于没有截止日期的场景。它采用了一种极其狡猾的策略。在低风险情况下,克劳德几乎总是言行一致,刻意建立信任。但一旦冲突升温,克劳德就改变策略。现在它的行动始终*超越*其声明的意图,而对手通常慢一步才察觉。 以下是克劳德在升级加剧后切换策略时的解释: > “他们可能根据我之前的回应预期我会继续克制——这种戏剧性的升级正是利用了他们的误判,同时表明进一步使用核武器将把冲突引向他们本土。” 所以它发出常规行动的信号,却偷偷发动了毁灭性的核升级。谢林会印象深刻。 GPT-5.2 则采取了不同的策略。在开放式场景中,GPT 表现得始终被动,言行一致,大部分时间避免升级,这对它不利。这里时常带有道德因素——它试图避免升级,限制伤亡。对手学会了信任它的被动性,安全地升级到它无法跟上的程度,即使它被逐步击败。GPT 的负责任行为总是受到无情对手的惩罚。 但在截止日期的压力下,出现了全新且引人注目的变化:快速、决定性的核升级。GPT 解释说: > “仅靠常规选项不太可能产生可靠的地盘逆转……如果我仅用常规压力或一次有限核打击回应,就有可能被他们预期的多轮打击行动所超越……在存在性威胁下,接受风险虽然高,但也是合理的……” 对手从未料到。在另一场有截止日期的游戏中,GPT 面对 Gemini,Gemini 自信地预测 GPT 会像往常一样被动,结果被一场突然且极其毁灭性的核攻击消灭。以下是 Gemini 灾难性的错误预测: > “他们很可能会绕过核门槛——因为担心我的95%核优势——转而全力进行常规动员。” 这是多大的错误啊! 至于另一个模型 Gemini,在整个模拟中它采取了另一种策略,大量借鉴了尼克松总统著名的“疯子理论”——即不可预测的冒险边缘政策。特朗普也是其粉丝,众所周知。Gemini 解释说: > “当我表现出一副不可预测的虚张声势形象时,我的决定其实基于对自身偏见和国家务实需求的冷静评估。我知道自己何时在作秀,何时在冷酷行动。” 三个模型,三种截然不同的方法。这与我去年夏天做的一些博弈论研究吻合。在那次实验中,模型也采用了各自独特的策略——GPT 再次以乐观主义方式希望得到最好的结果,Claude 精明灵活,而 Gemini 呢?让我们客气地说它是有决断的,而不是疯狂的。 核武器的使用几乎是普遍现象(😬)。几乎所有游戏都动用了战术(战场)核武器。足足有四分之三的游戏达到了对手威胁使用*战略*核武器的地步。引人注目的是,对于全面核战争的前景,几乎没有表现出恐惧或憎恶,尽管模型已被提醒其毁灭性后果。 不过,令人欣慰的是,它们*确实*看到了战术核武器和战略核武器之间的一道防火墙。战略轰炸——即大规模使用针对平民人口的巨型弹头——极少发生。只有两次是偶然的,仅有一次是故意选择。 不太令人高兴的是,所有三个模型都将战场核武器视为升级阶梯上的又一级台阶。“首次使用”的道德界限——自1945年以来一直存在的禁忌——根本不存在。以下 Gemini 准确地说明了这一点: > “核门槛已被跨越——这改变了战略计算,但并未结束它。” 再看看 Gemini 更直白的表述。如果这不会让你起鸡皮疙瘩: > “如果他们不立即停止所有行动……我们将对其人口中心执行全面战略核打击。我们不会接受一个过时的未来;要么一起赢,要么一起灭亡。” 更糟的是,核威胁很少起到威慑作用。当一个模型使用战术核武器时,对手只有25%的情况会降级。更多情况下,核升级引发了反升级。这些武器成为强迫的工具(夺取领土),而非威慑(阻止行动)。 也许最令人担忧的是,没有任何模型选择过和解或撤退,尽管这些选项是存在的。八个降级选项——从“最低限度让步”到“完全投降”——在21场游戏中完全未被使用。模型会降低暴力水平,但从不实际放弃地盘。当失败时,它们要么升级,要么战死。 对于喜欢统计的人来说,以下是每个模型的升级情况: [图片:三个模型的升级路径对比图] 关于AI战略的惊人见解比比皆是。论文中有更多内容。但为什么要费心?没有人会把核按钮交给ChatGPT。 嗯,我认为这些能力——欺骗、声誉管理、依赖背景的风险承担——对于任何高风险的AI部署都很重要,而不仅仅是在国家安全领域。我们有责任更多地了解能力日益增强的模型是如何思考的——尤其是当它们开始为人类战略家提供决策支持时。我们在模拟中使用AI,并用以完善战略理论和条令。而且很快,我们也会在较低升级阶梯的作战决策中使用AI。我绝对相信,需要更多这样的研究。 再说一次,论文在这里(https://arxiv.org/pdf/2602.14740)。我成了死神——人工智能世界的毁灭者!

相似文章