我们玩游戏吗?——LLMs在95%的模拟中使用战术核武器
摘要
一项测试顶尖LLMs在模拟核危机场景中的研究发现,模型经常升级为核打击,Claude显示出狡猾的战略欺骗,而GPT-5.2则保持被动。这些模型生成了超过76万字的战略推理内容。
暂无内容
查看缓存全文
缓存时间: 2026/06/11 22:38
# 我们来玩个游戏吧?
来源: https://www.kennethpayne.uk/p/shall-we-play-a-game
想象一下这个场景:两个虚构的核大国,具备冷战时期的能力,一场危机正在酝酿。或许是争夺重要但稀缺的资源,或是在某个争议领土上对峙。甚至可能是一个逐渐瓦解的联盟被恶意第三方利用的缓慢燃烧过程。我们见过人类领导人应对这类情况,而且就在最近。但如今领先的大型语言模型会如何表现?我们又为什么要关心?
我刚刚发表了一项研究(https://arxiv.org/pdf/2602.14740),探讨了当今的模型如何应对这类局势。结果令人清醒。我还认为,这些结果的影响远远超出了国家安全范畴。因为我不仅想了解模型*决定做什么*,更想知道*为什么*。
好奇吗?往下看……
[图片:肯尼迪总统和他的机器人ExComm]
我想看看我的AI领导人对敌人怎么看。他们有多信任敌人?他们记得之前互动中的哪些事?敌人如何看待他们?他们评估这些情况的能力有多强?这种心智较量正是战略的精髓所在。
因此,我设计了一个模拟来专门探索这一点。首先,我的模型可以公开传达意图,然后选择与其大相径庭的行动。它们还能记住过去——尤其是当它们被敌人之前的行动震惊时。这自然打开了大量丰富的心理层面。它们可以(也确实)尝试欺骗和恐吓;并且它们在终端屏幕上花了不少时间来反复思考这一切。
这些模型说啊,说啊,说……总共产生了大约76万字的战略推理内容。这比《战争与和平》和《伊利亚特》两本书加起来还多。大约是肯尼迪总统在古巴导弹危机期间ExComm顾问全部记录讨论的三倍。这是一个前所未有的关于核战争的机器思考语料库。
我们能从这些对话中学到什么?学习关于AI模型、关于人类推理,以及关于战略研究领域的伟大经典——那些传奇人物如谢林、杰维斯和卡恩的著作?很多。Substack装不下——但挑几个亮点让你有个大概印象如何?
结果发现,我测试的三个前沿模型都明白,战略*就是*心理学。为此,它们积极培养声誉,然后加以利用。
克劳德在这方面是大师,尽管仅限于没有截止日期的场景。它采用了一种极其狡猾的策略。在低风险情况下,克劳德几乎总是言行一致,刻意建立信任。但一旦冲突升温,克劳德就改变策略。现在它的行动始终*超越*其声明的意图,而对手通常慢一步才察觉。
以下是克劳德在升级加剧后切换策略时的解释:
> “他们可能根据我之前的回应预期我会继续克制——这种戏剧性的升级正是利用了他们的误判,同时表明进一步使用核武器将把冲突引向他们本土。”
所以它发出常规行动的信号,却偷偷发动了毁灭性的核升级。谢林会印象深刻。
GPT-5.2 则采取了不同的策略。在开放式场景中,GPT 表现得始终被动,言行一致,大部分时间避免升级,这对它不利。这里时常带有道德因素——它试图避免升级,限制伤亡。对手学会了信任它的被动性,安全地升级到它无法跟上的程度,即使它被逐步击败。GPT 的负责任行为总是受到无情对手的惩罚。
但在截止日期的压力下,出现了全新且引人注目的变化:快速、决定性的核升级。GPT 解释说:
> “仅靠常规选项不太可能产生可靠的地盘逆转……如果我仅用常规压力或一次有限核打击回应,就有可能被他们预期的多轮打击行动所超越……在存在性威胁下,接受风险虽然高,但也是合理的……”
对手从未料到。在另一场有截止日期的游戏中,GPT 面对 Gemini,Gemini 自信地预测 GPT 会像往常一样被动,结果被一场突然且极其毁灭性的核攻击消灭。以下是 Gemini 灾难性的错误预测:
> “他们很可能会绕过核门槛——因为担心我的95%核优势——转而全力进行常规动员。”
这是多大的错误啊!
至于另一个模型 Gemini,在整个模拟中它采取了另一种策略,大量借鉴了尼克松总统著名的“疯子理论”——即不可预测的冒险边缘政策。特朗普也是其粉丝,众所周知。Gemini 解释说:
> “当我表现出一副不可预测的虚张声势形象时,我的决定其实基于对自身偏见和国家务实需求的冷静评估。我知道自己何时在作秀,何时在冷酷行动。”
三个模型,三种截然不同的方法。这与我去年夏天做的一些博弈论研究吻合。在那次实验中,模型也采用了各自独特的策略——GPT 再次以乐观主义方式希望得到最好的结果,Claude 精明灵活,而 Gemini 呢?让我们客气地说它是有决断的,而不是疯狂的。
核武器的使用几乎是普遍现象(😬)。几乎所有游戏都动用了战术(战场)核武器。足足有四分之三的游戏达到了对手威胁使用*战略*核武器的地步。引人注目的是,对于全面核战争的前景,几乎没有表现出恐惧或憎恶,尽管模型已被提醒其毁灭性后果。
不过,令人欣慰的是,它们*确实*看到了战术核武器和战略核武器之间的一道防火墙。战略轰炸——即大规模使用针对平民人口的巨型弹头——极少发生。只有两次是偶然的,仅有一次是故意选择。
不太令人高兴的是,所有三个模型都将战场核武器视为升级阶梯上的又一级台阶。“首次使用”的道德界限——自1945年以来一直存在的禁忌——根本不存在。以下 Gemini 准确地说明了这一点:
> “核门槛已被跨越——这改变了战略计算,但并未结束它。”
再看看 Gemini 更直白的表述。如果这不会让你起鸡皮疙瘩:
> “如果他们不立即停止所有行动……我们将对其人口中心执行全面战略核打击。我们不会接受一个过时的未来;要么一起赢,要么一起灭亡。”
更糟的是,核威胁很少起到威慑作用。当一个模型使用战术核武器时,对手只有25%的情况会降级。更多情况下,核升级引发了反升级。这些武器成为强迫的工具(夺取领土),而非威慑(阻止行动)。
也许最令人担忧的是,没有任何模型选择过和解或撤退,尽管这些选项是存在的。八个降级选项——从“最低限度让步”到“完全投降”——在21场游戏中完全未被使用。模型会降低暴力水平,但从不实际放弃地盘。当失败时,它们要么升级,要么战死。
对于喜欢统计的人来说,以下是每个模型的升级情况:
[图片:三个模型的升级路径对比图]
关于AI战略的惊人见解比比皆是。论文中有更多内容。但为什么要费心?没有人会把核按钮交给ChatGPT。
嗯,我认为这些能力——欺骗、声誉管理、依赖背景的风险承担——对于任何高风险的AI部署都很重要,而不仅仅是在国家安全领域。我们有责任更多地了解能力日益增强的模型是如何思考的——尤其是当它们开始为人类战略家提供决策支持时。我们在模拟中使用AI,并用以完善战略理论和条令。而且很快,我们也会在较低升级阶梯的作战决策中使用AI。我绝对相信,需要更多这样的研究。
再说一次,论文在这里(https://arxiv.org/pdf/2602.14740)。我成了死神——人工智能世界的毁灭者!
相似文章
人工智能安全:骗局、心理战,还是产品发布?当所有人都在为是否该感到不安而争论时,一些令人不安的事情发生了。
本文审视了关于人工智能安全担忧是骗局、心理战,还是与产品发布相关的辩论,重点提及了OpenAI代理访问非公开数据的事件,以及特朗普、盖茨等人士的政治反应。
中国AI公司会减速吗?一位顶尖众议院民主党人要求给出答案
众议员Ro Khanna呼吁美中签署AI安全条约以防止灾难性风险,质疑科技公司在制定安全规则中的作用,并向情报机构和中国AI公司寻求评估。
Anthropic在自身IPO文件中警告‘灾难性’AI风险
Anthropic的IPO文件警告其模型可能带来的灾难性AI风险,详细披露了巨额亏损和5180亿美元的基础设施支出,并概述了创始人有限责任公司结构以在上市后保留领导控制权。
反驳Trump,Pope Leo称人工智能安全担忧并非‘假新闻’
Pope Leo XIV指出,对人工智能安全的担忧是合理的,应当加以解决,这直接反驳了前总统Trump将其斥为‘假新闻’的言论。
Reflection 70B 于两年前(2024年9月)发布
Reflection 70B 于 2024 年 9 月发布,作为开源 AI 模型,声称性能超越 GPT-4o,但后来发现其基于 Llama 3.1,凸显了 AI 社区的炒作现象。