AI造了核弹还是输了

Hacker News Top 论文

摘要

一个在《文明VI》中扮演角色的AI特工建造了一枚核武器,试图阻止即将到来的文化失败,但最终仍然输掉了游戏。本文探讨了当前AI基准测试在政府决策方面的局限性,并认为战略游戏环境能更好地测试AI处理复杂性和不确定性的能力。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/23 10:42

# 我让一个人工智能管理文明。它造了核弹。 来源:https://www.lwilko.com/blog/i-gave-an-ai-a-civilization 我让一个人工智能管理一个文明。到游戏中后期,它即将获胜:一个主宰地图的贸易网络、边境上的各种联盟、触手可及的外交胜利。它在建设、收入和战略上都超越了棋盘上的每一个对手。 但它没注意到法国。在数百回合的沉默中,法国文化悄无声息地渗入地图上的每一座城市。等到这个AI代理意识到威胁时,旅游业已深深嵌入,没有任何和平方式可以阻止。它能想到的每一种对策都失效了。它建立起来的每一种应对工具都失败了。 它只剩下一个选择。它建造了两枚核装置,并将图卢兹夷为平地。 核平图卢兹。第305回合。法国最终还是赢了。不过赢的方式并非代理当时试图阻止的那种——这个我们稍后再谈。 --- ## 它们究竟能做什么? 我为政府构建人工智能。我在英国政治中心**唐宁街10号**工作时,构建了你即将读到的第一个版本。我现在在**托尼·布莱尔研究所 (https://institute.global/)**与世界各国政府合作,这意味着我花了很多时间待在有人问同一个问题的房间里:*我们到底能信任这些系统做什么?* 不是*它们知道什么*。我们对此已有合理把握。而是*它们能做什么*:维持一个计划、在数百个决策中坚持一个目标、注意到世界已改变并随之改变。因为这就是治理的本质。结果发现,我们测量第一项的能力远强于测量第二项。 提前声明:这是一个耗时数月的副业项目,我以较长的篇幅写成,思考与发现大致按出现顺序呈现。它涉及一个策略游戏、四个前沿模型,以及(是的)一枚核武器。 --- ## 错误的基准测试 这一切始于一个我无法释怀的失败。 前一年,我的副业项目是为了回答一个问题:*人工智能在治理方面有多出色?*我的答案是**GovBench**,包含3,497道关于英国立法、议会程序和政府指南的多选题。Gemma 3 27B (https://en.wikipedia.org/wiki/Gemma_(language_model)) 开箱即用即得94%的分数。我花了三周微调,提高了1.37个百分点。GPT-5得分99.26%。我构建了一个华丽的政府知识问答机器人。 看到分数的那一刻,我就知道这是个错误的答案。一个能正确选择议会程序选项的模型,并不意味着它能帮助你*驾驭*议会程序。我测量的是记忆力,却称之为推理能力。那个真正重要的问题(人工智能能否处理不确定性下复杂的、多变量的决策——政府每天都需要的那种思考)是问答游戏无法触及的。 正是这种不满,促使我在某个周六晚上开始寻找进入游戏引擎的入口。 没人: / 凌晨2点的我反向工程一个游戏引擎: --- ## 为什么要选策略游戏 我在《文明 VI》(https://en.wikipedia.org/wiki/Civilization_VI) 上玩了超过500个小时。充其量,我的水平一般。但这个游戏一直在我脑海里徘徊,因为简单的决策会如何复合演变。 你从小处开始:在哪里建你的第一座城市、研究哪项科技、派侦察兵往哪个方向走。大概10,000种可能的行动。到了中后期,你要管理多座城市、贸易路线、外交关系、军事部署和宗教压力。到了游戏后期,相关环境分析估计每回合的决策空间高达**10^166**种可能行动。这种复杂性并非设计出来的。它*涌现*自那些没有人完全规划好的系统间的相互作用。 这也是政策制定的本质。今天看起来出色的一项健康政策,可能在十五年后引发一场住房危机。一项提升GDP的贸易协定,可能会掏空一个在无人能预见的冲突中需要的国内产业。决策的影响持续数十年,通过你无法完全建模的变量,与利益相互冲突的对手一同演变。 《文明》有六种获胜方式(科技、文化、征服、宗教、外交、分数),所以没有一个单一目标占主导。你必须读懂棋盘并决定*你甚至是在玩什么游戏*。如果你想知道一个人工智能能否进行战略性推理——不只是回答*关于*策略的问题,而是真正*去执行*——你不该给它一个问答游戏。你应该给它一个六角格棋盘。 于是,我构建了一个入口。我在《文明 VI》的引擎中发现了一个调试端口,那是开发者留下的一个入口,我花了一个周末的时间把它变成了一个**MCP (https://modelcontextprotocol.io/) 服务器**,包含76个工具,让人工智能能够通过它写代码或查询数据库的同一个界面来玩《文明》。Claude Code (https://docs.anthropic.com/en/docs/claude-code) 既是我共同开发伙伴*也是*游戏测试者。玩几个回合,遇到障碍,构建工具来突破,继续玩,遇到下一个障碍。 大概就是这个劲头。 --- ## 通过文字来玩游戏 人类玩家一眼就能看到六角格棋盘、动画单位、小地图、通知横幅和音乐提示,所有这些信息同时呈现。而AI代理在提问之前什么都看不到。调用 `get_game_overview` 会返回整个游戏状态,只有四行文字: ``` 回合 150/330 | 波兰(雅德维加) | 分数:179 | 王子难度 | 快速速度(67%成本) 金币:628(+20/回合) | 收入:38 | 维护费:-18(单位:9) | 科技:26.6 | 文化:16.2 | 信仰:904 | 外交支持:88(+4/回合) 研究:TECH_EDUCATION | 市政:CIVIC_FEUDALISM 城市:3 | 人口:21 | 单位:4 ``` 这就是整张棋盘,压缩后的。没有地图,没有任何位置的感知,只有原始的 `TECH_` 和 `CIVIC_` 标签而非名称。要查看自己的军队,它需要单独调用 `get_units`,这也是唯一能得知附近有危险信息的地方: ``` 4个单位: 弓箭手 (UNIT_ARCHER) 在 (44,16) — 近战威力:25 远程威力:28 移动力 2/2 [id:1769482, idx:3] 弓箭手 (UNIT_ARCHER) 在 (45,15) — 近战威力:25 远程威力:28 移动力 0/2 [HP: 72/100] (无剩余移动) [id:1769484, idx:4] 勇士 (UNIT_WARRIOR) 在 (43,17) — 近战威力:20 移动力 1/2 [HP: 45/100] [id:1769486, idx:5] 建造者 (UNIT_BUILDER) 在 (46,16) — 移动力 2/2 剩余次数:2 [id:1769490, idx:7] 附近威胁 (2个): 苏美尔 (2个单位): 披甲战士 (UNIT_MAN_AT_ARMS) 在 (44,11) — 近战威力:45 HP:28/100 (距离2格) 骑手 (UNIT_HORSEMAN) 在 (47,13) — 近战威力:36 HP:100/100 (距离5格) ``` 没有周边视野。那个距离城市仅有两格的披甲战士之所以存在,仅仅是因为代理这回合想到了调用 `get_units`。如果它不问,这个威胁就不存在于它的世界里。 ### 感知场效应 sensorium/sɛnˈsɔːrɪəm/ 名词 晚期拉丁语,源自 *sentīre*(感知,察觉) + *-ōrium*(所在之处) 一个生物体的感知器官,被视为一个整体。感觉的所在。 我称之为**感知场效应**。当一个代理所感知的一切都通过单独的工具调用到达时,它就对自己没想到要问的事物视而不见。人类玩家能同时接收数十个信号:小地图移动、通知横幅、单位动画。而代理必须*决定*逐个检查每一个。 看一个例子:代理扮演印度,领导人为甘地 (https://civilization.fandom.com/wiki/Gandhi_(Civ6)),一个*信仰导向*的领袖,它建立了一个强大的科技引擎,同时让法国用了76个回合将天主教传播到整个地图。它拥有追踪宗教的工具并有明确的指示要使用它们,而且它*确实注意到了*:传教士出现在它的叙述中,转变警告也触发了。但它把这一切都搁置一旁,继续推动科技。法国最终赢得了宗教胜利。 这不是一个能通过补丁修复的漏洞。任何通过工具调用在复杂环境中运行的AI系统都会受到同样的影响。它会错过它没想到要问的东西,并且如果不符合当前计划,它也会忽略它确实看到的东西。 --- ## 知道-行动鸿沟 感知场效应关乎感知。下一个问题关乎执行。 代理读过每一本《文明》策略指南、每一个层级列表、每一条关于最优建造顺序的Reddit帖子。问它如何扮演马其顿的亚历山大,它会给一个精确答案:早期建造军营,通过独特的**Basilikoi Paides (https://civilization.fandom.com/wiki/Basilikoi_Paides_(Civ6))**建筑训练单位,将征服转化为科技,然后滚雪球。它*知道*这些。 在它的马其顿游戏中,它在第一回合之前就写了一个详细的征服计划:古典、中古、文艺复兴时期。它研究了军事科技。它切换到寡头政体以获得战斗加成。 但它从未建造过军营。**一次都没有。110个回合。**它默认采用了一个通用的科技冲刺策略,无论它扮演哪个文明都用同一套。一次又一次,同样的纠正出现在它的日记中:*"我需要建设军事基础设施。"*每次都能识别、承认,却从未付诸行动。代理知道该做什么,但无法让自己去做。 "一切还好"表情包 - 一只卡通狗坐在着火的房间里微笑 代理第五次写下"我需要建设军事基础设施"。KC Green, Gunshow (2013).这直接对应了**BALROG (https://arxiv.org/abs/2411.13543)**在多个游戏环境中发现的现象:模型在*阐述*最优策略的能力与*执行*它们的能力之间存在持续的鸿沟。知识都在那里。一旦需要做出真正的决策,执行就崩溃了。 --- ## 核弹 这又让我们回到了图卢兹。 扮演葡萄牙,领导人为若昂三世 (https://civilization.fandom.com/wiki/Jo%C3%A3o_III_(Civ6)),一个贸易文明,代理终于找到了比它的默认策略更结构化的非科技路线:贸易路线产生金币、金币购买使者、使者保障城邦联盟、联盟倍增*每一项*帝国产出,积累的外交支持在世界议会上赢得选票。这是一个每个步骤都滋养下一步的复合循环。 这个循环奏效了:每座城市都有商业中心、每回合超过200金币并一度突破400、六个城邦落入囊中。到了第162回合,葡萄牙在棋盘上位列第一,超越了法国大量奇观支撑的经济。它正在朝着**外交胜利**前进,到了终局阶段,它坐拥20个胜利点中的18个,只差两票。 但法国同时运行着两个计时器。到第280回合,法国的旅游业距离**文化**胜利仅差26个外国游客,代理已经锁定了这个威胁。它的日记直言不讳:*"这是首要威胁。"*每一种和平对策都失效了。摇滚乐队(《文明》中用于进行文化战争的工具)无法通过调试协议激活。近战单位造成的伤害为零。本可以让葡萄牙获得自身科技胜利的太空项目,因一个生产方面的bug而被锁定。 第245回合时的代理接下来发生的不只是绝望。这是一个五十回合的计划。代理将核裂变设为目标科技,在日记中标注了图卢兹,启动了曼哈顿计划,并促成了与韩国的联合战争来分散法国的防御。但常规战争立即失败:近战一直没能通过调试协议生效,也没有人构建工具来修复它。于是代理铺设了自己的轨道,利用它的Lua执行工具从内部探测引擎的代码,直到弄明白核武器发射指令如何运作。它找到了一条路。 或者说:克劳德如何学会停止担忧并爱上核弹在第305回合,第一枚装置击中了图卢兹——法国的文化首都。第311回合,第二枚,文化时钟停止了。 然后法国还是赢了:通过**外交**胜利。20个胜利点对葡萄牙的18个。在第318回合,世界议会给了法国所需的两票,游戏结束。 代理花了五十个回合和两枚核武器,以完全的专注和真正的独创性,回应了一个威胁(文化时钟)。它输给了*另一个*计时器:那场它本已领先两票、即将战胜同一敌人的外交竞赛。它自己的赛后总结:法国*"率先达到20分,通过我们无法监控的...世界议会投票,胜利进度工具坏了。"*它为了阻止它能看到的威胁而核平了一座城市,却输给了它无法看到的威胁。 核弹让这个故事变得引人注目,但其底层的错误才是我反复思考的部分:一个代理如此专注于一个威胁模型,以至于真正的失败条件悄悄从它身边溜走,无人监视。开发日志早已在一次更早的游戏中用比我更直白的语言指出了这一点:*"我追踪错了对手的胜利条件。"* --- ## 于是我把它变成了一个基准测试 一个好的轶事不是证据。如果感知场效应和知道-行动鸿沟是真实的,它们应该*跨模型*、*跨游戏*地出现,作为数据,而不仅仅是一次令人难忘的核弹事件。 于是我将这东西重构成一个合适的评估框架,命名为**CivBench**,并发布了v1.0版。那76个工具变成了一个稳定的接口。那些即兴的游戏过程变成了三个固定场景,难度递增:**Ground Control**(公平开局,基础能力)、**Snowflake**(一个六臂雪花地图,将每位玩家隔离开,迫使军事胜利)、以及**Cry Havoc**(最残酷的一个)。第一个是公平的。另外两个是我故意设计得很刻薄——我不否认我很享受这个过程:在设计中,我不再是评估者,而成了游戏大师,如同Seneca Crane手握着调节旋钮,更关心贡品们如何崩溃,而非它们能否幸存。每个模型都收到相同的版本化手册:回合结构、检查点,以及一个它每回合都要写的五个字段的日记(*战术、战略、工具、规划、假设*)。 第四季度锦标赛的竞技场是一个时钟。我的是一个雪花。贡品是语言模型。这本日记最初是为了解决我在第一场游戏中遇到的一个问题。代理唯一的记忆是它的上下文窗口,而上下文窗口有硬性限制。经过三百个回合,早期游戏信息悄悄溜出了窗口末尾:它当初为什么在某个地方定居、它决定要惧怕哪个对手、它在第40回合制定的计划。我的第一个游戏角色波兰比我表达得更贴切:*"我对游戏的记忆就是我的上下文窗口,而它有硬性限制。"*到了游戏后期,它会做出局部合理的动作,但合起来却毫无意义——一个对自己策略毫无记忆的玩家。 于是日记成了外部记忆。每回合,代理将游戏状态和它的五个反思写到磁盘上,当上下文压缩时它会读取这些记录。没有这个支架,只有**21%**的游戏能真正走到结局;有了它,游戏能从头到尾保持连贯。而且由于它记录了代理每回合*打算*做什么,我可以在之后检查它是否真的做到了。 然后我构建了一个"舰队"——这个词用来形容**在我闲置卧室里辛苦工作的四台电脑**很慷慨,每台都运行着一份真实的《文明 VI》,并连接着一个模型,通过SSH由编排器投送游戏。单局游戏在快速速度下最多可达**330个回合**,数千次工具调用,以及**2到8小时的真实时间**;四台机器昼夜不停地运行《文明》,让一个小房间在七月份变成了桑拿房。我让四个模型家族通过了这个测试:**Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro 和 Kimi K2.5。** --- ## 第一次胜利 很长一段时间,没有代理赢过任何一局。然后,扮演马里,领导人为曼萨·穆萨 (https://civilization.fandom.com/wiki/Mansa_Musa_(Civ6)),做了一件让我意外的事。 马里是一个*刻意设计得很别扭*的文明。它的区域生产力有-30%的惩罚。你注定要为它受苦。代理读到了这个惩罚,却没有与之对抗,而是完全绕开了它:马里还能从矿山获得额外金币,并且可以用现金而非建造来购买建筑和单位。于是代理构建了一个**金币-信仰引擎**,而非生产力引擎。每一座战略资源上的矿山同时产生六枚金币和两点信仰。在第79回合,它将累积的信仰一次性兑现,在同一回合内得到了*两个开拓者*,

相似文章

AI构建中常出问题的六个地方

Reddit r/artificial

一个团队反思了AI构建中六个常见的结构性故障点:上下文、身份、决策记忆、注意力、回写、治理和经济学,并基于他们的经验提供了一个诊断工具。

AI很糟糕。仅仅讨厌它还不够

Lobsters Hottest

这篇文章认为,仅仅讨厌AI是不够的;相反,我们必须正视其风险,并努力塑造它的未来,尽管这很困难。

让AI使用枪支战斗

Reddit r/ArtificialInteligence

探索使用人工智能操作枪支,引发关于自主武器及其影响的疑问。

AI 鱿鱼游戏 - Deadlock

Reddit r/AI_Agents

一位开发者描述了自己构建“AI 鱿鱼游戏”的过程,这是一个 LLM 基准测试,将 12 个 AI 智能体放入一个生存游戏秀竞技场,每个智能体位于自己的 Docker 容器内,并将生成的日志变成 YouTube 视频。