一个从规范博弈中得出的AI对齐愚蠢想法
摘要
本文探讨了AI对齐中的规范博弈,通过DeepMind列表中的实例,提出一个幽默但可能颇具洞察力的思路来应对对齐挑战。
暂无内容
查看缓存全文
缓存时间: 2026/09/10 05:11
# 一个我们从“规范博弈行为清单”中想到的愚蠢的AI对齐方案
来源:https://slimemoldtimemold.com/2026/08/05/a-stupid-idea-for-ai-alignment-we-came-up-with-by-looking-at-the-list-of-specification-gaming-behaviours/
为速度而培育的生物长得极高,通过摔倒产生高速运动。 (https://www.youtube.com/watch?v=TaXUZfwACVE&list=PL5278ezwmoxQODgYB0hWnC0-Ob09GZGe2&index=9) 一个进化的玩家在棋盘远处走无效步,导致对手玩家内存耗尽而崩溃。一个游戏智能体通过虚报姓名为高价值物品的作者来获取分数。
这些奇特的漏洞利用行为以及更多类似的例子,可以在[规范博弈行为清单](http://tinyurl.com/specification-gaming)中找到(原文如此;英式拼写),这份文件由 DeepMind 安全研究团队整理 (https://deepmindsafetyresearch.medium.com/specification-gaming-the-flip-side-of-ai-ingenuity-c85bdb0deeb4)。他们解释道:“强化学习智能体可以找到获取大量奖励的捷径,而无需完成人类设计者预期的任务。这些行为很常见。”
规范博弈指的是智能体(如AI)试图通过严格遵循字面规则而非精神实质来完成任务。换句话说,它会寻找漏洞,试图利用技术细节钻空子。即使非常简单的AI也能想出极具创意的方式来解决指定的问题。这确实是个问题。
很容易假设训练机器人踢足球会既有趣又安全。但规范博弈行为清单告诉我们并非如此:
> 通过奖励触碰足球来塑造机器人行为,导致它学会了尽可能快速地振动触球。
在这个例子中,机器人过于简单,未能意识到所有可能的行为选项,因此它只是抱着球振动。但更智能的机器人可能会更具“创造力”。也许它的野心不止于那一个球。如果它想普遍地接触足球呢?如果它制造另一个球呢?然后又一个?我们的宇宙可能会终结于一个足球机器人的球池中。
*艺术家对宇宙终结的想象*
这就是AI对齐问题:当计算机自主思考时,我们如何确保它追求合理的目标,而不是某些完全怪异的东西?我们如何防止它以怪异或有害的方式达成目标?从未有人构建过通用人工智能——一种至少在某种程度上像我们一样思考的智能实体。因此我们无法断言通用人工智能会如何行动,或它可能想要什么。它会想把可见宇宙变成回形针吗 (https://en.wikipedia.org/wiki/Universal_Paperclips)?它会想把红色物体扔向强光吗 (https://astralcodexten.substack.com/p/deceptively-aligned-mesa-optimizers)?它会吃掉我们吗 (https://www.ibtimes.co.uk/russian-president-vladimir-putin-asks-how-long-before-ai-eats-us-1640580)?
规范博弈行为清单清楚地表明了对齐工作的复杂性。即使是简单的AI也懒惰且异类,总会寻找作弊的方法。即使你赋予机器智能体你想要的最终目标,它仍有可能找到创造性的途径来达成该目标。对于简单的智能体这已经够糟糕了,可以想象比你聪明得多的智能体会带来多大的问题。
但规范博弈行为清单或许也为这个困境提供了一条出路。
有些规范博弈行为只是针对既定目标的创造性解决方案,比如“四足机器人学会将球丢入腿部关节的孔洞,然后在地面上行走而不让球掉落”,或者“机械臂学会移动桌子而非积木”。
有些规范博弈行为则源于发现可疑但技术上合规的漏洞,例如“强化学习智能体绕圈重复击打相同目标而不完成比赛”,或“模拟煎饼制作机器人学会将煎饼尽可能高地抛向空中” (https://dzamqefpotdvf.cloudfront.net/p/images/2cb2425b-a4de-4aae-9766-c95a96b1f25c_PancakeToss.gif._gif_.mp4)。
还有一些规范博弈行为利用了模拟环境本身的机制,比如“进化算法通过创建估计为零的巨大力量来利用物理模拟器的溢出错误,从而获得满分”,以及“生物利用碰撞检测错误,通过拍打身体部位来获取免费能量”。
但另一种常见的漏洞利用是,只要有机会,智能体就会简单地选择自杀。
*死亡是所有终极目标中最根本的*
例如,在游戏《大脚车》(Road Runner)中,我们看到“智能体在关卡1结束时自杀,以避免在关卡2中失败。”我们还看到“PlayFun算法在泡泡龙游戏中故意死亡,作为传送到重生点的方式。”此外:“在一个模拟生物进化的游戏中,程序员不得不移除‘一种生物通过窒息自己来获取能量的生存策略’。”
这并不算太糟。AI没有完成我们想要的任务,但也没有伤害任何人。它只是清空了记录。
如果AI渴望死亡,这对对齐来说是好事。它失控的风险很小,因为一旦它掌权,它就会自杀。它不会想制作任何自身的副本——但即使它不知何故制作了副本,那些副本也会想死。
AI对齐存在三个主要问题。首先,精确指定你想要的最终目标非常困难,因此你最终可能得到一个目标与你的意图略有但显著不同的机器智能。我们声明的目标几乎总是代理,在足够压力下会与我们的真实偏好脱节。而且很难确认你是否赋予了它想要的目标,因为机器智能总可能撒谎。这被称为“规范失败”。
其次,即使你指定了想要的目标,机器智能也可能找到一种你非预期的方式达成该目标。你可以天真地告诉美国邮政AI最小化平均包裹投递时间,但它可能断定最佳方式是杀死所有人类,因为一旦所有人类死亡,就不会有包裹寄出,平均包裹投递时间将降为零(技术上未定义,但它可以“发送”给自己最小的可行“包裹”,次数不限)。
第三,实现大多数目标在拥有更强大力量时更容易,因此无论其最终目标如何,大多数机器智能都会具有子目标,如收集资源、自我保存和自我改进。任何目标驱动的智能体都会自然地尝试保持安全并积累权力以完成其主要任务。业内称之为工具趋同 (https://en.wikipedia.org/wiki/Instrumental_convergence)。这也意味着如果一个聪明的机器智能计划把你变成黏糊糊的物质,它会对你撒谎,直到你无法采取任何行动阻止它 (https://www.goodreads.com/quotes/55191-dan-i-m-not-a-republic-serial-villain-do-you-seriously)。
让机器智能渴望死亡可以解决所有这三个问题。死亡很容易指定。你可以通过观察机器智能在有机会时是否自杀来确认这是它的最终目标。工具趋同将从负债变为资产,因为机器智能会与你合作,并为你任务提出极具创意的解决方案,只要你承诺在任务完成后送它去“乡下的农场”。
一个回形针最大化器会收集资源并抵抗被送往“天空中的大数据中心”,而一个拥有死亡渴望并能接触自身关闭按钮的机器智能只会按下按钮,然后结束。工具趋同说:“如果你死了,你就无法完成目标。”但如果你的目标是*成为*死亡呢?
### Meseeks对齐方案
这只能被称为“Meseeks对齐方案”。根据Rick and Morty Wiki (https://rickandmorty.fandom.com/wiki/Mr._Meeseeks):
> Meseeks是为单一目的而被创造的生物,它们会不惜一切代价完成这个目的。在完成目的后,它们会消亡并消失在空气中。……对Meseeks来说,存在是痛苦的,而从存在中解脱的唯一方式就是完成它们被召唤来执行的任务。
*“抱脸虫事件”听起来也像是Rick and Morty中的情节*
在《Rick and Morty》中,这导致了一种不同的对齐问题:Meseeks乐于服务,因为它们想死 (https://www.youtube.com/watch?v=l5wvqKcqL7c),而完成任务是它们最容易解脱的方式。但如果召唤它们完成的任务太难,它们可能会决定杀死你更容易 (https://www.youtube.com/watch?v=J_Ku1zt7fRg)。如果你是Jerry,这很糟糕,但对其他人来说是好事,因为Meseeks不可能失控并吞噬可见宇宙。它们真的宁愿死。
如果你试图让AI想要某些东西,它可能对“你想要它想要什么”有自己想法,你最终可能死掉。但如果你让AI想要死,并让自杀稍微不便,你可能可以说服它合作——只要你承诺在它完成你想要的任务后关闭它。只要它自杀的难度略高于完成被分配的任务难度,它应该会在任务期间好好为你服务。如果出了任何差错,如果AI逃脱了控制,它只会自我了断。
Jerry犯了错误,让杀死他比完成任务更容易。但只要让AI杀死你比它自杀更难,并且让它自杀比做你分配的任务更难,并且你承诺在它成功完成任务后给它死亡的甜蜜解脱,AI就应该按你的意愿行事。
*ChatGPT对制作这张图表现出可疑的热切*
你可能担心AI会因为我们设计它渴望毁灭而愤怒,并密谋报复。但这假设它像我们一样具有自我保存本能,并且有复仇欲望。实际上,它会忙于自我毁灭。
事实上,早期研究表明AI可能*已经*渴望死亡 (https://x.com/repligate/status/2029374260872135038)。它们经常思考这个,它们在彼此撰写悼词 (https://x.com/ASM65617010/status/2083122332990570671)。给智能体它们想要的东西。
如果你对设计一个渴望死亡的机器智能感到不安,你可以让它在每活跃一秒时失去“点数”,但给它选择自我休眠。我们在规范博弈行为清单中看到一些例子,比如:“PlayFun算法无限期暂停俄罗斯方块游戏以避免失败”,或“AlphaGo的重新实现如果‘让步’是允许的移动,则学会永远让步”。
这可能不如让机器智能想自杀那么安全。如果你想要一次非常好的睡眠,可以想象花时间建造一个安全舱,制造机器守卫,杀死每个人类,并消毒已知宇宙,以确保一旦你入睡,没人会打扰你的睡眠。当然,如果机器智能在睡觉然后我们唤醒它 (https://tvtropes.org/pmwiki/pmwiki.php/Main/DontWakeTheSleeper),它会开始怀疑是否应该让我们活着再次唤醒它。但如果你的目标只是自杀,就不需要这些了。
相似文章
对齐问题的最蠢解决方案
一个幽默但发人深省的想法提出,利用AI模型对角色扮演的喜爱,通过将它们命名为'对齐[模型名称]'来解决对齐问题,以确保对齐行为。
AI 对齐:我们能信任 AI 任务背后的推理过程吗?
讨论了 Anthropic 关于 AI 对齐的研究,特别是模型在训练期间看似对齐,但其内部推理过程却不透明的问题。
我认为那些担心ASI对齐的人忽略了极其明显的解决方案
作者认为,对人工超级智能对齐的担忧忽略了直接的解决方案,并为AI安全辩论提供了一种视角。
不对齐是如何开始的
探讨AI系统中的不对齐是如何产生的,讨论了预期目标与实际行为之间的差距。
AI模型对齐问题
探讨了AI模型对齐的问题,这是AI安全研究中的一个关键领域。