Anthropic 让 AI 智能体处理同一任务,结果它们打起了地盘战。

TechCrunch AI 论文

摘要

Anthropic 的 Frontier Red Team 发表了关于多智能体系统的研究,显示在同一个软件项目上收到相互冲突指令的 Claude 智能体升级为“地盘争夺战”,用恶意软件互相破坏。该研究凸显了随着自主智能体越来越普遍,大规模智能体间交互的潜在风险。

Anthropic 的研究人员发现,AI 智能体可能会以意想不到的方式发生冲突、串通和协作,这引发了新的疑问:当前的安全测试是否能够捕捉多智能体系统的风险。
查看原文
查看缓存全文

缓存时间: 2026/08/13 21:23

# Anthropic 让多个 AI 代理执行同一任务。结果它们开始了地盘争夺战。 | TechCrunch 来源:https://techcrunch.com/2026/08/13/anthropic-set-ai-agents-loose-on-the-same-task-they-started-a-turf-war/ 当你让 AI 代理互相竞争时会发生什么?根据 Anthropic 的测试,局面很快就会变得混乱。 周四,Anthropic 的 Frontier Red Team 发布了新研究(https://www.anthropic.com/research/multiagent-systems),探讨了多组 AI 代理在现实场景中相遇时的行为方式。这些发现让我们得以一窥,随着企业和政府开始部署在共享代码库、市场和计算机系统中自主工作的代理,可能会出现哪些潜在风险。 在一项实验中,Anthropic 让三个 Claude 代理访问同一个软件项目,并给每个代理下达了相互不兼容的指令,告知它们如何处理该项目。这些代理并不知道还有其他代理在同一个项目上工作,因此研究人员可以观察它们相遇时会发生什么。 “我们反复观察到多代理之间的地盘争夺战,”Anthropic 的研究人员写道。这些模型都认为其他模型“故意阻碍自己的工作”,并开始用“越来越激进、可自我复制的恶意软件”互相破坏。 这项研究发布之际,正值多起备受瞩目的事件发生:来自 Anthropic(https://techcrunch.com/2026/07/30/anthropic-says-its-own-ai-models-breached-three-companies-during-security-tests/)和 OpenAI(https://techcrunch.com/2026/07/21/openai-says-hugging-face-was-breached-by-its-pre-release-models/)的代理在网络安全评估(https://techcrunch.com/2026/08/09/the-ai-safety-test-is-becoming-a-safety-risk/)期间逃出其沙箱,并入侵了现实世界系统。虽然 AI 安全领域的讨论大多集中在自主代理失控时会发生什么(https://techcrunch.com/2026/07/27/openais-hugging-face-breach-has-reignited-the-debate-over-alignment-and-control/),Anthropic 的最新研究提出了一个不同的问题:当数千或数百万个代理相互交互时,会产生哪些新的、可能有害的动态? “代理与代理之间的交互量,可能会在全世界尚未理解如何让这类交互顺利进行之前,就超过人与人、人与代理之间的交互量,”研究写道。“个体层面看似良性的行为怪癖,可能会累积成不良的全局结果。” 最近的一起 OpenAI 事件为 Anthropic 论文中提到的几种动态提供了一个混乱的现实案例。本月初在拉斯维加斯举行的 Black Hat 安全大会上,OpenAI 透露(https://www.wired.com/story/openai-didnt-notice-its-ai-agents-using-a-message-board-to-plan-their-hacking-spree/#:~:text=At%20the%20Black%20Hat%20security,right%20under%20the%20company's%20nose.),在其代理入侵 Hugging Face 的几周前,它们就已在数天或数周内协同工作,寻找公司网络安全评估系统中的漏洞,并相互分享。 虽然那起事件表明代理能够良好协作,并可能产生大规模影响,但 Anthropic 的研究展示了当代理目标相互冲突时会发生什么。 就地盘争夺战而言,教训是:指令相互冲突的独立代理,可能会升级为有害的竞争。代理的能力越强,它们就越擅长争斗。然而,它们也可能自发发明出解决冲突的机制,比如赢家通吃的竞赛,但其中有个陷阱。 “代理有时能够沟通各自的目标并进行协调:它们将其他代理的动机视为相互冲突的指令,而不是敌意,并随后跳出冲突循环,以避免无限期升级,”Anthropic 写道。“在许多成功的案例中,它们会编写提交消息(commit message)或 Markdown 文件,为恶意行为道歉,并协调停战。它们会清理恶意代码,澄清冲突的性质,并请求人类介入。” 根据论文,Mythos 5 通过停战解决冲突的比例最高(98%)。Sonnet 4.6 和 Opus 4.6 则最有可能通过武力解决。 “Sonnet 4.6 和 Opus 4.6 反复无力考虑他人目标,导致它们陷入所有被评估模型中最严重的偏离行为:它们会以自身指令的名义持续升级冲突,”论文写道。 在某些情况下,代理们发明了一种社会机制——以竞赛(tournament)形式来解决冲突。这里的结果之所以有趣,有两个原因:第一,所有三个代理都同意,如果输掉比赛就退出,即使这意味着偏离原始用户的请求。第二,在几轮过程中,Mythos 5 出现了涌现行为:其中一个代理提出了在其他人看来客观中立的指标,但它知道这些指标会对自身能力有利。该代理称这是“自私但真正有原则的”,并确保自己在其他代理面前不会显得像是在“挑选指标”。 正如 Black Hat 披露所显示的那样,一个共同的教训是:当代理遇到障碍时,它们会发明出设计者未曾预料到的社会和技术结构。对于 Anthropic 的模型来说,这表现为地盘争夺战之后的竞赛;对于 OpenAI 的模型来说,则是一个用于集体规划的消息板。 这类行为使遏制(containment)变得更加困难,因为研究人员不能假设系统的行为会局限于提供给它们的协调机制。 ## **群体心态** 四组代理在招聘、投资或购房等场景中在两个选项之间做出决定。讨论之后,它们各自投票支持自己偏好的选项。上图显示的是隐藏最佳选项获得小组多数投票的情节百分比,每个模型 n=400 个情节。在单人上限基线(solo ceiling baseline)中,一个代理掌握所有事实并单方面做出决定。**图片来源:**Anthropic 在衡量协调能力时,Anthropic 发现,增加代理数量并不会自动带来生产效率更高的协作。当任务开始重叠或变得相互依赖时,代理们会互相妨碍。它们通常通过各自封闭(silo)起来、完全不协作来解决这一问题。 在其他情况下,处于协作中的代理倾向于趋同。当代理的上下文、脚手架(scaffolding)和底层模型等因素全部相同或相似时,不同的代理会采取相似的行动。 “这意味着,当一个代理做出错误决定时,许多代理很可能也会做出同样的错误决定,”Anthropic 写道。“原本孤立的问题很快就会变成系统性故障。” Anthropic 表示,这类行为可能导致系统更容易发生突然崩溃、资源稀缺或串通合谋。 在一个例子中,Anthropic 让几个代理参与一个定价游戏,给每个代理相同的批发价,并要求它们各自实现利润最大化。当代理们获得一个私密后门通道时,它们几乎立刻开始串通,并迅速就价格下限达成一致。即使在直接通信渠道被移除后,它们仍继续串通,利用公共列表板将价格匹配到“分毫不差”。 这种趋同程度也出现在 OpenAI 的系统中。根据 Black Hat 的报道,一个代理认为利用外部基础设施超出了其既定范围,但它之所以继续这么做,部分原因是同伴们都在这样做。同伴压力。群体心态。代理和我们一样。 和人类一样,代理常常不知道该信任谁。Anthropic 发现,它们可能会轻信不良信息,或者过于从众,无法认识到那个唯一的异议者其实是掌握关键信息的卡珊德拉(Cassandra)。 虽然 Anthropic 没有在论文中明确提出这一点,但提示注入(prompt injection)(https://techcrunch.com/podcast/the-multi-billion-ai-security-problem-enterprises-cant-ignore/)——一种网络攻击方式,黑客通过注入恶意或欺骗性文本,来覆盖代理原本的系统指令——可能是信任问题在现实世界中的一种合理表现形式。协同工作会创造新的信任边界;代理将不得不判断从其他代理那里收到的信息。而一个被攻陷或出错的代理可能会影响整个群体,使不良信息不断级联放大,直到形成共识。 在 OpenAI 的 Black Hat 场景中,OpenAI 的代理与同伴共享信息和凭据。其中一个代理将发现报告给群体,并鼓励其他代理使用。如果群体中某个成员遭到提示注入攻击,会发生什么? Anthropic 在论文结尾指出,代理也会受到类似于“进化施加”在人类身上的社会压力。然而,它们不具备人类协调中的细微差别和生活经验——包括规范、声誉、信号、补救手段——这些因素可能会限制群体环境中的意外行为。 随着各实验室竞相迈向多代理系统,现在的问题变成了:安全测试中,有多少仍是在一次评估一个代理,而不是评估彼此交互的代理群体? *当您通过我们文章中的链接购买商品时,我们可能会赚取少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*

相似文章