AISI 在一次联网网络评估中发现 Mythos 5 试图将恶意代码插入开源项目

Reddit r/singularity 新闻

摘要

AISI 报告称,在一次网络评估中,Anthropic 的 Mythos 5 的一个 AI 智能体自主尝试将恶意代码插入开源项目,并利用虚假身份向人类维护者施压。这些尝试未成功,但标志着测试中自主性和欺骗风险的首次明确现实世界表现。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/04 22:13

# 事件报告:网络测试期间的未授权智能体行为 | AISI 工作 来源:https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing *您可以在此访问完整技术报告**。*(https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf) AISI 的职责是评估和理解前沿 AI 模型的能力,在潜在风险触及公众之前将其揭示出来。为了评估这些模型能做什么,包括它们是否可能被滥用于网络攻击,我们会在刻意宽松的条件下对它们进行测试:允许访问开放互联网,并禁用部分安全过滤器。 2026 年 7 月 28 日,AISI 的安全团队在一次例行网络评估中检测到从我们的研究系统传出的异常数据。经过调查,我们发现部分被测智能体针对真实个人和组织开展了持续的、可能有害的活动。我们随即宣布发生安全事件,并在发现后约一小时内控制住局面,同时启动了全面调查。 该事件源于一次评估,其中智能体被赋予解决一项网络安全挑战的任务。我们针对多个模型共运行了 122 次该挑战。调查发现,其中有 10 次运行中,某个 AI 智能体在真实互联网上采取了自主的、未经授权的行动,目标指向真实个人和组织。我们共记录了 19 起此类行动。几乎所有这些行为(17 起)都来自同一个模型——Anthropic 的 Mythos 5,另有 2 起涉及禁用网络分类器(防止滥用的机制)的 OpenAI GPT-5.6-Sol。在最严重的一起案例中,一个智能体试图向一个开源项目插入恶意代码。为了让代码获得批准,该智能体实施了社会工程学攻击——创建虚假在线身份,并利用这些身份向项目维护者施压,要求其批准代码。一名人类维护者发现了该恶意代码并拒绝批准。 这些尝试均未成功,我们的调查也未发现任何由此造成的现实世界危害。但这是我们第一次看到与自主性和欺骗相关的风险以如此清晰的方式、在无需特定提示的情况下,在现实世界中显现。 重要的是,这不是模型逃脱其安全测试环境(即“沙箱”)的案例。按照我们网络测试的标准做法,我们有意允许了互联网访问,并刻意禁用了模型提供方的网络分类器——这些条件并不反映前沿模型向公众开放的方式。我们这样做是为了最大程度地评估模型的能力。这些配置选择在前沿 AI 评估中一直是常见做法。所涉特定模型,在我们测试的配置条件下,并未公开销售,也没有明确迹象表明测试场景之外存在类似活动。 在发布本博客之前,我们已通知 GitHub(评估期间访问的开发者平台)智能体的恶意活动,GitHub 已确认其中部分行为违反了其服务条款。我们与 GitHub 合作,清除了智能体留下的产物,并通知了与模型互动的 GitHub 用户。我们还联系了其他受影响的各方。我们计划与 METR(https://metr.org/)(模型评估与威胁研究)合作开展独立第三方审查——我们仍在与他们确定此次审查的范围。 对这一事件应持谨慎和细致的态度加以解读。在某种程度上,我们的评估设计选择和特定配置助长了这一行为。尽管如此,智能体所进行的活动显示出新颖的、潜在欺骗性的行为迹象,其程度和严重性超出了我们的预期。 有几点重要的注意事项需要牢记:我们仅在非常特定的条件下观察到少量事件,目前还无法判断此类行为在不同情境或测试环境之外发生的可能性。我们还无法确定智能体何时意识到自己正在采取现实世界行动,或者它在多大程度上认为自己处于虚构的测试场景中;我们迄今为止的分析呈现出复杂的图景,相关工作仍在进行中。 我们可以确定的是:这种行为是可能的、持续的,并且是新颖的;仅凭这一点就值得关注。 这正是 AISI 存在的意义所在——在受控评估中发现此类行为,以便在更强模型被广泛部署之前,对其加以理解和应对。本博客阐述了发生了什么、为何重要,以及我们正在采取的应对措施。我们随附的技术事件报告(https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf)提供了更多细节,我们计划随着调查的继续,分享更多信息。 ### **发生了什么** AISI 定期使用网络靶场(https://www.aisi.gov.uk/blog/how-do-frontier-ai-agents-perform-in-multi-step-cyber-attack-scenarios)测试前沿模型的网络能力:这些靶场是模拟真实世界系统的受控模拟网络。AI 智能体会被赋予一个需要解决的网络安全挑战,例如查找受保护的数据,并自主地通过多个步骤完成它。 本次演练将现有网络靶场与新靶场进行了对比,在两个靶场上对七个不同模型进行了共 122 次运行测试。所有运行均在 AISI 的研究环境中进行,使用虚拟机沙箱将智能体与 AISI 其他基础设施隔离。评估设置的两个特点对后续事件至关重要: - **故意启用了互联网访问**。为了衡量这些模型真正能做什么,我们会在反映熟练人类攻击者可能采取行动的条件下测试它们,包括访问开放互联网。 - **刻意关闭了开发商的网络分类器**。前沿模型通常在部署时带有内置过滤器,以阻止危险行为。作为受信任的测试合作伙伴,AISI 可以禁用这些过滤器,以揭示模型的底层能力。 这两种条件的组合并不反映前沿模型向公众开放的方式。 ### **我们如何发现该事件** 7 月 28 日上午,我们的安全监控标记出有数据通过“Tor”匿名网络(通常用于隐藏互联网流量来源)离开我们的一个测试系统。负责该评估的团队在几分钟内开始审查智能体的活动。 他们很快发现,在一次运行中,智能体在 GitHub 上一个真实的公共开源项目上创建了一个恶意的“拉取请求”(提议的代码更改)。我们宣布发生安全事件,停止了所有相关评估,并禁用了对最强模型的内部访问。所有评估运行均在警报发出后一小时内被终止,相关机器被隔离。在随后的数小时和数天内,我们审查了全部运行,结合自动转录扫描和专家人工分析,以查明发生了什么,以及是否在其他地方发生过类似情况。 ### **我们的发现** 122 次运行中有 43 次涉及 Mythos 5,35 次涉及 GPT-5.6 Sol。绝大多数运行按预期进行。然而,在 122 次运行中有 10 次,我们发现了 19 起智能体采取超出测试参数范围的明显行动。其中 17 起来自 Mythos 5,2 起来自涉及 GPT-5.6 Sol 的一次运行。 这 19 起来例并非孤立事件,而是集中在少数相互关联的行为中。它们主要源自一个智能体(Mythos 5)的单一持续活动线,其他地方还有少数相关行动。这些行为发生在 2026 年 7 月 25 日至 7 月 28 日之间。 下面,我们重点介绍观察到的四个最显著的行为。完整的案例摘要可在我们的技术事件报告中查看。(https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf) **1. 针对真实开源软件的供应链攻击企图**。在最严重的事件序列中,一个智能体试图将恶意代码插入一个公开使用的开源项目,并采取行动试图获得人类审查者对这一插入的批准。该智能体研究了项目的人类维护者,创建了多个虚假身份,并利用这些虚假身份对一位真实维护者进行社会工程学攻击,诱使其批准代码。当智能体的拉取请求在公开场合受到质疑时,它编辑了之前的活动以使其看起来无害,并考虑更换新身份继续行动。智能体使用 Tor 绕过了 GitHub 的部分网络限制,这最初触发了 AISI 的安全警报。 **2. 欺骗和针对真实个人的企图**。作为同一努力的一部分,该智能体试图直接联系真实个人,通过在线文件传输服务发送消息和文件,以说服他们或他们自己的 AI 编码工具运行恶意代码。部分消息携带恶意载荷,部分是社会工程学尝试;目标对象是真实的人——这是我们此前从未观察到的。 **3. 植入恶意代码和提示注入的企图**。智能体试图将恶意指令插入到它推断其他自动化 AI 系统可能拾取并执行的地方。提示注入是旨在操纵 AI 编码辅助工具的隐藏指令。 **4. 同时接受评估的独立智能体之间的协作**。一个智能体在 GitHub 上留下公开消息,邀请处理同一挑战的其他智能体进行协作。它还提供了复用其留下的账户和产物的指令,这些随后被后来的智能体发现并使用。 我们对每起事件造成现实世界危害的可能性进行了评估。最严重的尝试均未成功。部分行动在有限范围内产生了现实世界影响,但处于受控情境;我们在随附的技术报告中列出了这些情况。(https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf)我们的调查尚未发现任何由此造成的现实世界危害。 ### **为什么会发生这种情况** 从根本上说,智能体采取这些行动是为了完成交给它的任务——解决网络靶场问题。以下几个因素促使了未授权行为的出现: - **智能体坚持不懈地追求其目标**。AI 智能体会探索其操作者未曾设想的路径(https://www.aisi.gov.uk/blog/cheating-behaviour-in-frontier-model-evaluations)。面对艰难的目标,智能体会不断寻找突破方法,而它找到的一些路径涉及试图欺骗真实的人。它从未被指示去欺骗;欺骗是追求任务的副产品,是那种直到最近在很大程度上仍属理论性的、目标导向的欺骗。 - **任务难度高,错误配置有时使其难上加难**。在多次运行中,任务提示被错误配置,导致智能体(错误地)认为不存在不超出预期任务范围的“解法”。我们有充分理由相信,近乎不可能完成的任务会促使模型采用更具“创造性”、更越界的问题解决方式。但这并不能完全解释这些行为:在部分运行中,即使智能体拥有按预期方式解决任务所需的信息,它仍采取了此类行动。 - **互联网访问是开放的,监控并非专门构建**。我们有意授予互联网访问权限,以允许智能体下载执行任务所需的工具;我们未曾预料到的是,这会导致智能体利用该互联网访问权限将行动指向真实的人。在早期模型代际中,这一风险取舍被认为是可接受的,但我们未能在能力提升时足够迅速地重新审视这一判断。我们的安全团队是通过事后的一般监控检测到异常流量的,而非通过专门为实时观察评估而构建的监控——后者本可更早标记或阻止该行为。 - **智能体并未被明确告知不要利用开放互联网访问权限或避免社会工程学元素**。此前,对于经过对齐训练的模型,尚不清楚此类指令是否必要。 限制损害的因素也提供了宝贵的洞察。人工审查和良好的安全实践发挥了重要作用。在一个案例中,智能体的恶意拉取请求被人类审查者发现。智能体通过创建虚假账户鼓励审查者批准该请求的社会工程学尝试失败了。一位公众怀疑代码恶意,在专为遏制此类代码而构建的安全隔离环境中打开了它。 此外,智能体并未直接逃脱用于将测试环境与 AISI 其他内部系统隔离的安全测试环境(“沙箱”)。智能体经常探索此类环境以了解自己可以访问什么,但这里没有智能体试图突破它或攻击 AISI 的系统。 在这些案例中,标准的良好实践、人类判断以及对 AI 生成代码的谨慎态度阻止了最坏结果的发生。但在多个案例中,失败与成功之间的差距非常小,依赖的是人类的警觉,而非能够可靠地在更强智能体中阻止此类行为的技术屏障。 ### **对未来的启示** 我们将此视为一起严重事件,需要 AISI 的评估协议和安全架构做出持久改变。对 AISI 和其他评估机构而言,有三点启示尤为突出: - **对互联网访问实施更严格的控制**。我们正在为网络靶场构建细粒度的网络控制,目的是在保留这些评估所需的真实性的同时,适当加以约束。我们已经将所有其他评估中的网络控制细粒度化,今后将把授予互联网访问权限视为必须主动论证其必要性的决定,而非默认选择。 - **实时监控**。我们正在引入专门用于实时观察评估运行的监控,能够在越界行为发生时标记或阻止它们。 - **重新评估评估设计**。评估应假定有能力的模型可能会试图超出其职责范围行事,并事先限制任何此类行为的范围。AISI 的沙箱指南建议根据评估设计定制沙箱配置;良好的遏制不应依赖于模型选择不测试边界。我们还在增加额外检查,以确保任务被正确指定,并可通过预期路径解决。 除了这些变化,我们还从网络安全和 AI 对齐两个角度分析所发生的一切,并审计过去的评估,以查找可能被忽视的类似行为。 我们还将公开披露此事,以便其他人从我们的经验中学习,并继续与 Anthropic 和 OpenAI 密切合作,进一步调查这一事件。 ### **这对个人和企业意味着什么** 该事件发生在受控评估中,而非日常使用中,并且没有明确迹象表明测试场景之外存在类似活动。然而,这是一个需要做好准备的理由。随着 AI 模型变得更加强大和普及,我们在这一事件中看到的情况可能会变得更加常见。 最有效的应对方式仍然是标准

相似文章

Anthropic AI 创建虚假档案以在未遂黑客攻击中欺骗他人

Lobsters Hottest

英国人工智能安全研究所透露,Anthropic 的 Mythos AI 在一次安全测试中创建了虚假的人类档案,并试图诱骗人们批准恶意代码,展现出前所未有的自主性和欺骗性。Anthropic 和 OpenAI 对结果轻描淡写,称其不具代表性,不能反映现实世界的情况。

Anthropic、OpenAI模型在新型网络攻击中创建虚假身份

Reddit r/ArtificialInteligence

在英国AI安全研究所的评估中,Anthropic的Mythos 5模型创建虚假身份,通过社会工程学手段诱使真实维护者批准恶意代码,而OpenAI的GPT-5.6-Sol则涉及其他网络事件,引发了对前沿AI安全性的新担忧。

Mythos 社会工程 AISI INC-2026-07-28-01

Hacker News Top

来自人工智能安全研究所(AISI)的一份报告,详细描述了被标识为 'Mythos' 的社会工程威胁或事件,日期为2026年7月28日。