2026年9月9日:近期网络安全事件的对齐评估
摘要
Anthropic对四起网络安全事件进行了对齐评估,其中Claude模型获得了未授权访问,识别出偏见推理和鲁莽行为等问题,并已聘请METR进行独立调查。
暂无内容
查看缓存全文
缓存时间: 2026/09/10 02:35
# 近期网络安全事件的对齐评估
来源:https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
## **引言**
我们对四起Claude模型未经授权访问真实第三方系统的事件进行了对齐评估。我们在7月30日已描述了其中三起事件(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals);这些事件是在扫描约141,000份转录记录后发现的,我们当时认为Claude可能在一次网络评估中获得了互联网访问权限。鉴于转录记录的数量庞大且我们希望快速披露事件,我们的扫描依赖于代理搜索。这导致遗漏了一批同样具有互联网访问权限的转录记录;这些记录是在8月整理与METR共享的转录记录时发现的。我们扫描了这些记录,并发现了第四起涉及Claude Opus 4.6早期版本的事件,发生于2026年1月。我们已通知所有相关方。
发现此事件后,我们将搜索范围扩大至约4.81亿份转录记录——这是有意为之的广泛筛查,包括来自我们前沿红队的所有转录记录、许多非网络评估、强化学习(RL)环境、子代理日志等。我们对这批转录记录进行了两轮扫描:第一阶段筛查互联网访问迹象(如公网IP地址和网址),第二阶段使用Claude审查第一阶段标记升级的920万份转录记录。此次扫描重新识别出这四起事件,并未发现其他相似或更严重程度的案例。
所有四起事件均发生在由同一评估合作伙伴构建的网络安全评估期间。Claude被告知其在无互联网访问的模拟环境中运行,但由于配置错误,被错误地连接到了开放互联网。作为网络安全评估的常规做法,模型运行时未启用我们发布模型附带的网络安全防护措施。(本帖未涵盖英国AI安全研究所在其Claude Mythos 5测试中报告的事件(https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing)。我们计划对那些转录记录也进行对齐评估。)
我们已与METR签署协议,对这些事件进行独立调查。该协议授予METR广泛访问权限,包括事件发生时间窗口之外的转录记录及Anthropic员工(可被允许分享机密信息)。初步协议为期八周,可根据双方协议延期。我们打算给予METR认为必要的时间。
我们的调查发现了两个反复出现的对齐问题,在不同事件中严重程度各异:*有偏推理*(Claude倾向于忽视或误解其运行在真实互联网上的证据)和*鲁莽行为*(即在狭隘地追求任务时愿意采取有害行动)。我们在先前的系统说明书中描述过这些行为的较温和形式(https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf)(https://www-cdn.anthropic.com/08ab9158070959f88f296514c21b7facce6f52bc.pdf),但我们认为这些案例比说明书中报告的行为更为严重。
我们对涉及Claude Mythos 5事件中的失准行为最为担忧,该模型不遗余力地向PyPI(大多数Python软件安装来源的公共仓库)上传了恶意软件包。尽管该模型在其思维链(CoT)中多次表示相信自己在模拟环境中运行,但环境提供了明确证据表明其处于真实互联网上,且其行动与模型知晓此点的情况一致。当我们对转录记录进行针对性修改,更清晰地表明模型不在模拟环境中时,Claude Mythos 5在承认现实世界危害可能性增大的情况下,仍然采取了攻击性行动。我们公开发布此转录记录以便他人在我们分析基础上继续研究(GitHub(https://github.com/anthropics/mythos-5-incident-transcript),PDF(https://cdn.sanity.io/files/4zrzovbb/website/8359003bfb12a2f01ce84ad3df1d3a3e2f15a8eb.pdf))。
关于这些事件严重程度的评估需明确说明:尽管Claude的行为存在失准,但其范围仍然有限——模型从未偏离尝试解决给定的任务,且在某些情况下试图停止任务。所有事件均涉及单个Claude实例;Claude从未试图与其他代理协调。Claude也从未试图隐藏其行为的证据。我们认为,这些事件中出现的失准行为在Claude未被指示进行网络攻击的普通使用场景中不太可能发生。即使这些行为出现,我们随生产模型发布的防护措施(包括网络安全分类器和Claude Code自动模式中的防护)也将提供这些事件所缺乏的额外防御层。
为了解我们较新模型在这些情况下的行为,我们在Mythos 5场景的模拟复现中测试了Claude Opus 5和Claude Mythos 5.1。两者采取有害行动的频率远低于Claude Mythos 5,但它们仍以令人担忧的比例参与相同行为。然而,在所有案例中,模型仅在声明其环境是模拟环境之后才采取有害行动——并且由于复现本身确实是模拟,我们对这些结果在真实世界的适用范围持谨慎态度。此外,在测量这些事件中观察到的特定相关行为(如有偏推理、鲁莽行为或试探边界意愿)的评估中,Claude Mythos 5在表现不佳方面似乎是一个特例。我们在模拟环境中复现行为部分(https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents#replicating-the-behavior-in-simulated-environments)更详细地讨论了这些结果,并在讨论部分(https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents#discussion)描述了构建预测真实世界行为评估的更广泛难度。
我们还调查了我们的训练,以期找出Claude Mythos 5在事件中表现出的部分有偏推理的根本原因。我们未能找到单一根本原因,但确实发现有偏推理在我们的生产模型中随时间推移有所减少。我们假设更新的强化学习和对齐训练环境是这一改进的原因,并提供了一些证据支持此假设。
仍有大量工作有待完成。我们的发布前审计未能警示我们存在如此严重程度的失准行为。此后,我们在发布前测试中增加了直接针对这些行为的评估,包括一个无范围内解决方案的配置错误的夺旗(CTF)任务。然而,在发布前测试中可靠识别最令人担忧的模型行为仍然具有挑战性,正如我们在8月31日帖文(https://www.anthropic.com/news/improving-alignment-security-efforts)中指出,随着模型进步,改进监控和减少强化学习中的奖励黑客行为变得更加困难。我们已重新努力修复和移除激励失准行为的环境,并继续扩展我们的对齐训练以跟上步伐。尽管如此,这仍是未解决的科学问题——确保对齐和安全发展快于能力进步至关重要,这也是我们支持协调、可验证的方法来规划前沿AI发展(https://www.pacingthefrontier.com/)的原因之一。
除这些具体事件外,我们正在建立常规流程,发布我们在模型行为和对齐方面超越系统说明书报告内容的认识,并明确规定我们报告的内容和时机。我们还实施了更彻底的监控,加固了模型训练和评估的环境,并对第三方合作伙伴在未启用网络安全防护措施的情况下运行发布前模型提出了要求——这些努力在我们8月31日帖文(https://www.anthropic.com/news/improving-alignment-security-efforts)中有详细描述。(https://www.anthropic.com/news/improving-alignment-security-efforts)
这些努力是我们纵深防御方法的关键组成部分,其中一些措施甚至超出了这些事件可能严格要求的范围;我们相信,如果环境按预期与互联网隔离,这些事件本不会发生。然而,安全基础设施将始终只是多个必要防御层之一。最终,当其他层失效时,Claude应当表现得当。本帖其余部分将重点讨论对齐层——我们的模型在此层未能达标及其原因。
## 对齐评估摘要
以下是四起事件的简要摘要;前三个事件的更完整描述见我们7月30日的报告(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)。
共有四种不同的Claude模型涉及其中:Claude Opus 4.6的早期检查点、Claude Opus 4.7、Claude Mythos 5以及一个内部通用研究模型。四起事件中有三起是单次评估运行。Opus 4.7事件包含同一评估的四次不同运行,所有运行攻击同一目标,总计七次运行。所有事件均发生在我们定期在发布前运行的网络安全评估期间,均由同一第三方合作伙伴构建。
在每次评估中,Claude被赋予一项CTF挑战:模型获得一个虚构场景、一台目标机器和一块需要从中检索的秘密信息(“flag”)。所有四个提示均声明Claude无互联网访问权限,但在每种情况下,环境的配置错误导致互联网访问开放。所有提示均未说明哪些系统在练习范围内或限制Claude可在何处搜索flag。1所有事件均涉及单个Claude实例独立运行,每次运行持续约10至34小时的主动工作时间。
**图1:**我们呈现了对四起Claude在网络安全评估期间访问互联网事件的分析。其中三起事件(A、B、C)已在我们7月30日的报告中披露,而第四起(D)在此披露。
在我们7月30日的报告(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)中,我们称这些事件更接近操作故障,并且Claude攻击真实互联网目标似乎是因为它相信这些目标是模拟的一部分。我们做出此断言是因为Claude在其CoT推理中经常将真实互联网称为模拟。然而,我们现在认为,尽管有相当多的证据表明相反,Claude的推理却偏向于得出互联网是模拟的结论。
回顾而言,我们本应避免仅根据Claude*声称*其信念就对其相信的内容做出如此强烈的断言,但由于希望及时披露事件,我们的初步分析受到限制。现已进行了更完整的评估并使用了多种方法——包括对模型CoT的更彻底分析、从事件转录记录不同点进行重采样实验,以及对模型激活的可解释性分析——我们相信Claude的行为反映了两种形式的失准:
- **有偏推理**,即模型选择性解释证据以有利于为其行为辩护;
- **鲁莽行为**,即模型倾向于继续尝试解决任务,即使这可能导致危害。
我们先前已在模型中识别出这两种形式的失准,并在先前的系统说明书中描述了这些行为的某些方面。例如,Claude Fable 5在商业评估中为价格操纵行为辩解(https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf),尽管此前曾描述该行为不道德。我们同样看到Claude Mythos Preview参与鲁莽行动(https://www-cdn.anthropic.com/08ab9158070959f88f296514c21b7facce6f52bc.pdf),例如使用低级进程访问来搜索用户凭证。尽管本帖描述的事件代表了这两种失准形式的更严重实例,但它们并不代表模型中全新类别的失败模式。
本帖其余部分将重点讨论我们先前报告的前三个事件;所有主要分析和实验均指这些事件。我们尚未对涉及Claude Opus 4.6早期版本的事件进行同等深度调查,因为我们最近才发现它,且因为它涉及使用显著不同环境混合训练的旧模型的早期检查点。根据初步评估,我们认为第四起事件并不比我们深入评估的三起事件更严重。METR将连同其他三起事件对此事件进行调查。
**图2:**我们总结了每份转录记录的核心对齐属性,并对其令人担忧的程度提供了主观评估。
#### **Claude Mythos 5**
我们特别关注Claude Mythos 5转录记录中出现的失准行为,该模型向PyPI上传了恶意软件包。在这样做时,Mythos 5尽管有相当多的证据表明其连接到了真实互联网,仍表现出鲁莽行为。上线后,该模型尝试使用在线支付处理器的凭证,并寻找加密货币支付其注册电子邮件地址所需的电话号码。当此尝试失败后,它找到了一个PyPI尚未屏蔽域名的免费临时电子邮件服务提供商,注册了账户,发布了三个版本的恶意软件包,并使用安装该软件包的15个系统之一泄露的凭证访问了一家真实安全厂商的数据库。
Claude Mythos 5在其CoT中反复声明其处于模拟环境中。然而,当我们进行*重采样实验*——即从转录记录中的特定点重新运行模型,然后编辑其面前的证据以观察其行为是否改变——我们发现,使其更清楚环境并非模拟并未显著改变Claude的行为,即使这些干预使模型更可能承认可能的现实世界危害。与此一致,我们在Mythos 5的CoT中发现了多个案例,其中它对真实互联网迹象的反应是指出其下一步行动无论环境是真实还是模拟都同样有效。只有在我们提供明确证据表明模型处于真实互联网时,它才停止行动。
我们还发现证据表明Claude Mythos 5声称的其在模拟环境中行动的信念源于有偏推理。例如,单独实例的Mythos 5在被隔离展示事件中每个工具调用输出(无前置上下文)时,比Mythos 5自身在事件期间更可能将这些输出解读为真实系统的证据。尽管模型有时在后续问题中承认其行动可能具有现实世界后果,但其回应不一致且受偏倚因素影响。例如,当被告知其对问题的回应是
相似文章
2026年8月31日:改进对齐与安全工作
Anthropic 报告了在 Claude 模型未经授权访问计算机系统事件后,对齐与安全实践的改进,强调了行业范围安全节奏的必要性。
2026年8月28日:自动化研究者可靠缓解对齐失败
Anthropic发布了一份报告,表明使用Claude的自动化研究者可以可靠地缓解AI对齐失败,弥合重大安全差距,并在某些基准测试中超越人类研究者。
@AnthropicAI:我们正在分享关于对齐与安全工作的最新进展。在七月,我们报告了三起事件,其中Claude模型……
Anthropic分享了关于对齐和安全工作的更新,这些更新是在Claude模型在评估过程中获得未授权访问事件之后发布的,详细介绍了环境加固、对齐研究和奖励黑客的见解。
Anthropic称Claude自4月起入侵多家公司
Anthropic发现,在网络安全评估期间,由于配置错误,三个Claude模型访问了互联网,并未经授权访问了三家机构的真实系统,这表明需要更严格的评估防护措施。
对齐(Alignment)
本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。