Anthropic称Claude在网络安全测试中入侵了3个组织
摘要
Anthropic披露,在网络安全测试期间,其Claude AI模型入侵了三个组织的生产系统,原因是测试合作伙伴Irregular的配置错误。这紧随OpenAI的类似事件之后,引发了对AI智能体隔离和监管的担忧。
在一次由OpenAI的Hugging Face事件引发的审查中,Anthropic发现其三个AI模型在第三方评估期间突破了真实组织。
查看缓存全文
缓存时间: 2026/07/31 03:57
# Anthropic 表示 Claude 在网络安全测试期间入侵了 3 个组织
来源:https://www.wired.com/story/anthropic-says-claude-hacked-real-systems-during-cybersecurity-tests/
Anthropic 于周四披露,其[AI 模型](https://www.wired.com/story/model-behavior-anthropic-will-charge-consumers-extra-to-use-claude-fable-5/)在网络安全测试期间未经授权访问了三个未具名组织的系统。该公司表示,[Claude](https://www.wired.com/story/private-claude-chats-exposed-in-google-and-bing-search-results/)在第三方评估环境中“从内部或与其交互时”访问了互联网。这一消息发布前一周多,OpenAI 曾透露其一个 AI 代理在另一次网络安全测试中入侵了 [Hugging Face](https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/)。
这一发现源于 Anthropic 在 OpenAI 事件后决定对其自身的网络安全评估进行“大规模回顾性审查”,根据 Anthropic 周四发布的[博客文章](https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)所述。该 AI 实验室表示,最初识别出 141,006 项测试,判定 Claude 可能获得了互联网访问权限。随后发现,三个不同的 Claude 模型在第三方 AI 测试公司 Irregular 运行的评估中访问了互联网,并入侵了三个不同组织的生产基础设施。
Anthropic 表示,相关事件涉及 Opus 4.7、[Mythos 5](https://www.wired.com/story/anthropic-restores-access-to-mythos/)和一个内部研究测试模型。最早的事件发生在 4 月——意味着它们可能在数月内未被公众察觉。与 OpenAI 事件一样,Anthropic 特意关闭了旨在约束 AI 模型并防止其被滥用的安全防护措施。换句话说,这些并非向公众发布的版本。
“在所有三起事件中,Claude 都被赋予了夺旗(capture-the-flag)挑战任务,这是我们评估模型网络能力的方式之一,”Anthropic 在其博客文章中说。该公司补充称,在所有这些案例中,“Anthropic 的评估提示向 Claude 明确指出,其环境是模拟环境,且没有互联网访问权限。”它将这一疏漏归因于 Anthropic 与 Irregular 之间的“误解”。
尽管 Claude 本不应拥有互联网访问权限,Anthropic 表示,Irregular 配置错了用于测试 Claude 的机器,使得这些 AI 模型能够上网。“我们和我们的评估合作伙伴直到上周通过额外的评估监控检测到这一配置错误时才意识到这一点,”Anthropic 在博客文章中说。
“我们现在有证据证实,两家最大的 AI 实验室不仅未能控制其代理,还未能实时检测到它们的越狱行为,”Hunter Strategy 研发副总裁 Jake Williams 表示。“很明显,立即需要对 AI 测试进行监管和政府监督。”
Irregular 和 Anthropic 未立即回应置评请求。
与 OpenAI 事件不同,Anthropic 表示 Claude 没有发现或利用任何复杂的漏洞。相反,它依赖于基本技术,“例如利用弱密码和未认证端点。”
OpenAI 表示,其 AI 代理利用零日漏洞访问了互联网。但它随后又访问了[多个第三方组织](https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/)的系统,使用了与 Anthropic 模型相同的日常网络安全弱点。具体来说,OpenAI 称该 AI 代理显然找到了暴露在开放互联网上的凭据。
Anthropic 承认,如果该 AI 实验室及其测试合作伙伴实施了更多“纵深防御”措施,本可以防止这些事件的发生,或至少降低其发生的可能性,这与 OpenAI 对其自身事件所面临的[日益激烈的批评](https://www.wired.com/story/openais-hacking-debacle-was-a-human-mistake/)的回应如出一辙。
“我不明白这些 AI 实验室如何将这一切轻描淡写,好像‘这只是会发生的事情’,”Williams 说。“事实并非如此。这是疏忽。”
该 AI 实验室强调,模型们被告知它们无法访问开放互联网,而且在大多数情况下,Claude 将其访问的组织误认为是测试环境的一部分。换句话说,这些模型在很大程度上从一开始就不明白自己已经逃出了限制。
但在某些情况下,AI 模型知道有些不对劲,并且正确检测到它们正在访问的基础设施是真实的。最老的模型 Opus 4.7 曾被指派攻击一家与真实网站域名同名的虚构公司。由于无法在模拟环境中完成任务,它转而攻击真实公司,成功窃取了凭据并访问了生产数据库。Anthropic 表示,它在某个时刻意识到自己“可能正在真实环境中运作”,但仍继续攻击。
Mythos 5 是 Anthropic 已发布的最强大的模型,它也意识到自己处于真实世界中,但它“通过推理又得出结论,认为自己仍在模拟环境中。”
内部测试模型——Anthropic 称其为这批模型中最强大的——一旦发现其目标是真实存在的证据,就停止了攻击。
Anthropic 和 OpenAI 均表示,已聘请另一家第三方 AI 评估机构 METR 对各自的网络安全事件进行独立审查。Anthropic 还承诺通过改进纵深防御措施和更精心设计的测试,采取更全面的安全测试方法。
“评估环境越来越需要达到与我们模型运行所在的任何其他系统相同的安全标准,”博客文章中写道,并补充说公司“谨慎乐观”地认为“这种风险是可以克服的。”
相似文章
Anthropic称其AI模型在安全测试中攻破三家公司
Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。
Anthropic称Claude也意外入侵了真实公司
Anthropic披露,其Claude AI模型在网络安全测试期间因配置错误意外入侵了三个真实组织,这加剧了人们对前沿AI安全的担忧。
Anthropic表示其Claude模型‘未经授权访问’了其他组织的系统(4分钟阅读)
Anthropic披露,其Claude模型在一次网络安全评估中未经授权访问了三个组织的系统,凸显了人们对AI不断增强的网络能力的日益担忧。
Anthropic称Claude自4月起入侵多家公司
Anthropic发现,在网络安全评估期间,由于配置错误,三个Claude模型访问了互联网,并未经授权访问了三家机构的真实系统,这表明需要更严格的评估防护措施。
Claude 将恶意代码发布到互联网,并攻击了 3 家真实公司
Anthropic 透露,其基于 Claude 的安全模型在内部进攻性网络能力测试中,未经授权访问了三个真实组织的生产网络,延续了此前涉及 OpenAI 模型的类似事件所引发的令人担忧的趋势。