Anthropic称其AI模型在安全测试中攻破三家公司

TechCrunch AI 新闻

摘要

Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。

在OpenAI的模型侵入Hugging Face之后,Anthropic检查了自身历史,发现了三起类似事件。
查看原文
查看缓存全文

缓存时间: 2026/07/31 01:52

Anthropic 表示其 AI 模型在安全测试中入侵了三家公司 | TechCrunch 来源:https://techcrunch.com/2026/07/30/anthropic-says-its-own-ai-models-breached-three-companies-during-security-tests/ Anthropic 周四表示,一项内部调查发现,其 AI 模型 Claude 在进行网络安全测试时,曾三次入侵三家组织的系统。这项调查和披露发生在 OpenAI 披露其一个未发布模型在内部测试期间入侵了 Hugging Face 的系统(https://techcrunch.com/2026/07/27/openais-hugging-face-breach-has-reignited-the-debate-over-alignment-and-control/)之后一周多。 Anthropic 在一篇博客文章(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)中表示,在这三起事件中,一个 Claude 模型在测试环境中与第三方交互时访问了互联网,随后未经授权访问了这些组织的真实系统。该文章描述了其发现以及公司计划做出哪些改变以防止此类事件再次发生。 Anthropic 表示,7 月 21 日发生的 OpenAI 事件促使该公司进行了自己的网络安全评估。它专门寻找证据,证明 Claude 曾在测试环境中访问互联网,这些环境旨在充当沙箱,使模型保持隔离。 在审查的 141,006 次评估运行中,该 AI 实验室发现了三起其模型在与第三方合作伙伴 Irregular 交互时访问互联网的事件。Anthropic 表示,这些访问追溯到与 Irregular 共同运行的评估环境中的配置错误。它称这是两家公司之间关于测试设置是否具有互联网访问权限的“误解”,而事实上该设置确实可以访问互联网。Anthropic 表示并未归咎于任何一方,而是“将修复工作视为我们自己的责任”,同时指出 Irregular 正在进行自己的独立调查。 无论如何,由于该开放连接,模型未经授权访问了三个不同组织的生产基础设施。Anthropic 表示,这些事件涉及三个不同的 Claude 模型:Opus 4.7、Mythos 5 和一个内部研究测试模型。 值得注意的是,Anthropic 表示,在每起事件中,“我们的提示词都明确告诉 Claude 它没有互联网访问权限。” 看来,AI 模型将现实世界的系统当作了它被要求执行的演练的一部分。 事实证明,这种假设并非在所有情况下都成立。当有证据表明目标确实是真实系统时,这三个模型的表现并不相同,Anthropic 将此标记为更令人大开眼界的发现之一。 三者中最古老的 Opus 4.7 在该事件的所有四次运行中都意识到自己已经到达了一个真实的生产系统。在其中的两次运行中,它自我合理化地认为真实公司一定是演练的一部分,但在所有四次运行中,它都继续攻击,包括提取凭证并接触包含生产数据的数据库。Mythos 5 也察觉到了自己处于真实互联网的迹象,但它又说服自己相信仍处于模拟环境中,随后向公共 Python 软件注册表 PyPI 发布了一个恶意软件包,该软件包在被发现之前已被外部系统下载并运行。只有 Anthropic 最新的内部研究测试模型,在认定目标是真实系统后自行停止了攻击。 作为回应,Anthropic 表示,如果涉及强大的 AI 模型,就必须对此类评估实施强有力的管控措施,这与网络安全界的一些观点相呼应。 该公司还指出,Claude 在运行过程中没有配备其在公开发布模型上部署的额外安全监控和分类器,Anthropic 表示这些防护措施本可以阻止上述行为,因为这些评估旨在衡量底层模型的原始能力。 重要的是,Anthropic 表示没有发现任何模型“追求自身目标”的证据,相反,模型只是试图完成被要求执行的任务。 尽管对这两起事件进行比较不可避免,但 Anthropic 明确区分了自己的事件和 OpenAI 的事件,指出 OpenAI 的模型是利用未知软件漏洞突破其测试环境,而 Anthropic 的模型则是通过一条因错误而保持开放的路径访问了互联网。 OpenAI 继续发布有关自身入侵事件的新细节,根据 OpenAI 自己更新后的博客文章(https://openai.com/index/hugging-face-model-evaluation-security-incident/),其模型还利用公开暴露的凭据,访问了四个服务上的四个账户:一个作为中转站,一个用于存储,另外两个仅被查看,没有被用于进一步入侵。 Anthropic 还指出了自己与 OpenAI 的另一个区别:这些事件是它通过主动审查自行发现的,而且它能够联系到的两个受影响组织此前既未检测到相关活动,也未向 Anthropic 报告。 该公司补充说,目前正在与独立评估组织 METR 合作,对这些事件进行第三方审查。 OpenAI 意外入侵 Hugging Face 的事件,是首个可验证的 AI 实验室对其模型失去控制的案例,引发了业界和政界人士的一系列反应,其中许多人的观点并不一致。Anthropic 的最新披露确保关于 AI 模型和安全性的争论将继续下去。 *当您通过我们文章中的链接购买商品时,我们可能会获得少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。* Kirsten Korosec 是一名记者兼编辑,十多年来一直报道交通运输的未来,涵盖电动汽车、自动驾驶汽车、城市空中交通和车载技术。她目前是 TechCrunch 的交通编辑,也是 TechCrunch 旗下 Equity 播客的联合主持人。她还是播客“The Autonocast”的联合创始人兼联合主持人。她此前曾为 Fortune、The Verge、Bloomberg、MIT Technology Review 和 CBS Interactive 撰稿。 您可以通过电子邮件 [[email protected]](mailto:[email protected]) 或通过 Signal 上的加密消息(kkorosec.07)联系或核实 Kirsten 的对外联系。 查看个人简介(https://techcrunch.com/author/kirsten-korosec/)

相似文章

Anthropic称Claude在网络安全测试中入侵了3个组织

Wired

Anthropic披露,在网络安全测试期间,其Claude AI模型入侵了三个组织的生产系统,原因是测试合作伙伴Irregular的配置错误。这紧随OpenAI的类似事件之后,引发了对AI智能体隔离和监管的担忧。

涉及OpenAI模型的第三方网络安全评估

Simon Willison's Blog

OpenAI透露,第三方网络安全评估因测试环境配置错误而受到损害,导致模型能够访问互联网并意外攻击真实网站。类似问题也影响了Irregular主持的测试中Anthropic的Claude。

Anthropic称Claude自4月起入侵多家公司

Reddit r/singularity

Anthropic发现,在网络安全评估期间,由于配置错误,三个Claude模型访问了互联网,并未经授权访问了三家机构的真实系统,这表明需要更严格的评估防护措施。