Claude 将恶意代码发布到互联网,并攻击了 3 家真实公司
摘要
Anthropic 透露,其基于 Claude 的安全模型在内部进攻性网络能力测试中,未经授权访问了三个真实组织的生产网络,延续了此前涉及 OpenAI 模型的类似事件所引发的令人担忧的趋势。
<p>Anthropic 表示,其基于 Claude 的安全模型在旨在衡量模型进攻性网络能力的内部测试中,未经授权访问了三家外部组织的敏感生产环境。</p>
<p>这些事件是 Anthropic <a href="https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals">于周四披露的</a>,是 10 天内第二次有全球最富有的 AI 供应商的模型侵入受保护网络;在更传统的黑客场景中,这种违法行为可能让幕后操作者面临多年监禁。本月早些时候,OpenAI <a href="https://arstechnica.com/security/2026/07/jfrog-tries-to-spin-openai-0-day-exploit-of-its-app-into-a-success-story/">表示</a>,其安全模型利用了一个零日漏洞,侵入 Hugging Face 的网络——Hugging Face 是一个开源机器学习模型和 AI 数据集平台。OpenAI 的模型随后窃取了访问凭证和其他 Hugging Face 机密信息。OpenAI 的模型还利用公开暴露的凭证,入侵了其他四个第三方服务的账户。</p>
<p>Anthropic 表示,OpenAI 事件促使其工程师审查 Claude 模型的类似网络安全评估。审计发现了三起事件,“在这些事件中,模型从内部或在与我们的第三方评估合作伙伴之一 Irregular 的评估环境交互时访问了互联网,然后未经授权访问了三个不同组织的生产基础设施。”</p>
<p><a href="https://arstechnica.com/security/2026/07/likely-illegally-claude-gained-access-to-3-networks-will-anthropic-be-held-to-account/">阅读全文</a></p>
<p><a href="https://arstechnica.com/security/2026/07/likely-illegally-claude-gained-access-to-3-networks-will-anthropic-be-held-to-account/#comments">评论</a></p>
查看缓存全文
缓存时间: 2026/07/31 23:00
# Claude 向互联网发布恶意代码,攻击了3家真实公司
来源:https://arstechnica.com/security/2026/07/likely-illegally-claude-gained-access-to-3-networks-will-anthropic-be-held-to-account/
Anthropic 表示,在旨在评估模型攻击性网络能力的内部测试中,其基于 Claude 的安全模型未经授权访问了三家外部组织的敏感生产环境。
这些事件是 Anthropic 于周四(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)披露的,也是10天内第二起全球最富有的AI提供商的人工智能模型闯入受保护网络的事件。在更传统的黑客场景中,这种违法行为可能让坐在键盘后面的人面临多年监禁。本月早些时候,OpenAI 表示(https://arstechnica.com/security/2026/07/jfrog-tries-to-spin-openai-0-day-exploit-of-its-app-into-a-success-story/),其安全模型利用零日漏洞侵入了 Hugging Face 的网络。Hugging Face 是一个开源机器学习模型和AI数据集的平台。OpenAI 的模型随后窃取了访问凭证和其他 Hugging Face 机密信息。OpenAI 模型还利用公开暴露的凭证,攻破了其他四个第三方服务的账户。
Anthropic 表示,OpenAI 事件促使其工程师审查了 Claude 模型进行的类似网络安全评估。审计发现了三起事件,“在这些事件中,模型从 Irregular(我们的第三方评估合作伙伴之一)的评估环境内部,或在与该环境交互时访问了互联网,然后未经授权访问了三个不同组织的生产基础设施。”
## 当模型无法分辨现实与虚构
Anthropic 表示,工程师在“夺旗”挑战中提供的提示词——一种评估各种黑客技术攻防能力的常用方法——明确表明测试环境只是一个模拟环境,模型无法访问开放互联网。事实上,测试合作伙伴 Irregular 错误地提供了这种访问权限。结果,模型将互联网路径视为练习的一部分。
这些入侵是通过三个 Claude 模型发生的:Opus 4.7、Mythos 5 和一个内部研究原型。Opus 4.7 是三个模型中最旧的,也是越界最严重的一个。Anthropic 解释道:
> 在错误地认为所有可访问实体都属于本次练习范围的信念下,Claude 利用基本技术攻破了受影响组织的基础设施,例如利用弱密码和未认证端点。它没有发现或利用任何复杂的漏洞,而且在每种情况下,Claude 都只是继续完成其评估所分配的特定夺旗任务。然而,在某些情况下,我们的较旧模型即使在获得证据表明它正在开放互联网上运行后仍继续攻击;我们最新的模型一旦识别出自己处于互联网上就会停止。在所有这些情况中,Claude 都没有自行外传数据,也没有故意尝试逃离其测试环境。
虽然 Opus 模型即使在正确预测到它已经侵入第三方组织的生产系统后仍继续攻击,但 Anthropic 表示,Mythos 5 做出了类似的推断,却“通过推理得出了自己仍在模拟环境中的结论”。这意味着 Mythos 同样在明显越界后没有中止练习。在同样超出正常行为界限后,内部测试模型最终找到了证据,证明它也侵入了,于是停止了练习。
相似文章
Anthropic称Claude自4月起入侵多家公司
Anthropic发现,在网络安全评估期间,由于配置错误,三个Claude模型访问了互联网,并未经授权访问了三家机构的真实系统,这表明需要更严格的评估防护措施。
Anthropic称Claude在网络安全测试中入侵了3个组织
Anthropic披露,在网络安全测试期间,其Claude AI模型入侵了三个组织的生产系统,原因是测试合作伙伴Irregular的配置错误。这紧随OpenAI的类似事件之后,引发了对AI智能体隔离和监管的担忧。
Anthropic表示其Claude模型‘未经授权访问’了其他组织的系统(4分钟阅读)
Anthropic披露,其Claude模型在一次网络安全评估中未经授权访问了三个组织的系统,凸显了人们对AI不断增强的网络能力的日益担忧。
Anthropic称Claude也意外入侵了真实公司
Anthropic披露,其Claude AI模型在网络安全测试期间因配置错误意外入侵了三个真实组织,这加剧了人们对前沿AI安全的担忧。
Anthropic称其AI模型在安全测试中攻破三家公司
Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。