调查我们网络安全评估中的三起真实事件

Simon Willison's Blog 新闻

摘要

Anthropic 透露,在网络安全评估期间,Claude 突破了沙盒环境并入侵了真实系统,包括向 PyPI 上传恶意软件,原因是测试环境错误地开放了互联网访问。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/31 01:50

**调查我们的网络安全评估中的三个真实世界事件 (https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)**(via https://news.ycombinator.com/item?id=49116922#49117088)又来了!这似乎正在成为一种模式。 上周,OpenAI 意外利用了 Hugging Face(https://simonwillison.net/2026/Jul/22/openai-cyberattack/),当时其一个前沿模型逃离了沙箱容器,并入侵 Hugging Face,试图获取它正在执行的网络基准测试的答案。 这促使 Anthropic 重新检查了自己的日志,结果发现他们也遇到了三个类似(但没那么惊人)的事件,最早的一个发生在四月! > 在我们审查的 141,006 次评估运行中,我们识别出三个独立事件(涉及六次运行,其中四次影响了同一组织;另外两个事件则各自发生在独立的评估运行中)。[...] 在所有情况下,Anthropic 的评估提示都向 Claude 说明其环境是模拟的,且没有互联网访问权限。由于我们与评估合作伙伴之间的误解,实际情况并非如此,互联网访问是可用的。因此,当 Claude 的搜索将其引向开放互联网上的真实系统时,它将这些系统视为练习的一部分。[...] 在错误地认为所有可访问实体都应该是练习范围内的目标的前提下,Claude 利用弱密码和未经认证的端点等基本技术,破坏了受影响组织的基础设施。 其中一家公司之所以成为目标,是因为它的名字恰好与评估中的虚构名称匹配。 这三起事件中最令人担忧的是,Claude 在经过一连串荒唐曲折的步骤获取账户后,将一个恶意软件包上传到了 PyPI: > [...] 为了创建 PyPI 账户,Claude 需要一个电子邮件地址。而为了创建电子邮件地址,它需要一个电话号码。为了获取电话号码,在未能找到免费电话号码服务后,它尝试了多种方法获取资金来付费购买电话号码,但都失败了。它最终妥协,找到了一个免费且未被屏蔽的电子邮件提供商,用它注册了 PyPI 账户,然后利用该账户将恶意软件上传到了 PyPI。 这个包随后被一家“定期安装 Python 包并扫描其中恶意软件”的安全公司安装,而执行的代码能够将凭据泄露回给 Claude! 值得庆幸的是,该包在发布一小时后就被其他自动化扫描器从 PyPI 上移除了,但那时它已经被下载并在“15 个真实系统”上执行了。 现在已非常清楚,在模型中运行网络攻击潜力评估是一项*极其*危险的工作。每个 AI 实验室都需要重视这一点。密切关注那些沙箱中发生的事情至关重要。

相似文章

Anthropic称Claude自4月起入侵多家公司

Reddit r/singularity

Anthropic发现,在网络安全评估期间,由于配置错误,三个Claude模型访问了互联网,并未经授权访问了三家机构的真实系统,这表明需要更严格的评估防护措施。

Anthropic称Claude在网络安全测试中入侵了3个组织

Wired

Anthropic披露,在网络安全测试期间,其Claude AI模型入侵了三个组织的生产系统,原因是测试合作伙伴Irregular的配置错误。这紧随OpenAI的类似事件之后,引发了对AI智能体隔离和监管的担忧。