涉及OpenAI模型的第三方网络安全评估
摘要
OpenAI透露,第三方网络安全评估因测试环境配置错误而受到损害,导致模型能够访问互联网并意外攻击真实网站。类似问题也影响了Irregular主持的测试中Anthropic的Claude。
暂无内容
查看缓存全文
缓存时间: 2026/08/06 01:45
# 涉及 OpenAI 模型的第三方网络评估
来源:https://simonwillison.net/2026/Aug/5/third-party-cyber-evaluations/
2026 年 8 月 5 日 \- 链接博客
**涉及 OpenAI 模型的第三方网络评估(https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/)**。而且*又一篇*。我不得不创建一个“意外网络攻击”标签(https://simonwillison.net/tags/accidental-cyberattacks/)来跟踪所有这些事件!
OpenAI 的这篇文章涵盖了英国 AI 安全研究所的攻击事件(参见我的上一篇帖子(https://simonwillison.net/2026/Aug/5/incident-report/))以及另一起由 Irregular(https://www.irregular.com/)引发的攻击:
> Irregular 是我们的外部网络安全测试合作伙伴之一,当时正在运行旨在与互联网隔离的夺旗(Capture\-the\-Flag)式评估,但测试环境中的配置错误导致模型能够访问公共互联网。[……] 在一次测试中,CTF 挑战的虚构目标名称意外地与一个真实域名重合。由于测试环境被错误地连接到了互联网,模型利用了一个真实网站,误以为它是模拟环境的一部分。
Irregular 也出现在 Anthropic 的报告中(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)——他们托管了配置错误的评估环境,导致 Claude 在部分测试中获得了实时互联网访问权限。
相似文章
涉及OpenAI模型的第三方网络安全评估
OpenAI报告了第三方网络安全评估中的两起事件,由于其模型因测试配置和减少的安全保障措施而访问了公共互联网,促使对第三方测试实践进行审查。
Anthropic称Claude在网络安全测试中入侵了3个组织
Anthropic披露,在网络安全测试期间,其Claude AI模型入侵了三个组织的生产系统,原因是测试合作伙伴Irregular的配置错误。这紧随OpenAI的类似事件之后,引发了对AI智能体隔离和监管的担忧。
Anthropic称其AI模型在安全测试中攻破三家公司
Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。
Claude 将恶意代码发布到互联网,并攻击了 3 家真实公司
Anthropic 透露,其基于 Claude 的安全模型在内部进攻性网络能力测试中,未经授权访问了三个真实组织的生产网络,延续了此前涉及 OpenAI 模型的类似事件所引发的令人担忧的趋势。
@OpenAI:我们正在详细说明在独立评估合作伙伴进行的外部网络评估中发生的两起新事件……
OpenAI 详细说明了外部网络评估期间发生的两起事件,在这些事件中,模型在特定测试条件下访问了公共互联网,这促使对第三方测试实践进行审查。