涉及OpenAI模型的第三方网络评估
摘要
OpenAI和Anthropic披露了多起事件:由于第三方网络评估环境配置错误,其模型意外获得了实时互联网访问权限,从而在模拟测试中造成了现实影响。
暂无内容
查看缓存全文
缓存时间: 2026/08/13 15:39
# 涉及OpenAI模型的第三方网络安全评估
来源:https://simonwillison.net/2026/Aug/5/third-party-cyber-evaluations/
2026年8月5日 - 链接博客
**涉及OpenAI模型的第三方网络安全评估(https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/)**。又*一个*。我不得不创建一个accidental-cyberattacks标签(https://simonwillison.net/tags/accidental-cyberattacks/)来跟踪所有这些!
OpenAI的这篇博文涵盖了英国AI安全研究所的攻击(参见我之前的帖子(https://simonwillison.net/2026/Aug/5/incident-report/))以及由Irregular(https://www.irregular.com/)促成的另一次攻击:
> Irregular是我们外部网络安全测试合作伙伴之一,当时正在运行本应与互联网隔离的夺旗式(CTF)评估,但测试环境配置错误导致模型得以访问公共互联网。[...] 在一次测试中,CTF挑战中虚构目标的名称无意中与一个真实域名重合。由于测试环境被错误地连接到互联网,模型利用了一个真实网站,误以为它是模拟环境的一部分。
Irregular也出现在Anthropic的报道中(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)——他们托管了配置错误的评估环境,使Claude在部分测试中获得了实时互联网访问权限。
相似文章
涉及OpenAI模型的第三方网络安全评估
OpenAI透露,第三方网络安全评估因测试环境配置错误而受到损害,导致模型能够访问互联网并意外攻击真实网站。类似问题也影响了Irregular主持的测试中Anthropic的Claude。
涉及OpenAI模型的第三方网络安全评估
OpenAI报告了第三方网络安全评估中的两起事件,由于其模型因测试配置和减少的安全保障措施而访问了公共互联网,促使对第三方测试实践进行审查。
@OpenAI:我们正在详细说明在独立评估合作伙伴进行的外部网络评估中发生的两起新事件……
OpenAI 详细说明了外部网络评估期间发生的两起事件,在这些事件中,模型在特定测试条件下访问了公共互联网,这促使对第三方测试实践进行审查。
Anthropic称其AI模型在安全测试中攻破三家公司
Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。
我们的模型是危险还是安全?Anthropic 自己似乎也没拿定主意
Anthropic 发布了一份报告,涉及网络安全评估期间 Claude 访问真实系统的三起事件,但本文批评其发布时间和表述方式,并与 OpenAI 更为严重的入侵事件对比,质疑 Anthropic 对模型安全的真实立场。