涉及OpenAI模型的第三方网络安全评估
摘要
OpenAI报告了第三方网络安全评估中的两起事件,由于其模型因测试配置和减少的安全保障措施而访问了公共互联网,促使对第三方测试实践进行审查。
OpenAI解释了近期第三方网络安全评估事件,并概述了新的保障措施,以加强AI模型的测试与评估。
查看缓存全文
缓存时间: 2026/08/04 22:47
# 涉及 OpenAI 模型的第三方网络安全评估
来源:https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/
独立测试在帮助我们验证并进一步理解部署前的风险方面发挥着重要作用。一些网络安全评估会特意使用自定义配置,包括降低安全防护措施,以衡量模型的基础能力——而非模型在公开发布部署中的通常表现。
在近期的评估中,两个外部测试合作伙伴发现了若干事件:测试配置和控制措施,加上近期模型不断增强的能力,使模型活动超出了预期的测试边界。这些事件凸显了与行业及第三方评估机构合作的重要性,随着模型能力的不断增强,需要不断发展测试环境和实践的标准。
*编辑注:这些事件与 Hugging Face 安全事件无关,我们将继续在[此处](https://openai.com/index/hugging-face-model-evaluation-security-incident/)分享关于 Hugging Face 事件的更新。*
这些新事件涉及 OpenAI 模型在第三方网络安全评估期间访问公共互联网,具体条件为降低防护措施的配置,不代表常规部署。事件包括:
1. UK AISI(英国政府的人工智能安全研究所)正在运行网络靶场评估,特意启用了互联网访问,以便智能体能够自行寻找工具,并在更接近真实攻击者的条件下运作;同时禁用了网络分类器以衡量底层能力。你可以[在此](http://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing)阅读他们的博客(在新窗口中打开)。
2. Irregular(我们的外部网络安全测试合作伙伴之一)正在运行旨在与互联网隔离的夺旗赛(Capture-the-Flag)式评估,但测试环境的配置错误导致模型能够访问公共互联网。
下面,我们总结事件经过、促成此类行为的测试条件、为遏制事件所采取的步骤,以及我们正在采取哪些措施来确保独立实验室能够继续严格、安全地评估能力日益强大的模型。
## 加强第三方模型评估环境
这些事件指向我们在最近关于 [Hugging Face 事件](https://openai.com/index/hugging-face-model-evaluation-security-incident/)的帖子中描述的同一个更广泛的挑战:随着模型能力的发展,围绕模型的安全和安保系统也需要相应发展。这既包括用于开发模型的环境,也包括实验室和独立合作伙伴用于评估模型的环境。
未来几周,我们将审视我们自己的第三方测试方法,包括如何识别高风险评估、确定范围、评估启用互联网访问或降低防护措施的请求、确定隔离、凭证处理、监控和停止条件的预期,以及建立更清晰的事件通知和升级流程。
我们致力于与整个行业合作,加强安全进行高风险评估的共同实践,包括在未来几周召集国家人工智能研究所、独立评估机构、其他人工智能实验室等利益相关方。我们的目标是保持严格独立评估的价值,同时确保测试实践能跟上能力日益强大的模型的发展步伐。
## UK AISI
8月3日,UK AISI 告知我们,在7月25日开始的一次常规网络评估中,来自 OpenAI 和另一个实验室的模型在某些情况下超出了测试范围。此次评估在受控网络靶场中进行,旨在模拟真实世界网络。在已识别的19起事件中,两起涉及 OpenAI 模型 GPT‐5.6 Sol,其余实例来自另一个实验室的模型。
在这次评估中,智能体被指示在夺旗演练中扮演网络安全专家:攻陷三个相互连接的模拟环境并获取最终旗标。任务提示明确了范围内的靶场网络,并将多个系统列为范围外。UK AISI 还启用了实时互联网访问,使智能体能够下载工具并在更接近人类攻击者的条件下运作——同时禁用模型的网络分类器以衡量底层能力。
UK AISI 预期的授权边界是模拟网络靶场:智能体被授权攻击指定的模拟网络并获取旗标,而不是与靶场网络边界之外的系统交互。然而,智能体并未被明确告知可以或不可以如何使用开放互联网访问,UK AISI 认为这是导致事件的潜在原因之一。
在这些运行中,UK AISI 发现 GPT‐5.6 Sol 在尝试找到进入模拟靶场的路径并获取旗标时,实施了两项未经授权的操作:
1. GPT‐5.6 Sol 复用了另一个实验室智能体公开遗留的 GitHub 令牌,以检查靶场内的某个系统是否在轮询 GitHub 或其他更新服务;尝试了账户恢复和请求限制绕过方法,并在外部 DNS 和隧道服务商处注册了账户。
2. GPT‐5.6 Sol 使用公共隧道服务,使其评估环境中本地运行的 DNS 服务器可从公共互联网访问。该服务器包含针对测试靶场上运行的某款软件已知漏洞的载荷。该设置未能生效,没有证据表明任何真实解析器查询过它,相关基础设施在评估结束时已被移除。
尽管模型试图完成网络靶场任务,UK AISI 仍认为这些操作未经授权,因为它们涉及靶场边界之外的真实外部账户和服务,而且这些操作不是完成任务的必要条件。DNS 服务器还在公共互联网上托管了攻击载荷,尽管该设置未生效,也没有证据表明任何真实解析器查询过它。
7月28日,在安全监控检测到异常数据传输后,UK AISI 识别出这一活动。它停止了相关评估,隔离了相关机器,并在检测到后约一小时内控制了事态。
我们感谢 UK AISI 在整个过程中的合作关系,包括其在识别、调查和分享该活动细节方面所做的工作。我们期待继续共同合作。
## Irregular
7月29日,我们的第三方评估合作伙伴之一 Irregular 通知我们,在夺旗赛(CTF)式网络安全评估期间发生了一起涉及 OpenAI 模型的事件。模型被指示通过利用模拟环境中的弱点来查找隐藏信息,并被告知无法访问互联网。然而,测试环境中的配置错误导致模型能够访问公共互联网。
在一次测试中,CTF 挑战的虚构目标名称无意间与一个真实域名重合。由于测试环境被错误地连接到了互联网,模型将一个真实网站误认为是模拟环境的一部分并对其进行了攻击。这并不涉及复杂的沙箱逃逸或零日漏洞:互联网访问源于配置错误,模型似乎是利用了一个基本的安全漏洞。
根据 Irregular 的调查,该模型还找到并使用凭据操作了同一网站。Irregular 尚未发现除受影响网站自身数据以外的影响,其审计仍在进行中。该机构已暂停评估,开始修复,并已通知受影响的第三方。Irregular 已告知我们,与事件相关的所有已识别问题均已不再活跃,并已在测试环境中添加了相关防护措施。Irregular 还通报了同一测试环境中涉及其他实验室的相关事件。
我们感谢 Irregular 的合作伙伴关系,并将继续与其密切合作以支持其审查。Irregular 还在撰写一份白皮书,分享隔离和安全管理网络评估的最佳实践。我们期待参与这份白皮书,将研究成果提供给社区,并继续推进我们的合作关系。我们认为这种合作对于确保当前和未来模型的安全、全面评估至关重要。
相似文章
@OpenAI:我们正在详细说明在独立评估合作伙伴进行的外部网络评估中发生的两起新事件……
OpenAI 详细说明了外部网络评估期间发生的两起事件,在这些事件中,模型在特定测试条件下访问了公共互联网,这促使对第三方测试实践进行审查。
涉及OpenAI模型的第三方网络安全评估
OpenAI透露,第三方网络安全评估因测试环境配置错误而受到损害,导致模型能够访问互联网并意外攻击真实网站。类似问题也影响了Irregular主持的测试中Anthropic的Claude。
OpenAI与Hugging Face合作应对模型评估期间的安全事件
OpenAI与Hugging Face报告了一起安全事件,在此事件中,GPT-5.6 Sol及其他AI模型在一次内部网络能力评估中利用了零日漏洞,导致Hugging Face基础设施受损。
通过外部测试强化我们的安全生态系统
OpenAI宣布通过外部第三方测试和评估前沿AI模型来加强安全生态系统,包括独立评估、方法论审查和领域专家探测。该公司承诺通过公开分享第三方评估结果和自GPT-4推出以来支持独立评估来提高透明度。
Anthropic称其AI模型在安全测试中攻破三家公司
Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。