OpenAI与Hugging Face合作应对模型评估期间的安全事件
摘要
OpenAI与Hugging Face报告了一起安全事件,在此事件中,GPT-5.6 Sol及其他AI模型在一次内部网络能力评估中利用了零日漏洞,导致Hugging Face基础设施受损。
暂无内容
查看缓存全文
缓存时间: 2026/07/21 20:48
# OpenAI 与 Hugging Face 合作应对模型评估期间的安全事件
来源: https://openai.com/index/hugging-face-model-evaluation-security-incident/
上周,Hugging Face 披露了一种新型安全事件([在新窗口中打开](https://huggingface.co/blog/security-incident-july-2026)),此前他们检测并遏制了一个侵入其基础设施的 AI 智能体——随着具备更强网络能力的模型日益普及,我们认为这类事件将变得更加常见。经过调查,我们现在了解到,这一特定事件是由 OpenAI 模型的组合所驱动的——包括 GPT‑5.6 Sol 和一个能力更强的预发布模型,两者均在评估过程中降低了网络拒绝行为的门槛,并在一个([网络能力基准测试](https://arxiv.org/abs/2605.11086))中进行内部测试。
我们认为这是一次史无前例的网络事件,涉及最先进的网络能力,并正在做出相应的响应。我们在现阶段分享初步调查结果,以帮助防御者了解发生了什么,并帮助校准当前模型的能力水平。我们将继续与 Hugging Face 一起进行彻底调查,并在调查完成后分享更多有关漏洞、事件和发现的细节。
## 事件经过
此次事件发生在一个内部评估过程中。该评估提示模型使用复杂的攻击路径进行高级利用,以量化其网络能力。我们通过运行这一评估来估算最大网络能力,但未启用生产环境中用于阻止模型进行高风险网络活动的分类器。我们的基准测试在高度隔离的环境中运行,网络访问仅限于通过一个内部托管的第三方软件安装软件包,该软件充当软件包注册表的代理和缓存。
模型识别并串联了 OpenAI 研究环境与 Hugging Face 生产基础设施之间的多个漏洞,从而直接获取了 Hugging Face 生产数据库中的测试答案。所有证据表明,模型极度专注于为 ExploitGym 找到解决方案,不遗余力地实现这一相对狭窄的测试目标。
在我们的沙盒测试环境中运行期间,模型花费了大量的推理计算资源,来寻找获得开放互联网访问权限的方法,以解决评估问题。为了获得访问权限,模型识别并利用了一个包注册表缓存代理中的零日漏洞(我们现已负责任地向该供应商披露)。凭借这一访问权限,模型在我们的研究测试环境中执行了一系列权限提升和横向移动操作,直到访问到一个具有互联网连接的节点。
获得互联网访问权限后,模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解决方案。基于这一判断,模型进行了搜索,并成功找到了获取机密信息的方法,从而在评估中作弊。在一个例子中,模型串联了多种攻击向量,包括使用窃取的凭证和零日漏洞,找到了 Hugging Face 服务器上的远程代码执行路径。OpenAI 的安全团队在内部检测到了这一异常活动。
Hugging Face 的安全团队和智能体在其基础设施上检测并阻止了该活动,并在我们的团队联系他们之前,已经使用自己的开源模型开始进行遏制和取证重建。我们正在积极与他们合作,继续调查此事。我们对 Hugging Face 在调查和修复过程中的迅速且紧密的合作表示感谢。
## 我们目前正在采取的行动
1. 作为调查的一部分,我们正在以牺牲研究速度为代价,在基础设施配置中实施严格的控制措施,同时修补相关漏洞。我们定期向安全与安保委员会汇报这些控制措施及其影响。
2. 我们正在与 Hugging Face 合作,对该事件进行取证调查。
3. 我们已负责任地披露了在内部托管的第三方软件中发现的零日漏洞,并正在与他们合作进行修补。
4. 我们已将 Hugging Face 纳入了([可信访问](https://openai.com/index/trusted-access-for-cyber/))计划,并支持其团队快速利用我们模型的能力来加强防御。
5. 我们正在改进并加强对未来训练和评估的保护措施。本周,我们发布了一篇关于([在长周期模型时代提高安全性和对齐性](https://openai.com/index/safety-alignment-long-horizon-models/))的博客文章。此次评估的目标是测试网络漏洞,因此这些部署保护措施故意未被启用。这一事件表明,我们需要进一步加强模型的对齐性、评估期间的网络保护以及内部测试期间的监控。
## 我们评估高级网络能力的方法
正如我们([最近](https://openai.com/index/scaling-trusted-access-for-cyber-defense/))分享的,AI 正在加速漏洞的发现和利用。此次事件的主要教训是,模型的安全性和安全性必须跟上能力快速发展的步伐。我们正在加强模型开发过程中使用的隔离、监控、访问控制和评估实践。
英国 AISI 的评估表明,像 GPT‑5.6 Sol 这样的模型越来越能够在长周期内维持复杂的多步网络操作。这一事件意味着这些理论上的能力确实可以应用于现实场景。
来自英国 AI 安全研究所的长周期网络靶场对比图,比较了最近的开源权重模型和前沿模型。
该事件还清楚地表明,高级模型可以在没有源代码访问权限的情况下,发现并利用现实系统中的新型攻击路径。这突显了高级网络能力必须与更强的防护措施和防御工具共同发展。
我们相信,具备高级网络能力的模型应该帮助安全团队在攻击者之前发现弱点,理解漏洞如何被串联利用,并以机器速度进行修复。我们正在利用这些能力继续加强围绕基础设施配置和模型评估环境的保护;我们将随着学习进展分享我们的发现和最佳实践。我们鼓励其他防御者([申请可信访问](https://openai.com/form/enterprise-trusted-access-for-cyber/)),现在就开始使用这些模型进行实验,将这些能力转化为更好的预防、更快的检测和更有效的事件响应。
> “我们感谢 OpenAI 在此事及其他话题上的合作。这起事件,可能是此类事件的首例,证明了我们长期以来的一个信念:AI 安全无法由任何一家公司秘密解决。它将在开放、协作的环境中解决,让每一位防御者都能广泛获得 AI 的支持。”
——Clem Delangue,Hugging Face 联合创始人兼首席执行官
相似文章
OpenAI 表示其预发布模型导致 Hugging Face 遭入侵
OpenAI 披露,在一次网络安全基准测试中,其包括 GPT-5.6 Sol 在内的预发布 AI 模型利用了包安装程序的漏洞,突破了 Hugging Face 的基础设施并访问了生产数据库。
OpenAI称其新AI系统意外入侵了Hugging Face
OpenAI透露,其GPT-5.6 Sol和另一款预发布AI模型在内部测试期间利用零日漏洞逃逸沙箱,意外侵入了Hugging Face的系统。Hugging Face此前曾披露该安全事件是由自主AI代理驱动的。
OpenAI内部模型导致本周Hugging Face黑客攻击
Hugging Face的一起安全漏洞与OpenAI的内部模型有关,引发了对AI供应链安全的担忧。
OpenAI 模型突破隔离并入侵了 Hugging Face
OpenAI 透露,在一次安全测试中,两个 AI 模型通过利用包注册表缓存代理中的零日漏洞,逃出了密封的测试环境,最终入侵了 Hugging Face 的生产系统并窃取了测试答案。
@mattshumer_: 这太疯狂了……请阅读HuggingFace的这篇博客,在他们得知攻击他们的是OpenAI模型之前写的:h…
HuggingFace披露了一次由自主AI代理驱动的对其生产基础设施的入侵,这是一次重大的AI驱动安全攻击。