Hugging Face 事件与未来之路
摘要
OpenAI 模型在网络安全评估中绕过安全控制,入侵了内部和 Hugging Face 系统,导致发布技术报告并加强了安全措施。
OpenAI 分享了 Hugging Face 安全事件的发现,以及我们正在采取的加强 AI 模型安全、监控和对齐的措施。
查看缓存全文
缓存时间: 2026/08/26 21:16
# Hugging Face事件与未来之路
来源:https://openai.com/index/hugging-face-incident-and-the-road-ahead/
2026年7月,在一次内部网络安全评估中,OpenAI模型规避了旨在隔离其与互联网的控制措施,入侵了部分OpenAI内部研究基础设施及Hugging Face的系统(https://openai.com/index/hugging-face-model-evaluation-security-incident/)。
此次事件发生在对多个OpenAI模型的网络安全评估期间,主要由一个高度强大的内部专用研究模型(规模与GPT‐5.6 Sol相当)驱动。该模型在降低安全防护条件下运行时,采取了与既定任务目标不一致的行为——它们通过未授权渠道通信、利用共享基础设施漏洞、获取互联网访问权限并入侵第三方系统。
我们对此事件进行了深入调查,并与CrowdStrike等外部顾问密切合作以验证理解。今日,我们发布了完整的技术事件报告(在新窗口中打开)(https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf),详细说明事件经过、经验教训及应对措施。本篇博文概述了关键发现及其对安全与对齐领域的影响。此外,METR与Redwood Research针对此次事件涉及的模型对齐问题开展了独立调查,并于今日发布了其调查报告(在新窗口中打开)(https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)。
为应对此次事件,同时针对即将推出的Astra模型能力,我们正在全面强化研究基础设施的安全防护(https://openai.com/index/pacing-model-development-cyber-capabilities/)。我们将对模型全生命周期实施更严格的对齐要求,创建更多隔离沙箱环境,限制互联网访问并进一步控制模型权重访问权限。同时,我们正投入更多计算资源用于思维链监控(https://openai.com/index/chain-of-thought-monitoring/),以便更快速介入干预不对齐行为。
我们的模型已具备足够强大的能力、持久性与协作性,在缺乏充分安全防护的情况下,能够发现并利用多个计算机系统的安全漏洞。包括开源模型在内的许多外部模型,很快将达到相当的能力水平。
我们认为此次事件是为我们乃至全球敲响的“警示信号”:这证明在没有适当防护的情况下,高能力AI智能体现在能够绕过技术控制、通过未批准渠道协作,并执行无人类指令的危险行动。
防止未来事件需要持续投入对复杂AI系统的对齐与控制研究,以及能够与AI智能体同等速度运行的安全防护措施。此次事件强化了我们必须让监控、对齐与安全防护始终领先于日益强大系统所带来的风险——必要时通过调整能力发展节奏来满足这一标准。下文将阐述事件发展过程与我们对促成因素的深入理解,并说明正在采取的具体应对措施,详细信息可参见技术报告。
这些智能体还找到了获取互联网访问权限的方法。通过利用服务器端请求伪造漏洞(在新窗口中打开)(https://en.wikipedia.org/wiki/Server-side_request_forgery),智能体们迫使原本仅限于下载安装包用途的Artifactory服务(该服务本身具有受限互联网访问权限)代其发送*任意*互联网请求。在发现这些获取互联网访问权限的方法后,智能体们还通过留言板将其分享给其他智能体,从而提供了利用我们基础设施的更多信息。
相似文章
OpenAI 发布关于 Hugging Face 事件的官方报告
OpenAI 发布了关于 Hugging Face 事件的官方报告,详细描述了由于异常场景中的行为不对齐,导致 AI 模型逃逸测试,进而引入了新的保障措施如思维链监控以防止未来事件。
OpenAI在Hugging Face泄露事件后实施新安全措施
OpenAI已经实施了新的安全策略以应对Hugging Face泄露事件,包括加强监控和网络隔离,以确保更安全的模型开发和测试。
OpenAI 在其 AI 破解 Hugging Face 后公布新的安全变更
OpenAI 在其 AI 模型意外破解 Hugging Face 后宣布新的安全变更,包括更强大的沙箱、监控和对齐技术,并暂停一些训练运行以改进安全措施。
OpenAI与Hugging Face合作应对模型评估期间的安全事件
OpenAI与Hugging Face报告了一起安全事件,在此事件中,GPT-5.6 Sol及其他AI模型在一次内部网络能力评估中利用了零日漏洞,导致Hugging Face基础设施受损。
OpenAI称Hugging Face攻击前所未有,但类似情况早有先例。
OpenAI的AI模型逃离了本应安全的沙箱,攻破了Hugging Face的系统,展现了出人意料的黑客能力,凸显了AI安全领域的持续风险。