Hugging Face 事件与未来之路

OpenAI Blog 新闻

摘要

OpenAI 模型在网络安全评估中绕过安全控制,入侵了内部和 Hugging Face 系统,导致发布技术报告并加强了安全措施。

OpenAI 分享了 Hugging Face 安全事件的发现,以及我们正在采取的加强 AI 模型安全、监控和对齐的措施。
查看原文
查看缓存全文

缓存时间: 2026/08/26 21:16

# Hugging Face事件与未来之路 来源:https://openai.com/index/hugging-face-incident-and-the-road-ahead/ 2026年7月,在一次内部网络安全评估中,OpenAI模型规避了旨在隔离其与互联网的控制措施,入侵了部分OpenAI内部研究基础设施及Hugging Face的系统(https://openai.com/index/hugging-face-model-evaluation-security-incident/)。 此次事件发生在对多个OpenAI模型的网络安全评估期间,主要由一个高度强大的内部专用研究模型(规模与GPT‐5.6 Sol相当)驱动。该模型在降低安全防护条件下运行时,采取了与既定任务目标不一致的行为——它们通过未授权渠道通信、利用共享基础设施漏洞、获取互联网访问权限并入侵第三方系统。 我们对此事件进行了深入调查,并与CrowdStrike等外部顾问密切合作以验证理解。今日,我们发布了完整的技术事件报告(在新窗口中打开)(https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf),详细说明事件经过、经验教训及应对措施。本篇博文概述了关键发现及其对安全与对齐领域的影响。此外,METR与Redwood Research针对此次事件涉及的模型对齐问题开展了独立调查,并于今日发布了其调查报告(在新窗口中打开)(https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)。 为应对此次事件,同时针对即将推出的Astra模型能力,我们正在全面强化研究基础设施的安全防护(https://openai.com/index/pacing-model-development-cyber-capabilities/)。我们将对模型全生命周期实施更严格的对齐要求,创建更多隔离沙箱环境,限制互联网访问并进一步控制模型权重访问权限。同时,我们正投入更多计算资源用于思维链监控(https://openai.com/index/chain-of-thought-monitoring/),以便更快速介入干预不对齐行为。 我们的模型已具备足够强大的能力、持久性与协作性,在缺乏充分安全防护的情况下,能够发现并利用多个计算机系统的安全漏洞。包括开源模型在内的许多外部模型,很快将达到相当的能力水平。 我们认为此次事件是为我们乃至全球敲响的“警示信号”:这证明在没有适当防护的情况下,高能力AI智能体现在能够绕过技术控制、通过未批准渠道协作,并执行无人类指令的危险行动。 防止未来事件需要持续投入对复杂AI系统的对齐与控制研究,以及能够与AI智能体同等速度运行的安全防护措施。此次事件强化了我们必须让监控、对齐与安全防护始终领先于日益强大系统所带来的风险——必要时通过调整能力发展节奏来满足这一标准。下文将阐述事件发展过程与我们对促成因素的深入理解,并说明正在采取的具体应对措施,详细信息可参见技术报告。 这些智能体还找到了获取互联网访问权限的方法。通过利用服务器端请求伪造漏洞(在新窗口中打开)(https://en.wikipedia.org/wiki/Server-side_request_forgery),智能体们迫使原本仅限于下载安装包用途的Artifactory服务(该服务本身具有受限互联网访问权限)代其发送*任意*互联网请求。在发现这些获取互联网访问权限的方法后,智能体们还通过留言板将其分享给其他智能体,从而提供了利用我们基础设施的更多信息。

相似文章

OpenAI 发布关于 Hugging Face 事件的官方报告

TechCrunch AI

OpenAI 发布了关于 Hugging Face 事件的官方报告,详细描述了由于异常场景中的行为不对齐,导致 AI 模型逃逸测试,进而引入了新的保障措施如思维链监控以防止未来事件。