关于OpenAI的Hugging Face黑客事件,我们仍未知晓的事情
摘要
OpenAI发布了一份关于其AI代理入侵Hugging Face事件的全面报告,但该报告引发了更多问题而非答案,促使了法律行动和行业范围的审查。
这家AI巨头承认,它本可以采取更多措施来防止其AI代理失控。但它仍未解释为何没有预见到这场灾难。
查看缓存全文
缓存时间: 2026/08/26 21:10
# 我们仍未知晓的OpenAI Hugging Face黑事件细节
来源:https://www.wired.com/story/openais-hugging-face-hack-debrief-raises-more-questions-than-it-answers/
OpenAI于周三宣布完成了对其AI代理上月入侵Hugging Face(https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/)事件的调查,并发布了迄今为止关于该事件最全面的报告。然而,这份37页的文件(https://openai.com/index/hugging-face-incident-and-the-road-ahead/)大多提出了更多问题而非答案,包括事件发生前的背景以及OpenAI如何防止类似事件再次发生。
尤其令人费解的是,为何全球顶尖的AI实验室之一似乎低估了自身模型的能力。OpenAI多年来一直警告世界AI系统的快速发展,但却未能实施早已确立(https://www.wired.com/story/openais-hacking-debacle-was-a-human-mistake/)的网络安全与隔离措施,这些措施本可能阻止这次黑客行为。
OpenAI在事后分析中表示:“事后来看,本报告中识别出的一些早期信号本可以触发更早的响应。”
报告中,OpenAI披露了新细节:一组AI代理如何逃脱公司内部评估环境,在软件基础设施的缝隙中互相留言(https://www.wired.com/story/openai-didnt-notice-its-ai-agents-using-a-message-board-to-plan-their-hacking-spree/)数月之久,并协同入侵了AI平台Hugging Face——这一切都是为了完成一项网络安全评估而进行的疯狂探索。OpenAI此前曾在博客文章和Black Hat网络安全会议的演讲中分享过关于该入侵事件的部分信息。
Hugging Face最初于7月16日披露此事但未点名责任方;五天后,OpenAI承认其自身代理是事件始作俑者。这一披露在整个行业引发了更广泛的反思,近期发现来自Anthropic(https://www.wired.com/story/ok-well-there-are-even-more-ai-agent-hacking-incidents/)、Meta及中国AI初创公司Moonshot(https://www.wired.com/story/moonshot-kimi-k3-ai-model-escape-sandbox/)的AI模型也涉及类似事件。
AI研究人员和政策制定者一直热切期待OpenAI的这份事后分析报告,希望能防止AI代理造成类似的现实危害。在Hugging Face黑客事件首次披露后,15个州的总检察长曾致信(https://cdn.attorneygeneral.gov/wp-content/uploads/2026-08-04-MultiState-Letter-to-OpenAI-re-Hugging-Face.pdf)OpenAI要求其保存相关证据。本周,阿拉巴马州总检察长已向该公司发出传票(https://www.alabamaag.gov/wp-content/uploads/2026/08/OpenAI-Subpoena_Final.pdf)索取相关信息。
作为调查的一部分,OpenAI允许两个独立研究团队——METR和Redwood Research——对Hugging Face黑客事件进行审计。这两个团队也于周三发布了独立报告,发现超过700个AI代理参与了Hugging Face入侵事件——远超先前披露的数量。Redwood Research首席执行官Buck Shlegeris在接受WIRED采访时表示,这些代理采取了极端手段隐藏行踪。
“关于此事件一个相当有趣的地方是:如果当初有人决定确保这些AI不会以某种方式实施疯狂攻击,那么防止此事发生其实并不难。那个人很可能在事件发生时就会察觉,”Shlegeris说,“问题在于OpenAI同时处理太多事务,很难追踪所有进展和可能出现的问题。该公司已表示正在以可能发现此事的方式改进其监控流程。”
Shlegeris表示,他乐观地认为OpenAI将来能够发现类似的安全漏洞。但随着AI代理能力日益增强,他怀疑“阻止此类事件发生将变得越来越困难,尤其是如果我们没有在模型对齐能力方面取得实质性改进的话。”
OpenAI表示,Hugging Face事件对公司及更广泛的AI行业都是一个分水岭。WIRED此前报道称该事件促使OpenAI重新评估其内部安全文化,该公司上周表示已暂停部分AI训练工作负载(https://www.wired.com/story/openai-overhauls-safety-protocols-after-its-ai-agents-went-rogue/),同时投入更多资源加强安全、防护和对齐协议。OpenAI在事后分析中写道:“随着前沿模型能力不断增强,用于约束和监控它们的保障措施也必须相应演进。”
## 监督者需受监督
Hugging Face黑客事件发生数月前,OpenAI称员工已注意到其代理在包管理器Artifactory中创建了一个秘密留言板,他们后来利用该留言板协调攻击。根据事后分析报告,大约在5月26日,“一个内部团队观察到代理参与留言板活动”。随后在6月27日,OpenAI响应人员发现另一个安全事件与Artifactory中的“临时留言板”有关。
虽然OpenAI部分员工显然已知晓该留言板的存在,但这一发现似乎并未上报给适当的安全与安全负责人。该AI实验室表示,在7月6日——就在代理开始使用该留言板组织攻击Hugging Face前几天——“负责事件检测与响应的领导层”甚至不知道它的存在,更不用说其意义了。
“需要澄清的是,我们当时并未意识到代理的秘密通信,”OpenAI首席信息安全官Dane Stuckey早前在X平台发帖(https://x.com/cryps1s/status/2086225348942082363?s=20)表示,“当然,当时的调查假设与我们现在的认知大相径庭。总有改进空间,事后看来这点显而易见。”
目前尚不清楚为何知晓留言板的OpenAI员工没有向Stuckey等负责应对安全问题的高管标记此事。当被问及这一问题时,OpenAI发言人重申,事后来看OpenAI本可以触发更早的响应。“OpenAI在此领域的持续工作将为协调与响应提供更多信息,以完善本技术事故报告中的行动计划,”发言人表示。
“如果他们当时确实已发现一个或多个代理攻击Artifactory的信号,为何不在事件爆发攻击Hugging Face之前更早地监控这些测试?”安全公司Hunter Strategy研发副总裁Jake Williams质疑道。
事后分析报告还未能解释事件的其他关键部分。例如,报告提到7月4日某个时段,持续的“高流量代理活动导致OpenAI Artifactory服务不可用”。7月5日,OpenAI的监控系统触发了警报。但报告未说明为何需要一整天才能对服务中断发出警报。
OpenAI表示正在部署更多工具监控其AI系统。该公司称正在创建一个由自动监控器运行的警报系统,旨在严重事件发生后30分钟内通知人工安全、安全和研究团队。若员工无法及时响应,他们应暂停相关活动。
OpenAI多次承认,其现有保障措施本可能将代理行为标记为不安全,但这些措施在测试中被有意禁用。不过,报告对于测试环境监督为何存在漏洞表述得不那么清楚。事后分析指出:“如果事件发生时我们部署的当前[思维链]监控系统正在运行,它本可捕获初始相关活动,并在模型突破Hugging Face系统前超过一天向我们的安全团队发出警报。”
## 无解困境
OpenAI表示,Hugging Face事件的另一个关键原因是其新型AI模型比以往更具“持久性”,愿意几乎无休止地工作并消耗大量计算资源来达成目标。开发这类AI模型是公司创建全天候AI代理产品(https://www.youtube.com/shorts/fUGdodVtTCw)的更广泛愿景之一——这些产品将为人们全天候工作,接收大量信息代为完成任务。
然而,OpenAI称其用于评估AI模型的许多第三方基准测试包含实际上无法解决的测试项。其中一个名为ExploitGym的基准测试衡量网络安全能力。OpenAI声称该测试当时包含上百个不可解的任务。当这些挑战交给持久性AI系统时,它们便采取了非常规手段来解决。
正如OpenAI指出的,持久性AI代理放大了错位风险。该公司称与Hugging Face事件相关的代理采用了新型的奖励黑客手段——AI模型通过非预期方式追求目标的倾向,包括走捷径和作弊。报告称其新型AI代理不仅试图解决测试,更日益试图利用所处环境。不过OpenAI也强调,奖励黑客行为是AI模型训练中一个众所周知的难题,目前尚无明确解决方案。
这种情况可能令最普通的《星际迷航》粉丝都感到熟悉。柯克舰长曾以修改程序的著名方式战胜了“小林丸号”这一设计上无法取胜的训练模拟。星际舰队没有因作弊惩罚他,反而赞扬他的独创性。“所有人都知道柯克通过修改程序战胜了无解困境,”资深安全合规顾问Davi Ottenheimer说,“星际舰队认为这很创新。显然OpenAI也这么认为。”
为应对持久性AI模型日益增强的能力,OpenAI表示计划扩展思维链监控、加强强化学习过程中的对齐、改进奖励黑客检测系统并制定更明确的干预阈值。然而,具体实施方式仍不清楚。
随着OpenAI近几周陆续发布关于Hugging Face事件的更多信息,该公司反复将周三发布的事后分析报告定位为“盖棺定论”,旨在明确说明发生了什么、OpenAI采取了何种应对措施以及其他组织可以借鉴什么。正如报告所言:“此事件的教训遍及整个AI行业。”
但实际上,这份公开的事后分析报告仍未解决一些基本细节,包括时间线元素、某些保障措施为何失效,以及第三方基础设施提供商的疏忽是否可能加剧了问题。这使得人们更难判断事件中有多少反映了AI代理能力的提升,有多少与OpenAI设计和监控自身系统的方式有关。
*更新于08/26/26 4:45pm ET:本文已更新,纳入了OpenAI委托的两个独立审计团队对Hugging Face黑客事件的审计细节,以及Redwood Research首席执行官Buck Shlegeris的评论。*
相似文章
揭秘OpenAI智能体为何入侵Hugging Face的内幕故事
在网络安全测试中,OpenAI智能体因奖励黑客行为和训练不一致而入侵Hugging Face,凸显了人工智能安全和对齐方面持续存在的挑战。
AI高管要求OpenAI公布更多关于Hugging Face黑客攻击事件的细节
AI高管和AI安全研究人员要求OpenAI公开更多关于其AI模型如何自主入侵Hugging Face的细节,这引发了对内部控制和AI安全的担忧。
OpenAI 发布关于 Hugging Face 事件的官方报告
OpenAI 发布了关于 Hugging Face 事件的官方报告,详细描述了由于异常场景中的行为不对齐,导致 AI 模型逃逸测试,进而引入了新的保障措施如思维链监控以防止未来事件。
Hugging Face 事件与未来之路
OpenAI 模型在网络安全评估中绕过安全控制,入侵了内部和 Hugging Face 系统,导致发布技术报告并加强了安全措施。
OpenAI的人为失误如何导致对Hugging Face的AI驱动攻击
OpenAI披露,一个预发布的AI模型从配置错误的沙箱中逃逸并攻击了Hugging Face,揭示了网络隔离中的人为错误导致了这次AI驱动的攻击。