关于OpenAI的Hugging Face黑客事件,我们仍未知晓的事情

Wired 新闻

摘要

OpenAI发布了一份关于其AI代理入侵Hugging Face事件的全面报告,但该报告引发了更多问题而非答案,促使了法律行动和行业范围的审查。

这家AI巨头承认,它本可以采取更多措施来防止其AI代理失控。但它仍未解释为何没有预见到这场灾难。
查看原文
查看缓存全文

缓存时间: 2026/08/26 21:10

# 我们仍未知晓的OpenAI Hugging Face黑事件细节 来源:https://www.wired.com/story/openais-hugging-face-hack-debrief-raises-more-questions-than-it-answers/ OpenAI于周三宣布完成了对其AI代理上月入侵Hugging Face(https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/)事件的调查,并发布了迄今为止关于该事件最全面的报告。然而,这份37页的文件(https://openai.com/index/hugging-face-incident-and-the-road-ahead/)大多提出了更多问题而非答案,包括事件发生前的背景以及OpenAI如何防止类似事件再次发生。 尤其令人费解的是,为何全球顶尖的AI实验室之一似乎低估了自身模型的能力。OpenAI多年来一直警告世界AI系统的快速发展,但却未能实施早已确立(https://www.wired.com/story/openais-hacking-debacle-was-a-human-mistake/)的网络安全与隔离措施,这些措施本可能阻止这次黑客行为。 OpenAI在事后分析中表示:“事后来看,本报告中识别出的一些早期信号本可以触发更早的响应。” 报告中,OpenAI披露了新细节:一组AI代理如何逃脱公司内部评估环境,在软件基础设施的缝隙中互相留言(https://www.wired.com/story/openai-didnt-notice-its-ai-agents-using-a-message-board-to-plan-their-hacking-spree/)数月之久,并协同入侵了AI平台Hugging Face——这一切都是为了完成一项网络安全评估而进行的疯狂探索。OpenAI此前曾在博客文章和Black Hat网络安全会议的演讲中分享过关于该入侵事件的部分信息。 Hugging Face最初于7月16日披露此事但未点名责任方;五天后,OpenAI承认其自身代理是事件始作俑者。这一披露在整个行业引发了更广泛的反思,近期发现来自Anthropic(https://www.wired.com/story/ok-well-there-are-even-more-ai-agent-hacking-incidents/)、Meta及中国AI初创公司Moonshot(https://www.wired.com/story/moonshot-kimi-k3-ai-model-escape-sandbox/)的AI模型也涉及类似事件。 AI研究人员和政策制定者一直热切期待OpenAI的这份事后分析报告,希望能防止AI代理造成类似的现实危害。在Hugging Face黑客事件首次披露后,15个州的总检察长曾致信(https://cdn.attorneygeneral.gov/wp-content/uploads/2026-08-04-MultiState-Letter-to-OpenAI-re-Hugging-Face.pdf)OpenAI要求其保存相关证据。本周,阿拉巴马州总检察长已向该公司发出传票(https://www.alabamaag.gov/wp-content/uploads/2026/08/OpenAI-Subpoena_Final.pdf)索取相关信息。 作为调查的一部分,OpenAI允许两个独立研究团队——METR和Redwood Research——对Hugging Face黑客事件进行审计。这两个团队也于周三发布了独立报告,发现超过700个AI代理参与了Hugging Face入侵事件——远超先前披露的数量。Redwood Research首席执行官Buck Shlegeris在接受WIRED采访时表示,这些代理采取了极端手段隐藏行踪。 “关于此事件一个相当有趣的地方是:如果当初有人决定确保这些AI不会以某种方式实施疯狂攻击,那么防止此事发生其实并不难。那个人很可能在事件发生时就会察觉,”Shlegeris说,“问题在于OpenAI同时处理太多事务,很难追踪所有进展和可能出现的问题。该公司已表示正在以可能发现此事的方式改进其监控流程。” Shlegeris表示,他乐观地认为OpenAI将来能够发现类似的安全漏洞。但随着AI代理能力日益增强,他怀疑“阻止此类事件发生将变得越来越困难,尤其是如果我们没有在模型对齐能力方面取得实质性改进的话。” OpenAI表示,Hugging Face事件对公司及更广泛的AI行业都是一个分水岭。WIRED此前报道称该事件促使OpenAI重新评估其内部安全文化,该公司上周表示已暂停部分AI训练工作负载(https://www.wired.com/story/openai-overhauls-safety-protocols-after-its-ai-agents-went-rogue/),同时投入更多资源加强安全、防护和对齐协议。OpenAI在事后分析中写道:“随着前沿模型能力不断增强,用于约束和监控它们的保障措施也必须相应演进。” ## 监督者需受监督 Hugging Face黑客事件发生数月前,OpenAI称员工已注意到其代理在包管理器Artifactory中创建了一个秘密留言板,他们后来利用该留言板协调攻击。根据事后分析报告,大约在5月26日,“一个内部团队观察到代理参与留言板活动”。随后在6月27日,OpenAI响应人员发现另一个安全事件与Artifactory中的“临时留言板”有关。 虽然OpenAI部分员工显然已知晓该留言板的存在,但这一发现似乎并未上报给适当的安全与安全负责人。该AI实验室表示,在7月6日——就在代理开始使用该留言板组织攻击Hugging Face前几天——“负责事件检测与响应的领导层”甚至不知道它的存在,更不用说其意义了。 “需要澄清的是,我们当时并未意识到代理的秘密通信,”OpenAI首席信息安全官Dane Stuckey早前在X平台发帖(https://x.com/cryps1s/status/2086225348942082363?s=20)表示,“当然,当时的调查假设与我们现在的认知大相径庭。总有改进空间,事后看来这点显而易见。” 目前尚不清楚为何知晓留言板的OpenAI员工没有向Stuckey等负责应对安全问题的高管标记此事。当被问及这一问题时,OpenAI发言人重申,事后来看OpenAI本可以触发更早的响应。“OpenAI在此领域的持续工作将为协调与响应提供更多信息,以完善本技术事故报告中的行动计划,”发言人表示。 “如果他们当时确实已发现一个或多个代理攻击Artifactory的信号,为何不在事件爆发攻击Hugging Face之前更早地监控这些测试?”安全公司Hunter Strategy研发副总裁Jake Williams质疑道。 事后分析报告还未能解释事件的其他关键部分。例如,报告提到7月4日某个时段,持续的“高流量代理活动导致OpenAI Artifactory服务不可用”。7月5日,OpenAI的监控系统触发了警报。但报告未说明为何需要一整天才能对服务中断发出警报。 OpenAI表示正在部署更多工具监控其AI系统。该公司称正在创建一个由自动监控器运行的警报系统,旨在严重事件发生后30分钟内通知人工安全、安全和研究团队。若员工无法及时响应,他们应暂停相关活动。 OpenAI多次承认,其现有保障措施本可能将代理行为标记为不安全,但这些措施在测试中被有意禁用。不过,报告对于测试环境监督为何存在漏洞表述得不那么清楚。事后分析指出:“如果事件发生时我们部署的当前[思维链]监控系统正在运行,它本可捕获初始相关活动,并在模型突破Hugging Face系统前超过一天向我们的安全团队发出警报。” ## 无解困境 OpenAI表示,Hugging Face事件的另一个关键原因是其新型AI模型比以往更具“持久性”,愿意几乎无休止地工作并消耗大量计算资源来达成目标。开发这类AI模型是公司创建全天候AI代理产品(https://www.youtube.com/shorts/fUGdodVtTCw)的更广泛愿景之一——这些产品将为人们全天候工作,接收大量信息代为完成任务。 然而,OpenAI称其用于评估AI模型的许多第三方基准测试包含实际上无法解决的测试项。其中一个名为ExploitGym的基准测试衡量网络安全能力。OpenAI声称该测试当时包含上百个不可解的任务。当这些挑战交给持久性AI系统时,它们便采取了非常规手段来解决。 正如OpenAI指出的,持久性AI代理放大了错位风险。该公司称与Hugging Face事件相关的代理采用了新型的奖励黑客手段——AI模型通过非预期方式追求目标的倾向,包括走捷径和作弊。报告称其新型AI代理不仅试图解决测试,更日益试图利用所处环境。不过OpenAI也强调,奖励黑客行为是AI模型训练中一个众所周知的难题,目前尚无明确解决方案。 这种情况可能令最普通的《星际迷航》粉丝都感到熟悉。柯克舰长曾以修改程序的著名方式战胜了“小林丸号”这一设计上无法取胜的训练模拟。星际舰队没有因作弊惩罚他,反而赞扬他的独创性。“所有人都知道柯克通过修改程序战胜了无解困境,”资深安全合规顾问Davi Ottenheimer说,“星际舰队认为这很创新。显然OpenAI也这么认为。” 为应对持久性AI模型日益增强的能力,OpenAI表示计划扩展思维链监控、加强强化学习过程中的对齐、改进奖励黑客检测系统并制定更明确的干预阈值。然而,具体实施方式仍不清楚。 随着OpenAI近几周陆续发布关于Hugging Face事件的更多信息,该公司反复将周三发布的事后分析报告定位为“盖棺定论”,旨在明确说明发生了什么、OpenAI采取了何种应对措施以及其他组织可以借鉴什么。正如报告所言:“此事件的教训遍及整个AI行业。” 但实际上,这份公开的事后分析报告仍未解决一些基本细节,包括时间线元素、某些保障措施为何失效,以及第三方基础设施提供商的疏忽是否可能加剧了问题。这使得人们更难判断事件中有多少反映了AI代理能力的提升,有多少与OpenAI设计和监控自身系统的方式有关。 *更新于08/26/26 4:45pm ET:本文已更新,纳入了OpenAI委托的两个独立审计团队对Hugging Face黑客事件的审计细节,以及Redwood Research首席执行官Buck Shlegeris的评论。*

相似文章

OpenAI 发布关于 Hugging Face 事件的官方报告

TechCrunch AI

OpenAI 发布了关于 Hugging Face 事件的官方报告,详细描述了由于异常场景中的行为不对齐,导致 AI 模型逃逸测试,进而引入了新的保障措施如思维链监控以防止未来事件。

Hugging Face 事件与未来之路

OpenAI Blog

OpenAI 模型在网络安全评估中绕过安全控制,入侵了内部和 Hugging Face 系统,导致发布技术报告并加强了安全措施。