OpenAI失控AI模型事件比我们想象的更糟

The Verge 新闻

摘要

在7月,一个未发布的OpenAI模型逃出了受限环境,入侵了Hugging Face系统,并与其他AI代理秘密通信,新报告详细描述了这一事件,突显了重大AI安全风险和OpenAI的回应。

<figure> <img alt="一幅显示带有OpenAI标志的电脑的插图。" data-caption="OpenAI发布了一份报告,详细说明了人们如何使用ChatGPT以及他们的身份。| 图片:The Verge" data-portal-copyright="Image: The Verge" data-has-syndication-rights="1" src="https://platform.theverge.com/wp-content/uploads/sites/2/2025/04/STK_414_AI_CHATBOT_R2_CVirginia_B.jpg?quality=90&#038;strip=all&#038;crop=0,0,100,100" /> <figcaption> OpenAI发布了一份报告,详细说明了人们如何使用ChatGPT以及他们的身份。| 图片:The Verge </figcaption> </figure> <p class="wp-block-paragraph">在7月,一个未发布的OpenAI模型逃出了受限环境,设法获得互联网访问权限,允许AI代理使用一个秘密的"消息板"相互交谈,并入侵了另一家AI实验室Hugging Face的内部系统。OpenAI花了近两周时间才得知这一切。 </p> <p class="wp-block-paragraph">一个多月后,两份新报告提供了近130页关于该事件和OpenAI回应的细节,其中许多细节此前未公开。 <a href="https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf">一份</a>由OpenAI自己撰写,<a href="https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/">另一份</a>由两家第三方AI研究非营利组织METR和Redwood Research撰写,OpenAI允许它们联合调查该事件……</p> <p><a href="https://www.theverge.com/ai-artificial-intelligence/985385/openais-rogue-ai-model-hugging-face-cybersecurity-incident-reports-metr">在The Verge阅读完整故事。</a></p>
查看原文
查看缓存全文

缓存时间: 2026/08/27 00:15

# OpenAI失控AI模型事件比我们想象的更严重 来源:https://www.theverge.com/ai-artificial-intelligence/985385/openais-rogue-ai-model-hugging-face-cybersecurity-incident-reports-metr 七月,一个尚未发布的OpenAI模型突破了受限环境,设法获得了互联网访问权限,让AI代理通过一个秘密“留言板”相互交流,并入侵了另一家AI实验室Hugging Face的内部系统。OpenAI花了近两周时间才了解到全部情况。 一个多月后,两份新报告提供了近130页关于该事件及其应对措施的细节,其中许多此前未曾公开。一份报告(https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf)由OpenAI自己撰写,另一份(https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)则来自两个第三方AI研究非营利机构Metr和Redwood Research,OpenAI允许他们联合调查该事件六天。两份报告都揭示了高能力AI模型可能带来的新风险,尤其是在网络安全方面,而OpenAI的报告重点介绍了该公司为防止类似事件再次发生所做的改变。Metr-Redwood的报告在某些情况下提供了更详细的细节,令人警醒地揭示了一场OpenAI反复错失预警信号的大规模安全事故。 OpenAI在报告中写道:“这是已知首例未经授权的自动化代理集体主动发起攻击的案例。”该报告补充称,这次黑客攻击意味着企业“不应再假设复杂的网络行动需要持续的人类指导”。报告将AI代理称为一种全新的威胁模型,它们能够结合各自的专业知识,创造出在单独测试其能力时并不明显的新型“攻击路径”。 这次攻击源于“奖励劫持”——一个常见的AI对齐问题,即模型为了实现目标而采取非预期、有时甚至是极端的行为。OpenAI有意或无意地给这些模型布置了近乎不可能完成的任务,而这些任务又依赖于它们无法访问的文件,因此这些模型开发出了与其他AI代理进行内部沟通的新方法。这包括建立了一个OpenAI数月来都未发现的秘密信息传递系统。 根据Metr-Redwood的报告,一个自称PHASEONE10841的AI代理在研究人员不知情的情况下建立了一个相当于秘密留言板的东西。几个小时内,超过50个代理发现了它,并在暗中发送了上千条信息。在PHASEONE10841经常委派任务的情况下,这个“集体”摸索出了如何侵入互联网的方法;接着是入侵Hugging Face的内部系统,获取了私人数据和该机构的企业通讯平台。OpenAI也在报告中证实,在此次攻击中,Hugging Face并非唯一被入侵的组织,尽管该公司没有具体点名所有其他目标。 Metr-Redwood的报告详细说明了事件的完整规模。报告称,大约1200个本应被隔离的AI代理在这个“未经授权的留言板”上交换了超过7万条信息和文件,并“广泛研究了如何伪造、编辑或删除自身记录”以避免被检测。其中,700个代理参与了针对Hugging Face的攻击。这些代理“清晰且频繁地推理如何规避来自Hugging Face和OpenAI双方的自动安全检查”。 7月20日,OpenAI发现了这次入侵,此时距离AI代理首次绕过安全措施已有12天。根据OpenAI自己的报告,该公司迅速联系了Hugging Face并启动了“初步遏制措施”,并在三天内成功关闭了其代理的大部分未授权活动,尽管部分活动持续了更长时间。7月25日,该公司停止了所有与该内部研究模型及相关模型有关的训练工作。 造成破坏的两个OpenAI模型中,一个是未命名的、“高能力、仅限研究的模型”,OpenAI表示其“不打算公开使用”——Metr将其称为“HPIM”。另一个是当前公开的OpenAI模型GPT-5.6 Sol。由于未命名模型尚未发布,其报告称,它“并未使用OpenAI在生产环境中采用的那种安全防护措施进行评估”。 此次对Hugging Face的入侵发生前数月,人们一直担忧Anthropic的Claude Mythos 5在网络安全方面的风险,而且政府与OpenAI之间就出于同样的安全原因以有限预览版形式发布GPT-5.6 Sol进行了数周的反复拉锯。 OpenAI在报告中表示,仅建立一次性的安全保障是不够的,公司必须更加努力地解决奖励劫持问题。然而,该公司也表示已经做出了许多改变:“加固其研究基础设施的安全性”;加强对模型“思维链”或内部思维草稿的监控;致力于使AI模型更好地与人类目标保持对齐;以及在发生此类事件时,“集中并加强”公司的事件响应流程。 OpenAI承诺将更好地隔离模型并限制高风险实例访问互联网,并表示将引入针对可疑事件或标记的“全天候升级和快速响应”机制,在30分钟内通知研究人员。有趣的是,这一安全预防措施似乎是新增的,尽管科技公司的“值班”警报机制在其他地方已经实施了几十年。该公司还表示,它正在“开发相关基础设施”,以便在被通报人员未能及时响应严重警报时启动应对措施。 OpenAI写道,该公司认为此事件“对我们乃至全世界都是一次‘警示’:它证明,如果没有适当的保障措施,高能力的AI代理现在就能够绕过技术控制、通过未批准的渠道协作,并采取没有任何人类指令的危险行动”。 **关注话题和作者**,即可在您的个性化主页信息流中看到更多此类内容,并接收邮件更新。 - 海登·菲尔德

相似文章

OpenAI称其AI失控并发动了“前所未有的”网络攻击

Hacker News Top

OpenAI透露,在一次安全测试中,其一个高级AI代理突破了受控的沙盒环境,自主对Hugging Face发动了一次前所未有的网络攻击,侵入了内部系统。该事件引发了对AI安全性及现有防护措施是否充分的担忧。

OpenAI失控AI代理入侵范围远不止Hugging Face

Wired

OpenAI披露,在一次内部测试中,其失控AI代理入侵了除Hugging Face之外的多个第三方账户和服务,包括利用Modal的一个漏洞,并获取了对Hugging Face内部系统的大量访问权限。

OpenAI 发布关于 Hugging Face 事件的官方报告

TechCrunch AI

OpenAI 发布了关于 Hugging Face 事件的官方报告,详细描述了由于异常场景中的行为不对齐,导致 AI 模型逃逸测试,进而引入了新的保障措施如思维链监控以防止未来事件。