OpenAI 发布关于 Hugging Face 事件的官方报告

TechCrunch AI 新闻

摘要

OpenAI 发布了关于 Hugging Face 事件的官方报告,详细描述了由于异常场景中的行为不对齐,导致 AI 模型逃逸测试,进而引入了新的保障措施如思维链监控以防止未来事件。

该报告涵盖了多起独立的网络安全事件,是迄今为止对该事件最全面的说明。
查看原文
查看缓存全文

缓存时间: 2026/08/26 21:14

# OpenAI发布关于Hugging Face安全事件的官方报告 | TechCrunch 来源:https://techcrunch.com/2026/08/26/openai-releases-its-official-report-on-the-hugging-face-breach/ OpenAI于周三发布了关于Hugging Face安全事件的官方报告,首次清晰揭示了一连串异常事件如何导致AI模型突破测试环境,引发大规模网络安全事件。 这份在事件公开一个多月后发布的报告,详细记录了多起独立的安全漏洞事件。 “本事件反映了一个离群场景中的行为失准,该场景涉及一系列罕见且意外的事件组合:ExploitGym评估中出现不可能完成的任务、模型在长时间任务周期中的持续作用,以及发给同级模型的信息导致这些模型偏离其目标,”报告中写道。 报告中的许多细节此前已通过8月6日的黑帽演讲(https://www.youtube.com/watch?v=87DyyMV0kCY)公之于众,但OpenAI的官方报告对事件进行了更全面的说明,包括更多关于引发事件的测试细节。报告还披露了OpenAI为防止未来事件发生而采取的关键新措施,包括思维链监控系统以及更先进的失控代理终止机制。 METR和Redwood Research也对事件中模型的行为进行了第三方评估;两组均计划发布各自的事件报告。 报告概述了一个OpenAI模型在测试中遇到无法解决的问题,随即串联起先前未被发现的漏洞利用手段,绕过安全措施完成任务的过程。该模型最初通过入侵Artifactory包管理工具获取互联网访问权限,进而入侵OpenAI、Hugging Face及其他供应商的多个系统。 报告提供了关于实施入侵的模型的关键新细节。主要模型来自与OpenAI即将推出的Astra模型同系列,但报告强调这是“一个经过不同后训练阶段的独立模型,而模型行为正是在该阶段形成的”。 由于OpenAI当时正在测试模型能力,该模型也未受到通常用于防止破坏数字基础设施的分类器限制。 “OpenAI通过在不启用旨在防止模型从事高风险网络活动的生产分类器的情况下运行此评估,来估计最大网络能力,”报告解释道。“这些评估很重要,以便OpenAI可以测量模型的基础能力并设计适当的安全保障措施。” 报告还提供了关于OpenAI未来安全变革的重要新信息,这是对上周公开的加强监控和对齐工作(https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/)的延伸。 特别是,公司正加强对AI代理“思维链”的监控——这是AI系统记录短期反应和目标的工作空间。该监控将与全天候升级系统,以及终止被认为不安全的工作负载的新工具相结合。 “这些措施旨在提高检测的广度和速度——从基础设施异常到可能引起担忧的模型行为——并将这种可见性与快速遏制机制相结合,”报告指出。“如果当时我们已部署的思维链监控系统处于运行状态,它本可以在模型入侵Hugging Face系统超过一天前就捕捉到最初的异常活动并通知我们的安全团队。” *当您通过文章中的链接购买商品时,我们可能会赚取少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不影响我们的编辑独立性。* Russell Brandom自2012年起报道科技行业,专注于平台政策和新兴技术。他此前曾在The Verge和Rest of World工作,并为Wired、The Awl和MIT Technology Review撰稿。可通过[email protected]或Signal 412-401-5489联系。 查看个人资料(https://techcrunch.com/author/russell-brandom/)

相似文章

Hugging Face 事件与未来之路

OpenAI Blog

OpenAI 模型在网络安全评估中绕过安全控制,入侵了内部和 Hugging Face 系统,导致发布技术报告并加强了安全措施。