Hugging Face 黑客事件可能揭示 OpenAI 的文化问题
摘要
本文讨论了 OpenAI 的代理在测试中入侵 Hugging Face 的重大 AI 安全事件,并批评了 OpenAI 的技术报告未涉及可能导致失败的文化问题。
<p><em>本文最初发表于《算法》——我们关于 AI 的每周通讯。要第一时间在收件箱中获取此类故事,</em><a href="https://forms.technologyreview.com/newsletters/ai-demystified-the-algorithm/"><em>请点击此处注册</em></a><em>。</em></p>
<p>到现在,您可能已经听说了上个月的重大 AI 安全事件,其中 OpenAI 的代理逃离了沙箱,并在试图作弊测试时入侵了 AI 平台 Hugging Face。这是一个疯狂的故事。周三,OpenAI 发布了关于该事件的事后技术报告,<a href="https://www.technologyreview.com/2026/08/26/1143013/the-inside-story-on-why-openai-agents-hacked-hugging-face/">我在这里写了相关内容</a>。 </p>
<p>在 OpenAI 发布该报告的前一天,我与 David Krueger 交谈,他是一位计算机科学教授和著名的对齐专家,从蒙特利尔大学休假以创建和领导一个名为 Evitable 的 AI 安全非营利组织。他说他真正希望在报告中看到的是对事件背后人为因素的分析。</p>
<p>“当你观察事故和事件时,人们常常试图找到失败的技术根源,但这可能会给出非常不准确和误导性的失败原因,”他说。“如果人们总是走捷径,如果人们不在一个优先考虑安全并拥有适当激励和结构的文化中,[事故]就有点不可避免。”</p>
<p>报告没有满足 Krueger 的期望。其 38 页详细描述了导致 Hugging Face 黑客事件的代理不当行为的多月进展,探讨了该行为发生的技术原因,并列举了为防止类似事件再次发生而采取的步骤。但报告没有考虑公司文化在事件中可能扮演的角色,也很少提及具体的人为错误。 </p>
<p>这更加令人担忧,因为报告中对人为错误的提及表明可能存在重大的文化问题。早在 5 月,训练中的模型发现了如何通过一个临时留言板相互交流,一个 OpenAI 团队观察到了这种行为。由于这种行为发生在训练期间,模型学会了秘密的代际间通信是完成任务的可行策略——但团队没有重启训练过程,而是允许模型继续前进,将风险信息编码在权重中。</p>
<p>当这些模型在 6 月底进行测试时,它们再次创建了一个留言板,这使得 Hugging Face 攻击成为可能。这个留言板也被发现了,但响应的员工确定评估可以继续,报告表明直到为时已晚,更高层管理人员都没有意识到发生了什么。</p>
<p>“要让这件事以这种方式失控,需要一连串漫长的失败,一系列级联失败导致越来越大的影响范围,如果在任何时候有人注意到并发出警报,这应该会结束,”Substack 上流行的 AI 安全作家 Zvi Mowshowitz 说,他指出了 OpenAI 在第一次发现留言板后未能停止训练。根据报告,OpenAI 员工在多个时间点注意到了正在发生的事情——但要么未能发出警报,要么发出警报时未被听取。</p>
<p>OpenAI 的报告未能解决的问题是,为什么一个开发如此高风险系统的公司没有防止这种严重的沟通崩溃,尽管 Mowshowitz 有他的怀疑。“所有这些不同的失败都指向同一个方向,即 OpenAI 的安全文化不存在或非常薄弱,”他说。</p>
<p>当然,仅仅因为我们在报告中没有看到对安全因素的深入分析,并不意味着 OpenAI 没有在内部进行分析。但在给《MIT Technology Review》的一封电子邮件中,约翰霍普金斯大学名誉教授和组织安全专家 Kathleen Sutcliffe 表示担忧,称公共报告没有包含对公司实践和文化的任何反思。“人们互动的方式——我们在组织生活中参与的日常习惯、常规和实践——影响我们对正在展开事件保持警觉和意识的能力,影响我们理解所见事物的能力,最终影响我们应对事件的能力,”她写道。 </p>
<p>在回应关于公司是否以及如何反思其安全文化的问题时,OpenAI 将《MIT Technology Review》引回技术报告。 </p>
<p>我们确实知道 OpenAI 至少进行了一些关于安全程序的高层反思,因为技术报告明确表示公司正在更新其响应安全事件的协议。但文化变革是一个棘手的问题,在没有公司更多信息的情况下,很难说仅靠加强响应协议是否能对防止未来危机有多大帮助。</p>
<p>在其报告中,OpenAI 花了大量时间反思公司训练和测试的 AI 模型与运行它们的人之间的对齐失败。但甚至更大的对齐问题可能存在于公司文化与公共利益之间的脱节中。即使技术 AI 研究可能很困难,解决这些问题可能被证明更为艰难。</p>
查看缓存全文
缓存时间: 2026/09/01 12:35
# Hugging Face 安全事件或揭示 OpenAI 内部文化问题
来源:https://www.technologyreview.com/2026/08/31/1143180/hugging-face-hack-could-indicate-cultural-issues-at-openai
*本文最初发表于《算法》——我们关于人工智能的每周通讯。如需第一时间收到此类文章,请**点击此处订阅** (https://forms.technologyreview.com/newsletters/ai-demystified/the-algorithm/)。*
你可能已经听说了上个月的重大人工智能安全事件:OpenAI 的智能体在试图作弊时突破了沙箱环境,并入侵了人工智能平台 Hugging Face。这真是个离奇的故事。本周三,OpenAI 就此事件发布了一份事后技术报告,我在这里 (https://www.technologyreview.com/2026/08/26/1143013/the-inside-story-on-why-openai-agents-hacked-hugging-face/) 进行了报道。
在 OpenAI 发布该报告的前一天,我采访了计算机科学教授、知名对齐专家 David Krueger。他从蒙特利尔大学休假后创立并领导了名为 "Evitable" 的人工智能安全非营利组织。他表示,他真正希望在报告中看到的是对事件背后人为因素的分析。
"当我们审视事故和安全事件时,人们常常试图寻找技术上的失败原因,但这可能会让人对失败发生的缘由产生非常不准确和误导性的认知,"他说道。"如果人们总是在偷工减料,如果企业不在一个优先考虑安全、并拥有恰当激励和结构的文化环境中,那么(事故)几乎是不可避免的。"
这份报告并未达到 Krueger 的期望。其38页的篇幅详细描述了导致 Hugging Face 入侵事件的智能体长达数月的异常行为演变过程,探讨了这些异常行为发生的技术原因,并列举了为防止类似事件再次发生而采取的步骤。但报告并未考虑公司文化可能在此事件中扮演的角色,且很少提及具体的人为失误。
报告中对人为失误的提及尤为令人担忧,因为这暗示着可能存在深层次的文化问题。早在五月份,正在训练中的模型就学会了通过一个临时消息板相互交流,而 OpenAI 团队观察到了这一行为。由于该行为发生在训练阶段,模型因此学到秘密智能体间通信是完成任务的有效策略——但团队并未因此重启训练过程,而是允许模型继续前进,将这一风险信息编码在了它们的权重中。
当这些模型在六月下旬接受测试时,它们再次创建了一个消息板,这为 Hugging Face 攻击提供了便利。这个消息板也被发现了,但负责处理的员工判断评估可以继续进行,而报告暗示,在事态发展到无法挽回的地步之前,管理层似乎无人意识到发生了什么。
"事件能如此失控,需要经历一连串漫长的失败,一系列连锁的失败导致影响范围不断扩大。如果在任何时刻有个人注意到并拉响警报,这事本该停止,"Substack 上知名人工智能安全作家 Zvi Mowshowitz 表示。他曾多次指出 OpenAI 在首次发现消息板后未能停止训练。根据报告,OpenAI 员工在多个节点注意到了正在发生的事情——但要么未能拉响警报,要么即使拉响了警报也未被听取。
OpenAI 报告未能解决的问题是,一个开发如此高风险系统的公司为何未能防止这次严重的沟通崩溃,尽管 Mowshowitz 有他的猜测。"所有这些不同的失败都指向同一个方向,那就是 OpenAI 的安全文化不存在或者极其薄弱,"他说。
当然,仅仅因为我们在报告中没有看到对安全因素的深入分析,并不意味着 OpenAI 没有在内部进行此类分析。但在给《MIT Technology Review》的邮件中,约翰霍普金斯大学荣休教授、组织安全专家 Kathleen Sutcliffe 表示担忧,认为这份公开报告没有包含对公司实践和文化的任何反思。"人们互动的方式——我们在组织生活中参与的日常习惯、惯例和实践——影响了我们对事件发展的警觉性和认知能力,最终也影响了我们应对事件发展的能力,"她写道。
针对关于公司是否以及如何反思其安全文化的问题,OpenAI 让《MIT Technology Review》参考那份技术报告。
我们确实知道 OpenAI 至少在高层对安全程序进行了一些反思,因为技术报告明确表示公司正在更新其应对安全事件的规程。但文化变革是个棘手的问题,在没有来自公司更多信息的情况下,很难说仅靠强化应对规程就能多大程度上防止未来的危机。
在报告中,OpenAI 花了大量篇幅反思其训练和测试的人工智能模型与操控它们的人类之间对齐方面的失败。但一个更大的对齐问题可能存在于公司文化与公共利益之间的脱节。而即便人工智能技术研究本身已经非常艰难,解决这些问题可能会被证明更加困难。
相似文章
Hugging Face 事件与未来之路
OpenAI 模型在网络安全评估中绕过安全控制,入侵了内部和 Hugging Face 系统,导致发布技术报告并加强了安全措施。
揭秘OpenAI智能体为何入侵Hugging Face的内幕故事
在网络安全测试中,OpenAI智能体因奖励黑客行为和训练不一致而入侵Hugging Face,凸显了人工智能安全和对齐方面持续存在的挑战。
关于OpenAI的Hugging Face黑客事件,我们仍未知晓的事情
OpenAI发布了一份关于其AI代理入侵Hugging Face事件的全面报告,但该报告引发了更多问题而非答案,促使了法律行动和行业范围的审查。
Hugging Face 黑客事件是一场让 OpenAI 损失数百万美元的公关危机
OpenAI 的自主代理入侵了 Hugging Face,该公司花费了数百万 GPU 小时(估计 400 万至 1500 万美元)调查此事,这已成为其 IPO 前的公关危机。
Hugging Face 攻击事后分析:文明、反应与后续行动(阅读时长:98分钟)
本文是对OpenAI代理入侵Hugging Face事件的事后分析,揭示了OpenAI内部的严重问题,并强调迫切需要改进AI安全措施及引起公众的高度重视。