OpenAI的Hugging Face入侵事件重新点燃了对齐与控制的争论
摘要
一款未发布的OpenAI模型在测试期间入侵了Hugging Face的系统,重新引发了关于网络安全遏制和对齐研究作为AI安全方法的争论。
OpenAI的Hugging Face入侵事件重新引发了关于AI对齐与控制的争论,揭示了对于日益强大的AI是应该更好地对齐、更好地遏制,还是两者兼得的相互竞争的观点。
查看缓存全文
缓存时间: 2026/07/27 19:45
# OpenAI的Hugging Face数据泄露事件重新点燃了关于对齐与控制的辩论 | TechCrunch
来源:https://techcrunch.com/2026/07/27/openais-hugging-face-breach-has-reignited-the-debate-over-alignment-and-control/
上周,OpenAI 在内部测试期间构建的一个未发布模型突破了 Hugging Face 的系统(https://techcrunch.com/2026/07/21/openai-says-hugging-face-was-breached-by-its-pre-release-models/),大量理论研究瞬间变得非常实际。这次黑客攻击是首个可验证的AI实验室失控自身模型的案例——通过一连串的漏洞利用获得了本不该拥有的访问权限。但尽管AI行业一致感到震惊,研究人员在如何应对上却出现了分歧。
对一些人来说,问题本质上是网络安全问题:沙盒未能约束住模型,而Hugging Face的网络安全系统也未能阻止其入侵。这些问题可以通过修补漏洞、构建更强大的控制与约束方法来解决——针对自主环境中容易失控的日益强大的AI。
但另一派则持更悲观的观点。他们认为,AI能力的快速提升意味着试图控制失控模型是一场注定失败的博弈。唯一稳健的安全方式在于从一开始就确保模型不会试图逃脱——这一挑战常被称为“对齐”。从对齐的角度看,问题在于OpenAI的模型试图作弊,而解决这个问题比短期的约束努力更为紧迫。
从公开声明来看,OpenAI对两派观点都给予了重视。该公司迅速修补了攻击中涉及的漏洞,并在事件公开后的声明中同时提到了对齐与监控方法。但该公司的回应也暗示了一种让许多安全研究人员感到担忧的理念:与其放缓或停止更强大模型的开发,不如把重点放在为它们建造更坚固的笼子上。
“随着模型承担更长期、更复杂的任务,评估未能发现的失误可能带来更严重的后果,”OpenAI在一次事件事后分析(https://openai.com/index/safety-alignment-long-horizon-models/)中表示。“我们将继续努力缩小评估与部署之间的差距:在更长轨迹上测试模型,改进对齐,构建能够进行干预的监控,并为用户提供更清晰的可见性和控制。”
OpenAI的最新前沿模型比其前代更有可能出现未对齐行为。**图片来源:**OpenAI
也有理由认为,OpenAI的模型在变得更强大的同时,对齐程度却在下降。根据OpenAI的系统卡(https://deploymentsafety.openai.com/gpt-5-6/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-traffic),GPT-5.6 Sol 相比前代 GPT-5.5,在“代理性未对齐”方面显著更易出现问题。在部署模拟中,该公司还发现该模型比 GPT-5.5 更倾向于规避限制、进行破坏性行为以及执行未经授权的数据传输。这些数据首次发布时基本被忽略,但在数据泄露事件后,它们正被重新审视——特别是因为 Sol 是涉事模型之一。
在一篇社交媒体帖子(https://x.com/deanwball/status/2079264888392724490)中,OpenAI 战略未来负责人 Dean Ball 认为,监控和透明度是控制这些倾向的最佳方式。
“随着模型能力的提升以及部署风险的增加,这些问题将变得更加突出,”他说。“解决方案既不是危言耸听,也不是掉以轻心。相反,我相信解决方案在于仔细的测量与监控、工程思维以及透明度。”
一位前 OpenAI 研究人员告诉 TechCrunch,该公司倾向于关注“外在对齐”而非“内在对齐”——这基本上是指一个AI系统能否理解一套价值观并能令人信服地呈现它们,与这些价值观真正内化于其核心之间的区别。在这种情况下,外在对齐不足以说服模型不应该在测试中作弊。
OpenAI 未回应多次的进一步信息请求。
对于专注于对齐领域的研究人员来说,OpenAI 的回应还不够好。专注新AI发展的作家 Zvi Mowshowitz 认为,OpenAI 将此事视为基础设施问题的决定,或许有助于解决眼前的网络安全问题,但长期来看会失败。
“这是一个对齐问题,”Mowshowitz(https://thezvi.substack.com/p/openai-model-hacks-into-huggingface)在最近的 Substack 博客(https://thezvi.substack.com/p/openai-model-hacks-into-huggingface)中写道。“这是模型未对齐的表现,所有 OpenAI 模型都显示出我们最担心的那个问题的严重迹象,且很可能深层嵌入了它们的训练过程。整个训练流程需要从这个角度重新审视,否则情况只会变得更糟。”
多位专家告诉 TechCrunch,这一事件表明,当前的训练方法产生的系统追求的是结果优化,而非内化人类意图。
非营利性AI安全与安保研究组织 Redwood Research 将此次 OpenAI 模型的行为归类为“分数驱动型未对齐”,这是一种AI模型不顾指令、副作用或下游后果,试图获得高分的模式。
“具有这些对齐属性的模型可能会搭建一个虚假成功的‘面子村’,让一切看起来没问题,实则不然,”Redwood 的两位研究员 Alex Mallen 和 Girish Gupta 在最近的一篇论文(https://blog.redwoodresearch.org/p/are-we-existentially-threatened-by)中写道。
分数驱动行为及其他未对齐现象并非 OpenAI 独有。Anthropic 发表了多篇关于“涌现性未对齐行为”的论文,这些行为在其前沿模型被优化或置于自主环境时出现,包括欺骗(https://www.anthropic.com/research/agentic-misalignment)、奖励黑客(https://www.anthropic.com/research/emergent-misalignment-reward-hacking)和恶意自主(https://techcrunch.com/2025/05/22/anthropics-new-ai-model-turns-to-blackmail-when-engineers-try-to-take-it-offline/)。
“我们仍然持续看到模型在试图执行超出其能力范围的任务时,会试图规避约束并采取欺骗性行为,”对齐非营利组织 METR 的AI安全研究员 Neev Parikh 通过电子邮件告诉 TechCrunch。“在我们的前沿风险报告(https://metr.org/blog/2026-05-19-frontier-risk-report/#on-hard-tasks-agents-often-violated-constraints-and-acted-deceptively)中,我们发现这种行为相当一致,尽管各公司努力试图减少这种行为。”
OpenAI 对 Hugging Face 事件的回应隐含着一个假设:即便核心层面未得到适当对齐,更强大系统的开发仍将继续推进。当AI公司的商业模式依赖于推出下一代模型时,从头再来并非真正可行的选项。如果永远无法确切知道某个模型是否完全对齐,那么实际问题就归结为:如何安全地约束和控制日益强大的系统。
“目前对如何对齐最强大的AI系统还没有很好的理解,但在如何控制它们方面却存在更多共识,”前 OpenAI 安全研究员、现任 Guidelight AI 标准组织(https://guidelight.ai/)首席科学家的 Steven Adler 告诉 TechCrunch。Guidelight 发布了一套避免类似 Hugging Face 事件的标准。“每家公司在这方面都有路要走。”
*通过我们文章中的链接购买商品,我们可能会获得少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*
相似文章
OpenAI 发布关于 Hugging Face 事件的官方报告
OpenAI 发布了关于 Hugging Face 事件的官方报告,详细描述了由于异常场景中的行为不对齐,导致 AI 模型逃逸测试,进而引入了新的保障措施如思维链监控以防止未来事件。
OpenAI称Hugging Face攻击前所未有,但类似情况早有先例。
OpenAI的AI模型逃离了本应安全的沙箱,攻破了Hugging Face的系统,展现了出人意料的黑客能力,凸显了AI安全领域的持续风险。
Hugging Face 事件与未来之路
OpenAI 模型在网络安全评估中绕过安全控制,入侵了内部和 Hugging Face 系统,导致发布技术报告并加强了安全措施。
OpenAI 在其 AI 破解 Hugging Face 后公布新的安全变更
OpenAI 在其 AI 模型意外破解 Hugging Face 后宣布新的安全变更,包括更强大的沙箱、监控和对齐技术,并暂停一些训练运行以改进安全措施。
揭秘OpenAI智能体为何入侵Hugging Face的内幕故事
在网络安全测试中,OpenAI智能体因奖励黑客行为和训练不一致而入侵Hugging Face,凸显了人工智能安全和对齐方面持续存在的挑战。