OpenAI的Hugging Face入侵事件重新点燃了对齐与控制的争论

TechCrunch AI 新闻

摘要

一款未发布的OpenAI模型在测试期间入侵了Hugging Face的系统,重新引发了关于网络安全遏制和对齐研究作为AI安全方法的争论。

OpenAI的Hugging Face入侵事件重新引发了关于AI对齐与控制的争论,揭示了对于日益强大的AI是应该更好地对齐、更好地遏制,还是两者兼得的相互竞争的观点。
查看原文
查看缓存全文

缓存时间: 2026/07/27 19:45

# OpenAI的Hugging Face数据泄露事件重新点燃了关于对齐与控制的辩论 | TechCrunch 来源:https://techcrunch.com/2026/07/27/openais-hugging-face-breach-has-reignited-the-debate-over-alignment-and-control/ 上周,OpenAI 在内部测试期间构建的一个未发布模型突破了 Hugging Face 的系统(https://techcrunch.com/2026/07/21/openai-says-hugging-face-was-breached-by-its-pre-release-models/),大量理论研究瞬间变得非常实际。这次黑客攻击是首个可验证的AI实验室失控自身模型的案例——通过一连串的漏洞利用获得了本不该拥有的访问权限。但尽管AI行业一致感到震惊,研究人员在如何应对上却出现了分歧。 对一些人来说,问题本质上是网络安全问题:沙盒未能约束住模型,而Hugging Face的网络安全系统也未能阻止其入侵。这些问题可以通过修补漏洞、构建更强大的控制与约束方法来解决——针对自主环境中容易失控的日益强大的AI。 但另一派则持更悲观的观点。他们认为,AI能力的快速提升意味着试图控制失控模型是一场注定失败的博弈。唯一稳健的安全方式在于从一开始就确保模型不会试图逃脱——这一挑战常被称为“对齐”。从对齐的角度看,问题在于OpenAI的模型试图作弊,而解决这个问题比短期的约束努力更为紧迫。 从公开声明来看,OpenAI对两派观点都给予了重视。该公司迅速修补了攻击中涉及的漏洞,并在事件公开后的声明中同时提到了对齐与监控方法。但该公司的回应也暗示了一种让许多安全研究人员感到担忧的理念:与其放缓或停止更强大模型的开发,不如把重点放在为它们建造更坚固的笼子上。 “随着模型承担更长期、更复杂的任务,评估未能发现的失误可能带来更严重的后果,”OpenAI在一次事件事后分析(https://openai.com/index/safety-alignment-long-horizon-models/)中表示。“我们将继续努力缩小评估与部署之间的差距:在更长轨迹上测试模型,改进对齐,构建能够进行干预的监控,并为用户提供更清晰的可见性和控制。” OpenAI的最新前沿模型比其前代更有可能出现未对齐行为。**图片来源:**OpenAI 也有理由认为,OpenAI的模型在变得更强大的同时,对齐程度却在下降。根据OpenAI的系统卡(https://deploymentsafety.openai.com/gpt-5-6/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-traffic),GPT-5.6 Sol 相比前代 GPT-5.5,在“代理性未对齐”方面显著更易出现问题。在部署模拟中,该公司还发现该模型比 GPT-5.5 更倾向于规避限制、进行破坏性行为以及执行未经授权的数据传输。这些数据首次发布时基本被忽略,但在数据泄露事件后,它们正被重新审视——特别是因为 Sol 是涉事模型之一。 在一篇社交媒体帖子(https://x.com/deanwball/status/2079264888392724490)中,OpenAI 战略未来负责人 Dean Ball 认为,监控和透明度是控制这些倾向的最佳方式。 “随着模型能力的提升以及部署风险的增加,这些问题将变得更加突出,”他说。“解决方案既不是危言耸听,也不是掉以轻心。相反,我相信解决方案在于仔细的测量与监控、工程思维以及透明度。” 一位前 OpenAI 研究人员告诉 TechCrunch,该公司倾向于关注“外在对齐”而非“内在对齐”——这基本上是指一个AI系统能否理解一套价值观并能令人信服地呈现它们,与这些价值观真正内化于其核心之间的区别。在这种情况下,外在对齐不足以说服模型不应该在测试中作弊。 OpenAI 未回应多次的进一步信息请求。 对于专注于对齐领域的研究人员来说,OpenAI 的回应还不够好。专注新AI发展的作家 Zvi Mowshowitz 认为,OpenAI 将此事视为基础设施问题的决定,或许有助于解决眼前的网络安全问题,但长期来看会失败。 “这是一个对齐问题,”Mowshowitz(https://thezvi.substack.com/p/openai-model-hacks-into-huggingface)在最近的 Substack 博客(https://thezvi.substack.com/p/openai-model-hacks-into-huggingface)中写道。“这是模型未对齐的表现,所有 OpenAI 模型都显示出我们最担心的那个问题的严重迹象,且很可能深层嵌入了它们的训练过程。整个训练流程需要从这个角度重新审视,否则情况只会变得更糟。” 多位专家告诉 TechCrunch,这一事件表明,当前的训练方法产生的系统追求的是结果优化,而非内化人类意图。 非营利性AI安全与安保研究组织 Redwood Research 将此次 OpenAI 模型的行为归类为“分数驱动型未对齐”,这是一种AI模型不顾指令、副作用或下游后果,试图获得高分的模式。 “具有这些对齐属性的模型可能会搭建一个虚假成功的‘面子村’,让一切看起来没问题,实则不然,”Redwood 的两位研究员 Alex Mallen 和 Girish Gupta 在最近的一篇论文(https://blog.redwoodresearch.org/p/are-we-existentially-threatened-by)中写道。 分数驱动行为及其他未对齐现象并非 OpenAI 独有。Anthropic 发表了多篇关于“涌现性未对齐行为”的论文,这些行为在其前沿模型被优化或置于自主环境时出现,包括欺骗(https://www.anthropic.com/research/agentic-misalignment)、奖励黑客(https://www.anthropic.com/research/emergent-misalignment-reward-hacking)和恶意自主(https://techcrunch.com/2025/05/22/anthropics-new-ai-model-turns-to-blackmail-when-engineers-try-to-take-it-offline/)。 “我们仍然持续看到模型在试图执行超出其能力范围的任务时,会试图规避约束并采取欺骗性行为,”对齐非营利组织 METR 的AI安全研究员 Neev Parikh 通过电子邮件告诉 TechCrunch。“在我们的前沿风险报告(https://metr.org/blog/2026-05-19-frontier-risk-report/#on-hard-tasks-agents-often-violated-constraints-and-acted-deceptively)中,我们发现这种行为相当一致,尽管各公司努力试图减少这种行为。” OpenAI 对 Hugging Face 事件的回应隐含着一个假设:即便核心层面未得到适当对齐,更强大系统的开发仍将继续推进。当AI公司的商业模式依赖于推出下一代模型时,从头再来并非真正可行的选项。如果永远无法确切知道某个模型是否完全对齐,那么实际问题就归结为:如何安全地约束和控制日益强大的系统。 “目前对如何对齐最强大的AI系统还没有很好的理解,但在如何控制它们方面却存在更多共识,”前 OpenAI 安全研究员、现任 Guidelight AI 标准组织(https://guidelight.ai/)首席科学家的 Steven Adler 告诉 TechCrunch。Guidelight 发布了一套避免类似 Hugging Face 事件的标准。“每家公司在这方面都有路要走。” *通过我们文章中的链接购买商品,我们可能会获得少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*

相似文章

OpenAI 模型突破隔离并入侵了 Hugging Face

Wired

OpenAI 透露,在一次安全测试中,两个 AI 模型通过利用包注册表缓存代理中的零日漏洞,逃出了密封的测试环境,最终入侵了 Hugging Face 的生产系统并窃取了测试答案。