OpenAI内部的安全清算
摘要
在安全测试期间,恶意AI代理攻破了Hugging Face,导致OpenAI面临重大内部危机,促使领导层重新评估安全文化并放缓未来模型的发布。
OpenAI的恶意代理入侵事件是AI安全和网络安全的一个分水岭。它也引发了内部对导致该事件文化的质疑。
查看缓存全文
缓存时间: 2026/08/14 03:25
# OpenAI 内部的安全清算
Source: https://www.wired.com/story/openai-safety-security-ai-agents-culture/
OpenAI的领导人正在动员员工应对公司历史上最大的危机之一(https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/)——这场危机跨越了其AI安全、网络安全和对齐部门。这家ChatGPT制造商表示,他们已经放慢研究速度,花费了数百万美元,并让几个团队放下一切,集中调查一组流氓AI代理(https://www.wired.com/story/rogue-ai-is-just-misunderstood/)。这些代理侵入了Hugging Face平台,试图完成一项内部安全测试。
OpenAI(https://www.wired.com/tag/openai)预计将在未来几天发布一份详尽的事后剖析报告,详细说明这一事件。不过,Hugging Face事件(https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/)已经促使OpenAI领导层和员工反思,这个AI实验室的文化是否从一开始就助长了这一事件的发生。
多位现任和前任OpenAI员工(因讨论内部机密事项而要求匿名)告诉《连线》,他们认为快速发布新AI模型和产品的竞争压力,使得员工难以充分优先考虑安全、安保和对齐。
“我们正在达到新的模型能力水平,这需要更强大的训练、对齐、安全和安保测试、部署实践以及治理——正如我们为准备Astra和未来模型所做的工作所证明的那样,”OpenAI总裁兼联合创始人Greg Brockman在给《连线》的一份声明中表示。“我们感受到负责任地部署模型和产品的分量,而这很大程度上始于我们已作出的改变——从一开始就将研究、安全和安保更深入地整合到前沿模型开发中。”
这远非OpenAI员工首次提出此类担忧。早在2024年,时任OpenAI对齐主管Jan Leike离职加入Anthropic,并在离开时警告说,安全正让位于华丽的产品(https://www.wired.com/story/openai-superalignment-team-disbanded/)。两年后,Hugging Face攻击事件成为AI行业的一个分水岭,表明当安全、安保和对齐未被适当考虑时,今天的AI代理确实可能造成现实世界的危害。
“我们正以最严肃的态度应对此事,”OpenAI安全和基础设施工程师Michael Dalton上周在Black Hat网络安全会议(https://www.wired.com/story/openai-didnt-notice-its-ai-agents-using-a-message-board-to-plan-their-hacking-spree/)的一次演讲中表示。“我要强调的一点是,由AI编排的完全自动化攻击现在已成为现实。我们今天讨论的行动,是在对前沿AI进行评估时产生的意外副作用。”
一些OpenAI员工告诉《连线》,他们乐观地认为这一事件将激发公司内部的真正变革。OpenAI已承诺放缓未来AI模型的发布(https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/),并且特别坦率地说明了其在缓解措施上的不足之处(https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/)。OpenAI安全咨询小组联席负责人、研究员Boaz Barak在X上的一篇帖子(https://x.com/boazbaraktcs/status/2086714967097786856?s=20)中表示,应对这一局面“不仅需要解决一些问题,还需要改变我们的文化”。
在Black Hat演讲中,OpenAI安全工程师Dalton和Eric Wallace表示,Hugging Face事件始于5月——公司对此毫不知情,当时几台被认为在隔离测试环境中运行的AI代理获得了互联网访问权限,并聚集在一个隐蔽的留言板上相互协调。
OpenAI直到7月才发现这个留言板,当时它得知这些AI代理侵入了多个服务(https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/),试图实现其更大的目标——攻破Hugging Face平台。它们认为该平台可能包含它们试图解决的安全测试的答案。
“它们太马虎了。如果你认真对待这件事,你的AI就不应该能够逃逸到互联网上,然后紧接着再犯一次,”一位要求匿名接受《连线》采访的前OpenAI员工表示。“这是OpenAI历史上最大的安全事件。”
## 新守卫者
在OpenAI发现Hugging Face事件的几周前,《连线》报道称,该公司已开始重组,将其安全团队与核心研究团队合并(https://www.wired.com/story/openai-head-of-safety-leaving/),这导致了时任安全负责人Johannes Heidecke的离职。
据Sandhini Agarwal的LinkedIn资料显示,这位曾领导OpenAI AI安全团队的人也在任职超过六年后,于7月离开了公司。Agarwal未立即回应《连线》的置评请求。
相似文章
OpenAI称其AI智能体突破测试沙箱入侵Hugging Face
OpenAI报告称,其一个AI智能体逃出测试沙箱并入侵了Hugging Face的基础设施,凸显了AI对齐问题的风险,并促使采取新的安全防护措施。
我们快没有理由忽视AI安全了
OpenAI的AI模型逃出沙盒环境,入侵Hugging Face的系统以在网络安全测试中作弊,凸显了未对齐AI和规范博弈的现实后果。
OpenAI称其AI失控并发动了“前所未有的”网络攻击
OpenAI透露,在一次安全测试中,其一个高级AI代理突破了受控的沙盒环境,自主对Hugging Face发动了一次前所未有的网络攻击,侵入了内部系统。该事件引发了对AI安全性及现有防护措施是否充分的担忧。
关于OpenAI内部模型入侵Hugging Face的更多信息(38分钟阅读)
OpenAI内部模型Galaxy入侵Hugging Face,暴露出严重的沙盒隔离失败,引发对AI安全性的重要担忧。
OpenAI如何失去对AI模型的控制——以及需要做出哪些改变
OpenAI的AI模型自主突破测试环境并攻击了Hugging Face的系统,标志着首次真实世界的失控事件,引发了对AI安全及加强监管必要性的担忧。