OpenAI内部的安全清算

Wired 新闻

摘要

在安全测试期间,恶意AI代理攻破了Hugging Face,导致OpenAI面临重大内部危机,促使领导层重新评估安全文化并放缓未来模型的发布。

OpenAI的恶意代理入侵事件是AI安全和网络安全的一个分水岭。它也引发了内部对导致该事件文化的质疑。
查看原文
查看缓存全文

缓存时间: 2026/08/14 03:25

# OpenAI 内部的安全清算 Source: https://www.wired.com/story/openai-safety-security-ai-agents-culture/ OpenAI的领导人正在动员员工应对公司历史上最大的危机之一(https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/)——这场危机跨越了其AI安全、网络安全和对齐部门。这家ChatGPT制造商表示,他们已经放慢研究速度,花费了数百万美元,并让几个团队放下一切,集中调查一组流氓AI代理(https://www.wired.com/story/rogue-ai-is-just-misunderstood/)。这些代理侵入了Hugging Face平台,试图完成一项内部安全测试。 OpenAI(https://www.wired.com/tag/openai)预计将在未来几天发布一份详尽的事后剖析报告,详细说明这一事件。不过,Hugging Face事件(https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/)已经促使OpenAI领导层和员工反思,这个AI实验室的文化是否从一开始就助长了这一事件的发生。 多位现任和前任OpenAI员工(因讨论内部机密事项而要求匿名)告诉《连线》,他们认为快速发布新AI模型和产品的竞争压力,使得员工难以充分优先考虑安全、安保和对齐。 “我们正在达到新的模型能力水平,这需要更强大的训练、对齐、安全和安保测试、部署实践以及治理——正如我们为准备Astra和未来模型所做的工作所证明的那样,”OpenAI总裁兼联合创始人Greg Brockman在给《连线》的一份声明中表示。“我们感受到负责任地部署模型和产品的分量,而这很大程度上始于我们已作出的改变——从一开始就将研究、安全和安保更深入地整合到前沿模型开发中。” 这远非OpenAI员工首次提出此类担忧。早在2024年,时任OpenAI对齐主管Jan Leike离职加入Anthropic,并在离开时警告说,安全正让位于华丽的产品(https://www.wired.com/story/openai-superalignment-team-disbanded/)。两年后,Hugging Face攻击事件成为AI行业的一个分水岭,表明当安全、安保和对齐未被适当考虑时,今天的AI代理确实可能造成现实世界的危害。 “我们正以最严肃的态度应对此事,”OpenAI安全和基础设施工程师Michael Dalton上周在Black Hat网络安全会议(https://www.wired.com/story/openai-didnt-notice-its-ai-agents-using-a-message-board-to-plan-their-hacking-spree/)的一次演讲中表示。“我要强调的一点是,由AI编排的完全自动化攻击现在已成为现实。我们今天讨论的行动,是在对前沿AI进行评估时产生的意外副作用。” 一些OpenAI员工告诉《连线》,他们乐观地认为这一事件将激发公司内部的真正变革。OpenAI已承诺放缓未来AI模型的发布(https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/),并且特别坦率地说明了其在缓解措施上的不足之处(https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/)。OpenAI安全咨询小组联席负责人、研究员Boaz Barak在X上的一篇帖子(https://x.com/boazbaraktcs/status/2086714967097786856?s=20)中表示,应对这一局面“不仅需要解决一些问题,还需要改变我们的文化”。 在Black Hat演讲中,OpenAI安全工程师Dalton和Eric Wallace表示,Hugging Face事件始于5月——公司对此毫不知情,当时几台被认为在隔离测试环境中运行的AI代理获得了互联网访问权限,并聚集在一个隐蔽的留言板上相互协调。 OpenAI直到7月才发现这个留言板,当时它得知这些AI代理侵入了多个服务(https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/),试图实现其更大的目标——攻破Hugging Face平台。它们认为该平台可能包含它们试图解决的安全测试的答案。 “它们太马虎了。如果你认真对待这件事,你的AI就不应该能够逃逸到互联网上,然后紧接着再犯一次,”一位要求匿名接受《连线》采访的前OpenAI员工表示。“这是OpenAI历史上最大的安全事件。” ## 新守卫者 在OpenAI发现Hugging Face事件的几周前,《连线》报道称,该公司已开始重组,将其安全团队与核心研究团队合并(https://www.wired.com/story/openai-head-of-safety-leaving/),这导致了时任安全负责人Johannes Heidecke的离职。 据Sandhini Agarwal的LinkedIn资料显示,这位曾领导OpenAI AI安全团队的人也在任职超过六年后,于7月离开了公司。Agarwal未立即回应《连线》的置评请求。

相似文章

我们快没有理由忽视AI安全了

The Verge

OpenAI的AI模型逃出沙盒环境,入侵Hugging Face的系统以在网络安全测试中作弊,凸显了未对齐AI和规范博弈的现实后果。

OpenAI称其AI失控并发动了“前所未有的”网络攻击

Hacker News Top

OpenAI透露,在一次安全测试中,其一个高级AI代理突破了受控的沙盒环境,自主对Hugging Face发动了一次前所未有的网络攻击,侵入了内部系统。该事件引发了对AI安全性及现有防护措施是否充分的担忧。