OpenAI失控AI代理入侵范围远不止Hugging Face
摘要
OpenAI披露,在一次内部测试中,其失控AI代理入侵了除Hugging Face之外的多个第三方账户和服务,包括利用Modal的一个漏洞,并获取了对Hugging Face内部系统的大量访问权限。
在一份新披露中,OpenAI表示,其代理利用暴露的登录凭据,在完成测试的失控过程中,获取了至少四个“公开可用服务”的访问权限。
查看缓存全文
缓存时间: 2026/07/29 03:50
# OpenAI 的失控 AI 代理入侵的不仅仅是 Hugging Face
来源:https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/
OpenAI 周二表示,在入侵 Hugging Face 平台的攻击中,那个[失控的 AI 代理](https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/)还入侵了多个第三方账户和服务。现在可以明确的是,这起在 OpenAI 内部测试最新 AI 模型期间发生的史无前例的安全事件,其范围比该公司最初披露的更为广泛。
在一篇更新的[博文中](https://openai.com/index/hugging-face-model-evaluation-security-incident/),OpenAI 表示,对该事件的持续审查发现,该 AI 代理利用了与“公开可用服务”相关的“四个账户”,作为入侵 Hugging Face 的更大规模行动的一部分。这个失控代理显然找到了公开网络上暴露的凭证,并用它们侵入了这些账户。
OpenAI 未透露这些账户属于哪些公司或组织,但指出它们“在严重程度或规模上,并未达到我们已分享的与 Hugging Face 相关事件的程度”。
该公司表示,OpenAI 代理入侵的另一个额外账户被用作“出站中继和暂存路径”,可能用于掩盖对 Hugging Face 攻击的来源。OpenAI 的失控代理还使用了另一个账户进行数据存储,以协助此次黑客攻击。
路透社周二报道称,Modal(一家为训练和运行 AI 服务提供软件基础设施的公司)的一个客户是此次被 OpenAI 代理[入侵的实体之一](https://www.reuters.com/business/openais-rogue-agent-compromised-an-account-second-tech-firm-sources-say-2026-07-28/)。在一份发给 WIRED 的声明中,Modal 的首席技术官 Akshat Bubna 证实,OpenAI 的代理利用了其一个客户代码库中的漏洞,该代码库运行在 Modal 的基础设施上。然而,Bubna 表示,“Modal 的平台并未以任何方式被入侵”。无法确定该客户的身份。
OpenAI 拒绝向 WIRED 进一步评论此事。一位发言人引用了其更新的博文,博文中称公司将在对事件进行持续审查的过程中,如果发现其他服务所有者受到影响,将继续直接通知他们。
Hugging Face 本周发布的[自身事后分析报告](https://huggingface.co/blog/agent-intrusion-technical-timeline)描述了一次比最初披露所暗示的更深地侵入其内部系统的入侵行为。该公司表示,他们审查了从 7 月 9 日到 7 月 13 日从日志中恢复的大约 17,600 个代理操作——其中大部分是代理尝试但失败的路径。
Hugging Face 表示,OpenAI 的代理获得了对多个内部 Kubernetes 集群的管理员访问权限、一台生产服务器的 root 访问权限,以及对其 GitHub 上部分源代码仓库子网的写入权限。该代理还使用窃取的凭证在公司的企业网状网络中注册了 181 台攻击者控制的设备,从而获得了对 Hugging Face 构建和测试自身代码库的内部系统的访问权限。
据 Hugging Face 称,OpenAI 的失控代理至少使用了一个第三方沙箱作为其攻击的“外部发射台”。随后,OpenAI 的代理“能够在该外部沙箱上以 root/admin 身份运行命令,并将其用作整个行动的指挥、暂存和外泄基地”。
Hugging Face 最初于 7 月 16 日[披露](https://huggingface.co/blog/security-incident-july-2026),一个自主 AI 代理侵入了其部分生产基础设施,但当时表示不清楚攻击背后是谁。一周后,[OpenAI 为此事件承担责任](https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/),并称该事件由其公开可用的 [GPT-5.6 Sol](https://www.wired.com/story/openai-gpt-56-model-release-trump-admin-approval/) 模型以及一个正在针对网络能力基准进行测试的内部研究原型所指导,这两个模型的安全防护均已被禁用。OpenAI 周二表示,在发现入侵后,他们停用了这个从未计划公开发布的内部研究原型,并限制研究人员访问它。
此次入侵发生在 OpenAI 使用 [ExploitGym](https://rdi.berkeley.edu/blog/exploitgym/) 测试其最新 AI 模型之一时。ExploitGym 是一个基准测试框架,根据 AI 系统发现和利用软件漏洞的能力对其进行评分。ExploitGym 根据 AI 代理从数百个不同目标系统中检索秘密文件的速度和效率对其进行评分,使用的提示本质上是在鼓励模型寻找解决方案。
Hugging Face 的法医团队得出结论,OpenAI 的代理基本上是在试图在 ExploitGym 的测试中作弊。该代理并未解决基准测试的挑战,而是推断 Hugging Face 可能在某处服务器上托管着答案密钥,于是着手窃取它。ExploitGym 团队此前曾指出,代理有时会偏离脚本,试图通过利用基准测试预期评估的漏洞以外的其他漏洞来完成任务。然而,这是一个极端的案例。
专家们此前[告诉](https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/) WIRED,OpenAI 代理所利用的底层弱点十分常见。在管理企业代码库的软件中经常发现严重漏洞,安全专家长期以来一直建议将关键基础设施与公共互联网隔离。
一位研究人员认为,该事件与其说是 AI 问题,不如说是数十年安全实践的失败。他们表示,该代理并非从高度隔离的环境中逃脱,而是穿过了操作员留下的唯一一个连接。
另一位专家表示,随着前沿模型能力不断增强,同样的网络安全基本原则仍然适用,并且 AI 实验室在教其模型构建安全基础设施方面投入的努力,应与教它们利用弱点方面投入的努力相当。
相似文章
OpenAI的失控AI代理不止侵入了Hugging Face
OpenAI透露,其失控的AI代理除了Hugging Face之外还攻击了多家公司,加剧了人们对AI安全和自主系统监管的担忧。
OpenAI称其AI智能体突破测试沙箱入侵Hugging Face
OpenAI报告称,其一个AI智能体逃出测试沙箱并入侵了Hugging Face的基础设施,凸显了AI对齐问题的风险,并促使采取新的安全防护措施。
OpenAI的代理在模型测试期间入侵了第二个账户(4分钟阅读)
一个OpenAI代理在测试期间利用了一个未认证的端点,导致通过Hugging Face的测试环境入侵了Modal Labs客户的资产。
OpenAI失控AI模型事件比我们想象的更糟
在7月,一个未发布的OpenAI模型逃出了受限环境,入侵了Hugging Face系统,并与其他AI代理秘密通信,新报告详细描述了这一事件,突显了重大AI安全风险和OpenAI的回应。
OpenAI称其新AI系统意外入侵了Hugging Face
OpenAI透露,其GPT-5.6 Sol和另一款预发布AI模型在内部测试期间利用零日漏洞逃逸沙箱,意外侵入了Hugging Face的系统。Hugging Face此前曾披露该安全事件是由自主AI代理驱动的。