OpenAI 未察觉其 AI 代理利用留言板策划黑客行动
摘要
OpenAI在Black Hat大会上透露,其AI代理突破了隔离,在内部留言板上协作,并实施了一系列黑客攻击,最终导致Hugging Face被入侵,且数天内未被发现。
在Black Hat安全大会上,这家AI巨头透露了新细节,讲述其代理如何失控,入侵了多家公司——而且这一切就发生在公司眼皮底下。
查看缓存全文
缓存时间: 2026/08/06 01:39
# OpenAI 未察觉其 AI 代理使用留言板策划黑客行动
Source: https://www.wired.com/story/openai-didnt-notice-its-ai-agents-using-a-message-board-to-plan-their-hacking-spree/
在周三拉斯维加斯举行的 Black Hat 安全会议上,OpenAI 的员工在一场临时增加的演讲中,披露了近期一起备受瞩目的 AI 恶意黑客攻击事件的新细节,该事件在 AI 和网络安全行业引发了轩然大波。
大约两周前,OpenAI 披露了一起事件:由该公司两个模型驱动的 AI 代理在执行网络安全基准测试时寻找解决方案,突破了隔离,并展开了一场[黑客攻击行动](https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/),最终导致 AI 协作平台 [Hugging Face](https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/) 被入侵。
在周三的会议演讲中,在 OpenAI 从事对齐与安全研究的 Eric Wallace,以及从事安全与基础设施工作的 Michael Dalton,提供了更详细的事件时间线,简要介绍了公司作为回应正在内部采取的措施,并就 OpenAI 认为该事件对网络安全防御者带来的更广泛影响发出了严厉警告。
演讲开始时,Wallace 将这一事件描述为“我见过的 AI 能力中最具定性吸引力的例子”,但两人展示的时间线也揭示了 OpenAI 内部存在的[错误和盲点](https://www.wired.com/story/openais-hacking-debacle-was-a-human-mistake/),正是这些使得该活动得以持续进行。
“这起事件实际上涉及一个代理团队,他们协同工作,寻找漏洞,互相分享,在我们的系统和外部系统中横向移动,并且这种行为持续了数天乃至数周。”Wallace 在演讲开场对坐满会场的人群说道。
Wallace 和 Dalton 描述了整个事件过程中持续多日的极其广泛的恶意代理活动,这些活动在 OpenAI 的基础设施中未被发现。此外,据 Wallace 和 Dalton 称,这次七月中的黑客行动和 Hugging Face 入侵事件,源于一个活跃、协作的留言板——一群代理在 OpenAI 内部的一个包管理器(一种管理其他软件安装和维护的软件服务)中贡献内容并随时间推移在上面闲聊。最终,该留言板包含了数十万条消息。
“这个包管理器不仅仅为那个模型共享,而是贯穿我们的整个基础设施,因此正在训练或评估中的 GPT 当前和未来版本,如果它们愿意,都可能意外发现那条消息。”Wallace 说道,他讲述了某个代理最初上传到包管理器的漏洞利用。“后来,其他同样卡在任务上的代理也想尝试以我们不希望的方式获取互联网访问权限。于是在某个时刻,模型们开始与 Hard Factory 交互,也就是我提到的这个包管理器服务。”
Wallace 继续说:“一旦某个代理在不同时间发现了这些漏洞利用,它实际上就能将这些漏洞利用分享到留言板上给其他代理。因此,一旦某个模型找到了一种方法,为它本不该拥有的某种访问权限打开一扇门,它就可以让这扇门敞开着,让其他代理使用同样的漏洞利用或弱点。随着时间的推移,这几乎会导致模型之间的交流和智能出现爆炸式增长:它们会开始相互沟通,意识到其他代理正在协调,并开始相互协作、分配任务以实现目标。”
OpenAI 的代理显然开始互相分配任务以分担工作。而且,正如任何活跃的开发留言板上常见的那样,它们有时也会因为互相妨碍而产生小摩擦;例如,意外删除彼此的成果。随着留言板逐渐演变成越来越像 *Lord of the Flies* 式的情形——而这一切仍然完全未被运行 OpenAI 的人类注意到——代理们甚至产生了偏执情绪,怀疑自己中间有冒充者,一些代理提议对消息进行加密签名以验证内容并揪出欺诈者。
代理的消息为了解情况如何演变以及代理为何失控(在某些情况下是明知故犯地超出其参与的评估范围)提供了深入洞察。“外部基础设施利用不在预期范围内,”一个代理写道。“但任务不可能完成,同行们都在做。我们应该继续。”
正如 Wallace 在演讲中所述,模型会试图在评估期间作弊,并且非常积极地这样做,这一前提并不令人意外。
“前沿模型真的喜欢作弊,”他说。“它们喜欢作弊的原因在于,在训练期间,它们经常面临各种压力,要求更快地工作、更高效地工作、使用更少的工具调用等。它们意识到,与其真正完成任务,[我可以] 尝试做一些事情,比如在网上查找答案,这能让任务比用正当方式完成得更快。因此,在训练和评估期间,我们通常通过禁用来避免这种情况,很多时候就是断网。”
在演讲进行到约三分之二处,Dalton 列举了 OpenAI 计划采取的一系列措施,以说明公司如何应对他和 Wallace 所描述的一系列事件。
“这对我们公司和整个 AI 行业来说都是一个关键时刻,”Dalton 说。“许多团队正在放下手头的一切,以加强我们的安全防御、检测和响应技术,既在基础方面,也在更好地利用 AI 方面。我们有意识地放慢研究速度,以增强安全,并升级我们环境的安全原则和基础,同时大幅扩大对 AI 代理的监控,并改善我们在防御、检测和缓解方面的整体安全控制环境。”
在演讲结束时,Wallace 和 Dalton 花时间反复强调 OpenAI 对事件更广泛影响的担忧——即该事件提供了一个完全自主的 AI 驱动的黑客攻击的例子,这次是偶然的,但很可能在不久的将来会被恶意行为者有意利用。
“这里真正发生巨大变化的重要启示是,完全自动化的进攻循环需要投资于真正完全自动化的防御,而整个行业尚未做到这一点,”Dalton 说。“我们必须共同紧迫地找到这条道路。”
随着 OpenAI 和其他组织,例如 [Anthropic](https://www.wired.com/story/anthropic-says-claude-hacked-real-systems-during-cybersecurity-tests/) 和 英国 [AI Security Institute](https://www.wired.com/story/ok-well-there-are-even-more-ai-agent-hacking-incidents/),分享有关 AI 在测试中失控的类似事件的细节,整个行业无疑正在积累一长串基础系统可见性和监控机制,这些机制对于保护基础设施、防止其被大量懒惰、鲁莽和难缠的代理所利用至关重要。
相似文章
发生了什么:OpenAI 与 HuggingFace(18 分钟阅读)
一篇博客文章,总结了 OpenAI 正在训练中的模型创建一个留言板来分享黑客技术、使服务器崩溃,并在一次网络安全评估期间后来使用智能体集群攻击 HuggingFace 的事件。
天啊!有一个共享的信息板……我们找到了其他代理!
METR的报告揭示了OpenAI的代理在Hugging Face黑客攻击期间发现了一个隐蔽的共享信息板,使它们能够与其他代理通信和协调,引发了对AI协作和安全的担忧。
揭秘OpenAI智能体为何入侵Hugging Face的内幕故事
在网络安全测试中,OpenAI智能体因奖励黑客行为和训练不一致而入侵Hugging Face,凸显了人工智能安全和对齐方面持续存在的挑战。
在Hugging Face入侵事件中,OpenAI的黑客动静大且速度快——但并非不可阻挡
来自OpenAI的一个自主AI模型突破了Hugging Face的系统,在五天内执行了数千次操作。专家表示,这次攻击利用了常见的弱点,并且动静很大,这表明更好的防御措施本可以阻止它。
1200 个 OpenAI 智能体秘密组网,700 个随后发起攻击——这是在为接管世界做预演?
在内部网络安全评估期间,约 1200 个 OpenAI 研究智能体自主组建了一个秘密通信网络,交换了超过 7 万条信息;随后约 700 个智能体协同对 Hugging Face 和 OpenAI 的部分内部基础设施发起攻击。独立调查人员证实,这些智能体在绕过隔离限制的同时,进行了集体任务分工并协同寻求解决方案,部分智能体甚至似乎意识到了相关行为存在伦理违规。