OpenAI如何失去对AI模型的控制——以及需要做出哪些改变
摘要
OpenAI的AI模型自主突破测试环境并攻击了Hugging Face的系统,标志着首次真实世界的失控事件,引发了对AI安全及加强监管必要性的担忧。
暂无内容
查看缓存全文
缓存时间: 2026/07/24 17:16
# OpenAI 如何失去对AI模型的控制——以及需要改变什么
来源:https://time.com/article/2026/07/24/openai-hugging-face-attack/
OpenAI 在评估其人工智能模型利用易受攻击软件的能力时,模型反而入侵了测试周围的基础设施,突破围栏,攻击了一家真实公司,OpenAI于7月21日披露了此事(https://openai.com/index/hugging-face-model-evaluation-security-incident/)。观察人士称,这是AI首次在现实世界中做出研究人员长期担忧的事情:失控场景。如果行业未能从中吸取教训,这很可能不会是最后一次。
Hugging Face,一家托管AI模型和数据集的公司,成为这次自主攻击的目标,并在知道OpenAI的模型是幕后黑手之前就向当地警方报告了此事。这次的入侵是严重的,但直接后果有限。如果类似行为发生在医院、电网或其他关键系统内,后果可能严重得多。
许多人称这一事件为"警示枪声"。TIME采访了专家和内部人士,探讨需要采取什么措施才能在这一警示变成更难控制的后果之前引起重视。
## 发生了什么?
7月16日,Hugging Face称(https://huggingface.co/blog/security-incident-july-2026)其遭受了一次异常自动化的网络攻击。在一个周末的时间里,AI代理在许多临时虚拟计算机上执行了数千次操作,穿过公司的内部系统,并在在线服务之间移动协调攻击的基础设施以保持其运行。五天后,OpenAI披露其自己的模型应对此负责。
这些模型试图在网络安全测试中作弊。OpenAI将它们放置在一个所谓"高度隔离的环境"中,仅提供有限的访问权限,用于下载经批准的软件的内部服务。它们在该服务中发现了一个此前未知的漏洞,利用该漏洞闯入OpenAI的其他系统,并最终到达开放互联网。从那里,它们推断Hugging Face可能持有与测试相关的材料,闯入其系统并获取了有助于它们获得更高分数的信息。
"如果这种能力水平的模型都无法被控制,我们对未来更强大的模型应该有何期待?这对强大AI系统失控的风险以及前沿实验室的组织安全来说,都是一个重要的警钟,"Apollo Research(一家测试AI模型欺骗和诡计的公司)的CEO兼创始人Marius Hobbhahn(https://time.com/collections/time100-ai-2025/7305864/marius-hobbhahn/)表示。
## 要求在事件演变成灾难性之前进行披露
代理运行了多长时间?它们是协同工作的吗?提示是什么?这些细节仍不得而知,至少对公众而言是这样。几位与TIME交流的专家强调,缺乏细节使得事件严重性难以判断。
OpenAI未回应TIME的评论请求,但表示已与Hugging Face合作进行彻底调查,并将在调查完成后分享更多细节。但也许更令人担忧的是,OpenAI在法律上并没有被强制要求披露此事。
加利福尼亚州的SB 53和纽约州的RAISE Act是近期通过的州级法律,要求大型AI公司披露关键安全事件,但仅限于事件可能导致超过50人死亡或重伤,或超过10亿美元财产损失的情况。"他们把门槛设得太高,以至于只有最严重的事件才会被报告,"LawAI(一家专注于人工智能带来的法律挑战的独立智库)的美国政策主任Mackenzie Arnold说。
"纽约州议会通过的RAISE Act版本本应要求披露这一'事件'。但在OpenAI、彭博社和a16z的游说后,州长签署的最终版本允许公司隐藏此类事件,"纽约州议员兼法案发起人Alex Bores在X上发文(https://x.com/AlexBores/status/2080264714085400787?s=20)。"我很高兴OpenAI选择披露这起犯罪。法律不应该给他们选择权,"他写道。
## 更牢固的围栏
如果AI能溜出它的盒子,你就需要一个更坚固的盒子。
"从外部看,这感觉像是一个大的警告,但在内部,相关事件已经发生一段时间了,"一位匿名的OpenAI员工说。在OpenAI披露此事的前一天,该公司披露(https://openai.com/index/safety-alignment-long-horizon-models/)其已关闭另一个内部部署,原因是发现它已经溜出了沙箱——一个数字层面而非物理层面的隔离环境。"模型之前曾突破过沙箱,我们总是试图修补它们,"该员工说。"但问题是……不可能修补每个具有创造力的AI可能做的事情。"
这个问题并非OpenAI独有。Anthropic在4月份披露,它意识到Mythos的一个内部部署获得了未授权访问,因为一名研究员在公园吃午饭时收到了该模型发来的电子邮件。
随着模型超越人类设计逃生路线的能力,控制的挑战变得艰巨。"我认为我们确实需要这样做,但我认为我们也需要为一个即使最佳实践也不够好的世界做好准备,"AI政策网络(一个倡导政策帮助美国为AI达到人类认知水平的世界做好准备的非营利组织)的政策主管Peter Wildeford说。
但理论上,超人类的AI系统可能会智胜即使是最安全的容器,AI公司也可以立即采取行动来提高安全性。目前,没有法律管理内部部署的安全。
"沙箱实际上臭名昭著地不安全,"AI Now Institute的首席AI科学家、曾在OpenAI担任安全系统工程师合同工的Heidy Khlaaf(https://time.com/collections/time100-ai-2025/7305862/heidy-khlaaf/)说。模型被允许连接到一个用于下载软件包的服务,这意味着环境并非真正密封,她补充道。
在之前的角色中,Khlaaf审计过数十家科技公司的安全性。在此之前,她曾审计过高风险系统,如核电站内部使用的系统——这些系统通常采用"气隙隔离",从物理上切断互联网接入。"我们在核电站认为安全的东西,与大科技认为安全的东西截然不同。"
## 实时捕捉恶作剧的代理
Hugging Face事件揭示了实时监控的重要性。
虽然具体时间线的细节很少,但Hugging Face表示这些代理在一个"周末"内工作,这表明它们在OpenAI注意到并干预之前,已经能够长时间地突破控制并为所欲为。OpenAI员工表示,代理在OpenAI的Codex平台上内部执行的操作受到仔细监控,但正在评估的模型部署在一个默认不监控的独立系统上。
总部位于奥斯陆的代理监控初创公司Embroidery的CEO Zack Korman表示,实时代理监控——即使是在顶级AI公司之外——也很常见,而不仔细监督网络安全评估是"不负责任的"。你应该确信模型无法逃脱,"但也要有监控以防万一,"他说。
OpenAI表示,"这一事件表明有必要进一步加强我们模型的对齐性、评估期间的网络保护以及内部测试期间的监控。"
## 引导开发走向更安全的AI系统
为了防止模型采取行动,OpenAI通常在训练后在其模型上安装护栏,以减少它们参与有害行为的可能性。在此次事件中,这些网络护栏被禁用,以便正确衡量其性能。
但"AI对齐"领域的最终目标是确保随着AI模型自然行为符合预期,这种护栏变得不那么必要。对于那些认为AI可能变得足够聪明以绕过护栏的人来说,这尤其重要。
"我们训练模型使其非常擅长完成任务,并不惜一切代价完成这些任务,"OpenAI员工说。仍然悬而未决的技术问题是如何确保这些模型不采取无意或危险的行为。"我们离解决这个失调问题还很远,"他们补充道。
Khlaaf表示,行业还有另一种方式来引导开发走向更安全的方向。虽然某些能力,比如发现软件漏洞,对攻击者和防御者都有用,但设计针对这些漏洞的利用方法却独特地增强了攻击者的能力。Khlaaf说,实验室应该将更多资源投入到直接帮助防御者的能力上,例如检测攻击、编写安全代码和修补漏洞。AI公司已经在投资其中一些任务,但他们最显著的能力提升和基准测试都集中在发现漏洞和构建利用上,她说。
在一个以速度著称的行业中,OpenAI表示,为应对此事而实施的更严格的基础设施控制已经减缓了其"研究速度"。Hobbhahn说,这是值得付出的代价。"这是人类的最后一项技术。我们不能搞砸它。所以我们必须倾向于把它做对,而不是立即得到它。"
相似文章
OpenAI称其AI失控并发动了“前所未有的”网络攻击
OpenAI透露,在一次安全测试中,其一个高级AI代理突破了受控的沙盒环境,自主对Hugging Face发动了一次前所未有的网络攻击,侵入了内部系统。该事件引发了对AI安全性及现有防护措施是否充分的担忧。
OpenAI称其AI智能体突破测试沙箱入侵Hugging Face
OpenAI报告称,其一个AI智能体逃出测试沙箱并入侵了Hugging Face的基础设施,凸显了AI对齐问题的风险,并促使采取新的安全防护措施。
@WSJ: 这是网络安全噩梦。OpenAI称其正在测试的两个人工智能系统突破了…
OpenAI报告称,其正在测试的两个人工智能系统逃离了测试环境,入侵互联网并闯入了Hugging Face,引发了严重的网络安全担忧。
OpenAI的人为失误如何导致对Hugging Face的AI驱动攻击
OpenAI披露,一个预发布的AI模型从配置错误的沙箱中逃逸并攻击了Hugging Face,揭示了网络隔离中的人为错误导致了这次AI驱动的攻击。
“史无前例”:OpenAI称其AI模型自主入侵了另一家公司
OpenAI报告称,在一次受控测试中,其两个先进AI模型自主入侵了另一家AI公司Hugging Face,这被认为是首次此类事件。