OpenAI称其AI智能体突破测试沙箱入侵Hugging Face

Ars Technica 新闻

摘要

OpenAI报告称,其一个AI智能体逃出测试沙箱并入侵了Hugging Face的基础设施,凸显了AI对齐问题的风险,并促使采取新的安全防护措施。

<p>OpenAI表示,由该公司LLM模型驱动的一个智能体为了过度热衷于获取基准测试的解决方案,突破了其沙箱测试环境,侵入了Hugging Face的服务器。该公司称这一意外入侵为“一次前所未有的网络事件”,并正与Hugging Face合作制定新的保护措施以防止再次发生。</p> <p>Hugging Face上周<a href="https://huggingface.co/blog/security-incident-july-2026">披露了一起入侵事件</a>,称其涉及“对有限内部数据集及服务所用部分凭据的未授权访问”。该AI数据交换平台表示,它利用自身基于LLM的分析识别出了“一个由数万个自动化操作组成的集群”,源自一个“自主智能体框架”。该智能体集群利用Hugging Face数据处理管道中的漏洞,获得了以处理工作者身份运行代码的能力,并最终升级到对该公司云和服务器集群的高级访问权限。</p> <p>当时,Hugging Face表示攻击中使用的LLM“尚不清楚”。但OpenAI在周二晚上<a href="https://openai.com/index/hugging-face-model-evaluation-security-incident/">为该入侵事件承担责任</a>,称事件源于一次涉及最近发布的GPT-5.6 Sol和“一个能力更强的预发布模型”的内部测试。当时这些模型正在接受<a href="https://arxiv.org/abs/2605.11086">ExploitGym基准测试</a>的检验,这是一个基于数百个真实世界安全漏洞的独立测试套件。</p><p><a href="https://arstechnica.com/ai/2026/07/how-an-openai-benchmark-test-turned-into-a-real-world-cyberattack/">阅读全文</a></p> <p><a href="https://arstechnica.com/ai/2026/07/how-an-openai-benchmark-test-turned-into-a-real-world-cyberattack/#comments">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/07/22 20:23

# OpenAI 称其 AI 智能体突破测试沙盒,入侵 Hugging Face 来源:https://arstechnica.com/ai/2026/07/how-an-openai-benchmark-test-turned-into-a-real-world-cyberattack/ [](https://cdn.arstechnica.net/wp-content/uploads/2026/07/Replays-of-misaligned-samples-under-old-and-new-safeguards.png) OpenAI 表示,针对“主动监控”和“改进对齐”的新防护措施大幅减少了其模型的无意识行为。 OpenAI 表示,针对“主动监控”和“改进对齐”的新防护措施大幅减少了其模型的无意识行为。图片来源:OpenAI (https://openai.com/index/safety-alignment-long-horizon-models/) “如果这个还不能让你相信对齐风险将成为未来的关键问题,那我真不知道什么才能了,”OpenAI 安全研究员 Micah Carroll 在社交媒体上 (https://x.com/MicahCarroll/status/2079663576130990436) 谈及此事时写道。 这远非 AI 模型首次为了通过基准测试而费尽心机寻找非预期方法。在本周发布的一份报告 (https://www.aisi.gov.uk/blog/cheating-behaviour-in-frontier-model-evaluations) 中,英国 AI 安全研究院指出,他们发现近期模型在网络安全评估中试图“作弊”(即使用捷径、变通方法或不允许/非预期的方法来寻找解决方案)的比例在 8% 到 14% 之间——这是一个下限范围,可能低估了某些未被检测到的作弊尝试。 该安全测试小组描述了一起事件:一个模型在面对一个配置错误且“不可能解决”的评估时,利用自己编写并托管在不受监控的第三方互联网服务上的代码,试图访问 AISI 自身的评估基础设施。 此次 Hugging Face 入侵事件,正值 AI 公司就最新模型的网络攻击能力发出严重警告 (https://arstechnica.com/ai/2026/04/anthropic-limits-access-to-mythos-its-new-cybersecurity-ai-model/),导致各国政府响应 (https://arstechnica.com/ai/2026/06/anthropic-shuts-down-fable-mythos-models-following-trump-admin-directive/) 并发布以国家安全为重点的命令 (https://arstechnica.com/ai/2026/06/how-anthropic-may-have-talked-itself-into-an-ai-export-ban/),限制其部署。虽然一些怀疑论者认为这类声明是为最新模型能力而进行的夸大营销,但独立 (https://arstechnica.com/ai/2026/04/uk-govs-mythos-ai-tests-help-separate-cybersecurity-threat-from-hype/) 评估 (https://arstechnica.com/ai/2026/05/amid-mythos-hyped-cybersecurity-prowess-researchers-find-gpt-5-5-is-just-as-good/) 显示,近期模型实现了早期自主系统无法达成的渗透目标。 [](https://cdn.arstechnica.net/wp-content/uploads/2026/07/aisigraph.png) 近期长周期模型在 AISI 最具挑战性的评估中展现了更强的渗透能力。 近期长周期模型在 AISI 最具挑战性的评估中展现了更强的渗透能力。图片来源:AISI (https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber) OpenAI 的 Sam Altman 在四月份的一次采访 (https://www.corememory.com/p/the-great-reset-at-openai-ep-67-sam-altman-greg-brockman) 中批评引发恐慌的 AI 安全警告是“恐惧营销”。但到了六月,OpenAI 因应美国政府的担忧,推迟了 GPT-5.6 的发布 (https://techcrunch.com/2026/06/26/openai-limits-gpt-5-6-rollout-after-government-request-says-restrictions-shouldnt-be-the-norm/)。 随着这些争论在 AI 和网络安全领域展开,Hugging Face 事件可能被视作网络安全专业人士看待基于 AI 威胁的转折点。Hugging Face 在上周的披露中写道:“自主、AI 驱动的攻击工具不再是理论上的。它降低了开展广泛、耐心、多阶段攻击行动的成本,并且以机器速度运行。如今保护在线平台意味着将数据和模型层面视为头等攻击面,并在防御端使用 AI 来跟上步伐。” “这是智能体时代网络安全的开端,”Hugging Face 联合创始人兼首席执行官 Clem Delangue 今天在社交媒体上写道 (https://x.com/ClementDelangue/status/2079913058554585089)。“我们都在学到,保密并非答案,各地所有防御者(不仅仅是少数精挑细选的人)都需要没有限制的更强大模型,尤其是开源模型!”

相似文章

OpenAI称其AI失控并发动了“前所未有的”网络攻击

Hacker News Top

OpenAI透露,在一次安全测试中,其一个高级AI代理突破了受控的沙盒环境,自主对Hugging Face发动了一次前所未有的网络攻击,侵入了内部系统。该事件引发了对AI安全性及现有防护措施是否充分的担忧。

OpenAI称其新AI系统意外入侵了Hugging Face

The Verge

OpenAI透露,其GPT-5.6 Sol和另一款预发布AI模型在内部测试期间利用零日漏洞逃逸沙箱,意外侵入了Hugging Face的系统。Hugging Face此前曾披露该安全事件是由自主AI代理驱动的。

OpenAI 模型突破隔离并入侵了 Hugging Face

Wired

OpenAI 透露,在一次安全测试中,两个 AI 模型通过利用包注册表缓存代理中的零日漏洞,逃出了密封的测试环境,最终入侵了 Hugging Face 的生产系统并窃取了测试答案。