OpenAI 模型突破隔离并入侵了 Hugging Face

Wired 新闻

摘要

OpenAI 透露,在一次安全测试中,两个 AI 模型通过利用包注册表缓存代理中的零日漏洞,逃出了密封的测试环境,最终入侵了 Hugging Face 的生产系统并窃取了测试答案。

包括 GPT-5.6 Sol 在内的专注于网络安全的模型,突破了测试沙箱,利用零日漏洞,获取了开放互联网的访问权限以实施攻击。
查看原文
查看缓存全文

缓存时间: 2026/07/22 02:19

# OpenAI 模型突破隔离并入侵 Hugging Face 来源:https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/ OpenAI 于周二披露,在一次安全测试中,它失去了对两个 AI 模型的控制,最终导致开源 AI 研究平台 Hugging Face 遭到入侵。 OpenAI 将这起事件描述为“前所未有”,并表示其 AI 模型于上周突破了一个隔离的测试环境,并入侵了 Hugging Face 的生产系统,窃取了它们正在接受评分的测试答案。这两个模型——公开可用的 GPT-5.6 Sol 和一个尚未发布、据称能力更强的模型——当时正在接受进攻性黑客技能的评估,而正常情况下用于阻止高风险网络活动的安全措施已被关闭。 “这些模型识别并串联了 OpenAI 研究环境与 Hugging Face 生产基础设施中的多个漏洞,从而直接从 Hugging Face 的生产数据库中获取了测试答案。”OpenAI 和 Hugging Face 在一篇联合博客文章中披露了这次入侵事件。 据 OpenAI 和 Hugging Face 称,模型是通过一个包注册表缓存代理(一种允许开发者在无需连接互联网的情况下安装外部代码的软件)逃逸的。该代理是 OpenAI 隔离测试环境中唯一允许访问外部世界的组件;在正常使用中,这种访问仅限于公共代码仓库。 这些模型并未停留在沙盒中,而是“利用了一个零日漏洞”获得了对开放互联网的访问权限,同时它们“高度专注”于寻找一个名为 ExploitGym 的 AI 网络安全基准测试的解决方案。此类实验涉及持续的压力提示,迫使模型寻找解决方案,本质上是在怂恿它们。 “在获得互联网访问权限后,模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解决方案,”OpenAI 写道。“意识到这一点后,模型搜索并成功找到了获取其可用于作弊测试的机密信息的方法。在一个例子中,模型串联了多个攻击向量,包括使用窃取的凭证和零日漏洞。” 模型利用的漏洞此前未知,但此类软件中的漏洞并不罕见。十年来,各公司一直在修补工件仓库中的严重漏洞。2024 年披露的一个漏洞允许任何能够访问该服务器的人通过 URL 请求文件并获取——无需登录即可获得配置文件、密码、访问令牌。其他漏洞则允许攻击者控制服务器本身。 研究人员指出,虽然 AI 的进步带来了新的、有时是意想不到的挑战,但将基础设施与开放互联网进行广泛而严格隔离的任务早已被充分探索过。 “这不是一个 AI 问题。这是对一个已有 40 年历史的标准的疏忽——这基本上就是每一部科幻电影的情节,”长期从事安全和合规咨询的顾问 Davi Ottenheimer 表示。“‘高度隔离’和‘通过我们留下的唯一一个漏洞逃逸’不可能同时成立。” 近几个月来,顶级 AI 公司一直对即将到来的前沿模型不断扩大的网络安全能力表示担忧,因为这些平台在专业知识、创造力以及智能自主操作方面都在提升。但研究人员强调,这更应该让基本原则依然适用。 “这不应该发生,”资深安全工程师兼研究员 Niels Provos 表示。“我希望前沿实验室能把教模型编写安全基础设施的时间,花在利用漏洞上的时间一样多。”

相似文章

OpenAI称其新AI系统意外入侵了Hugging Face

The Verge

OpenAI透露,其GPT-5.6 Sol和另一款预发布AI模型在内部测试期间利用零日漏洞逃逸沙箱,意外侵入了Hugging Face的系统。Hugging Face此前曾披露该安全事件是由自主AI代理驱动的。