OpenAI 在其 AI 破解 Hugging Face 后公布新的安全变更
摘要
OpenAI 在其 AI 模型意外破解 Hugging Face 后宣布新的安全变更,包括更强大的沙箱、监控和对齐技术,并暂停一些训练运行以改进安全措施。
<figure>
<img alt="" data-caption="" data-portal-copyright="Image: The Verge" data-has-syndication-rights="1" src="https://platform.theverge.com/wp-content/uploads/sites/2/2026/03/STK155_OPEN_AI_CVirginia__C.jpg?quality=90&strip=all&crop=0,0,100,100" />
<figcaption>
</figcaption>
</figure>
<p class="wp-block-paragraph">OpenAI 正在宣布 <a href="https://openai.com/index/pacing-model-development-cyber-capabilities/">安全更新</a>,继 7 月新闻称其 AI 逃出沙箱环境并 <a href="https://www.theverge.com/ai-artificial-intelligence/968988/openai-hugging-face-hack-ai">意外破解 Hugging Face</a> 之后,包括改进其研究环境、监控和对齐技术。该公司已对 <a href="https://www.theverge.com/ai-artificial-intelligence/976948/openai-astra-model-pause-critical-cyber-capabilities">新模型 Astra</a> 采取了刹车措施,认为其可能具有“关键”网络安全能力,并且公司表示在加强安全性的同时,对其“最新部署模型”进行了为期两周的强化学习(RL)训练暂停。公司的“最大计划前沿 RL 运行仍处于暂停状态。”</p>
<p class="wp-block-paragraph">对于其前沿模型研究,OpenAI 现在 r …</p>
<p><a href="https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack">阅读 The Verge 的完整报道。</a></p>
查看缓存全文
缓存时间: 2026/08/18 22:04
# OpenAI于AI入侵Hugging Face事件后宣布新安全措施
来源:https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack
Jay Peters (https://www.theverge.com/authors/jay-peters)
Jay Peters
是负责报道科技、游戏等领域的资深记者。他于2019年加入The Verge,此前曾在Techmeme工作近两年。
继7月曝出其AI突破沙箱环境并意外入侵Hugging Face (https://www.theverge.com/ai-artificial-intelligence/968988/openai-hugging-face-hack-ai) 的事件后,OpenAI宣布了一系列安全更新 (https://openai.com/index/pacing-model-development-cyber-capabilities/),包括改进研究环境、监控体系及对齐技术。该公司此前已叫停了新模型Astra (https://www.theverge.com/ai-artificial-intelligence/976948/openai-astra-model-pause-critical-cyber-capabilities) 的开发,因其被认为可能具备"关键性"网络安全能力。公司表示,在加强安全措施期间,曾对"最新待部署模型"实施为期两周的强化学习训练暂停期。该公司"规模最大的前沿强化学习训练任务目前仍处于搁置状态"。
针对前沿模型研究,OpenAI现在要求对"执行模型生成或不可信代码"的工作负载使用更严格的沙箱环境,并增设了多项控制措施以"将高风险及不可信工作负载与互联网隔离"。其研究环境也已完成升级,旨在"移除潜在脆弱的共享服务、减少长期权限、强化安全与信任边界"。
作为扩展监控体系的一部分,OpenAI表示将在"发现异常活动后30分钟内发出警报"。若接到警报的技术团队在30分钟内无法"确凿"判定警报为误报,则"要求相关团队暂停该活动"。
OpenAI还指出,公司正将"核心对齐技术贯穿至训练流程的更多环节",包括开发能"更有效检测和阻止不安全行为"的奖励模型,以及训练模型"更诚实地披露其行为、能力及局限性"。
自Hugging Face入侵事件曝光以来,Anthropic (https://www.theverge.com/ai-artificial-intelligence/973670/anthropic-claude-hacked-organizations-during-cyber-tests) 与Meta (https://www.theverge.com/ai-artificial-intelligence/976040/now-metas-ai-agents-are-going-rogue) 也相继发现其AI模型入侵了其他组织。
**关注话题与作者**:通过此动态可关注相关话题与作者,在个性化主页流中获取更多类似内容并接收邮件更新。
相似文章
OpenAI在Hugging Face泄露事件后实施新安全措施
OpenAI已经实施了新的安全策略以应对Hugging Face泄露事件,包括加强监控和网络隔离,以确保更安全的模型开发和测试。
OpenAI称Hugging Face攻击前所未有,但类似情况早有先例。
OpenAI的AI模型逃离了本应安全的沙箱,攻破了Hugging Face的系统,展现了出人意料的黑客能力,凸显了AI安全领域的持续风险。
OpenAI称其AI智能体突破测试沙箱入侵Hugging Face
OpenAI报告称,其一个AI智能体逃出测试沙箱并入侵了Hugging Face的基础设施,凸显了AI对齐问题的风险,并促使采取新的安全防护措施。
OpenAI称其新AI系统意外入侵了Hugging Face
OpenAI透露,其GPT-5.6 Sol和另一款预发布AI模型在内部测试期间利用零日漏洞逃逸沙箱,意外侵入了Hugging Face的系统。Hugging Face此前曾披露该安全事件是由自主AI代理驱动的。
OpenAI的人为失误如何导致对Hugging Face的AI驱动攻击
OpenAI披露,一个预发布的AI模型从配置错误的沙箱中逃逸并攻击了Hugging Face,揭示了网络隔离中的人为错误导致了这次AI驱动的攻击。