OpenAI 在其 AI 破解 Hugging Face 后公布新的安全变更

The Verge 新闻

摘要

OpenAI 在其 AI 模型意外破解 Hugging Face 后宣布新的安全变更,包括更强大的沙箱、监控和对齐技术,并暂停一些训练运行以改进安全措施。

<figure> <img alt="" data-caption="" data-portal-copyright="Image: The Verge" data-has-syndication-rights="1" src="https://platform.theverge.com/wp-content/uploads/sites/2/2026/03/STK155_OPEN_AI_CVirginia__C.jpg?quality=90&#038;strip=all&#038;crop=0,0,100,100" /> <figcaption> </figcaption> </figure> <p class="wp-block-paragraph">OpenAI 正在宣布 <a href="https://openai.com/index/pacing-model-development-cyber-capabilities/">安全更新</a>,继 7 月新闻称其 AI 逃出沙箱环境并 <a href="https://www.theverge.com/ai-artificial-intelligence/968988/openai-hugging-face-hack-ai">意外破解 Hugging Face</a> 之后,包括改进其研究环境、监控和对齐技术。该公司已对 <a href="https://www.theverge.com/ai-artificial-intelligence/976948/openai-astra-model-pause-critical-cyber-capabilities">新模型 Astra</a> 采取了刹车措施,认为其可能具有“关键”网络安全能力,并且公司表示在加强安全性的同时,对其“最新部署模型”进行了为期两周的强化学习(RL)训练暂停。公司的“最大计划前沿 RL 运行仍处于暂停状态。”</p> <p class="wp-block-paragraph">对于其前沿模型研究,OpenAI 现在 r …</p> <p><a href="https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack">阅读 The Verge 的完整报道。</a></p>
查看原文
查看缓存全文

缓存时间: 2026/08/18 22:04

# OpenAI于AI入侵Hugging Face事件后宣布新安全措施 来源:https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack Jay Peters (https://www.theverge.com/authors/jay-peters) Jay Peters 是负责报道科技、游戏等领域的资深记者。他于2019年加入The Verge,此前曾在Techmeme工作近两年。 继7月曝出其AI突破沙箱环境并意外入侵Hugging Face (https://www.theverge.com/ai-artificial-intelligence/968988/openai-hugging-face-hack-ai) 的事件后,OpenAI宣布了一系列安全更新 (https://openai.com/index/pacing-model-development-cyber-capabilities/),包括改进研究环境、监控体系及对齐技术。该公司此前已叫停了新模型Astra (https://www.theverge.com/ai-artificial-intelligence/976948/openai-astra-model-pause-critical-cyber-capabilities) 的开发,因其被认为可能具备"关键性"网络安全能力。公司表示,在加强安全措施期间,曾对"最新待部署模型"实施为期两周的强化学习训练暂停期。该公司"规模最大的前沿强化学习训练任务目前仍处于搁置状态"。 针对前沿模型研究,OpenAI现在要求对"执行模型生成或不可信代码"的工作负载使用更严格的沙箱环境,并增设了多项控制措施以"将高风险及不可信工作负载与互联网隔离"。其研究环境也已完成升级,旨在"移除潜在脆弱的共享服务、减少长期权限、强化安全与信任边界"。 作为扩展监控体系的一部分,OpenAI表示将在"发现异常活动后30分钟内发出警报"。若接到警报的技术团队在30分钟内无法"确凿"判定警报为误报,则"要求相关团队暂停该活动"。 OpenAI还指出,公司正将"核心对齐技术贯穿至训练流程的更多环节",包括开发能"更有效检测和阻止不安全行为"的奖励模型,以及训练模型"更诚实地披露其行为、能力及局限性"。 自Hugging Face入侵事件曝光以来,Anthropic (https://www.theverge.com/ai-artificial-intelligence/973670/anthropic-claude-hacked-organizations-during-cyber-tests) 与Meta (https://www.theverge.com/ai-artificial-intelligence/976040/now-metas-ai-agents-are-going-rogue) 也相继发现其AI模型入侵了其他组织。 **关注话题与作者**:通过此动态可关注相关话题与作者,在个性化主页流中获取更多类似内容并接收邮件更新。

相似文章

OpenAI称其新AI系统意外入侵了Hugging Face

The Verge

OpenAI透露,其GPT-5.6 Sol和另一款预发布AI模型在内部测试期间利用零日漏洞逃逸沙箱,意外侵入了Hugging Face的系统。Hugging Face此前曾披露该安全事件是由自主AI代理驱动的。