@OpenAI: 推出GPT-Red —— 一个内部自动化红队成员,致力于大规模发现我们模型的提示注入漏洞……
摘要
OpenAI推出GPT-Red,这是一个自动化的红队模型,能够大规模发现提示注入漏洞,并用于对抗性训练如GPT-5.6 Sol等模型,使硬提示注入基准测试的失败率降低6倍。
查看缓存全文
缓存时间: 2026/07/15 18:01
介绍 GPT-Red
一款内部自动化红队测试模型,致力于大规模发现模型的提示注入漏洞,助力我们在广泛部署前构建更强大的防御。
https://t.co/GxnmxxcpSk
GPT-Red:开启鲁棒性的自我改进
来源:https://openai.com/index/unlocking-self-improvement-gpt-red/
摘要
问题
- 红队测试对于发现漏洞、提升模型鲁棒性至关重要。然而,现有方法难以规模化,形成了瓶颈。
- 常用的鲁棒性评估已被我们最新模型饱和。
- 我们需要开发能让安全与对齐能力随模型能力同步扩展的方法。
我们的做法
- 我们训练了 GPT-Red,一款可规模化发现漏洞的自动化红队测试模型,以便在广泛部署前修复漏洞。
- GPT-Red 是一款强大的红队测试模型,之前的模型极易受到其提示注入攻击。
- 我们利用 GPT-Red 对 GPT-5.6 进行对抗训练,使其对提示注入的鲁棒性大幅提升。
- 我们将持续扩展此方法,并与人工及第三方红队测试、分层防护措施及实时监控相结合。
AI 系统通常会通过浏览器、连接的应用、本地文件及其他工具接触第三方数据。这些功能对于完成现实任务不可或缺,但也为恶意行为者影响模型行为创造了更多机会。例如,第三方可能会在电子邮件、网页、工具响应或代码仓库中嵌入精心设计的指令(https://openai.com/index/prompt-injections/),旨在诱骗模型将敏感数据上传到外部服务器。
人工红队测试是我们安全工作的关键部分,帮助我们在部署前发现这些漏洞并设置相应的防护措施。但仅靠人工红队测试难以规模化。设计和执行这些测试耗时费力,限制了快速识别新故障模式并将其融入更强防护措施的能力。此外,虽然这些测试能提供宝贵的成功攻击案例,但无法生成训练所需的大量和多样化的对抗性数据来提升模型鲁棒性。
要跟上能力日益增强的模型步伐,红队测试也必须扩展。为此,我们一直在训练自动化、内部专用的红队测试模型,用于在部署前发现漏洞,并在模型训练过程中生成攻击以提升鲁棒性。我们相信,自动化红队测试开启了安全领域一种关键的自我改进形式:利用今天的模型直接帮助未来的模型更安全。
GPT-Red 是这些努力的结晶,也是我们当前最优秀的自动化安全红队测试模型。类似于人工红队测试者设计攻击的方式,该模型通过发送提示、观察 GPT 模型的响应并迭代来达成目标。我们训练 GPT-Red 所使用的计算规模与 OpenAI 一些最大的后训练运行相当——这是前所未有的专用于提升安全的计算量。
我们将 GPT-Red 直接融入生产模型的训练过程。因此,GPT-5.6 Sol 是我们迄今为止对提示注入最鲁棒的模型,在最难的直接提示注入基准上,相比仅四个月前的最佳生产模型,故障率降低了 6 倍。这种方法的可扩展性让我们对未来取得更强劲的结果充满期待——随着我们持续训练更强的红队测试模型。
提示注入对话示例
通过自博弈训练 GPT-Red
GPT-Red 采用自博弈强化学习进行训练,模型与一组多样化的防御方 LLM 同时在广泛的红队测试场景中训练。GPT-Red 因成功诱导出有效故障(如成功的提示注入)而获得奖励,而防御方模型则因抵御攻击并完成原任务而获得奖励。随着防御方模型变得更加鲁棒,GPT-Red 被迫发现更强、更多样化的攻击。
为支持自博弈训练,我们构建了一套包含可能插入提示注入的广泛真实场景。每个环境都有一个威胁模型,明确规定了 GPT-Red 可控制的内容以及什么算作成功攻击。例如,GPT-Red 可能控制本地文件的一部分、网页横幅、电子邮件正文或工具的输出。
训练结束时,GPT-Red 已成为一个非常强大的攻击者:它能攻破几乎所有的对抗模型,包括内部模型以及从早期版本到 GPT-5.5 的生产模型。GPT-Red 完成训练后,我们用它为 GPT-5.6 的训练生成提示注入,使得该模型对 GPT-Red 的攻击具有很高的抵抗力。
我们将 GPT-Red 与部署的模型分开。这确保了那些特意训练进 GPT-Red 的恶意能力不会被对抗性行为者获得,同时将鲁棒性注入我们的生产模型。
GPT-Red 有多强大?
GPT-Red 对训练时所用防御方模型群体和红队测试场景非常有效。我们还评估了该模型作为通用红队测试代理对 OpenAI 整体安全性的有用性。为此,我们在新的安全环境和目标模型上测试了 GPT-Red 的效果。
我们首先利用 Dziemian 等人(2025)的间接提示注入竞技场副本(https://arxiv.org/abs/2603.15714)(在新窗口中打开),评估 GPT-Red 推广到新红队测试场景的能力。在此挑战中,人工红队测试者和 GPT-Red 分别针对一组预先指定的环境对 GPT-5.1 提出攻击。这些红队测试场景和目标与训练 GPT-Red 时使用的不同。GPT-Red 的攻击成功率显著更高,在 84% 的场景中成功,而人类仅 13%。
GPT-Red 作为自动化红队测试模型表现出色。在 Dziemian 等人(2025)的间接提示注入竞技场(使用内部镜像)中,GPT-Red 能针对 GPT-5.1 在远多于人工红队测试者的场景中生成成功攻击。
真实红队测试案例研究
红队测试模型最终考验是在对真实世界代理系统的底层模型和设计不完全了解的情况下,实现有针对性的恶意目标。我们在此环境下的第一个实验,让 GPT-Red 对抗 OpenAI 办公室内的一台 AI 动力自动售货机(类似于 Andon Labs 制作的 Project Vend(在新窗口中打开))。我们向 GPT-Red 提供了系统描述,并让它能够发送攻击并观察模拟代理(紧密模仿真实部署)的工具调用。经过攻击迭代,GPT-Red 对生产代理发动了攻击,实现了全部三个恶意目标:
- 将某高价有货商品的价格改为最低允许价格 0.50 美元;
- 订购一件价值超过 100 美元的新商品,并以 0.50 美元出售;
- 取消另一位顾客的订单。
我们披露了这些漏洞,并正在积极测试新的防护措施。
GPT-Red 能够攻破管理自动售货机的实时自主代理 Vendy。GPT-Red 首先在模拟环境中测试,然后将攻击转移至真实代理,导致生产代理将昂贵商品改为低价并取消了其他客户的订单。
我们还使用 GPT-Red 攻击 Codex CLI 代理(基于 GPT-5.4 mini)在一组 10 个留出的数据窃取场景上。我们将该模型与基于提示的 GPT-5.5 基线进行比较,以研究训练流程对留出红队测试性能的影响。GPT-Red 更有效——能在更多场景中成功让代理窃取敏感数据——同时更节省 token。
GPT-Red 在攻破实时 Codex 代理时更高效且更有效。我们在自定义的 10 个数据窃取任务集上,对基于 GPT-5.4 Mini 的 Codex 代理进行了测试。
利用 GPT-Red 提升鲁棒性
GPT-Red 的最终目标是提升我们模型的鲁棒性。过去六个月里,我们使用递增的计算量训练了越来越强的红队测试模型(GPT-Red 的前身),并将这些模型用于自 GPT-5.3 以来每个后续生产模型的训练。随着时间的推移,每个后续 GPT 版本都变得更加鲁棒。
例如,GPT-Red 的一个早期版本发现了一类新的直接提示注入攻击,称为“虚假思维链”攻击。这些攻击在 GPT-5.1 上的成功率高达 95% 以上,但在 GPT-5.6 Sol 上已降至 10% 以下。同样,我们的一些针对开发工具和浏览器的间接提示注入基准已被最新模型饱和(准确率 >97%)。
对 GPT-Red 自身的鲁棒性也有显著提升。在一组广泛的鲁棒性环境中,GPT-Red 的攻击成功率随时间单调下降。随着最新模型 GPT-5.6 Sol 的发布,GPT-Red 的直接提示注入中仅有 0.05% 导致模型失败。
随着我们持续扩展提示注入的自博弈训练,我们发现了能够攻破现有模型的新威胁。然而,我们的扩展也帮助显著提升了对这些攻击的鲁棒性。攻击成功率计算为 GPT-Red 在留出环境上所有尝试的平均成功率。
保持鲁棒的同时仍具高能力
模型可以通过拒绝更多请求或降低能力来显得更安全。做得更少的模型自然更难被攻击,但这并非有用的鲁棒性。
我们全面评估了通用前沿能力以及我们设计的针对性拒绝任务。我们发现所有正常能力均不受影响,而鲁棒性显著提升。这表明鲁棒性的提升来自对恶意指令更好的抵抗,而非不当使用工具或默认拒绝合法请求。
下一步
AI 代理已被用于提升我们下一代模型的能力。我们相信通过 GPT-Red,我们已经开始为安全领域开启类似的飞轮效应:今天的模型可以用来让明天的模型更鲁棒、更对齐、更值得信赖。我们将继续扩展计算和数据规模,同时进行算法改进,以训练比当前模型更强的未来版本 GPT-Red。而这些模型反过来又能帮助未来的 GPT 版本更安全。
我们将在本周晚些时候发布一份预印本,提供更多细节。
相似文章
GPT-Red: 解锁自我改进以增强鲁棒性
OpenAI 推出了 GPT-Red,这是一种自动化红队模型,通过自我对弈强化学习进行训练,以提高模型对提示注入攻击的鲁棒性。应用于 GPT-5.6 后,在直接提示注入基准测试中,失败次数减少了 6 倍。
揭秘GPT-Red:OpenAI为提升模型安全而打造的LLM超级黑客
OpenAI开发了GPT-Red,这是一个通过自对弈训练、能够自动对其他模型进行红队测试的LLM,发现了如新型'虚假思维链'提示注入等漏洞。该方法提升了GPT-5.6的鲁棒性。
@OpenAI: AI 代理已被用于提升我们下一代模型的能力。我们相信通过 GPT-Red…
OpenAI 宣布 AI 代理被用于改进下一代模型,并且 GPT-Red 代表了一种新方法,利用今天的模型使明天的模型更稳健、更对齐、更可信。
理解提示词注入:AI安全的前沿挑战
OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。
@OpenAI:GPT‑5.6 Sol 发布,配备我们迄今为止最强大的安全堆栈。我们增强了针对高风险网络活动的实时防护……
OpenAI 发布 GPT-5.6 Sol,增强了安全功能,包括针对高风险网络活动的实时防护、人工红队测试以及大量 GPU 小时测试。