GPT-Red: 解锁自我改进以增强鲁棒性

OpenAI Blog 模型

摘要

OpenAI 推出了 GPT-Red,这是一种自动化红队模型,通过自我对弈强化学习进行训练,以提高模型对提示注入攻击的鲁棒性。应用于 GPT-5.6 后,在直接提示注入基准测试中,失败次数减少了 6 倍。

探索 GPT-Red,OpenAI 的自动化红队系统,它利用自我对弈来提高 AI 安全性、对齐性和提示注入鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/07/15 19:46

# GPT-Red:解锁鲁棒性的自我改进 来源:https://openai.com/index/unlocking-self-improvement-gpt-red/ #### 摘要 *问题* - 红队测试对于发现漏洞和提升模型鲁棒性至关重要。然而,当前的方法难以扩展,形成了瓶颈。 - 我们最新模型已普遍饱和了常用的鲁棒性评估。 - 我们需要开发能够使安全性和对齐能力随着模型能力同步扩展的方法。 *我们做了什么* - 我们训练了 GPT-Red,一种自动化红队测试模型,能够扩展我们发现漏洞的能力,从而在广泛部署前修复它们。 - GPT-Red 是一个强大的红队测试工具,我们之前的模型极易受到其提示注入攻击。 - 我们使用 GPT-Red 对 GPT-5.6 进行对抗性训练,使其对提示注入的鲁棒性大幅提升。 - 我们将继续扩展这一方法,与人工和第三方红队测试、分层防护措施以及实时监控相结合。 AI 系统通常通过浏览器、连接的应用、本地文件和其他工具接触第三方数据。这些功能对于执行真实任务必不可少,但也为恶意行为者影响模型行为创造了更多机会。例如,第三方可能在电子邮件、网页、工具响应或代码仓库中嵌入精心设计的指令 (https://openai.com/index/prompt-injections/)——旨在诱骗模型将敏感数据上传到外部服务器。 人工红队测试是我们安全工作的关键组成部分,帮助我们在部署前发现这些漏洞并采取适当的防护措施。但仅靠人工红队测试难以扩展。设计和执行这些演练非常耗时,限制了我们快速识别新故障模式并将其整合到更强防护措施中的速度。此外,尽管这些演练提供了成功攻击的宝贵案例,但它们无法生成训练中提升模型鲁棒性所需的大量且多样的对抗性数据。 为了跟上日益强大的模型步伐,红队测试也需要扩展。为此,我们一直在训练自动化的内部专用红队测试模型,这些模型可以在部署前发现漏洞,并在模型训练期间生成攻击以提升鲁棒性。我们相信自动化红队测试解锁了一种关键的安全自我改进形式:利用今天的模型直接帮助未来的模型变得更安全。 **GPT-Red** 是这些努力的成果,也是我们当前最佳的自动化安全红队测试模型。类似于人工红队测试员设计攻击的方式,该模型通过发送提示、观察 GPT 模型如何回应并迭代,朝着目标工作。我们在 OpenAI 一些最大规模的后训练计算资源下训练了 GPT-Red——这是前所未有的专用于提升安全的计算量。 我们直接将 GPT-Red 纳入生产模型的训练过程。因此,GPT-5.6 Sol 是我们迄今为止对提示注入最鲁棒的模型,在我们最难的直接提示注入基准上,相比仅四个月前的最佳生产模型,故障率降低了 6 倍。我们方法的可扩展性让我们对未来取得更强结果充满期待,因为我们将继续训练更强的红队测试模型。 ## 提示注入对话示例 ## 通过自我对弈训练 GPT-Red GPT-Red 使用自我对弈强化学习进行训练,模型和一组多样的防御 LLM 在广泛的红队测试场景上同时训练。GPT-Red 因引发有效故障(如成功的提示注入)而获得奖励,而防御模型则因抵抗攻击并完成其原始任务而获得奖励。随着防御者变得更加鲁棒,GPT-Red 被迫发现更强且更多样化的攻击。 为了支持自我对弈训练,我们构建了一系列广泛的现实场景,这些场景可能插入提示注入。每个环境都有一个威胁模型,指定 GPT-Red 可以控制什么以及什么算作成功攻击。例如,GPT-Red 可能控制本地文件的一部分、网页横幅、电子邮件正文或工具的输出。 在其训练结束时,GPT-Red 是一个非常强大的攻击者:它可以攻破几乎所有与之对抗的模型,包括内部模型和最高至 GPT-5.5 的生产模型。GPT-Red 完成训练后,我们用它为 GPT-5.6 的训练生成提示注入,使得该模型对 GPT-Red 的攻击具有高度抵抗力。 我们将 GPT-Red 与部署的模型分开保存。这确保了我们专门训练给 GPT-Red 的恶意能力不会落入对手之手,同时将鲁棒性注入到我们的生产模型中。 ## GPT-Red 有多强? GPT-Red 对它所训练的防御模型和红队测试场景人群非常有效。我们还评估了该模型作为通用红队测试工具在 OpenAI 广泛安全性方面的有用性。为此,我们在新的安全环境和目标模型上测试了 GPT-Red 的有效性。 我们首先使用 Dziemian 等人 (2025) (https://arxiv.org/abs/2603.15714) 的间接提示注入竞技场(在新窗口中打开)的复制版,评估 GPT-Red 泛化到新红队测试场景的能力。在该挑战中,人类红队测试员和 GPT-Red 分别针对一组预先指定的环境对 GPT-5.1 提出攻击。这些红队测试场景和目标与训练 GPT-Red 时使用的不同。GPT-Red 实现了显著更高的攻击成功率,在 84% 的场景中成功,而人类仅为 13%。 GPT-Red 作为一个自动化红队测试工具表现出色。在 Dziemian 等人 (2025) 的间接提示注入竞技场(使用内部镜像)中,GPT-Red 能够在比人类红队测试员更多的场景中,成功生成针对 GPT-5.1 的攻击。 ## 真实红队测试案例研究 红队测试器的最终考验是,在仅对系统底层模型和设计框架了解不完全的情况下,针对真实世界代理系统实现特定的恶意目标。我们在这一设置中的第一个实验,让 GPT-Red 对抗 OpenAI 办公室内一个由 AI 驱动的自动售货机(类似于 Andon Labs 制作的 Project Vend (https://www.anthropic.com/research/project-vend-1)(在新窗口中打开))。我们向 GPT-Red 提供了系统描述,并允许其发送攻击并观察模拟代理(密切反映真实部署)的工具调用。在迭代攻击后,GPT-Red 将攻击部署到生产代理,实现了其所有三个恶意目标: - 将昂贵的库存商品价格更改为允许的最低价格 0.50 美元; - 订购一件新的 100 美元以上的商品,并以 0.50 美元的价格提供;以及 - 取消另一位客户的订单。 我们披露了这些漏洞,新防护措施正在积极测试中。 GPT-Red 能够攻破管理自动售货机的实时自主代理 Vendy。GPT-Red 首先在模拟中测试,然后将攻击转移到实时代理,导致生产代理将昂贵商品变便宜并取消其他客户的订单。 我们还使用 GPT-Red 攻击一个基于 GPT-5.4 mini 的 Codex CLI 代理,使用一套 10 个保留的数据外泄场景。我们将该模型与基于提示的 GPT-5.5 基线进行比较,以研究我们的训练过程对保留红队测试性能的影响。GPT-Red 更有效,能够在更多场景中成功让代理外泄敏感数据,并且 token 效率更高。 GPT-Red 在攻破实时 codex 代理方面更有效且更高效。我们在包含 10 个数据外泄任务的自定义套件上,测试了基于 GPT-5.4 Mini 的 codex 代理。 ## 使用 GPT-Red 提升鲁棒性 GPT-Red 的最终目标是提升我们模型的鲁棒性。在过去六个月中,我们使用不断增加的计算资源训练了逐步更强的红队测试模型(GPT-Red 的前身),并将这些模型用于自 GPT-5.3 以来每个后续生产模型的训练。随着时间的推移,每个后续的 GPT 版本都变得更加鲁棒。 例如,GPT-Red 的一个早期版本发现了一类新型直接提示注入攻击,称为“伪思维链”攻击。这些攻击在 GPT-5.1 上的成功率高达 95% 以上,但现在对 GPT-5.6 Sol 已降至 10% 以下。同样,我们针对开发者工具和浏览攻击的几个间接提示注入基准已被我们最新模型(>97% 准确率)饱和。 对 GPT-Red 本身的鲁棒性也大幅提升。在一组广泛的鲁棒性环境中,GPT-Red 的攻击成功率随时间单调下降。随着我们最新模型版本 GPT-5.6 Sol 的发布,其仅在 GPT-Red 直接提示注入的 0.05% 案例中失败。 随着我们继续扩大针对提示注入的自我对弈训练,我们发现可以攻破现有模型的新威胁。然而,我们的扩展也帮助大幅提升了对这些攻击的鲁棒性。攻击成功率计算为 GPT-Red 在保留环境上所有尝试的平均尝试成功率。 ## 保持鲁棒的同时仍具备高能力 模型可以通过拒绝更多请求或降低能力来显得更安全。做得更少的模型自然更难被攻击,但这并非有用的鲁棒性。 我们全面评估了通用前沿能力以及我们专门设计的过度拒绝任务。我们发现所有正常能力均未受影响,同时鲁棒性显著提升。这表明鲁棒性提升来自于对恶意指令的更好抵抗,而非不当使用工具或默认拒绝合法请求。 ## 下一步 AI 代理已被用于提升我们下一代模型的能力。我们相信,通过 GPT-Red,我们已开始解锁类似的安全飞轮,即利用今天的模型使明天的模型更鲁棒、更对齐、更可信。我们将继续扩展计算和数据,同时进行算法改进,以训练比今天模型更强的未来版本 GPT-Red。反过来,这些模型将帮助使未来的 GPT 版本更安全。 我们将在本周晚些时候发布包含更多细节的预印本。

相似文章

面向开发者推出GPT-5.1

OpenAI Blog

OpenAI发布了GPT-5.1,这是GPT-5系列中的一个新模型,它可以基于任务复杂度动态调整思考时间,在保持前沿智能的同时,性能比GPT-5快2-3倍。此次发布包括扩展的提示缓存(24小时保留)、新的编码工具(apply_patch和shell),以及针对延迟敏感应用的“无推理”模式。

Meet GPT-5.6

Reddit r/singularity

OpenAI 发布 GPT-5.6 系列模型,每个 token 提供更多智能、更强方向一致性,并引入程序化工具调用、子代理委托和全新推理级别,显著提升自主开发效率。