GPT-Red:通过规模化自我对弈实现自动化红队测试
摘要
本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。
查看缓存全文
缓存时间: 2026/07/30 05:46
论文页面 - GPT-Red:通过大规模自对弈实现自动化红队测试
来源:https://huggingface.co/papers/2607.26115
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们推出了 GPT-Red,一个经过训练的自动化红队测试智能体,能够发现针对前沿 LLM 的新颖提示注入攻击。该模型的目标是评估并提升我们生产系统的鲁棒性。为此,我们利用它对抗性训练了 GPT-5.6,这是迄今为止我们对提示注入攻击最鲁棒的模型。为了创建 GPT-Red,我们设计了一种可扩展的自对弈算法,其中模型被要求攻击一个由同时训练的防御智能体组成的多样化群体。我们在逼真的红队测试环境中训练该模型,其计算规模与我们最大的部分 RL 后训练运行相当,使其成为有史以来最大规模的 LLM 安全训练运行。GPT-Red 在红队测试中表现出色:它能够可靠地突破我们过去的模型(最高至 GPT-5.5),发现比人类红队成员更多成功的攻击,并能泛化到未见过的新环境、防御模型及测试装备。未来,我们预期随着每个新 GPT 模型鲁棒性的提升,它将反过来为更强的红队智能体提供更好的学习信号,从而开启自我改进的飞轮效应。
查看 arXiv 页面 (https://arxiv.org/abs/2607.26115)
查看 PDF (https://arxiv.org/pdf/2607.26115)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26115)
在你的智能体中获取此论文:
hf papers read 2607.26115
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 (0)
尚无模型关联此论文
请在模型的 README.md 中引用 arxiv.org/abs/2607.26115 以从此页面链接。
引用此论文的数据集 (0)
尚无数据集关联此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2607.26115 以从此页面链接。
引用此论文的 Spaces (0)
尚无 Space 关联此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2607.26115 以从此页面链接。
包含此论文的收藏集 (0)
尚无包含此论文的收藏集
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
揭秘GPT-Red:OpenAI为提升模型安全而打造的LLM超级黑客
OpenAI开发了GPT-Red,这是一个通过自对弈训练、能够自动对其他模型进行红队测试的LLM,发现了如新型'虚假思维链'提示注入等漏洞。该方法提升了GPT-5.6的鲁棒性。
GPT-Red: 解锁自我改进以增强鲁棒性
OpenAI 推出了 GPT-Red,这是一种自动化红队模型,通过自我对弈强化学习进行训练,以提高模型对提示注入攻击的鲁棒性。应用于 GPT-5.6 后,在直接提示注入基准测试中,失败次数减少了 6 倍。
@OpenAI: 推出GPT-Red —— 一个内部自动化红队成员,致力于大规模发现我们模型的提示注入漏洞……
OpenAI推出GPT-Red,这是一个自动化的红队模型,能够大规模发现提示注入漏洞,并用于对抗性训练如GPT-5.6 Sol等模型,使硬提示注入基准测试的失败率降低6倍。
为大语言模型辅助的生物威胁创建构建早期预警系统
# 为大语言模型辅助的生物威胁创建构建早期预警系统 来源:[https://openai.com/index/building-an-early-warning-system-for-llm-aided-biological-threat-creation/](https://openai.com/index/building-an-early-warning-system-for-llm-aided-biological-threat-creation/) *注:作为我们*[*预防性框架*](https://openai.com/preparedness/)*的一部分,我们正在投资开发改进的AI赋能型安全风险评估方法。我们相信这些努力*
自我对弈帮助AI在围棋中达到超人类水平,那么为何对LLM未能如此?研究人员找到了解决方案。
研究人员引入了自导自对弈(Self-Guided Self-Play, SGS),这是一种用于LLM的自我对弈算法,通过使用指引角色(Guide)对合成问题进行评分来防止奖励作弊(reward hacking)。应用于Lean4中的定理证明时,SGS超越了强化学习基线,并使7B模型胜过671B模型。