GPT-Red:通过规模化自我对弈实现自动化红队测试

Hugging Face Daily Papers 论文

摘要

本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。

我们介绍了GPT-Red,一种经过训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击。该模型的目标是评估并提升我们生产系统的鲁棒性。为此,我们利用它对GPT-5.6进行了对抗训练,这是我们迄今为止对提示注入最鲁棒的模型。为了创建GPT-Red,我们设计了一种可扩展的自我对弈算法,该模型的任务是攻击一组同时训练的多样化防御代理。我们在逼真的红队测试环境中训练该模型,使用的计算规模与我们最大规模的强化学习后训练运行相当,使其成为有记录以来最大规模的单一LLM安全训练运行。GPT-Red在红队测试方面表现出色:它能够可靠地攻破我们此前直至GPT-5.5的模型,发现比人类红队测试者更多的成功攻击,并且能够泛化到保留环境、防御代理和工具上。未来,我们预计随着每个新GPT模型鲁棒性的提升,它将为更强大的红队测试代理提供更好的学习信号,从而开启一个自我改进的飞轮。
查看原文
查看缓存全文

缓存时间: 2026/07/30 05:46

论文页面 - GPT-Red:通过大规模自对弈实现自动化红队测试

来源:https://huggingface.co/papers/2607.26115
作者:

,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,

摘要

我们推出了 GPT-Red,一个经过训练的自动化红队测试智能体,能够发现针对前沿 LLM 的新颖提示注入攻击。该模型的目标是评估并提升我们生产系统的鲁棒性。为此,我们利用它对抗性训练了 GPT-5.6,这是迄今为止我们对提示注入攻击最鲁棒的模型。为了创建 GPT-Red,我们设计了一种可扩展的自对弈算法,其中模型被要求攻击一个由同时训练的防御智能体组成的多样化群体。我们在逼真的红队测试环境中训练该模型,其计算规模与我们最大的部分 RL 后训练运行相当,使其成为有史以来最大规模的 LLM 安全训练运行。GPT-Red 在红队测试中表现出色:它能够可靠地突破我们过去的模型(最高至 GPT-5.5),发现比人类红队成员更多成功的攻击,并能泛化到未见过的新环境、防御模型及测试装备。未来,我们预期随着每个新 GPT 模型鲁棒性的提升,它将反过来为更强的红队智能体提供更好的学习信号,从而开启自我改进的飞轮效应。

查看 arXiv 页面 (https://arxiv.org/abs/2607.26115)
查看 PDF (https://arxiv.org/pdf/2607.26115)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26115)

在你的智能体中获取此论文:

hf papers read 2607.26115

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 (0)

尚无模型关联此论文

请在模型的 README.md 中引用 arxiv.org/abs/2607.26115 以从此页面链接。

引用此论文的数据集 (0)

尚无数据集关联此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2607.26115 以从此页面链接。

引用此论文的 Spaces (0)

尚无 Space 关联此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2607.26115 以从此页面链接。

包含此论文的收藏集 (0)

尚无包含此论文的收藏集

请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

GPT-Red: 解锁自我改进以增强鲁棒性

OpenAI Blog

OpenAI 推出了 GPT-Red,这是一种自动化红队模型,通过自我对弈强化学习进行训练,以提高模型对提示注入攻击的鲁棒性。应用于 GPT-5.6 后,在直接提示注入基准测试中,失败次数减少了 6 倍。

为大语言模型辅助的生物威胁创建构建早期预警系统

OpenAI Blog

# 为大语言模型辅助的生物威胁创建构建早期预警系统 来源:[https://openai.com/index/building-an-early-warning-system-for-llm-aided-biological-threat-creation/](https://openai.com/index/building-an-early-warning-system-for-llm-aided-biological-threat-creation/) *注:作为我们*[*预防性框架*⁠](https://openai.com/preparedness/)*的一部分,我们正在投资开发改进的AI赋能型安全风险评估方法。我们相信这些努力*