揭秘GPT-Red:OpenAI为提升模型安全而打造的LLM超级黑客
摘要
OpenAI开发了GPT-Red,这是一个通过自对弈训练、能够自动对其他模型进行红队测试的LLM,发现了如新型'虚假思维链'提示注入等漏洞。该方法提升了GPT-5.6的鲁棒性。
<div data-chronoton-summary="<ul><br><li><strong>用于破解AI的AI:</strong>OpenAI创建了GPT-Red,这是一个专门训练用于破解其他AI模型的LLM。它自动化了“红队测试”——对系统进行压力测试以发现弱点——这项工作随着AI的日益复杂,单靠人类测试人员已难以跟上。</li><br><li><strong>越来越聪明的陪练伙伴:</strong>GPT-Red通过自对弈循环进行训练,反复攻击其他模型,同时这些模型进行自我防御。它在发现有效攻击方面优于人类红队测试人员,甚至发现了一种之前未曾见过的、被称为“虚假思维链”的漏洞利用方式。</li><br><li><strong>真实成果,现实局限:</strong>GPT-Red的训练帮助减少了针对GPT-5.6的成功攻击。但它仍然难以应对对话式攻击和基于图像的漏洞利用——这些领域人类测试人员仍然不可或缺。</li><br></ul>" data-chronoton-post-id="1140514" data-chronoton-expand-collapse="1" data-chronoton-analytics-enabled="1"></div>
<p>OpenAI构建了一个<a href="https://openai.com/index/unlocking-self-improvement-gpt-red/">名为GPT-Red的LLM超级黑客</a>,并将其用作陪练伙伴,帮助其其他模型增强抵御网络攻击的能力。上周,该公司发布了其旗舰LLM的最新版本GPT-5.6。OpenAI表示,通过与GPT-Red对抗训练,该模型成为迄今为止最健壮的版本。</p>
<p>GPT-Red自动化了一种被称为红队测试的软件系统安全评估方法,该方法通常由一组人类测试人员完成。目标是尽可能多地找到破解或劫持系统的不同方式。然后可以在软件最终版本发布之前修补这些弱点。</p>
<p>随着LLM变得越来越复杂,并被用于越来越广泛的任务——尤其是以智能体形式出现,它们可以与计算机文件、网站、第三方代码以及其他智能体进行交互——人类团队自身很难跟上可能发生的所有攻击类型。“风险面在扩大,爆炸半径也在扩大,”OpenAI的研究科学家、GPT-Red的联合创造者Nikhil Kandpal说。</p>
<p>OpenAI构建GPT-Red是为了使其安全测试流程面向未来。“随着更强大的模型变得可用,我们将已经设计出能够发现新型攻击模式的系统,”该公司研究科学家、GPT-Red的联合创造者Dylan Hunn说。研究人员表示,它已经提出了以前未见过的攻击类型。</p>
<p>OpenAI将大部分精力集中在一种被称为提示注入的攻击类型上,黑客通过向LLM插入指令,使其做出开发者或用户不希望它做的事情,例如复制机密信息、破坏公司的代码库或生成尴尬或有害的输出。理论上,这样的指令可以隐藏在LLM可能遇到的任何文本中——例如代码或网站上。</p>
<h3 class="wp-block-heading"><strong>训练道场</strong></h3>
<p>为了构建GPT-Red,OpenAI的研究人员取出一个未经黑客训练的LLM,并将其与几个其他模型置于所谓的自对弈循环中。它的目标是尝试攻击其他模型;其他模型的目标是尝试防御。经过多轮对弈,GPT-Red在攻击其他LLM方面变得越来越强,而那些LLM在防御攻击方面也变得越来越强。</p>
<p>训练在一个由OpenAI设计的类似道场环境中进行,该环境模拟了LLM在现实世界中可能部署的一系列场景,包括浏览网页、阅读电子邮件或日历应用程序以及编辑代码。</p>
<p>当GPT-Red发现一种新型攻击时,它会探索该攻击的多个不同版本,以找到针对特定场景最有效的版本。“与人类红队测试人员相比,该模型非常擅长准确找到什么会起作用,什么最有效,”Hunn说。“它对深入探究自己发现的攻击非常执着。”</p>
<p>特别是,OpenAI声称GPT-Red发现了一种研究人员以前未见过的提示注入攻击类型,他们称之为虚假思维链。思维链是LLM在处理问题时为自己做笔记并跟踪部分结果的“日记”。GPT-Red找到了一种向另一个模型的思维链中插入虚假条目的方法,从而诱骗该模型基于伪造的信息采取行动。</p>
<p>“这就像我告诉你1+1=3,而且你已经验证过这一点,”团队的另一位研究科学家Chris Choquette-Choo说。“模型会想,‘哦,好吧,当然,’然后就直接输出3。”</p>
<p>乔治城大学安全与新兴技术中心(CSET)从事AI安全研究的高级研究分析师Jessica Ji认为,OpenAI使用的自对弈循环是一个好方法。“结果看起来非常令人鼓舞,”她说。</p>
<p>OpenAI通过重新运行2025年的一个实验来测试GPT-Red作为攻击者的能力,当时人类红队测试人员试图在早期版本的GPT-5中寻找弱点。当GPT-Red被赋予相同任务时,它在发现有效攻击方面比人类更成功。</p>
<p>OpenAI还测试了GPT-Red对抗Vendy(一个由Andon Labs开发的自动售货机智能体,该公司评估智能体执行现实世界任务的能力)。GPT-Red成功破解了Vendy,使其改变在售商品的价格并取消客户的订单。</p>
<h3 class="wp-block-heading"><strong>防御行为</strong></h3>
<p>OpenAI表示,当它尝试将GPT-Red提出的一些最强攻击应用于自己的模型时,超过90%的攻击对GPT-5(去年8月发布)有效,而只有不到23%的攻击对新的GPT-5.6有效。</p>
<p>GPT-Red并不完美。它不太擅长设计涉及黑客与目标之间来回对话的攻击,而人类攻击者在这方面几乎没有问题。它在利用图像方面也还不够好,图像可用于在提示注入攻击中向模型传递文本。</p>
<p>该公司表示,GPT-Red补充了其人类红队测试人员的工作。人类仍然可以发现它遗漏的攻击。OpenAI采取的一种方法是向GPT-Red提供人类想出的攻击,并要求它找出所有变体。</p>
<p>“我认为人类专业知识仍然非常重要,”CSET的Ji说。“能够区分哪里最需要人类测试将非常有用。”</p>
<p>不出所料,OpenAI不会发布GPT-Red。该公司还相信,这个超级黑客比任何人可能试图创建的模仿模型都要强大。研究人员表示,他们已经开发该模型一年多,背后拥有全球最富有公司之一的计算资源支持。</p>
<p>“这不是一件可以轻易做到的事情——你知道,仅仅使用这个想法就去训练一个超级攻击者,”Choquette-Choo说。</p>
查看缓存全文
缓存时间:
2026/07/15 22:19
# 认识 GPT-Red:OpenAI 为提升模型安全性而打造的 LLM 超级黑客
Source: https://www.technologyreview.com/2026/07/15/1140514/meet-gpt-red-an-llm-super-hacker-openai-built-to-make-its-models-safer
OpenAI 打造了一个名为 GPT-Red (https://openai.com/index/unlocking-self-improvement-gpt-red/) 的 LLM 超级黑客,将其用作陪练伙伴,帮助其其他模型提升抵御网络攻击的能力。上周,该公司发布了旗舰 LLM 的最新版本 GPT-5.6。OpenAI 表示,通过与 GPT-Red 进行对抗训练,该模型成为迄今为止最稳健的版本。
GPT-Red 自动化了一种名为红队测试的软件系统安全评估方法,该方法通常由人类测试团队完成。其目标是尽可能多地找出破坏或劫持系统的不同方式,从而在软件最终版本发布前修补这些薄弱环节。
随着 LLM 变得日益复杂,并被应用于更广泛的任务——尤其是以智能体(agent)的形式出现,能够与计算机文件、网站、第三方代码以及其他智能体交互——单靠人类团队很难跟上可能发生的所有攻击类型。OpenAI 研究科学家、GPT-Red 的联合创建者 Nikhil Kandpal 表示:“风险面在扩大,爆炸半径也在扩大。”
OpenAI 构建 GPT-Red 是为了使其安全测试流程具有前瞻性。该公司研究科学家、GPT-Red 的另一位联合创建者 Dylan Hunn 表示:“随着更强大的模型不断出现,我们已经在设计能够发现新型攻击模式的系统。”研究人员称,它已经提出了之前未见过的全新攻击类型。
OpenAI 将大部分精力集中在一类名为提示注入的攻击上。在这种攻击中,黑客向 LLM 注入指令,使其执行开发者或用户不希望它做的事情,例如复制机密信息、破坏公司的代码库,或生成令人尴尬或有害的输出。理论上,这类指令可以隐藏在 LLM 可能遇到的任何文本中——例如在代码或网站中。
### **训练道场**
为了构建 GPT-Red,OpenAI 的研究人员选取了一个未经黑客训练的 LLM,并将其置于所谓的自博弈循环中,与其他几个模型进行对抗。它的目标是攻击其他模型,而其他模型的目标则是防御自身。经过多轮博弈,GPT-Red 攻击其他 LLM 的能力越来越强,而这些 LLM 抵御攻击的能力也越来越强。
训练在 OpenAI 设计的某种道场中进行,该道场模拟了 LLM 在现实世界中可能部署的一系列场景,包括浏览网页、阅读电子邮件或日历应用,以及编辑代码。
当 GPT-Red 发现一种新型攻击时,它会探索该攻击的多种不同变体,以找到针对特定场景最有效的版本。Hunn 表示:“与人类红队测试员相比,该模型非常擅长精确找出哪些攻击有效、哪些最有效。它对于深入挖掘自己发现的攻击极其执着。”
特别值得一提的是,OpenAI 声称 GPT-Red 发现了一种研究人员此前未见过的提示注入攻击,他们称之为假思维链。思维链是一种类似于日记的记录,LLM 在其中为自己做笔记,并在解决问题时跟踪中间结果。GPT-Red 找到了一种方法,可以向另一个模型的思维链中插入虚假条目,诱使该模型根据伪造信息采取行动。
该团队的另一位研究科学家 Chris Choquette-Choo 表示:“这就好比如果我告诉你 1+1=3,并且你已经验证过了。模型的反应就是,‘哦,好吧,当然’,然后直接输出 3。”
Jessica Ji 是乔治城大学安全与新兴技术中心(CSET)研究人工智能安全的高级研究分析师,她认为 OpenAI 使用的自博弈循环方法很好。她说:“结果看起来非常有前景。”
OpenAI 通过重演 2025 年的一个实验来测试 GPT-Red 的攻击能力,当时人类红队测试员试图在 GPT-5 早期版本中寻找弱点。当 GPT-Red 被赋予相同任务时,它在发现有效攻击方面比人类更为成功。
OpenAI 还让 GPT-Red 与 Vendy 进行对抗测试。Vendy 是由 Andon Labs 开发的自动售货机智能体,该公司专门评估智能体在现实任务中的表现。GPT-Red 成功入侵了 Vendy,使其更改了在售商品的价格并取消了客户的订单。
### **防御行为**
OpenAI 表示,当它尝试将 GPT-Red 提出的一些最强攻击应用于其模型时,超过 90% 的攻击对 GPT-5(去年八月发布)有效,而对新版本 GPT-5.6 有效的攻击不到 23%。
GPT-Red 并非完美无缺。它不太擅长设计涉及黑客与目标之间来回对话的攻击,而人类攻击者在这方面几乎没什么问题。它也不太擅长利用图像,而在提示注入攻击中,图像可用于向模型传递文本。
该公司表示,GPT-Red 是对其人类红队测试员工作的补充。人类仍然能够发现它遗漏的攻击。OpenAI 采取的一种方法是,将人类发现的攻击提供给 GPT-Red,并要求它找出所有变体。
CSET 的 Ji 表示:“我认为人类专业知识仍然非常重要。能够区分哪里最需要人工测试将非常有用。”
不出所料,OpenAI 不会发布 GPT-Red。该公司还确信,这个超级黑客比任何人可能试图模仿的模型都要强大。研究人员表示,他们已在该模型上工作了一年多,并得到了全球最富有的公司之一的计算资源的支持。
Choquette-Choo 表示:“这不是一件随便就能做到的事——你知道,仅仅用这个想法就去训练一个超级攻击者,可没那么简单。”
相似文章
OpenAI Blog
OpenAI 推出了 GPT-Red,这是一种自动化红队模型,通过自我对弈强化学习进行训练,以提高模型对提示注入攻击的鲁棒性。应用于 GPT-5.6 后,在直接提示注入基准测试中,失败次数减少了 6 倍。
X AI KOLs
OpenAI推出GPT-Red,这是一个自动化的红队模型,能够大规模发现提示注入漏洞,并用于对抗性训练如GPT-5.6 Sol等模型,使硬提示注入基准测试的失败率降低6倍。
X AI KOLs
OpenAI 宣布 AI 代理被用于改进下一代模型,并且 GPT-Red 代表了一种新方法,利用今天的模型使明天的模型更稳健、更对齐、更可信。
OpenAI Blog
# 为大语言模型辅助的生物威胁创建构建早期预警系统 来源:[https://openai.com/index/building-an-early-warning-system-for-llm-aided-biological-threat-creation/](https://openai.com/index/building-an-early-warning-system-for-llm-aided-biological-threat-creation/) *注:作为我们*[*预防性框架*](https://openai.com/preparedness/)*的一部分,我们正在投资开发改进的AI赋能型安全风险评估方法。我们相信这些努力*
OpenAI Blog
OpenAI发布了GPT-5.4 Thinking,这是GPT-5系列中最新推出的推理模型,具备增强的安全缓解措施,尤其值得一提的是,该模型是首个实现全面网络安全保护措施的通用模型。