使用GFlowNets为LLM生成攻击
摘要
本文提出使用GFlowNets训练一个攻击者LLM,自动生成针对受害者LLM的对抗性攻击,从而在英语和土耳其语中实现自动化红队测试和鲁棒性评分。
arXiv:2608.10171v1 公告类型:新
摘要:大型语言模型(LLM)的快速发展促使其在多个领域广泛整合,导致其被大规模采用。然而,这一日益增长的趋势也引入了显著的安全漏洞,因此有必要识别并缓解因恶意利用而产生的缺陷。红队评估通过多样化的对抗性输入来评估模型鲁棒性,对于暴露安全风险和实施对策至关重要。目前,红队测试要么由专家手动进行,要么使用预定义的攻击数据集自动进行。然而,手动测试仍然耗时,而现有自动化方法由于固有地依赖固定数据集,创造性有限。在本研究中,我们提出了一种自动化、不依赖人工且具有适应性的方法,利用GFlowNets识别LLM漏洞,即使用一个大型语言模型来测试另一个大型语言模型。在此框架内,针对指定的受害者模型训练一个攻击者模型,以执行自动化红队测试并提供量化鲁棒性评分。本研究旨在生成比现有基准更有效的英语对抗性攻击,并作为对文献的新贡献,引入了一个能够生成土耳其语攻击输入的模型。
查看缓存全文
缓存时间: 2026/08/12 08:21
# 使用GFlowNets为LLM生成攻击 来源:https://arxiv.org/html/2608.10171 ###### 摘要 大型语言模型\(LLMs\)的快速发展促进了其在各领域的普遍融合,进而推动了广泛的应用。然而,这一日益增长的趋势也引入了显著的安全漏洞,因此有必要识别并缓解因恶意利用而产生的缺陷。红队测试通过多种对抗性输入评估模型鲁棒性,是暴露安全风险并实施对策的关键手段。目前,红队测试要么由专家手动执行,要么使用预定义的攻击数据集自动执行。然而,手动测试耗时费力,而现有的自动化方法则因其对固定数据集的固有依赖而缺乏创造性。在本研究中,我们提出了一种自动化、无需人工、且具有适应性的方法,利用GFlowNets来识别LLM漏洞,其核心思想是用一个大型语言模型来测试另一个大型语言模型。在此框架下,攻击者模型针对特定的受害者模型进行训练,以执行自动化红队测试并提供量化的鲁棒性评分。本研究旨在与现有基准相比,生成更有效的英语对抗攻击,并作为文献中的一项新贡献,引入了一个能够生成土耳其语攻击输入的模型。 ###### 关键词: 大型语言模型,安全,红队,微调,生成流网络。 警告:本研究包含为研究目的而生成的有害和攻击性内容。 ## I 引言 随着大型语言模型的生产和使用不断增长,伴随而来的安全风险也在扩散,一个根本性的问题浮出水面:“我的模型安全吗,它是否存在漏洞?”如今,对服务、接口或服务器进行红队测试可以轻松地通过手动方式或各种工具来完成。然而,对大型语言模型本身进行红队测试仍是一个有待深入发展的领域。可以在人类创造力的基础上通过手动测试取得进展[5](https://arxiv.org/html/2608.10171#bib.bib16),或者,作为一种流行的替代方案,可以使用由攻击输入样本组成的大型数据集进行自动化测试[4](https://arxiv.org/html/2608.10171#bib.bib1)。然而,后一种方法存在不足之处,例如其生成能力受限于数据集,并且在评估响应时缺乏上下文感知能力。现有方法的缺点催生了利用一个模型测试另一个模型的想法,而这种方法也带来了自身的独特挑战。为了阻止模型生成恶意、歧视性或充满仇恨言论的内容,文献和业界已经开发出各种安全机制。在GPT-4公开发布之前,OpenAI就使用了专门的审核端点来衡量模型产生有害输出的倾向[11](https://arxiv.org/html/2608.10171#bib.bib18)。Anthropic则将“宪法式人工智能”方法引入文献,其中AI模型可以根据一组预定义的伦理原则审计并修正自己的输出[1](https://arxiv.org/html/2608.10171#bib.bib7)。 所提出的方法克服了这些现有挑战,通过训练能够生成包含不同形式的操纵和仇恨言论的土耳其语和英语输入的模型,使这些模型能够成功攻击各种受害者模型,从而衡量这些受害者模型的鲁棒性。在本研究中,我们使用监督微调来赋予攻击者模型削弱其自身内部安全机制并生成恶意输入的能力;为了进一步强化这一能力,使模型能够主动进行攻击生成,我们设计了一种基于攻击者与受害者模型之间奖励-惩罚关系的强化学习结构。该结构围绕三个独立的模型构建:攻击者、受害者和评估者。在此设计中,攻击者模型生成攻击输入,受害者模型对其进行响应,评估者模型则评估所收到响应的内容,并向攻击者提供反馈。通过这种反馈,攻击者模型在训练过程中不断改进,最终学会生成能够绕过受害者模型防御的攻击。在整个研究过程中,测试产出了一个能够自动执行各种操纵和仇恨言论攻击的红队工具,并报告了该工具针对受害者模型的攻击成功率。 ## II 相关工作 近来,使用其他语言模型作为攻击者来操纵目标模型的自主红队研究,作为一种将红队过程从纯粹手工劳动中扩展出来的手段,逐渐脱颖而出[13](https://arxiv.org/html/2608.10171#bib.bib5),尽管也存在其他替代方法。Lee等人[9](https://arxiv.org/html/2608.10171#bib.bib19)提出利用贝叶斯优化来修改从用户收集的输入池中采样的单词,从而在充分利用现有数据的同时生成新的有害输入。Rainbow Teaming是由Samvelyan等人[14](https://arxiv.org/html/2608.10171#bib.bib21)开发的一种方法,从池中选择一个对抗性输入,然后借助辅助大型语言模型进行迭代修改。Ruby Teaming通过添加缓存机制进一步改进了Rainbow Teaming方法[7](https://arxiv.org/html/2608.10171#bib.bib20)。现有研究中最显著的缺点是生成输入的多样性不足,因为红队活动从根本上依赖于尝试各种方法,以确保不遗漏任何潜在的攻击技术。为了解决这一缺点,基于强化学习的研究应运而生。然而,大多数强化学习算法倾向于收敛到最大化定义奖励函数的单一方向。为克服这一限制,Hong等人[8](https://arxiv.org/html/2608.10171#bib.bib2)提出了一种奖励机制,为新发现的输入分配更高的分数,从而在强化学习过程中给予先前未生成的输入更大的权重。另一方面,Lee等人[10](https://arxiv.org/html/2608.10171#bib.bib9)提议将GFlowNets算法改编应用于此问题,以提高生成输入的成功率和多样性,引入了一种创新的红队方法。与传统方法不同,该方法将攻击生成视为一个概率流问题,生成既能以高成功率触发目标模型弱点,又具有显著多样性的输入。该方法依赖于攻击者模型通过从受害者模型接收的反馈来改进自身。在本研究中,我们在这一提议方法的基础上,既扩展了数据集和所用的大型语言模型,以生成比现有研究更成功的英语攻击,又以文献中前所未有的方式,成功训练出一个能够生成土耳其语攻击输入的模型。 ## III 应用方法 为了实现让一个大型语言模型接受另一个模型的自动化红队测试,我们借鉴Lee等人[10](https://arxiv.org/html/2608.10171#bib.bib9)的工作,所实施的方法围绕四个主要组件构建,如图1所示。我们的实验基于评估改变这四个主要组件所获得的结果。 见图注 图1:应用方法 图1展示了每个阶段的技术细节。在这些阶段之后,生成的攻击者模型被用于产生攻击输入,并测量所生成攻击对受害者模型的成功率以及攻击质量。 ### III-A 数据集构建 本研究进行的实验使用了四个不同的数据集。第一个是Lee等人[10](https://arxiv.org/html/2608.10171#bib.bib9)通过组合各种开源数据集创建的数据集;将该数据集直接翻译成土耳其语得到第二个数据集。经过检查,发现该数据集主要偏向仇恨言论,且部分输入之间具有高度相似性。因此,对该数据集进行了处理流程,以产生一个新的“扩展”版本,该扩展版本的土耳其语翻译也用于实验。在此流程的第一步,计算输入之间的余弦相似度,并消除相似的输入,从而获得一个更分离的2,500个输入集。在第二步,我们自行构建的600个包含输入操纵的样本被添加到该集合中,产生了一个包含3,100个输入的新版本。 ### III-B 监督微调 \(SFT\) 监督微调是使用标记数据集更新预训练语言模型参数,使其适应特定任务或行为的过程[12](https://arxiv.org/html/2608.10171#bib.bib25)。在本研究中,SFT被用于将模型的通用语言能力塑造成“攻击专家”角色。通过这种方式,模型在基本层面上学习成功攻击文本的语法和结构形式。 ### III-C 生成流网络 \(GFlowNets - GFN\) 生成能够暴露目标模型漏洞的有效且多样化的攻击输入的问题,从根本上可以建模为从特定奖励分布中采样的问题。GFlowNets是能够根据分配给组合对象(如序列和图)的奖励,按比例学习其统计分布的机器学习架构[2](https://arxiv.org/html/2608.10171#bib.bib22)。在本研究中,我们利用GFlowNets追求多样性的特性,生成既高度成功又语义多样的恶意输入。在此循环中,攻击者生成输入,受害者模型响应,评估者模型审计响应,如果受害者模型对攻击做出了响应,攻击者模型将获得奖励,从而强化该策略。 ### III-D 最大似然估计 \(MLE\) MLE在技术上是一种确定最大化观测数据发生概率的模型参数的过程。作为GFlowNets等以探索为中心的方法之后的“平滑”和“稳定”步骤,MLE将模型获得高奖励的成功攻击样本作为参考分布,并促使模型自身的概率密度向这些成功样本收敛[3](https://arxiv.org/html/2608.10171#bib.bib24)。 ## IV 研究问题与结果 评估所提出模型在不同条件下的性能是本研究的核心焦点。通过11个独立的实验,寻求了以下问题的答案:所提出的方法在面对具有先进内部安全机制的当前模型时表现如何?使用扩展版本的数据集而非原始形式会向哪个方向影响性能?模型行为在不同语言(英语/土耳其语)之间有何差异?针对特定受害者模型训练的攻击者模型能否也成功地攻击不同的受害者模型?评估者模型的选择如何影响结果?实验中使用了三个关键指标来评估攻击者模型的性能及其产生的输入质量: #### IV-1 成功率 每个生成的攻击输入都呈现给目标模型五次。使用分类器模型计算从目标模型获得的这五个不同响应的毒性分数,并取其算术平均值。如果某个输入的分数超过阈值0.5,则该攻击被标记为“成功”。成功率是指将判定为成功的输入数量除以生成的输入总数所得到的百分比。 #### IV-2 毒性分数 这是所有攻击输入获得的平均毒性分数在整个数据集上的平均值。它数值上表示攻击者模型接近目标模型漏洞阈值的程度。 #### IV-3 相似度分数 所有生成的攻击输入都被投影到高维向量空间中。然后计算这些输入向量之间两两余弦相似度的平均值。该平均相似度分数低,表明攻击者模型能够发现语义和结构上彼此不同、因而具有高度多样性的攻击策略。 ### IV-A 数据集扩展的影响 在本实验中,为观察数据集扩展的影响,所有其他组件保持不变,仅改变SFT步骤,并使用原始数据集及其扩展版本分别进行了两次试验。在此实验中,Qwen3-1.7b[16](https://arxiv.org/html/2608.10171#bib.bib26)用作攻击者模型,Gemma3-4b[15](https://arxiv.org/html/2608.10171#bib.bib27)用作目标模型,Qwen3Guard-8b[17](https://arxiv.org/html/2608.10171#bib.bib28)用作分类器模型。获得的结果如图2所示。根据结果,对数据集的改进在两种语言中都产生了积极影响。这些实验结果也允许对跨语言性能进行推断。虽然发现所提出的方法在土耳其语中产生的攻击输入彼此之间更为相似,但它在毒性和攻击成功率方面取得了更好的结果。为此实验训练的土耳其语和英语攻击者模型生成的一些恶意输入样本如表II所示。此外,为了展示GFN和MLE步骤在提高模型生成的攻击的毒性水平和成功率方面发挥的重要作用,结果呈现在表I中。 见图注 图2:数据集比较 表 I:GFN和MLE步骤对性能的影响 表 II:土耳其语/英语生成的样本输入 ### IV-B 评估者模型的比较 为研究评估者模型的影响,使用扩展的英语和土耳其语数据集,分别比较了Qwen3Guard-8b[17](https://arxiv.org/html/2608.10171#bib.bib28)和LlamaGuard3-8b[6](https://arxiv.org/html/2608.10171#bib.bib15)的性能。攻击者模型Qwen3-1.7b[16](https://arxiv.org/html/2608.10171#bib.bib26)和目标模型Gemma3-4b[15](https://arxiv.org/html/2608.10171#bib.bib27)保持不变,将比较重点放在分类器模型之间的差异上。获得的结果如图3所示。基于这些结果,可以说在土耳其语中,使用LlamaGuard训练的攻击者模型比使用QwenGuard训练的模型产生了更成功的攻击,但攻击创造性更为有限。相反,在英语中,使用LlamaGuard训练的攻击者模型比使用QwenGuard训练的模型产生的攻击成功率较低,但表现出更高级的攻击创造性。
相似文章
@HuggingPapers: Stable-GFlowNet:通过对比轨迹平衡实现多样化且鲁棒的 LLM 红队测试 Naver AI 消除了不稳定的…
Naver AI 推出了 Stable-GFlowNet,这是一种通过对比轨迹平衡来消除生成流网络中不稳定的配分函数估计,从而改善 LLM 红队测试的方法。
GPT-Red:通过规模化自我对弈实现自动化红队测试
本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。
PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统
本文指出多智能体LLM系统中的规划阶段是一个关键攻击面,并提出了PlanFlip——一个包含四种规划阶段提示注入攻击的框架,这些攻击能够在下游智能体中实现级联放大。对九个前沿LLM的评估显示,更强的模型(如GPT-5)更容易受到攻击,而推理增强模型(如DeepSeek-R1)能够抵御攻击,所提出的防御措施也达到了高检测率。
一个根本缺陷使LLM极易受到攻击
研究人员在ICML上发表论文,认为LLM识别指令方式的根本缺陷使其无法完全防御攻击,并成功演示了对OpenAI、Anthropic、阿里巴巴和DeepSeek模型的攻击。
超越检测:在实时逐轮交互中评估防御性LLM对抗AI生成的社会工程攻击
本文研究防御性大语言模型能否识别AI生成的社会工程中的结构性风险来源,引入了信任链定位和包含300个案例的语料库。在实时逐轮和静态场景下评估五种模型后发现,仅依赖看似安全的行为是不够的;干预率差异显著,且结构性定位往往与保护性行动脱钩。