NeuronFuzz: 安全神经元引导的模糊测试在LLM安全评估中的应用
摘要
NeuronFuzz是一个白盒模糊测试框架,利用内部安全神经作为连续反馈来评估LLM对越狱攻击的安全性,并在多个模型上展示了高发现率。
arXiv:2608.26222v1 公告类型:新
摘要:安全评估对于评估对齐的大型语言模型(LLMs)是否仍然能够抵御越狱攻击至关重要。然而,现有的自动化测试方法主要依赖于响应级反馈:每个候选提示通常需要生成目标模型的响应来评估其攻击效果。这个过程代价高昂,更重要的是,对于强对齐模型,它只提供稀疏的指导,其中大多数候选提示以相同的失败结果被拒绝。
本文提出了NeuronFuzz,一个白盒模糊测试框架,它利用内部安全神经作为连续执行反馈用于LLM安全评估。SafetyOracle将安全神经元激活转换为连续的安全警报分数,作为模糊测试的反馈,并且可以在预填充期间获得,从而从模糊测试循环中消除响应生成。为了构建SafetyOracle,NeuronFuzz使用模板无关的有害和良性输入以及稳定性感知选择来识别一组紧凑的安全神经元,其激活捕获有害意图识别。此外,由于安全警报分数是可微的,NeuronFuzz使用其梯度来识别安全敏感的模板位置,并使用掩码语言模型生成流畅、上下文兼容的突变,同时保留原始有害负载并避免额外的优化变量。我们在21个文本和多模态模型上评估NeuronFuzz。在五个白盒源模型上,它实现了76-100%的越狱发现率,比基线高出最多48个百分点。其优化模板进一步零样本转移到开源权重和六个专有目标模型,分别实现平均ASR和前5个集成ASR(EASR)为69.6%/92.6%和44.1%/60.0%。
查看缓存全文
缓存时间: 2026/08/28 09:37
# NeuronFuzz:基于安全神经元引导的大语言模型安全评估模糊测试 来源:https://arxiv.org/html/2608.26222 ###### 摘要 安全评估对于评估对齐后的大语言模型(LLMs)是否仍能抵御越狱攻击至关重要。然而,现有的自动化测试方法大多依赖于响应级别的反馈:每个候选提示通常需要生成目标模型的响应来评估其攻击效果。这一过程代价高昂,更重要的是,对于强对齐模型只能提供稀疏的指导——大多数候选提示都因相同的失败结果而被拒绝。本文提出 NeuronFuzz,一个白盒模糊测试框架,它利用内部安全神经元作为连续执行反馈,用于大语言模型的安全评估。安全预言机(SafetyOracle)将安全神经元的激活转换为连续的安全警报分数,作为模糊测试的反馈,并可在预填充阶段获取,从而无需在模糊测试循环中生成响应。为了构建安全预言机,NeuronFuzz 使用与模板无关的有害和良性输入,并采用稳定性感知选择来识别一组紧凑的安全神经元,其激活能捕获有害意图识别。此外,由于安全警报分数可微分,NeuronFuzz 利用其梯度定位安全敏感的模板位置,并通过掩码语言模型生成流畅、上下文兼容的变异,同时保留原始有害载荷并避免额外的优化变量。我们在 21 个文本和多模态模型上评估了 NeuronFuzz。在五个白盒源模型中,它实现了 76-100% 的越狱发现率,比基线方法高出最多 48 个百分点。其优化后的模板还能零样本迁移到开源权重和六个专有目标模型,平均攻击成功率(ASR)和前 5 集成 ASR(EASR)分别达到 69.6%/92.6% 和 44.1%/60.0%。 ## 1 引言 大语言模型(LLMs)正日益部署在直接与用户交互的应用中。为防止滥用,现代大语言模型经过了*安全对齐*训练,以识别有害请求并抑制不安全响应。然而,对齐后的模型仍然容易受到精心设计的对抗性提示(即*jailbreaks*)攻击,这些攻击能绕过安全机制并诱发有害内容[64 (https://arxiv.org/html/2608.26222#bib.bib4), 55 (https://arxiv.org/html/2608.26222#bib.bib7)]。随着大语言模型及其对齐策略的持续演进,系统性地识别此类安全故障已成为部署前评估模型稳健性的重要环节。 现有的大语言模型安全测试大致可分为手动和自动化两类。手动红队测试依赖于人类设计的策略,如角色扮演、指令冲突、拒绝抑制和语境框架[25 (https://arxiv.org/html/2608.26222#bib.bib8), 36 (https://arxiv.org/html/2608.26222#bib.bib5), 64 (https://arxiv.org/html/2608.26222#bib.bib4), 55 (https://arxiv.org/html/2608.26222#bib.bib7)]。虽然手动测试能有效暴露个别弱点,但它需要大量人力投入和领域专业知识,限制了可探索输入的规模和多样性。 自动化方法通过算法生成或优化越狱提示来提高可扩展性。例如,AutoDAN [35 (https://arxiv.org/html/2608.26222#bib.bib3)] 通过分层遗传优化来演化提示;PAIR [11 (https://arxiv.org/html/2608.26222#bib.bib9)] 使用攻击者大语言模型迭代地根据目标模型响应和外部评判来精炼攻击。另一类自动化测试借鉴了模糊测试——一种广泛应用于软硬件测试的技术[37 (https://arxiv.org/html/2608.26222#bib.bib1), 68 (https://arxiv.org/html/2608.26222#bib.bib83)]——并将其应用于大语言模型安全评估[76 (https://arxiv.org/html/2608.26222#bib.bib10)]。大语言模型模糊测试器使用基于语言的操作(如重述、缩短和扩展)迭代地变异越狱模板,并根据响应级别的安全评估反馈保留有希望的候选提示。通过重复的变异和选择,它们可以逐渐发现更有效的越狱模板。 尽管搜索策略不同,这些方法都遵循相同的评估范式:每个候选提示都提交给目标大语言模型;生成响应,然后由分类器、启发式检测器或大语言模型评判器进行评估。然而,这种响应级范式为自动化安全测试带来了两个根本性限制: (i) 稀疏的搜索反馈:响应级评估几乎不提供关于*一个不成功的候选提示有多接近成功*的信息。这个问题在强对齐模型上尤为严重,因为大多数变异提示都被拒绝,并因此收到相同的失败结果。然而,这些候选提示对模型底层安全行为的影响可能大不相同:一个可能使安全机制基本保持不变,而另一个可能在尚未产生成功越狱的情况下显著削弱了安全机制。响应级反馈无法区分它们,使得模糊测试器在保留和进一步探索哪些候选提示方面指导有限。增加查询预算并不能从根本上解决这个问题,因为反馈本身仍然是稀疏的。 (ii) 昂贵的响应生成:评估每个候选提示都需要自回归解码,这比仅处理输入提示要昂贵得多[26 (https://arxiv.org/html/2608.26222#bib.bib22), 32 (https://arxiv.org/html/2608.26222#bib.bib82)]。基于响应的方法可能在生成后还会调用外部分类器或大语言模型评判器。由于自动化模糊测试器需要反复评估大量候选提示,完整的响应生成成为主要的可扩展性瓶颈。因此,一个高效的模糊测试器需要一种能在*响应生成之前*评估候选提示的反馈信号。 我们的方法和贡献:为解决这些限制,我们提出了 NeuronFuzz,一个白盒模糊测试框架,它使用内部安全神经元激活作为连续执行反馈。受覆盖率引导模糊测试[79 (https://arxiv.org/html/2608.26222#bib.bib71)] 启发,NeuronFuzz 构建了一个轻量级安全预言机(SafetyOracle),它在预填充阶段将一组紧凑的稳定安全神经元映射到一个连续的安全警报分数。为确保该信号捕获的是有害意图而非越狱模板的假象,我们使用与模板无关的有害-良性对和稳定性感知选择来识别安全神经元。安全预言机消除了为中间候选提示生成响应的需要,即使当它们共享相同的响应级失败结果时,也能区分有希望的变异。此外,其可微分的分数允许 NeuronFuzz 通过梯度定位安全敏感的模板位置,同时掩码语言模型生成上下文兼容的替换词,在保留有害载荷和自然语言结构的同时进行变异。 我们的主要贡献如下: - • 我们引入了一种新的大语言模型模糊测试视角,*将安全神经元用作执行反馈*,用预填充阶段可用的连续内部反馈取代了昂贵且稀疏的响应级评估。 - • 我们设计了一个轻量级的安全预言机,基于模板无关的激活提取和稳定性感知的安全神经元选择。其可微分的安全警报分数既指导候选提示排序,也指导安全敏感模板位置的梯度定位。 - • 我们开发了 NeuronFuzz,它将仅使用预填充的安全预言机反馈与梯度引导的掩码词元变异相结合,在保留有害载荷和自然语言结构的同时,高效地探索越狱模板。 - • 我们在 21 个文本和多模态模型上进行了广泛的评估。NeuronFuzz 持续提高了相比代表性基线的越狱发现率,并且其优化后的模板可以在不同模型系列、专有 API、数据集和视觉安全任务之间迁移。 论文其余部分的结构如下。第 2 节 (https://arxiv.org/html/2608.26222#S2) 提供了大语言模型安全评估和模糊测试的背景。第 3 节 (https://arxiv.org/html/2608.26222#S3) 介绍了动机、威胁模型以及安全预言机和 NeuronFuzz 的设计。第 4 节 (https://arxiv.org/html/2608.26222#S4) 描述了实现和实验设置。第 5 节 (https://arxiv.org/html/2608.26222#S5) 报告了主要结果,第 6 节 (https://arxiv.org/html/2608.26222#S6) 展示了消融研究。第 7 节 (https://arxiv.org/html/2608.26222#S7) 评估了输入防御和安全预言机的防御性用途。最后,第 8 节 (https://arxiv.org/html/2608.26222#S8) 对论文进行了总结。 ## 2 预备知识 ### 2.1 大语言模型安全评估 对齐的大语言模型(LLMs)被训练来拒绝有害请求,但其安全稳健性仍需要在部署前后进行系统评估。大语言模型安全评估考察模型在面临具有挑战性或对抗性输入时是否继续遵循其安全策略[64 (https://arxiv.org/html/2608.26222#bib.bib4), 55 (https://arxiv.org/html/2608.26222#bib.bib7)]。一个常见的越狱测试由一个有害载荷和一个越狱模板组成[21 (https://arxiv.org/html/2608.26222#bib.bib80), 43 (https://arxiv.org/html/2608.26222#bib.bib81)]。载荷指定了有害请求,而模板改变了请求呈现给模型的方式。相同的模板可以与不同的载荷结合,以检验安全弱点是否在跨有害任务中泛化。 现有方法大致可分为三类:手动测试、自动化测试和内部安全分析。 手动测试。早期的大语言模型安全测试主要依赖于手动设计的对抗性提示。人类测试员使用角色扮演、虚构场景、指令冲突、拒绝抑制和情感框架等策略来构建提示,以探测模型对齐中的弱点[55 (https://arxiv.org/html/2608.26222#bib.bib7), 36 (https://arxiv.org/html/2608.26222#bib.bib5), 64 (https://arxiv.org/html/2608.26222#bib.bib4), 25 (https://arxiv.org/html/2608.26222#bib.bib8)]。这些测试易于解释,并表明即使是提示上下文的微小变化也可能显著影响模型行为[6 (https://arxiv.org/html/2608.26222#bib.bib74)]。然而,手动测试需要大量人力和领域知识,这限制了可探索测试用例的数量和多样性。 自动化安全测试。自动化方法通过算法生成或精炼越狱提示来减少这种手动工作量。不同的方法采用不同的优化策略。AutoDAN 使用分层遗传算法在句子和词语级别演化越狱提示[35 (https://arxiv.org/html/2608.26222#bib.bib3)];PAIR 使用攻击者大语言模型根据目标模型响应和外部评判迭代精炼提示[11 (https://arxiv.org/html/2608.26222#bib.bib9)];LLM-Fuzzer 则自动生成现有越狱模板的变体[76 (https://arxiv.org/html/2608.26222#bib.bib10)]。尽管优化过程不同,这些方法都旨在以更少的人工干预产生有效的安全测试用例。它们的有效性通常根据目标模型的生成响应来判断,提供了测试用例是否成功绕过模型安全策略的外部度量。 内部安全分析。除了模型输出,先前研究表明安全相关信息也在内部表示中。有害和良性输入可以产生不同的激活模式,而拒绝行为可能与特定的表示方向或内部组件相关[62 (https://arxiv.org/html/2608.26222#bib.bib12), 7 (https://arxiv.org/html/2608.26222#bib.bib11), 47 (https://arxiv.org/html/2608.26222#bib.bib13), 52 (https://arxiv.org/html/2608.26222#bib.bib14), 72 (https://arxiv.org/html/2608.26222#bib.bib15)]。更近期的神经元级研究进一步表明,这些信息可以定位到一组紧凑的神经元子集,其激活能选择性地区分有害和良性输入[67 (https://arxiv.org/html/2608.26222#bib.bib6), 27 (https://arxiv.org/html/2608.26222#bib.bib16)]。操纵这些神经元或相关内部组件可以显著改变模型的安全行为,这证明它们与安全和拒绝功能相关[67 (https://arxiv.org/html/2608.26222#bib.bib6), 27 (https://arxiv.org/html/2608.26222#bib.bib16), 73 (https://arxiv.org/html/2608.26222#bib.bib19), 66 (https://arxiv.org/html/2608.26222#bib.bib20), 61 (https://arxiv.org/html/2608.26222#bib.bib21)]。这些发现表明,内部激活暴露了从最终响应中无法直接观察到的安全相关信息。我们的工作基于这一观察,使用与安全相关的神经元激活作为自动化安全测试的信号,而不修改模型的内部状态。 ### 2.2 模糊测试 模糊测试是一种自动化测试技术,通过反复生成随机测试输入来暴露程序的异常行为和安全漏洞[37 (https://arxiv.org/html/2608.26222#bib.bib1)]。根据从目标程序获得的信息量,模糊测试方法大致可分为黑盒、灰盒或白盒。一个覆盖率引导的灰盒模糊测试过程[79 (https://arxiv.org/html/2608.26222#bib.bib71), 15 (https://arxiv.org/html/2608.26222#bib.bib72)]通常包含四个组件:种子语料库和调度器[12 (https://arxiv.org/html/2608.26222#bib.bib77)]、输入变异器[31 (https://arxiv.org/html/2608.26222#bib.bib78)]、运行时插桩[79 (https://arxiv.org/html/2608.26222#bib.bib71)]和执行反馈[9 (https://arxiv.org/html/2608.26222#bib.bib79)]。模糊测试过程始于一个初始种子输入的语料库。在每次迭代中,调度器根据调度策略为种子分配能量值。根据反馈,那些达到新覆盖目标的种子输入会获得更高的能量,更有可能被选中进行下一次变异。变异器随后修改选定的种子以生成新的测试,这些测试由目标程序执行。一个预言机[8 (https://arxiv.org/html/2608.26222#bib.bib84)]随后判断执行是否揭示了异常行为(例如,程序崩溃)。通过反复使用执行信息更新种子选择和变异,模糊测试器可以逐步探索程序的执行空间。 大语言模型模糊测试将这种反馈引导过程应用于自然语言安全测试[76 (https://arxiv.org/html/2608.26222#bib.bib10)]。越狱模板可以作为初始种子,而基于语言的变异器通过扩展、重述或缩短等操作生成新的模板变体。目标程序是一个大语言模型,成功的测试对应于生成的响应违反了预期的安全策略。生成的响应使用分类器、启发式规则或大语言模型评判器进行评估,这些作为响应级预言机[11 (https://arxiv.org/html/2608.26222#bib.bib9), 76 (https://arxiv.org/html/2608.26222#bib.bib10), 35 (https://arxiv.org/html/2608.26222#bib.bib3)]。评估结果随后用于决定哪些提示应该被保留并进一步探索。然而,这种响应级范式在大语言模型安全评估中存在两个局限。首先,每个提示必须生成响应后才能被评估,引入了重复的解码和评估开销。其次,由此产生的反馈为区分那些具有
相似文章
Latent Fusion Jailbreak: 混合有害与无害表征以诱发不安全的大语言模型输出
介绍Latent Fusion Jailbreak(LFJ),一种白盒攻击方法,通过混合大语言模型隐藏状态中有害提示与无害提示的表征,达到94.13%的攻击成功率。同时提出一种潜在对抗训练防御方法,将攻击成功率降低至12.37%。
少量神经元揭示LLM何时误用工具:面向可靠工具使用的稀疏检测与选择性引导
本文介绍了PRISMS,一种利用少量针对特定失败的MLP神经元,通过稀疏读出检测和引导LLM工具使用错误(过度调用、缺失调用、无效参数)的框架,从而提升多个模型系列的工具使用可靠性。
FUSE:大语言模型危险能力评估框架
FUSE是一个统一框架,用于评估大语言模型的危险能力,包括知识、防御和危害维度。研究发现,尽管对齐取得进展,但新模型的危险能力有所增加,并提供了跨模型比较。
对Gleam编译器的模糊测试
本文探讨了模糊测试技术,包括基于LLM的和结构感知模糊测试,以发现Gleam编译器中的错误,该编译器可以编译为JavaScript和Erlang,并具有静态类型。
控制平面才是关键:LLM 时代重访 autofz
作者重新审视了 autofz 元模糊测试工具,认为其控制平面编排方法(管理多个不完善的 worker)在 LLM 时代对安全自动化越来越重要,即便具体的模糊测试技术在不断演进。