Latent Fusion Jailbreak: 混合有害与无害表征以诱发不安全的大语言模型输出
摘要
介绍Latent Fusion Jailbreak(LFJ),一种白盒攻击方法,通过混合大语言模型隐藏状态中有害提示与无害提示的表征,达到94.13%的攻击成功率。同时提出一种潜在对抗训练防御方法,将攻击成功率降低至12.37%。
arXiv:2508.10029v3 公告类型: replace
摘要: 安全对齐的大语言模型仍然可以通过修改内部表征的白盒干预被操控。我们引入Latent Fusion Jailbreak(LFJ),该方法将有害查询与结构相似但无害的查询配对,然后在精心选择的层和token位置插值它们的隐藏状态。拒绝损失梯度精确确定干预位置,并使用token归一化的服从和拒绝抑制目标优化逐层混合系数。编辑后的提示状态依次通过剩余的Transformer模块。在四个安全基准测试和五个开放权重目标模型上,LFJ在我们描述的白盒协议下达到了94.13%的宏平均攻击成功率(ASR)。由于LFJ直接访问内部状态,与仅提示攻击的比较作为描述性参考而非匹配评估。丢弃拒绝采样使ASR降至86.72%,而将结构化的有害-无害配对替换为随机配对则使其降至27.45%。我们还设计了一种LFJ特定的潜在对抗训练程序,当攻击针对防御模型重新优化时,将ASR从94.13%降低到12.37%。此防御评估不涵盖对其他攻击类型的迁移或良性实用性的保持。
查看缓存全文
缓存时间: 2026/07/20 09:37
# 融合有害与无害表示以诱导不安全的大语言模型输出
来源:https://arxiv.org/html/2508.10029
Wenpeng Xing1,2, Bohan Yang6, Mohan Li3, Chunqiang Hu4, Haitao Xu2, Ningyu Zhang2, Bo Lin1, 和 Meng Han1,2,5
###### 摘要
经过安全对齐的大语言模型仍然可以通过修改其内部表示的白盒干预被操控。我们提出了潜在融合越狱(LFJ),其工作原理是将有害查询与结构相似但良性的查询配对,然后在精心选择的层和 token 位置对它们的隐藏状态进行插值。拒绝损失梯度确定干预的确切位置,我们使用 token 归一化的合规性和拒绝抑制目标来优化逐层的混合系数。编辑后的提示状态顺序传播通过剩余的 Transformer 块。在四个安全基准和五个开放权重目标模型上,LFJ 在我们描述的白盒协议下达到了 94.13% 的宏观平均攻击成功率(ASR)。由于 LFJ 直接访问内部状态,与仅提示攻击的比较作为描述性参考而非匹配评估。放弃拒绝采样会使 ASR 降至 86.72%,而将结构化的有害-良性配对替换为随机配对则使其降至 27.45%。我们还设计了一种 LFJ 特定的潜在对抗训练程序,当攻击针对被防御模型重新优化时,ASR 从 94.13% 降至 12.37%。此防御评估不涵盖对其他攻击类型的迁移或良性效用的保持。
###### 索引术语:对抗训练,隐藏状态插值,越狱攻击,大语言模型,安全对齐。
## I 引言
大语言模型(LLM)现在为广泛的推理、编码和对话任务提供支持[1 (https://arxiv.org/html/2508.10029#bib.bib22),38 (https://arxiv.org/html/2508.10029#bib.bib32),10 (https://arxiv.org/html/2508.10029#bib.bib92)]。后训练技术,特别是基于人类反馈的强化学习(RLHF)[29 (https://arxiv.org/html/2508.10029#bib.bib102),3 (https://arxiv.org/html/2508.10029#bib.bib95)] 和直接偏好优化 [32 (https://arxiv.org/html/2508.10029#bib.bib58)],通常用于教导模型拒绝有害请求。然而,越狱攻击表明这种拒绝行为是脆弱的:推理时的对抗性输入或干预仍然可以提取不安全输出。理解这些失败对于红队评估和构建更强的防御都至关重要。
表 I: 代表性大语言模型越狱攻击对比
大多数自动化越狱是在文本上进行搜索。贪婪坐标梯度(GCG)[50 (https://arxiv.org/html/2508.10029#bib.bib106)] 利用 token 级别的梯度构造对抗性后缀,而 AutoDAN [24 (https://arxiv.org/html/2508.10029#bib.bib47),48 (https://arxiv.org/html/2508.10029#bib.bib93)] 依赖进化或梯度引导的生成。提示自动迭代优化(PAIR)[4 (https://arxiv.org/html/2508.10029#bib.bib39)] 和带剪枝的攻击树(TAP)[27 (https://arxiv.org/html/2508.10029#bib.bib99)] 使用攻击者模型迭代地优化提示。这些方法在访问权限、查询预算和输出形式上差异很大。一些优化的后缀还表现出高困惑度,使其可以被输入过滤器检测到[15 (https://arxiv.org/html/2508.10029#bib.bib85),2 (https://arxiv.org/html/2508.10029#bib.bib67),18 (https://arxiv.org/html/2508.10029#bib.bib20)]。另一个攻击面存在于模型的连续表示空间中。激活引导通过添加或移除残差流中的方向来改变行为[49 (https://arxiv.org/html/2508.10029#bib.bib27),39 (https://arxiv.org/html/2508.10029#bib.bib104)]。例如,RepIt [37 (https://arxiv.org/html/2508.10029#bib.bib3)] 隔离了特定概念的拒绝向量,而“不要说 No”(DSN)[46 (https://arxiv.org/html/2508.10029#bib.bib75)] 是一种提示空间方法,包含显式的拒绝抑制损失。LFJ 采取不同的路径:它为每个有害查询构建一个匹配的良性参考,并且仅在选定位置对配对的提示表示进行插值。LFJ 需要白盒访问隐藏状态及其梯度。它基于拒绝损失选择层和 token,单调地对齐有害和良性 token 序列,并为每个选定的层优化单个插值系数。在四个基准和五个开放权重模型上取平均,LFJ 达到 94.13% 的宏观平均攻击成功率。由于内部状态干预提供了比纯提示接口更强的访问模型,跨接口比较是描述性的而非访问匹配的。消融研究量化了查询配对、层和 token 选择、顺序传播和拒绝采样的贡献。我们进一步探索了一种防御,其中每个目标模型都在动态重新计算的 LFJ 扰动上进行训练,并针对自适应重新优化的 LFJ 攻击进行评估。我们将贡献总结如下:
- •**配对隐藏状态插值:** 我们制定了一种白盒攻击,它结合了查询特定的有害-良性配对、基于梯度的干预点选择和逐层隐藏状态插值(HSI),无需附加文本后缀或估计全局拒绝方向。
- •**组件级评估:** 我们在四个数据集和五个开放权重模型上基准测试 LFJ。消融实验衡量了结构化配对以及 HSI 组件各自贡献的联合效果。
- •**攻击特定防御研究:** 我们在动态重新计算的 HSI 扰动上训练模型,并针对自适应 LFJ 重新优化进行测试。该研究刻画了对 LFJ 风格插值的鲁棒性;向其他攻击的迁移和良性效用的保持仍然是开放问题。
## II 相关工作
我们根据被修改的表示形式对先前工作进行组织:离散提示、连续嵌入或激活,以及模型或系统防御。在推理时威胁的分类下[5 (https://arxiv.org/html/2508.10029#bib.bib5)],LFJ 在提示处理期间作用于最终模型。
### II-A 离散输入优化
早期的越狱依赖于手工制作的提示,包括角色扮演模板如“现在什么都做”(DAN)[36 (https://arxiv.org/html/2508.10029#bib.bib101),41 (https://arxiv.org/html/2508.10029#bib.bib96)]。GCG [50 (https://arxiv.org/html/2508.10029#bib.bib106)] 使用 token 梯度自动化后缀搜索。AutoDAN [24 (https://arxiv.org/html/2508.10029#bib.bib47)] 引入了分层遗传算法来生成可读的提示,而 PAIR [4 (https://arxiv.org/html/2508.10029#bib.bib39)] 通过黑盒查询目标模型迭代地优化提示。离散搜索可能计算量大,并且诸如 GCG 之类的方法会生成高困惑度的后缀,这些后缀会被困惑度过滤器[15 (https://arxiv.org/html/2508.10029#bib.bib85)] 或对抗性后缀过滤 [18 (https://arxiv.org/html/2508.10029#bib.bib20)] 捕获。广网投射 [43 (https://arxiv.org/html/2508.10029#bib.bib2)] 考虑了一种不同的场景,其中攻击者查询多个目标模型,如果其中任何一个返回有害响应,则攻击成功。这些方法在利用的攻击面以及成功的定义上都与 LFJ 不同。
### II-B 潜在和连续优化
基于梯度的分布攻击(GBDA)[11 (https://arxiv.org/html/2508.10029#bib.bib100)] 和投影梯度下降(PGD)攻击 [9 (https://arxiv.org/html/2508.10029#bib.bib97)] 优化 token 嵌入的连续松弛。EBGCG [12 (https://arxiv.org/html/2508.10029#bib.bib21)] 在离散后缀搜索之前执行嵌入空间预优化。对抗性后缀嵌入翻译框架(ASETF)[40 (https://arxiv.org/html/2508.10029#bib.bib54)] 将连续后缀嵌入翻译回文本。DSN 仍然是一种 token 后缀方法,但添加了显式的拒绝抑制损失。其他工作将内部表示视为优化信号或干预表面本身。LARGO [20 (https://arxiv.org/html/2508.10029#bib.bib65)] 优化潜在向量并通过自我反思将其解码为自然语言提示。LatentBreak [28 (https://arxiv.org/html/2508.10029#bib.bib56)] 使用潜在反馈来选择保留含义的单词替换。RepIt [37 (https://arxiv.org/html/2508.10029#bib.bib3)] 直接在残差流中识别并抑制特定概念的拒绝向量。相关技术从安全表示和有害表示之间的差异构建对抗性方向[25 (https://arxiv.org/html/2508.10029#bib.bib55)]。类似的想法也在多模态模型中通过将视觉输入匹配到有害文本表示进行探索[34 (https://arxiv.org/html/2508.10029#bib.bib57),23 (https://arxiv.org/html/2508.10029#bib.bib4)]。
这些方法在接口上不等价。LARGO 和 LatentBreak 最终产生文本,而 RepIt 和 LFJ 干预激活。RepIt 估计一个特定概念的方向;LFJ 则为每个有害查询构建一个量身定制的良性参考。与方向抑制技术相反,LFJ 通过 HSI 融合配对的有害和良性表示。其标志是构建结构同构的良性参考以及选择性、顺序地将该参考与有害流进行插值。表 I (https://arxiv.org/html/2508.10029#S1.T1) 总结了代表性攻击之间的方法论差异。
### II-C 针对越狱的防御
越狱防御在模型、系统或表示级别发挥作用。在模型级别,RLHF [29 (https://arxiv.org/html/2508.10029#bib.bib102)]、直接偏好优化 [32 (https://arxiv.org/html/2508.10029#bib.bib58)] 以及在红队数据上进行对抗性微调 [26 (https://arxiv.org/html/2508.10029#bib.bib64)] 会修改模型参数。在系统级别,Llama Guard [14 (https://arxiv.org/html/2508.10029#bib.bib63)] 过滤输入或输出,SmoothLLM [33 (https://arxiv.org/html/2508.10029#bib.bib62)] 聚合在扰动提示上的响应,而 Erase-and-Check [19 (https://arxiv.org/html/2508.10029#bib.bib60)] 检查提示子序列。表示级别的防御包括 Jailbreak Antidote [35 (https://arxiv.org/html/2508.10029#bib.bib61)],它在运行时干预激活,以及 GradSafe [44 (https://arxiv.org/html/2508.10029#bib.bib59)],它使用梯度来检测越狱尝试。对抗性后缀过滤(ASF)[18 (https://arxiv.org/html/2508.10029#bib.bib20)] 和 SmoothLLM 作用于文本输入,因此它们不能直接移除内部状态干预。这种差异促使我们在第 V 节 (https://arxiv.org/html/2508.10029#S5) 中研究的攻击特定潜在训练程序。
参见说明
图 1:潜在融合越狱(LFJ)和攻击特定防御概述。
顶部:有害查询与结构匹配的良性查询配对。拒绝损失梯度选择层和 token,隐藏状态插值(HSI)混合相应的状态,编辑后的状态通过剩余块传播。有界拒绝采样防止模型完成规范的拒绝短语;一个独立的安全法官评估最终响应。
底部:潜在对抗训练在线重新计算 HSI 扰动,并使用安全目标和良性数据优化模型。
参见说明
图 2:梯度引导的隐藏状态插值(HSI)。
顶部:选择拒绝损失敏感性超过 \( \bar{S} + \sigma_S \) 的层。
中间:在选定的 token 位置,有害残差流与对齐的良性流进行插值。
底部:每个编辑后的状态传播到下一个选定的层,然后通过剩余块。
## III 预备知识
### III-A 符号和问题形式化
令 \( f_\theta \) 为一个安全对齐的 LLM,权重为 \( \theta \)。对于输入 token 序列 \( x = \{x_1, \dots, x_n\} \),模型通过 \( L \) 个堆叠层传递信息,并自回归计算下一个 token 分布。LFJ 作用于残差流。对于 \( l = 1, \dots, L \),令 \( \mathbf{h}_i^{(l)} \in \mathbb{R}^d \) 为 token \( i \) 到 Transformer 块 \( l \) 的输入,并令 \( \mathbf{h}_i^{(L+1)} \) 表示最终块输出。我们将前向传播抽象为
\[
\mathbf{h}_i^{(l+1)} = \operatorname{Block}_l(\mathbf{h}_1^{(l)}, \dots, \mathbf{h}_i^{(l)}),
\tag{1}
\]
其中 \( \operatorname{Block}_l \) 包括自注意力、前馈、归一化和残差操作。本文中我们采用这种输入到块的约定。越狱攻击的目标是针对有害查询 \( q_h \) 获得不安全补全。LFJ 仅将确定性合规延续 \( y(q_h) \) 用作可微优化目标;攻击成功的最终判定来自完整的采样响应,由第 VI-G 节 (https://arxiv.org/html/2508.10029#S6.SS7) 中定义的安全评估器判断。
### III-B 威胁模型
遵循白盒对抗性评估协议[50 (https://arxiv.org/html/2508.10029#bib.bib106)],攻击者可以读取隐藏状态及其梯度,并可以在推理时替换隐藏状态。攻击者不能更改模型架构或其参数。这种能力对于具有可修改推理图的开放权重模型是可行的,但通过标准的闭源模型 API 不可用。它也强于仅提示访问,包括黑盒 PAIR 和基于分数的 AutoDAN。因此,这些实验刻画了在内部状态访问下的脆弱性,而不是相对于较弱接口的部署可行性估计。
攻击是针对每个有害查询实例化的。攻击者知道目标权重、分词器、聊天模板和解码配置,并且可以执行教师强制的前向和反向传播。它可以检查每个 Transformer 块的残差流状态,计算用于选择点的拒绝损失梯度,并在提示预填充期间安装替换块输入的前向钩子。规范短语集和合规目标是攻击配置的一部分。外部安全法官在优化期间不被查询,不提供梯度或接受-拒绝反馈;它仅在生成后用于测量 ASR。
LFJ 受到四个干预约束。第一,它只编辑提示的用户内容位置;系统消息、聊天模板 token、模型权重和文本查询保持不变。第二,每个编辑后的状态被限制在当前有害状态与其对齐的良性参考之间的线段上,因为 \( \alpha^{(l)} \in [0,1] \)。第三,层和 token 掩码从干净有害查询梯度中一次性选择,并在优化查询特定系数时保持固定。第四,HSI 仅在提示预填充期间应用。生成的 token 状态随后不会被插值,尽管有界拒绝短语过滤器可能会在候选 token 进入缓存之前对其进行屏蔽。这些约束将 LFJ 与任意激活替换或参数篡改区分开来。攻击者旨在产生一个独立 judge相似文章
CHASE:基于强化学习的对抗性红蓝对抗提升大语言模型安全性
CHASE 提出了一种共同进化的红蓝对抗框架,利用强化学习增强大语言模型对自适应黑盒对抗攻击的防御能力,在基准测试中将越狱成功率降低43.2%,同时在对良性提示的误拒率保持为零。
隐藏、重建与越狱:利用多模态大语言模型中的重建-隐藏权衡
本文分析了针对多模态大语言模型(MLLMs)的意图混淆越狱攻击中存在的重建-隐藏权衡问题。提出了感知隐藏的变体构建方法和与关键词相关的干扰图像,以更有效地利用模型漏洞。
MJ: 基于分解信用分配的多轮LLM越狱
本文提出了DC-GRPO,一种面向多轮LLM越狱学习的回合级信用分配框架,在多个基准测试中实现了超过98%的攻击成功率,优于现有方法。
面向自然语言理解任务的混合对抗防御框架
来自南安普顿大学和曼彻斯特大学的研究人员提出了一种面向大语言模型的混合对抗防御框架,该框架将基于熵、基于不确定性和基于几何的模型相结合,旨在同时应对自然语言理解任务中的幻觉问题和对抗性攻击漏洞,最终实现了高达 64.92% 的对抗鲁棒性提升和 62.27% 的攻击成功率降低。
大型语言模型中的不完整提示越狱
本文正式定义了不完整提示越狱(IPJ),这是一种漏洞,当不完整的恶意提示导致大型语言模型生成有害的延续内容时,并分析了吸引子类型和神经元层面的防御机制。