通过低秩防御和电路引导代理的高效LLM对抗训练

arXiv cs.LG 论文

摘要

本文提出了针对LLM潜在对抗训练(LAT)的计算高效策略,利用低秩表示微调和电路引导代理模型,将每步FLOPs减少48.1%,同时仅需0.0118%的可训练参数。

arXiv:2607.28959v1 公告类型:新 摘要:对抗训练是抵御对抗攻击最有效的防御方法之一,但在现代规模下,其计算成本仍然高得令人望而却步,尤其是对于大型语言模型(LLM)。尽管已有缓解策略(如潜在对抗训练(LAT))被开发出来,但它们仍然会产生高昂的计算成本。在这项工作中,我们从两个互补的角度全面研究了加速LAT的计算高效策略:(1)防御方优化:我们探索了LAT中的表示微调(ReFT),并揭示了如果应用ReFT的令牌与攻击之间存在不匹配,可能会产生潜在问题。(2)攻击方优化:在每次LAT迭代中计算对抗攻击时,我们仅从LLM中提取相关电路来构建轻量级代理模型,从而避免在攻击生成过程中对完整模型进行前向-后向传播的计算。对于这两个角度,我们都提供了理论论证和数值证据来说明所提出策略的有效性。最终,与使用全量微调的标准LAT相比,我们的方法平均将每步对抗训练FLOPs减少了48.1%,同时仅需0.0118%的可训练参数。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:34

# 基于低秩防御和电路引导代理的高效LLM对抗训练
来源:https://arxiv.org/html/2607.28959
Weiyi He Yuping Lin Jiliang Tang Yue Xing
密歇根州立大学
\{heweiyi, linyupin, tangjili, xingyue1\}@msu\.edu
###### 摘要
对抗训练是抵御对抗攻击最有效的防御手段之一,但在现代模型规模下,其计算成本仍然高得令人望而却步,尤其是对于大型语言模型 \(LLMs\)。尽管已有多种缓解策略(例如潜在对抗训练 \(LAT\))被提出,但它们依然引入了高昂的计算成本。在这项工作中,我们从两个互补的视角全面研究计算高效策略以加速 LAT:(1)防御端优化:我们探讨了在 LAT 中应用表示微调 \(ReFT\),并揭示了如果在应用 ReFT 的 token 与攻击对象之间存在不匹配时可能出现的问题。(2)攻击端优化:在每次 LAT 迭代中计算对抗攻击时,我们仅从 LLM 中提取相关电路来构建轻量级代理模型,从而避免在攻击生成过程中对完整模型进行前向-反向传播。对于这两个视角,我们都提供了理论证明和数值证据,以说明所提出策略的有效性。最终,与使用全量微调的标准 LAT 相比,我们的方法平均将每步对抗训练的 FLOPs 降低了 48.1%,同时仅需 0.0118% 的可训练参数。

## 1 引言

大型语言模型 \(LLMs\) 在各种任务上取得了显著性能,但仍然极易受到对抗攻击的影响——攻击者可通过精心设计的提示词操纵模型输出(Zou et al., 2023b (https://arxiv.org/html/2607.28959#bib.bib1);Yu et al., 2023 (https://arxiv.org/html/2607.28959#bib.bib2);Andriushchenko et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib3))。这些漏洞对现实部署构成了严重风险,因此鲁棒的防御机制至关重要。例如,近期报告显示,间接提示注入可以通过被污染的外部内容劫持使用工具的 LLM 系统,例如针对 Gemini 的恶意日历邀请;类似缺陷也被利用来诱导 AI 编程代理执行不安全的后续操作(Burgess, 2025 (https://arxiv.org/html/2607.28959#bib.bib59);Hart, 2026 (https://arxiv.org/html/2607.28959#bib.bib63))。为了确保 LLM 的鲁棒性,最有效的防御方法之一是对抗训练(Xing et al., 2021 (https://arxiv.org/html/2607.28959#bib.bib12);Zhao et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib11)),即在对抗样本上训练 LLM,使其更好地抵御对抗输入。然而,将对抗训练扩展到现代 LLM 在计算上不可行。其成本来源于两个方面:(i)训练期间需要更新大量模型参数;(ii)需要反复运行完整模型,通过在 token 空间中进行迭代优化来生成对抗样本(Zou et al., 2023b (https://arxiv.org/html/2607.28959#bib.bib1);Howe et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib7))。近期工作提出了潜在对抗训练 \(LAT\)(Xhonneux et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib6);Sheshadri et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib4);Casper et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib5)),该方法扰动词元空间的离散优化,转而扰动连续隐藏表示。这使得优化比 token 级对抗样本生成容易得多,但计算瓶颈仍然显著:在 Kaplan FLOPs 估计下(Kaplan et al., 2020 (https://arxiv.org/html/2607.28959#bib.bib56)),仅以内循环使用投影梯度下降 \(PGD\)(Madry et al., 2017 (https://arxiv.org/html/2607.28959#bib.bib13))进行 8 步攻击就约占 LAT 计算的 80%。参见图1说明:

图1:一种天真的潜在防御只保护最后一层的最后一个 token,效果不佳。当防御覆盖一个后缀窗口并远离模型末端时,鲁棒性会显著提高。

虽然 LoRA 和表示微调 \(ReFT\)(Wu et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib8);Ren et al., 2025 (https://arxiv.org/html/2607.28959#bib.bib9);Zeng et al., 2025 (https://arxiv.org/html/2607.28959#bib.bib10))等参数高效训练策略已被广泛采用,但在将它们应用到 LAT 中时仍存在显著差距。(G1)在防御端(即更新模型参数以增强鲁棒性),ReFT 比 LoRA 需要更少的可训练参数,因此是高效对抗训练的有力候选。然而,标准 ReFT 通常对任务相关位置施加干预,有时只对特定隐藏层(通常不是最后一层)的最后一个 token 进行干预。由于对抗攻击可能扰动多个 token,目前尚不清楚这种位置受限的干预能否有效防御多 token 攻击。(G2)在攻击端,虽然 ReFT 和其他参数高效方法降低了模型参数更新的成本,但它们并未解决攻击生成本身的计算负担:计算对抗扰动仍然需要在每个训练步骤中对完整模型进行迭代前向-反向传播。为解决这些差距,我们遵循 Howe et al. (2024) (https://arxiv.org/html/2607.28959#bib.bib7) 的做法,研究以 token 级后缀攻击为重点的分类设置对抗鲁棒性。我们从理论和实证两个角度系统地探索了在防御端和攻击端降低 LAT 计算成本的策略。我们的贡献如下:

- •防御端:我们提出了 LAT-ReFT,一种将 ReFT 集成到 LAT 中的参数高效潜在防御方法。为了分析(G1),如图1 (https://arxiv.org/html/2607.28959#S1.F1) 所示,当干预被添加到被攻击 token 的后缀窗口上时,攻击成功率要低得多。我们进一步在理论上证明,单 token 防御是不够的:注意力机制允许来自更早后缀位置的攻击泄漏到被防御的输出中(定理1 (https://arxiv.org/html/2607.28959#Thmtheorem1))。随后我们推导了多 token 后缀窗口 ReFT 能够可证明地抑制这种泄漏的条件(定理2 (https://arxiv.org/html/2607.28959#Thmtheorem2))。实证结果表明,所提出的算法在降低计算成本方面是有效的。
- •攻击端:受机制可解释性研究(该研究表明模型行为由稀疏电路决定)的启发(Wang et al., 2022 (https://arxiv.org/html/2607.28959#bib.bib18);Elhage et al., 2022 (https://arxiv.org/html/2607.28959#bib.bib17);Hanna et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib15);Chen et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib16)),我们开发了一种电路引导的代理攻击策略以克服(G2):在修剪后的代理模型上生成攻击,然后将其迁移到完整模型。关键挑战在于平衡效率和可迁移性:朴素剪枝虽然能加速攻击生成,但会严重削弱攻击效果。受此前工作的启发(Molchanov et al., 2016 (https://arxiv.org/html/2607.28959#bib.bib60), 2019 (https://arxiv.org/html/2607.28959#bib.bib61);Syed et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib21)),我们开发了一种激活-梯度重要性评分方法 ActGrad 来识别攻击关键神经元,并在定理3 (https://arxiv.org/html/2607.28959#Thmtheorem3) 中对其进行了理论验证。实证结果表明,剪除 25% 的 MLP 神经元可以保留与攻击相关的几何结构,同时将内循环成本降低约 20%。结合我们的防御端策略,与使用全量微调的标准 LAT 相比,我们平均实现了 48.1% 的整体计算量削减。
- •统一洞察:尽管防御和攻击组件通过不同的机制运作,但它们揭示了一个共同的逐层模式:有效的 ReFT 干预应放置在早期或中间层,而不是非常靠后的层;同样,攻击代理保留的重要神经元也主要来自早期和中间层。这一观察与近期可解释性证据大体一致,即 Transformer 的后期层通常具有有限的功能复杂性(Skean et al., 2025 (https://arxiv.org/html/2607.28959#bib.bib20);Queipo-de-Llano et al., 2025 (https://arxiv.org/html/2607.28959#bib.bib55)),并为高效对抗训练设计提供了实用指导。

## 2 相关工作

#### 面向 LLM 的对抗训练。
对抗训练 \(AT\) 是一种广泛使用的模型鲁棒性改进方法,通过在最坏情况扰动下优化性能来实现(Madry et al., 2017 (https://arxiv.org/html/2607.28959#bib.bib13);Shafahi et al., 2019 (https://arxiv.org/html/2607.28959#bib.bib26);Wong et al., 2020 (https://arxiv.org/html/2607.28959#bib.bib27);Andriushchenko and Flammarion, 2020 (https://arxiv.org/html/2607.28959#bib.bib28))。在 LLM 的语境下,AT 通常涉及在离散 token 空间中生成对抗提示,这会产生高昂的计算成本(Ebrahimi et al., 2018 (https://arxiv.org/html/2607.28959#bib.bib29);Zou et al., 2023b (https://arxiv.org/html/2607.28959#bib.bib1);Howe et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib7))。为了解决这一挑战,近期工作提出了连续对抗训练 \(CAT\),即在嵌入空间施加对抗扰动(Xhonneux et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib6);Dékány et al., 2025 (https://arxiv.org/html/2607.28959#bib.bib23))。这使得高效的基于梯度的优化成为可能,从而降低了对抗样本生成的成本。后续工作进一步将该框架扩展到攻击 LLM 中间层的潜在表示(Sheshadri et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib4);Casper et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib5))。近期的理论分析也为这种连续扰动的有效性提供了支持(Fu and Wang, 2026 (https://arxiv.org/html/2607.28959#bib.bib24))。

#### 表示工程。
表示工程研究如何通过直接操作内部激活来控制模型行为,而不是更新所有模型参数(Zou et al., 2023a (https://arxiv.org/html/2607.28959#bib.bib30))。已有工作表明,LLM 中的隐藏表示编码了丰富的语义和行为信息,修改这些表示可以有效地引导模型输出(Turner et al., 2023 (https://arxiv.org/html/2607.28959#bib.bib31);Zheng et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib32);Lin et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib33);Arditi et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib34))。在这一研究方向中,表示微调 \(ReFT\) 通过学习激活空间中的局部低秩干预,提供了一种参数高效的适配机制(Wu et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib8))。后续研究进一步表明,这种表示级更新可以作为全参数微调的有效替代方案(Ren et al., 2025 (https://arxiv.org/html/2607.28959#bib.bib9);Zeng et al., 2025 (https://arxiv.org/html/2607.28959#bib.bib10))。这与我们的设置密切相关,因为潜在对抗防御也直接作用于内部表示,因此自然受益于参数高效的激活级干预。

#### 机制可解释性与电路。
机制可解释性旨在识别负责特定模型行为的内部组件和计算路径(Chen et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib16);Lee et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib36);Sharkey et al., 2025 (https://arxiv.org/html/2607.28959#bib.bib35))。该领域的一个反复出现的发现是,LLM 中的许多行为是由相对稀疏的电路或局部子网络介导的,而不是均匀分布在所有参数中(Wang et al., 2022 (https://arxiv.org/html/2607.28959#bib.bib18);Hanna et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib15);Patel et al., 2025 (https://arxiv.org/html/2607.28959#bib.bib37))。为了研究这种局部性,已有工作开发了定位和验证重要组件的方法(Vig et al., 2020 (https://arxiv.org/html/2607.28959#bib.bib38);Frantar and Alistarh, 2023 (https://arxiv.org/html/2607.28959#bib.bib39))。在我们的工作中,这些发现启发我们通过聚焦于与对抗行为表达最相关的模型组件来减少对抗优化所用的计算量。

## 3 预备知识

#### Transformer。
一个仅解码器的 Transformer(Vaswani et al., 2017 (https://arxiv.org/html/2607.28959#bib.bib22))将输入 token 序列 \(x=[x_1,\dots,x_T]\) 映射到输出 logits。令 \(\mathbf{h}_t^l\in\mathbb{R}^d\) 表示 token \(t\) 在层 \(l\in[L_{\mathrm{all}}]\) 的隐藏表示。每一层包含一个自注意力块和一个带残差连接的 MLP 块。为了简化记号,我们将层更新写为
\(\mathbf{h}_t^l = \mathbf{h}_t^{l-1} + \mathbf{a}_t^l + \mathbf{m}_t^l\),
其中 \(\mathbf{a}_t^l\) 和 \(\mathbf{m}_t^l\) 分别表示注意力更新和 MLP 更新。

#### 潜在对抗训练 \(LAT\)。
令 \(f_\theta(x)\) 表示参数为 \(\theta\) 的模型对输入 \(x\) 输出的 logits,令 \(\ell(f_\theta(x),y)\) 表示标签 \(y\) 的分类损失。标准对抗训练寻求对最坏情况扰动鲁棒的参数:
\(\min_\theta \mathbb{E}_{(x,y)}\left[\max_{x'\in\mathcal{B}(x,\varepsilon)} \ell(f_\theta(x'),y)\right]\),
其中 \(\mathcal{B}(x,\varepsilon)\) 表示在扰动预算 \(\varepsilon\) 下围绕 \(x\) 的扰动集合。为了节省计算离散攻击 token 的成本,LAT(Sheshadri et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib4);Casper et al., 2024 (https://arxiv.org/html/2607.28959#bib.bib5))改为在连续隐藏空间中执行内部最大化。令 \(\mathbf{H}_l(x;\theta)\in\mathbb{R}^{T\times d}\) 表示输入 \(x\) 在层 \(l\) 的隐藏状态张量。LAT 不直接扰动离散输入,而是在 \(\mathbf{H}_l(x;\theta)\) 的邻域内优化隐藏表示:
\(\min_\theta \mathbb{E}_{(x,y)}\left[\ell(f_\theta(x),y) + \lambda_{\mathrm{adv}} \max_{\widetilde{\mathbf{H}}\in\mathcal{B}(\mathbf{H}_l(x;\theta),\varepsilon)} \ell\bigl(f_\theta(x;\widetilde{\mathbf{H}}),y\bigr)\right]\)。
(1)
这里,\(\mathcal{B}(\mathbf{H}_l(x;\theta),\varepsilon)\) 表示隐藏空间中的邻域,\(f_\theta(x;\widetilde{\mathbf{H}})\) 表示当层 \(l\) 的隐藏表示被替换为 \(\widetilde{\mathbf{H}}\) 时的模型输出。由于内部优化在连续空间中执行,因此相比离散 token 攻击的生成方式,其计算效率更高。

相似文章

潜在递归LLM系统的原理性思考

Hugging Face Daily Papers

本文提出REST,一种针对潜在递归LLM系统的新型训练目标,通过将因果性和最小化等特性融入可微损失中,在基准测试中将准确率提高了多达7.5个百分点。

面向自然语言理解任务的混合对抗防御框架

arXiv cs.CL

来自南安普顿大学和曼彻斯特大学的研究人员提出了一种面向大语言模型的混合对抗防御框架,该框架将基于熵、基于不确定性和基于几何的模型相结合,旨在同时应对自然语言理解任务中的幻觉问题和对抗性攻击漏洞,最终实现了高达 64.92% 的对抗鲁棒性提升和 62.27% 的攻击成功率降低。