无需输入梯度的低秩Householder展开对抗训练方法
摘要
本研究提出了一种新的对抗训练方法,利用低秩Householder展开消除输入梯度需求,从而在降低计算成本的同时,实现与标准技术在小扰动条件下相当的鲁棒性。
arXiv:2608.26963v1 宣布类型:新
摘要:本研究涉及针对训练深度神经网络固有输入不稳定性产生的小范数对抗样本的对抗训练。此类样本在相对 $\ell^2$-范数下较小,因此位于模型近似线性作用的输入邻域内,即扰动保持不可感知的区域。我们首先展示,通过一种称为低秩Householder展开(LRHE)的线性化方法,可以直接从训练好的网络参数计算此类样本,无需输入梯度迭代。该展开描述了组合仿射映射,而非任何单个层,其识别的方向从正向传播中已有的激活模式中读取。然后,我们基于此构造提出了一种简单的对抗训练方案。在整个过程中,不执行对输入的任何微分:训练仅需额外的正向评估,权重参数通过标准反向传播更新,而通常最小-最大化公式中的内部最大化完全被消除。存在这样的正则化器是我们的主要发现:所有放弃内部搜索的方法都通过对输入微分来获取局部几何,我们证明这是不必要的。该正则化器每个epoch的成本相当于2.8个PGD步骤,相对于MNIST上的40步对抗训练减少了8.7倍,并低于3步训练的成本。所得模型在相对 $\ell^2$ 预算 $\varepsilon \le 0.02$ 时匹配三步PGD对抗训练,在 $\varepsilon \le 0.012$ 时匹配40步训练,超过此范围后性能下降,这与展开的局部性一致。
查看缓存全文
缓存时间: 2026/08/28 09:46
# 无需输入梯度的对抗训练:基于低秩Householder展开式 来源:https://arxiv.org/html/2608.26963 Tiana C\. Johnson 地址:华盛顿大学圣路易斯分校数学系,密苏里州圣路易斯市63130 邮箱:[j\.tiana@wustl\.edu](mailto:[email protected]) Donsub Rim 地址:华盛顿大学圣路易斯分校数学系,密苏里州圣路易斯市63130 邮箱:[rim@wustl\.edu](mailto:[email protected]) 日期:2026年8月27日 ###### 摘要 本研究针对由训练好的深度神经网络固有的输入不稳定性所产生的**小范数对抗样本**进行对抗训练。这类样本在相对$\ell^{2}$范数下测量值很小,因此位于模型作用近似线性的输入邻域内——在此区域内扰动仍不可察觉。我们首先展示,此类样本可以直接从训练好的网络参数中计算得出,无需输入梯度迭代,方法是采用一种称为**低秩Householder展开式(LRHE)**的线性化技术。该展开式描述的是复合仿射映射而非任何单层,并且其识别的方向可从**前向传播**中已有的激活模式直接读取。随后,我们基于这一构造提出一种简单的对抗训练方案。**任何阶段都不执行对输入的微分操作**:训练仅需额外的前向评估,权重参数通过标准反向传播更新,并且完全消除了通常极大极小公式中的内层最大化。这类正则化的存在是我们的主要发现:所有放弃内层搜索的方法都通过对输入求导来获取其局部几何信息,而我们证明这并非必要。该正则化每个训练周期的开销相当于2.8次PGD迭代,相比MNIST上40步对抗训练减少了8.7倍,且低于3步训练的成本。所得模型在相对$\ell^{2}$预算$\varepsilon\leq 0.02$时与三步PGD对抗训练相当,在$\varepsilon\leq 0.012$时与40步训练相当,超出该范围后性能下降,这与展开式的局部性一致。 ## 1. 引言 深度神经网络会被人类观察者无法察觉的微小扰动所误导而误分类输入,这一现象的发现已逾十年\[27, 9\],且其解决方案依然难以捉摸。多年来涌现了大量防御方案以及几乎同等数量的证明其无效的案例。对某次会议上提出的防御方案的调查显示\[3\],大多数方案依赖于梯度混淆,一旦这一依赖被识别出来,它们就可被绕过,后续的防御方案也得出了类似结论\[28\]。得以在这一淘汰过程中幸存的是\[15\]中极大极小公式下的**对抗训练**,它在每次参数更新时增加一个内层搜索,以寻找最坏情况扰动。该方法经受住了自适应评估的考验,是后续研究进行对比的标准\[4, 7\]。因此,问题的持续存在并非未知有效防御方法,而是其**成本**。这一成本具有特定且恒定的结构。内层最大化没有闭式解,需用$K$步投影梯度上升来近似,每一步都需要计算损失对输入的梯度,因此对抗训练的开销大约是普通训练的$K$倍。降低这一开销的努力分为三组。第一组跨更新重用计算:扰动可在小批量之间传递,使得对抗更新与参数更新共享一次反向传播\[23\],或通过最优控制公式将内层循环限制在第一层\[35\]。第二组直接减小$K$(通常减至1),然后修补由此产生的不稳定性;FGSM结合随机初始化和周期性学习率已被证明足够\[34\],单步方法出现的灾难性过拟合可以通过惩罚梯度错位来预防\[2\]。第三组完全放弃内层最大化,代之以对损失局部几何的惩罚:输入梯度正则化\[22\]、雅可比矩阵正则化\[11\]、曲率正则化\[17\]以及局部线性正则化\[18\](后者明确以几何惩罚换取投影梯度下降步数的减少)。这些看似迥异的方法的共同点在于,**它们获取网络局部行为信息的方式都是通过对输入求导**。区别仅在于导数的次数,而非是否求导。我们证明,对于相对$\ell^{2}$范数较小的扰动,这并非必要。 我们的起点是\[21\]中引入的**低秩Householder展开式(LRHE)**。ReLU网络是分段仿射的。在输入空间中激活模式保持不变的区域,网络表现为单个仿射映射。具体而言,可以写出一个前馈ReLU神经网络(省略偏置项),其形式为矩阵乘积 $$ F = W_L \Sigma_{L-1} W_{L-1} \cdots \Sigma_1 W_1, \tag{1.1} $$ 其中每个$\Sigma_{\ell}$是记录第$\ell$层哪些单元激活的对角0-1矩阵,$W_{\ell}$是权重矩阵。激活模式的改变通过一个秩一的项扰动网络的局部作用。为理解这一点,固定一层$\ell$,将乘积(1.1)在$\Sigma_{\ell}$处分割: $$ F = C_{\ell} \Sigma_{\ell} B_{\ell}, \quad C_{\ell} = W_L \Sigma_{L-1} \cdots W_{\ell+1}, \quad B_{\ell} = W_{\ell} \Sigma_{\ell-1} \cdots \Sigma_1 W_1, \tag{1.2} $$ 于是$B_{\ell}$收集了第$\ell$层之前的因子,$C_{\ell}$收集了之后的因子。假设输入跨越一个激活边界移动,使得第$\ell$层的单元$i$从激活变为不激活,而其他单元状态保持不变。则$\Sigma_{\ell}$被替换为$\Sigma_{\ell} - e_i e_i^\top$,其中$e_i$是第$i$个标准基向量。网络在新区域的矩阵表示为 $$ F_1 = C_{\ell}(\Sigma_{\ell} - e_i e_i^\top)B_{\ell} = F - (C_{\ell}e_i)(B_{\ell}^\top e_i)^\top. \tag{1.3} $$ 因此扰动是秩一的,左因子为$C_{\ell}e_i$,右因子为$B_{\ell}^\top e_i$,即$C_{\ell}$的第$i$列和$B_{\ell}$的第$i$行。出现在(1.3)中的右因子$B_{\ell}^\top e_i$是输入空间中的向量,正是它们决定了复合映射敏感的方向。注意它们可从**前向传播**中获得:$B_{\ell}$是第$\ell$层以下的部分复合,$e_i$选择所讨论的单元。通过(1.3),一个单元的激活对输出的影响变得清晰,且任何阶段都不涉及对输入的微分。 LRHE通过进一步利用这一特性推导得出。将$\Sigma_{\ell}$以形式$I - v_{\ell} v_{\ell}^\top$(其中$v_{\ell}$是单位向量)视为恒等矩阵的秩一扰动。该展开的关键在于如何通过将ReLU激活重写为Householder反射来找到$v_{\ell}$。反射向量不是学习得到的,它们在前向传播过程中计算,无需微分。该展开描述的是扰动隐藏状态对复合映射$B_{\ell}$或$C_{\ell}$的影响,而非任何单个层,因此它识别的方向是整个网络放大的方向,而非某个权重矩阵$W_{\ell}$。文献\[21\]已表明,在海啸波形预测任务\[20\]中发现的对抗样本在这些基方向上具有显著分量。本工作将该构造视为给定,并提出一个不同的问题:它识别的子空间是否就是分类任务中对抗扰动所处的子空间,以及仅关注该子空间是否足以训练出鲁棒模型。 由此得出两个结论。首先,此类小范数对抗样本可以直接从训练好的参数构造,完全无需输入梯度迭代。其次,也是本工作剩余部分的主题,针对它们的对抗训练简化为一个最小化问题:内层搜索消失,网络因其沿一组在每次前向传播时重新计算的方向上的响应而受到惩罚,且训练过程中任何阶段都不进行对输入的微分。 由于LRHE能够识别对抗扰动的线性子空间,这可以用于通过限制内层最大化来降低对抗训练的成本。因此,我们的方法属于上述第三组,但不同之处在于其几何信息的来源。曲率、雅可比矩阵和局部线性惩罚都是**测量**得到的,每种方法都需要超出标准训练的导数评估,因此相对于多步PGD的节省是真实但部分的。而展开式则以代数方式提供相关子空间。如此限制的可能性,早期观察\[29\]已有所暗示:对抗扰动占据一个连续的子空间,其维度远低于输入维度,在MNIST规模下约为几十维。如果对抗相关方向如此之少,在每一步搜索整个输入空间是浪费的。子空间对抗训练\[14\]得出了相关结论,但其从优化轨迹中提取子空间,并在参数空间工作;我们的方法由输入处的网络结构决定,且位于输入空间。第二个区别将我们的方法与**可证明鲁棒性**文献区分开来,后者通过单独约束每一层来控制网络的几何性质。Parseval网络\[5\]、谱归一化\[16\]以及\[13, 30, 24\]中的正交卷积构造都在每个权重矩阵上施加范数或正交条件,使得复合映射的Lipschitz常数受限于逐层界限的乘积;该计划在\[25, 26\]中扩展到激活。全局保证源于纯局部条件,证书作为副产品获得。代价是乘积界限是**松散**的。对于映射(1.1),估计$\|F\| \leq \prod_{\ell} \|W_{\ell}\|$仅在相继因子的主要奇异方向对齐时等号成立,而它们通常并不对齐,朴素界限与真实常数的距离已在\[33, 8\]中记录。因此,逐层约束的网络比鲁棒性目标要求的约束更紧,其多余部分以表达能力为代价支付。 我们的方法作用于乘积而非其因子。展开式是$F$自身的展开,因此无需任何层正交或范数有界,无需替换任何激活,网络以通常方式训练。我们未获得证书,因为我们未施加可推导出证书的条件;我们获得的是对复合映射敏感位置的描述,其**非保守性**是构造固有的。这也支持了与先前使用Householder反射的工作\[25\]的联系。那里Householder结构是**强加的**:它是激活的设计约束,被精确满足,反射向量是训练参数。此处它是**描述性的**,从无任何直接限制训练的网络中读取。文献\[25\]的定理仍然是对我们选择基的有用独立证明,因为它确立了Householder反射是分段线性网络中跨越激活边界的雅可比矩阵过渡的标准形式。因此,我们的展开不是任意的坐标变换,而是与被逼近映射的内在结构对齐的变换。 我们在MNIST上的实验支持以下主张: 首先,展开式识别的子空间正是对抗扰动所在的子空间:将扰动投影到其正交补空间上,攻击成功率从28.01%降至9.20%,而移除相同维度的随机子空间仅将其降至25.42%(第5节)。 其次,针对这些方向进行训练的开销相当于每个训练周期2.8次PGD迭代,相比40步对抗训练减少了8.7倍,且低于3步训练的成本。 第三,在展开式具有描述性的预算范围内,所得模型与多步抗训练相当:在相对$\ell^{2}$预算$\varepsilon\leq 0.02$时与三步PGD训练的鲁棒性相当,在$\varepsilon\leq 0.012$时与40步训练相当,超出此范围后多步训练领先(第6节)。性能下降与展开式的局部性一致,一旦扰动大到足以离开仿射单元,展开式便不再能描述网络。 我们认为这一**相当性**是实质性的结果。上述第三组中的每种方法都通过对输入求导来获取其关于网络局部行为的信息,人们自然会认为这种微分对于获取该信息至关重要。比较表明情况并非如此:几何信息已存在于激活模式中,一个**从不形成输入导数**的正则化器达到了与需要导数的正则化器相似的性能。
相似文章
通过低秩防御和电路引导代理的高效LLM对抗训练
本文提出了针对LLM潜在对抗训练(LAT)的计算高效策略,利用低秩表示微调和电路引导代理模型,将每步FLOPs减少48.1%,同时仅需0.0118%的可训练参数。
无子空间可追踪:低秩训练中的不可辨识性与优化器状态
本文通过实验证明,在GaLore等低秩训练方法中,梯度的前r维子空间除了一个小的可复现核心外是不可辨识的,估计器噪声主导了表观旋转。文章分析了这对优化器状态传输的影响,并引入了LDAdam,它在困惑度上优于GaLore。
减少信息依赖并不会导致训练数据隐私问题。真正的原因是对抗性非鲁棒特征
本文挑战了普遍认为的死记硬背导致训练数据在重构攻击中暴露的观点,指出真正的原因是对抗性非鲁棒特征。作者引入了AntiAdversarial Training (AT-AT),该训练方法有意学习非鲁棒特征,以实现卓越的重构防御和更高的准确性。
基于低秩进化策略的脉冲神经网络无梯度训练
介绍了一种名为 Eggroll 的低秩进化策略,用于脉冲神经网络的无梯度训练,在 N-MNIST 上减少内存和时间开销,同时达到有竞争力的准确率。
通过梯度手术的持续学习低秩适配器初始化
该论文提出了Slice,一种基于梯度手术的LoRA适配器初始化方法,用于持续学习,通过调和当前任务和过去任务的冲突梯度来减少灾难性遗忘,实现了更好的稳定性-可塑性权衡。