梯度能量引导的逐块扰动用于锐度感知最小化

arXiv cs.LG 论文

摘要

本文提出GEAR-SAM,通过使用平方梯度的指数移动平均来自适应地在网络块之间分配扰动预算,在不增加额外计算开销的情况下提升泛化能力。

arXiv:2607.18306v1 公告类型: 新 摘要: 锐度感知最小化(Sharpness-Aware Minimization, SAM)通过最小化局部参数邻域内的最差损失来提升泛化能力。标准SAM根据瞬时小批量梯度范数,隐式地将其全局扰动预算分配到各参数块上。这种分配可能存在噪声,且可能无法反映块在整个训练过程中积累的敏感度。我们提出梯度能量自适应半径SAM(Gradient-Energy Adaptive Radius SAM, GEAR-SAM),该方法维护一个平方块梯度的指数移动平均(EMA),作为一种轻量级的、与曲率相关的敏感度信号,并通过闭式约束优化来分配固定的SAM预算。GEAR-SAM保留了全局SAM半径,无需计算Hessian-向量积或显式Fisher估计,且在SAM基础上仅增加标量状态。在图像分类、迁移学习、噪声标签学习和分区研究上的实验表明,该方法在不同架构和任务上均提升了泛化能力和鲁棒性。更广泛地说,GEAR-SAM提供了一种动态的锐度感知优化视角:固定的扰动预算应根据训练过程中功能网络块敏感度的演变而重新分配。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:19

# Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization  
Source: https://arxiv.org/html/2607.18306  
Zhen Huang, Jiaxin Deng, and Junbiao Pang  
Z. Huang, J. Deng, and J. Pang are with the Faculty of Information Technology, Beijing University of Technology, Beijing, China (e-mail: [email protected]; [email protected]; [email protected]).  
Corresponding author: Junbiao Pang.

###### 摘要

Sharpness-Aware Minimization (SAM) 通过最小化局部参数邻域内的最坏情况损失来改善泛化性能。标准的SAM隐式地根据即时小批量梯度范数将全局扰动预算分配给各参数块。这种分配可能受到噪声影响,且无法反映块在整个训练过程中累积的敏感性。我们提出了梯度能量自适应半径SAM(GEAR-SAM),该方法维护块梯度平方的指数移动平均(EMA)作为轻量级的曲率相关敏感性信号,并通过闭式约束优化来分配固定的SAM预算。GEAR-SAM保留了全局SAM半径,无需Hessian-向量积或显式Fisher估计,并且相比SAM仅增加了标量状态。在图像分类、迁移学习、噪声标签学习以及分块研究上的实验表明,该方法在不同架构和任务上都能提升泛化性能和鲁棒性。更广泛地说,GEAR-SAM提供了锐度感知优化的动态视角:固定的扰动预算应根据训练过程中功能网络块敏感性的变化进行重新分配。

## I. 引言

深度神经网络在优化收敛至更平坦的极小值时,通常能获得更好的泛化能力 [13 (https://arxiv.org/html/2607.18306#bib.bib3), 12 (https://arxiv.org/html/2607.18306#bib.bib5), 1 (https://arxiv.org/html/2607.18306#bib.bib7)]。Sharpness-Aware Minimization (SAM) 通过最小化当前参数局部邻域内的最坏情况损失,显式地鼓励此类解 [6 (https://arxiv.org/html/2607.18306#bib.bib8)]。由于其简洁性和有效性,SAM已成为广泛使用的训练策略,并催生了众多后续方法,包括ASAM [17 (https://arxiv.org/html/2607.18306#bib.bib12)]、GSAM [31 (https://arxiv.org/html/2607.18306#bib.bib13)]、Fisher SAM [14 (https://arxiv.org/html/2607.18306#bib.bib14)]、F-SAM [19 (https://arxiv.org/html/2607.18306#bib.bib17)] 和 BSAM [4 (https://arxiv.org/html/2607.18306#bib.bib18)]。

尽管取得了成功,标准SAM的扰动决策仍基于当前的随机梯度。当网络被划分为功能块时,该决策隐式地为每个块分配了不同部分的全局扰动预算,但这种分配仅由当前小批量决定。这是一个动态问题:网络块的优化角色和扰动敏感性可能在训练过程中不断演化,而瞬时梯度可能受到小批量噪声或瞬时更新的主导。因此,固定的全局半径不应意味着网络中固定或完全瞬时的分配。

为了构建稳定的动态分配,信号应反映超越瞬时梯度幅度的信息。在训练过程中直接使用曲率信息是困难的:Hessian矩阵对于现代网络而言存储不可行,而在线Hessian-向量或Hessian-块估计会引入额外计算。Fisher信息提供了一种自然的曲率相关替代方案,并已被用于几何感知SAM方法 [14 (https://arxiv.org/html/2607.18306#bib.bib14)]。尽管如此,显式Fisher估计仍然代价高昂。受梯度平方、对角经验Fisher信息以及标准似然假设下期望Hessian信息之间联系的启发 [16 (https://arxiv.org/html/2607.18306#bib.bib42), 9 (https://arxiv.org/html/2607.18306#bib.bib43)],我们使用在线二阶矩统计量作为轻量级的曲率相关信号。

在这项工作中,我们重新审视SAM,将其视为一种动态的按块预算分配方法。我们表明,标准SAM为每个块诱导了一个不同的有效半径,但这种隐式分配仅依赖于瞬时小批量梯度范数。与之相反,GEAR-SAM使用块梯度平方的指数移动平均(EMA)作为持久敏感性得分,并根据这一历史信号分配固定的SAM扰动预算。由此产生的扰动保留了全局SAM预算,同时将更大的半径分配给在近期优化历史中保持敏感性的块。

我们的贡献总结如下:

- • 我们从二阶和动态逐块角度分析了SAM,表明其实际扰动是一阶最优的,但忽略了与曲率相关的块敏感性和时间持久性。
- • 我们提出了GEAR-SAM,该方法使用基于EMA的历史梯度能量作为持久的、与Fisher相关的二阶矩信号,并在固定SAM预算下推导出闭式逐块半径分配。
- • 我们在图像分类、迁移学习、标签噪声鲁棒性以及划分和参数研究上进行了实验,证明了所提出分配策略的有效性和稳定性。

## II. 相关工作

### II-A 锐度感知最小化

SAM通过优化局部邻域内对抗扰动的损失来改善泛化性能 [6 (https://arxiv.org/html/2607.18306#bib.bib8)]。该方法简单有效,但其实际扰动是使用内部最大化的近似一阶计算得出的。因此,大量工作从不同角度研究了如何改进SAM。ASAM解决了锐度的尺度依赖性问题 [17 (https://arxiv.org/html/2607.18306#bib.bib12)]。GSAM引入了一个代理间隙,以更好地引导平坦极小值的搜索 [31 (https://arxiv.org/html/2607.18306#bib.bib13)]。F-SAM分析了随机梯度分量在SAM扰动中的作用 [19 (https://arxiv.org/html/2607.18306#bib.bib17)]。BSAM通过考虑最大锐度和最小锐度引入了双边锐度 [4 (https://arxiv.org/html/2607.18306#bib.bib18)]。其他方法通过随机扰动、扰动复用、样本选择或并行化来提高SAM的效率 [5 (https://arxiv.org/html/2607.18306#bib.bib15), 20 (https://arxiv.org/html/2607.18306#bib.bib16), 11 (https://arxiv.org/html/2607.18306#bib.bib31), 25 (https://arxiv.org/html/2607.18306#bib.bib32), 27 (https://arxiv.org/html/2607.18306#bib.bib33)]。这些方法主要修改了锐度目标、扰动方向或计算过程。相比之下,GEAR-SAM专注于如何在参数块之间分配固定的扰动预算。

### II-B 结构感知SAM

尽管SAM通常针对完整的参数向量进行公式化,但最近的研究表明其行为强烈依赖于网络结构。扰动归一化层可以保留完整参数SAM的大部分收益 [24 (https://arxiv.org/html/2607.18306#bib.bib19)],并且归一化的作用已在理论和实证上得到研究 [3 (https://arxiv.org/html/2607.18306#bib.bib20)]。有效的SAM更新可能需要按层缩放扰动 [7 (https://arxiv.org/html/2607.18306#bib.bib21)],而稀疏或选择性扰动可以进一步改进SAM [22 (https://arxiv.org/html/2607.18306#bib.bib22), 30 (https://arxiv.org/html/2607.18306#bib.bib23), 18 (https://arxiv.org/html/2607.18306#bib.bib24), 2 (https://arxiv.org/html/2607.18306#bib.bib41)]。这些发现表明,将网络视为一个单一的未分化参数向量可能会忽略有用的结构。

这些研究激发了结构感知的扰动设计。大多数现有方法要么选择参数子集,要么修改层级的缩放。GEAR-SAM则将网络划分为功能块,并根据历史块敏感性在它们之间持续分配固定的全局扰动预算。因此,它既不改变扰动几何,也不改变被扰动参数的集合。

### II-C 用于Hessian的曲率代理

锐度感知训练与局部曲率密切相关。基于Hessian的量,如最大特征值或迹,被广泛用于表征平坦性和泛化能力 [13 (https://arxiv.org/html/2607.18306#bib.bib3), 12 (https://arxiv.org/html/2607.18306#bib.bib5), 10 (https://arxiv.org/html/2607.18306#bib.bib6), 1 (https://arxiv.org/html/2607.18306#bib.bib7)]。近期研究还将SAM与稳定性、一阶平坦性和显式曲率正则化联系起来 [21 (https://arxiv.org/html/2607.18306#bib.bib10), 29 (https://arxiv.org/html/2607.18306#bib.bib27), 26 (https://arxiv.org/html/2607.18306#bib.bib30)]。然而,对于现代神经网络而言,显式Hessian计算代价高昂。

Fisher信息提供了一种实用的曲率相关替代方案。Fisher SAM使用Fisher几何来定义SAM邻域 [14 (https://arxiv.org/html/2607.18306#bib.bib14)],而Fisher Mask SAM使用Fisher信息来估计参数重要性 [30 (https://arxiv.org/html/2607.18306#bib.bib23)]。尽管如此,显式Fisher估计仍然代价高昂,且经验Fisher不应被视为精确的Hessian估计量 [16 (https://arxiv.org/html/2607.18306#bib.bib42)]。Adam风格的梯度平方统计量提供了一种高效的在线二阶矩信号 [15 (https://arxiv.org/html/2607.18306#bib.bib25)],并已被证明与对角经验Fisher信息相关 [9 (https://arxiv.org/html/2607.18306#bib.bib43)]。受此启发,GEAR-SAM使用逐块历史梯度能量作为轻量级的曲率相关代理,用于自适应半径分配。

## III. 方法

### III-A 动机

SAM求解以下局部最小-最大问题:

minw⁡max‖ε‖2≤ρ⁡L(w+ε)。 (1)

在迭代 tt 时,设

gt=∇wLBt(wt),Ht=∇w2LBt(wt)。 (2)

SAM使用的实际扰动源自一阶近似

LBt(wt+ε)≈LBt(wt)+gt⊤ε。 (3)

求解相应的内部最大化问题得到

εtSAM=ρgt‖gt‖2。 (4)

当 gt≠0 时成立;若全梯度为零,我们将一阶扰动定义为零。因此,式 (4) 对于线性化锐度目标是最优的。这直接由柯西-施瓦茨不等式得出:gt⊤ε≤‖gt‖2‖ε‖2≤ρ‖gt‖2,当 ε 与 gt 平行时取等号。

然而,局部锐度目标也包含曲率。二阶近似给出

LBt(wt+ε)≈LBt(wt)+gt⊤ε+12ε⊤Htε⏟Qt(ε)。 (5)

令 Qt(ε) 表示式 (5) 中的二次项。在范数球上最大化 Qt 是一个经典的信赖域问题 [23 (https://arxiv.org/html/2607.18306#bib.bib45)]。当相关的最优性系统非奇异时,其解的形式为

εt⋆=(2λtI−Ht)−1gt, (6)

其中 λt 的选取需满足信赖域条件。完整条件(包括奇异硬情形)在附录中给出。式 (6) 表明,期望的扰动同时由梯度 gt 和曲率 Ht 塑造。因此,SAM是一阶最优的,但对于二阶锐度目标通常并非最优。

### III-B SAM的逐块视角

在线计算式 (6) 中的Hessian信息代价高昂。因此,我们研究如何在保持每个块内当前梯度方向的前提下,将固定的SAM半径分配给各参数块。将参数划分为 BB 个互不相交的块:

w=(w1,w2,...,wB), (7)

对应的梯度分解为

gt=(g1,t,g2,t,...,gB,t)。 (8)

**架构感知的块划分。** 我们使用一种粗略的、架构感知的划分,而不是将每个参数张量视为独立组。一个块是一个自包含的架构级计算单元,或是一组在相同表示尺度上运行的连续单元。因此,一个粗略的块可以包含多个残差单元;输入主干和最终分类器是独立的块。每个可训练参数恰好属于一个块。

属于一个计算单元的所有可训练仿射归一化参数被分配到与其权重层相同的块中;不可训练的归一化缓冲区不被扰动。这种处理很重要,因为归一化参数不能与任意小的参数子集互换。特别是,仅扰动仿射归一化参数可以保留,有时甚至超过完整参数SAM的收益 [24 (https://arxiv.org/html/2607.18306#bib.bib19)]。为这些参数分配单独的半径会割裂尺度调节归一化操作与其激活值被归一化的权重之间的关系。因此,我们使用完整功能块的聚合梯度能量作为其分配信号。这是一个架构感知的设计原则,而非声称单一划分粒度普遍最优;替代块粒度在表VI (https://arxiv.org/html/2607.18306#Sx1.T6) 中进行了评估。

从式 (4) 可知,施加于块 bb 的扰动为

εb,tSAM=ρgb,t∑j=1B‖gj,t‖22。 (9)

这可以写成一个块半径乘以归一化的块方向:

εb,tSAM=rb,tSAMgb,t‖gb,t‖2,rb,tSAM=ρ‖gb,t‖2∑j=1B‖gj,t‖22。 (10)

相似文章

梯度平滑:耦合逐层更新以改进优化

arXiv cs.LG

介绍了深度方向梯度增强(Depth-wise Gradient Augmentation),这是一种通用的优化范式,沿着深度维度转换块级优化器更新。该方法,即梯度平滑(Gradient Smoothing),提升了包括Transformer和扩散模型在内的多种架构的优化和泛化性能。

小批量噪声通过主导子空间波动降低锐度

arXiv cs.LG

本文认为,Hessian矩阵的主导子空间虽然对减少损失贡献甚微,但在小批量SGD中降低锐度方面起着关键作用。文章推导了由主导方向上的小批量噪声引起的锐度校正项。