从扰动校正到几何感知采样:长尾学习中用于平衡平坦极小值的锐度引导均衡采样
摘要
介绍了锐度引导均衡采样(SGS),该方法利用锐度估计动态调整采样概率,以在长尾学习中实现平衡的平坦极小值,在CIFAR-100 LT和ImageNet-LT上取得了显著提升。
arXiv:2607.21999v1 公告类型:新
摘要:长尾学习耦合了两种导致泛化能力差的原因:头部类别主导训练曝光,而代表性不足的类别往往收敛到损失景观的更尖锐区域。传统的重采样解决了前者,但没有考虑几何结构,而现有的长尾锐度感知最小化(SAM)方法仅在抽取有偏的小批量后修改损失或扰动。我们引入了锐度引导均衡采样(SGS),将采样分布视为优化几何的主动控制变量。SGS通过增加采样频率较低的类别的采样概率,同时抑制SAM诱导损失变化较大的类别,来动态调整后续小批量,仅使用累积类别计数和从标准SAM更新中获得的EMA锐度估计,无需逐类别扰动或额外的反向传播。我们通过连续时间随机微分方程和依赖于采样的PAC-Bayes分析来刻画这一采样过程,解释了频率-锐度反馈如何将训练推向更平衡的平坦度剖面。在不平衡比为100的CIFAR-100 LT上,SGS-SAM在尾部准确率上比Focal-SAM提高了10.85个百分点,整体提高了3.56个百分点。在ImageNet-LT上,它在尾部类别上比ImbSAM提高了6.59个百分点,整体提高了1.20个百分点。其训练时间仅为普通SAM的$1.02\\times$。除了这些提升,SGS还建立了一条基于采样的损失景观控制路径,表明未来的长尾方法可以联合调节数据曝光和优化几何结构,而不是将两者视为固定不变。
查看缓存全文
缓存时间: 2026/07/27 07:43
# 从扰动校正到几何感知采样:锐度引导的均衡采样用于长尾学习中平衡平坦极小值
来源:https://arxiv.org/html/2607.21999
###### 摘要
长尾学习耦合了两种泛化不良的来源:头部类别主导训练暴露,而代表性不足的类别往往收敛到损失景观中更尖锐的区域。传统的重采样解决了前者但没有考虑几何形状,而现有的长尾锐度感知最小化(SAM)方法仅在采样到有偏的小批量后才修改损失或扰动。我们引入了锐度引导的均衡采样(SGS),它将采样分布视为优化几何的主动控制变量。SGS通过增加采样频率较低的类别的采样概率,同时抑制由SAM引起的损失变化较大的类别,动态调整后续的小批量,仅使用累积的类别计数和从标准SAM更新中获得的EMA锐度估计,无需类别级扰动或额外的反向传播。我们通过一个连续时间随机微分方程和一个依赖于采样的PAC-Bayes分析来描述这一采样过程,解释了频率-锐度反馈如何将训练推向更平衡的平坦度剖面。在CIFAR-100 LT上,不平衡比为100时,SGS-SAM在尾部类别准确率上比Focal-SAM提高了10.85个百分点,总体提高了3.56个百分点。在ImageNet-LT上,它在尾部类别上比ImbSAM提高了6.59个百分点,总体提高了1.20个百分点。其训练时间仅为普通SAM的1.02倍。除了这些提升,SGS建立了通向损失景观控制的采样侧路径,表明未来的长尾方法可以联合调节数据暴露和优化几何,而不是将两者视为固定不变。
## 引言
深度神经网络在视觉识别任务中取得了显著成功,如图像分类(Wang等人,2023a(https://arxiv.org/html/2607.21999#bib.bib14))和目标检测(Wang等人,2024(https://arxiv.org/html/2607.21999#bib.bib15))。然而,它们的性能通常依赖于平衡且精心整理的训练数据,而现实世界中的视觉数据通常遵循长尾分布,少数头部类别包含大量样本,而许多尾部类别严重代表性不足。在这种不平衡数据上使用标准经验风险最小化进行训练会使模型偏向头部类别并降低整体泛化能力(Cao等人,2019(https://arxiv.org/html/2607.21999#bib.bib21))。为了解决这个问题,现有方法主要集中在重采样(Buda等人,2018(https://arxiv.org/html/2607.21999#bib.bib17))、重平衡(Wang等人,2023b(https://arxiv.org/html/2607.21999#bib.bib18);Li等人,2025(https://arxiv.org/html/2607.21999#bib.bib16))、鲁棒表示学习(Cui等人,2023(https://arxiv.org/html/2607.21999#bib.bib19))和基础模型微调(Shi等人,2024(https://arxiv.org/html/2607.21999#bib.bib20))。
现有方法解决了这个问题的不同部分。重采样和类别先验校正改善了尾部暴露,但它们是几何无关的:过采样可以重复使用稀缺的尾部示例并放大梯度方差,而欠采样则丢弃了信息丰富的头部数据(Buda等人,2018(https://arxiv.org/html/2607.21999#bib.bib17))。锐度感知最小化(SAM)(Foret等人,2021(https://arxiv.org/html/2607.21999#bib.bib22))及其长尾变体,包括ImbSAM(Zhou等人,2023a(https://arxiv.org/html/2607.21999#bib.bib23))、CC-SAM(Zhou等人,2023b(https://arxiv.org/html/2607.21999#bib.bib24))和Focal-SAM(Li等人,2025(https://arxiv.org/html/2607.21999#bib.bib16)),反而通过类别相关的扰动或惩罚来调节优化几何。然而,这些校正是在采样到有偏的小批量之后应用的。因此,原始的长尾分布继续决定哪些类别和几何区域主导训练。这种分离留下了一个核心问题:能否通过采样器本身联合控制数据暴露和优化几何?
我们通过锐度引导的均衡采样(SGS)来回答这个问题,它将几何控制从采样后扰动校正转移到小批量构建。SGS重复利用标准SAM已经产生的扰动损失差距作为高效的锐度信号。每次更新后,SGS记录每个类别的累积暴露和EMA锐度,利用这些统计信息重新计算采样概率,并据此构建下一个小批量。采样不足的类别获得更多的优化机会,而扰动响应较大的类别被暂时降权,以避免重复强调不稳定区域。由此产生的小批量更新模型并生成新的频率和锐度统计信息,然后用于下一次采样决策。因此,采样分布与模型共同演化,而不是在整个优化过程中保持不变,且无需类别级扰动或额外的反向传播。
我们通过连续时间随机动力学和依赖于采样的PAC-Bayes分析来表征这种自适应采样过程。随机视角将类别频率和锐度引起的确定性竞争与小批量采样引起的波动分离开来。PAC-Bayes分析进一步确定了所得分布改善类别平衡并产生比普通长尾SAM更紧泛化界的条件。在CIFAR-LT和ImageNet-LT上的实验表明,在严重不平衡下,中类和尾类性能持续提升,而基础模型微调实验则证明了SGS适用于不同的自适应管道。重要的是,SGS保留了标准SAM优化过程,仅引入了轻量级的类别统计和采样概率更新,因此训练成本几乎与普通SAM相同。我们的贡献是:
- • 我们提出了SGS,一种几何感知采样方法,它利用每个类别的累积暴露和SAM引起的损失响应来更新后续小批量的组成。SGS在参数更新之前重新分配优化机会,无需类别级扰动或额外的反向传播。
- • 我们将离散采样过程与连续时间随机动力学和依赖于采样的PAC-Bayes界联系起来,解释了频率-锐度竞争、小批量噪声和自适应类别暴露如何共同影响长尾泛化。
- • 我们在CIFAR-LT、ImageNet-LT和基础模型微调上验证了SGS。SGS在严重不平衡下显著提高了中类和尾类的性能,同时保持了与普通SAM几乎相同的训练效率,在CIFAR-LT上仅增加了大约2%的训练时间。
## 相关工作
### 长尾学习
长尾学习已被广泛研究,以减轻不平衡类别分布引起的偏差。现有方法大致可分为数据重平衡、数据增强、损失和logit调整、表示学习、解耦训练和集成学习。数据重平衡方法调整不同类别的采样频率,而增强方法合成或丰富尾部样本以缓解数据稀缺(Kang等人,2019(https://arxiv.org/html/2607.21999#bib.bib25);Ren等人,2020(https://arxiv.org/html/2607.21999#bib.bib26);Wang等人,2020(https://arxiv.org/html/2607.21999#bib.bib27))。损失和logit调整方法将类别先验纳入训练目标,例如基于边界的损失(Cao等人,2019(https://arxiv.org/html/2607.21999#bib.bib21))、平衡softmax(Ren等人,2020(https://arxiv.org/html/2607.21999#bib.bib26))和logit校正(Menon等人,2020(https://arxiv.org/html/2607.21999#bib.bib28))。表示学习方法通过对比目标(Cui等人,2021(https://arxiv.org/html/2607.21999#bib.bib32))、原型(Wei等人,2022(https://arxiv.org/html/2607.21999#bib.bib31))或特征增强(Hong等人,2022(https://arxiv.org/html/2607.21999#bib.bib33))来改善尾类特征的可分离性。解耦训练方法将表示学习与分类器校准分离,表明平衡的分类器学习对长尾识别至关重要(Zhong等人,2021(https://arxiv.org/html/2607.21999#bib.bib34))。
尽管这些方法取得了有希望的结果,但大多数是由类别频率或类别先验驱动的。这种基于数量的校正对于减少头部类别的主导是有效的,但它没有明确描述采样的实例是否位于损失景观的尖锐区域。SGS通过将采样控制与局部曲率联系起来,根据类别不平衡和锐度信息动态分配优化努力,从而补充了现有的长尾学习范式。
### 长尾学习中的锐度感知最小化
SAM(Foret等人,2021(https://arxiv.org/html/2607.21999#bib.bib22))通过寻找平坦的极小值来提高泛化能力,这在长尾学习中尤为重要,因为稀有和困难的类别常常遭受决策区域压缩和鲁棒性差的问题。因此,已经提出了几种长尾SAM变体。ImbSAM(Zhou等人,2023a(https://arxiv.org/html/2607.21999#bib.bib23))采用粗粒度策略,将SAM扰动限制在尾部类别。虽然这在一定程度上保护了尾部,但当与标准重平衡算法结合时,可能会使头部类别景观变尖锐并降低整体性能。CC-SAM(Zhou等人,2023b(https://arxiv.org/html/2607.21999#bib.bib24))引入了类别条件扰动半径以实现细粒度控制,但需要昂贵的类别级扰动计算。Focal-SAM(Li等人,2025(https://arxiv.org/html/2607.21999#bib.bib16))通过将焦点式权重应用于类别级锐度惩罚来改进效率-控制权衡,从而增强了尾类平滑性,而无需额外的类别级反向传播负担。
这些方法提供了重要证据,表明优化几何对长尾识别很重要。然而,它们主要是在小批量被抽取之后进行干预,通过改变扰动方向、扰动半径或锐度惩罚。相比之下,SGS将控制点从损失/扰动规则转移到采样分布本身。SGS根据频率和曲率重新塑造小批量流,无需类别级扰动或额外的反向传播。
## 方法
### 频率和锐度引导的采样
令N_c为类别c的训练样本数,N = ∑_{j=1}^{C} N_j,P_c^{base} = N_c/N为经验类别先验。在长尾训练中,P_c^{base}使得头部类别主导梯度更新和SAM扰动。SGS通过结合频率反馈和锐度反馈构建动态采样分布。
**频率采样指标。** 令m_c^{(t)}表示到步骤t为止从类别c采样的累积实例数。我们定义经验采样份额为p_c^{(t)} = m_c^{(t)} / (∑_j m_j^{(t)} + ξ),其中ξ > 0是引入用于数值稳定性并避免除以零的小常数。p_c^{(t)}较小表示类别c对优化更新的贡献较少。因此,我们将逆频率指标定义为:
w_c^{freq} = 1 / (p_c^{(t)} + ξ), \tag{1}
它为累积采样份额较小的类别分配更大的分数。
**锐度代理。** 直接估计Hessian矩阵或进行类别级SAM扰动是昂贵的。SGS转而重复使用标准SAM步骤中的扰动。对于实例x_i和模型权重w,我们定义:
ΔL_{x_i} = |L_{x_i}(w + ε) - L_{x_i}(w)|. \tag{2}
大的ΔL_{x_i}表明对SAM对抗方向的高敏感性。局部泰勒展开给出L_{x_i}(w+ε) - L_{x_i}(w) ≈ ∇L_{x_i}(w)^⊤ε + ½ ε^⊤ ∇²L_{x_i}(w) ε,其中二次项捕捉w附近的方向曲率。因此,ΔL_{x_i}作为一种高效的更新感知锐度代理。
**锐度采样指标。** 尽管尾类需要额外的暴露,但反复采样来自尖锐区域的样本可能会放大梯度噪声并损害泛化。因此,SGS使用等式(2)中的锐度代理来构建稳定的类别级锐度指标。
对于步骤t的小批量B,令B_c表示类别c的样本。当|B_c| > 0时,我们计算批次级类别锐度为:
ΔL_c = (1/|B_c|) ∑_{x_i∈B_c} ΔL_{x_i}. \tag{3}
为了减少小批量估计的随机性,我们为每个类别维护一个指数移动平均:
h_c^{(t)} = \begin{cases} β h_c^{(t-1)} + (1-β) ΔL_c, & |B_c| > 0, \\ h_c^{(t-1)}, & |B_c| = 0, \end{cases} \tag{4}
其中β = 0.9或0.99。EMA减少了由不频繁的尾类观测引起的噪声。
然后我们将类别级估计归一化为\tilde{h}_c = h_c / (∑_{j=1}^{C} h_j + ξ),并定义锐度采样权重为:
w_c^{sharp} = 1 / (\tilde{h}_c^κ + ξ), \tag{5}
其中κ > 0控制锐度反馈的强度,ξ > 0避免除以零。逆形式为扰动响应较大的类别分配较低的采样权重,从而防止采样器过度强调尖锐和不稳定的区域。
**联合采样权重。** 联合类别分数\tilde{w}_c结合了两个采样指标:
\tilde{w}_c = w_c^{freq} · w_c^{sharp}. \tag{6}
我们应用均值归一化以确保数值稳定性,得到归一化的类别采样权重w_c:
w_c = \frac{\tilde{w}_c}{\frac{1}{C} \sum_{j=1}^{C} \tilde{w}_j + ξ}, \tag{7}
其中C表示类别总数。
**实例级概率分配。** 校准后的类别分数为S_c = P_c^{base} w_c = (N_c/N) w_c。为了保持类内公平性,类别c中的每个实例都均等地共享该分数。因此,对于标签为y_i=c的实例x_i,其未归一化分数为s_{x_i} = S_c / N_c = w_c / N。最终概率为:
P_{x_i} = \frac{s_{x_i}}{\sum_{j=1}^{N} s_{x_j}} = \frac{w_{y_i}}{N \sum_{c=1}^{C} P_c^{base} w_c}. \tag{8}相似文章
梯度能量引导的逐块扰动用于锐度感知最小化
本文提出GEAR-SAM,通过使用平方梯度的指数移动平均来自适应地在网络块之间分配扰动预算,在不增加额外计算开销的情况下提升泛化能力。
利用外梯度实现深度学习中的有效Sharpness-Aware Minimization
提出EISAM,一种新的优化器,通过使用外梯度步骤扩展Sharpness-Aware Minimization,寻找更平坦的最小值,从而改进泛化能力和鲁棒性,同时降低对超参数的敏感性。在基准测试上优于SGD、Adam和SAM。
小批量噪声通过主导子空间波动降低锐度
本文认为,Hessian矩阵的主导子空间虽然对减少损失贡献甚微,但在小批量SGD中降低锐度方面起着关键作用。文章推导了由主导方向上的小批量噪声引起的锐度校正项。
面向长尾分布的谱感知解析类增量学习
提出几何-谱修正(GSR),这是一个理论严谨的框架,将长尾学习视为谱正则化问题,在解析类增量学习上取得了新的最先进结果。
在困难处采样:通过熵引导的幂采样增强基础模型推理
本文提出熵引导幂采样(EGPS),一种无需训练和验证器的采样方法,提高了幂采样在增强基础语言模型推理中的效率。与标准Metropolis-Hastings采样相比,EGPS在MATH500、HumanEval和GPQA等基准测试上达到最佳或并列最佳准确率,同时实现高达12.6倍的加速。