利用外梯度实现深度学习中的有效Sharpness-Aware Minimization

arXiv cs.LG 论文

摘要

提出EISAM,一种新的优化器,通过使用外梯度步骤扩展Sharpness-Aware Minimization,寻找更平坦的最小值,从而改进泛化能力和鲁棒性,同时降低对超参数的敏感性。在基准测试上优于SGD、Adam和SAM。

arXiv:2607.06151v1 公告类型: new 摘要: 泛化仍然是深度学习中的关键挑战,传统的优化器如随机梯度下降(SGD)往往收敛到尖锐最小值,导致过拟合以及在未见数据上性能下降。基于Sharpness-Aware Minimization (SAM) 寻找与改进泛化相关的平坦最小值,我们提出了外梯度启发的Sharpness-Aware Minimization (EISAM),一种通过外梯度技术增强泛化的新型优化器。EISAM采用两步更新过程:一个预测步骤,探索损失景观的几何形状;一个扰动步骤,用基础优化器细化更新。该方法在泛化性能上优于SAM。关键的是,EISAM降低了对扰动半径的敏感性,增强了鲁棒性,并简化了在不同设置下的调优。在基准数据集上的大量实验表明,EISAM在各种架构上的测试准确率和训练效率方面始终优于SGD、自适应矩估计(Adam)和SAM。理论分析进一步证实,EISAM通过将参数引导向曲率更小的平坦最小值,收紧了泛化界限。结合全面的超参数分析,EISAM提供了实用的调优指导,使其成为一种稳健、可扩展且广泛适用的优化解决方案,推动了深度学习理论和实践的发展。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:46

# 利用外梯度法实现深度学习中的有效锐度感知最小化
来源:https://arxiv.org/abs/2607.06151
查看 PDF (https://arxiv.org/pdf/2607.06151)

> **摘要**:泛化能力仍是深度学习中的关键挑战,传统优化器(如随机梯度下降 \(SGD\))常收敛至尖锐极小值,导致过拟合及在未见数据上性能下降。基于寻求与更好泛化能力相关的平坦极小值的锐度感知最小化(SAM),我们提出外梯度启发锐度感知最小化(EISAM),这是一种通过外梯度技术增强泛化能力的新型优化器。EISAM 采用两步更新过程:预测步骤探索损失景观的几何结构,扰动步骤则利用基础优化器优化更新。该方法比 SAM 获得了更好的泛化性能。关键在于,EISAM 降低了对扰动半径的敏感性,增强了鲁棒性,并简化了不同设置下的调参过程。在基准数据集上的大量实验表明,EISAM 在测试精度和训练效率上始终优于 SGD、自适应矩估计(Adam)和 SAM,适用于多种架构。理论分析进一步证实,EISAM 通过引导参数向曲率更小的平坦极小值收敛,收紧泛化界。结合全面的超参数分析,EISAM 提供了实用的调参指导,使其成为一种鲁棒、可扩展且广泛适用的优化解决方案,推动了深度学习理论与实践的发展。

## 提交历史

来自:Yao Fu \[查看邮箱 (https://arxiv.org/show-email/e9698c5f/2607.06151)\] **\[v1\]** 2026年7月7日星期二 11:25:46 UTC (30,880 KB)

相似文章

小批量噪声通过主导子空间波动降低锐度

arXiv cs.LG

本文认为,Hessian矩阵的主导子空间虽然对减少损失贡献甚微,但在小批量SGD中降低锐度方面起着关键作用。文章推导了由主导方向上的小批量噪声引起的锐度校正项。

梯度平滑:耦合逐层更新以改进优化

arXiv cs.LG

介绍了深度方向梯度增强(Depth-wise Gradient Augmentation),这是一种通用的优化范式,沿着深度维度转换块级优化器更新。该方法,即梯度平滑(Gradient Smoothing),提升了包括Transformer和扩散模型在内的多种架构的优化和泛化性能。