标签
一项关于模拟硬件噪声的实验表明,准确率在阈值处崩溃而非平滑下降,而噪声感知训练显著移动了该阈值。
本文分析了平坦最小值附近固定步长SGD的缩放极限,表明对于平坦度指数m≥2的目标函数,不变分布集中在尺度α^(1/m)上,且当m>2时收敛到非高斯平稳分布。
提出EISAM,一种新的优化器,通过使用外梯度步骤扩展Sharpness-Aware Minimization,寻找更平坦的最小值,从而改进泛化能力和鲁棒性,同时降低对超参数的敏感性。在基准测试上优于SGD、Adam和SAM。
推导了损失Hessian特征谱的Wolkowicz-Styan上界的闭式梯度,以引导神经网络训练朝向平坦极小值,并提出了Hessian谱范围(HSR)正则化。数值实验表明,HSR收窄了Hessian特征值范围,避免了尖锐极小值和鞍点,并实现了与Sharpness-Aware Minimization(SAM)相当的解。
本文挑战了关于平坦最小值能导致神经网络更好泛化的普遍观点,认为‘弱性’——一种函数简单性的重参数化不变度量——才是真正的驱动力。在MNIST和Fashion-MNIST上的实验结果表明,弱性能够预测泛化,而尖锐性则与之负相关,且随着训练数据增加,大批次泛化优势消失。