Flatland:大步长梯度下降的冒险

arXiv cs.LG 论文

摘要

本文探讨了在非L-光滑目标上梯度下降收敛的最大步长这一开放问题,引入了在稳定性边缘运行且能够全局最小化尖锐度的自适应方法。

arXiv:2606.06722v1 Announce Type: new Abstract: 神经网络的训练通常涉及并非全局 $L$-光滑的目标函数。对于这些函数,理论上和实践上都很难回答一个问题:保证梯度下降(GD)收敛的最大可能步长是多少?我们通过提供一个统一的“大”步长定义来解决深度学习中这一长期存在的开放问题,该定义仅要求梯度的局部Lipschitz(甚至H\"older)连续性。我们设计了可证明产生大步长的一阶自适应方法,并表明它们从一开始就在稳定性边缘(EoS)运行。特别是,损失非单调地下降,步长与尖锐度(即Hessian的最大特征值)的乘积在整个训练过程中保持在EoS阈值2以上。使用我们的方法,我们还能将尖锐度一直最小化到其全局最小值。与预期相反,我们发现训练过早遇到全局平坦区域可能会减慢收敛速度并损害网络的泛化能力。利用自稳定化论证,我们允许GD进入稍尖锐的谷底,将不成功的训练转化为非常成功的训练。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:18

# Flatland:大步长梯度下降的冒险
来源:https://arxiv.org/abs/2606.06722
查看PDF(https://arxiv.org/pdf/2606.06722)

> **摘要:** 神经网络的训练通常涉及非全局 $L$-光滑的目标函数。对于这些函数,无论是在理论上还是实践中,都难以回答这样一个问题:确保梯度下降(GD)收敛的最大可能步长是多少?我们通过提供一个“大”步长的统一定义来解答深度学习领域这个长期存在的开放问题,该定义仅要求梯度的局部 Lipschitz(甚至 Hölder)连续性。我们设计了可证明产生大步长的一阶自适应方法,并展示了它们从训练一开始就在稳定性边界(EoS)上运行。具体而言,损失非单调下降,且步长与锐度(即 Hessian 矩阵的最大特征值)的乘积在整个训练过程中始终保持在 2 的 EoS 阈值之上。使用我们的方法,我们还能将锐度一路最小化至其全局最小值。与预期相反,我们发现训练过早遇到全局平坦区域既可能减慢收敛速度,也可能损害网络的泛化能力。利用自稳定化论证,我们允许 GD 进入稍微更陡峭的谷底,从而将不成功的训练转变为非常成功的训练。

## 提交历史

来自:Curtis Fox \[查看电子邮件(https://arxiv.org/show-email/e2ceb203/2606.06722)\] **\[v1\]** 2026年6月4日星期四 21:14:07 UTC(10,979 KB)

相似文章

平坦最小值下固定步长SGD的缩放极限

arXiv cs.LG

本文分析了平坦最小值附近固定步长SGD的缩放极限,表明对于平坦度指数m≥2的目标函数,不变分布集中在尺度α^(1/m)上,且当m>2时收敛到非高斯平稳分布。

非均匀光滑性下最速下降与Adam的收敛性

arXiv cs.LG

本文将非均匀光滑性假设推广到曲率与目标值呈仿射关系的目标函数,证明了最速下降法以及RMSProp和Adam的对角变体的收敛速率,并应用于逻辑回归和神经网络。

大步长梯度下降恢复多路径深度线性网络中的对称性

arXiv cs.LG

本文证明,使用大步长的离散梯度下降能够恢复多路径深度线性网络中的对称性,这与梯度流所预测的对称性破缺相反,并导致跨路径的信号重新平衡。作者从理论上证明,平衡解比稀疏解更平坦(锐度更低),且大的学习率驱动网络朝着稳定、平衡的配置发展。

基于广义Lipschitz光滑性的神经网络梯度下降收敛保证

arXiv cs.LG

本文针对任意宽度或深度的通用前馈神经网络,建立了梯度下降的收敛保证。文中使用了一种新颖的广义Lipschitz光滑性条件,该条件适用于常见激活函数和均方误差,且不需要特殊的初始化或数据集要求。