标签
本文证明了在平滑性和有界梯度噪声假设下,带裁剪和加性噪声的随机梯度下降(包括动量变体)几乎必然收敛,为凸和非凸环境中的稳定训练提供了理论基础。
本文认为,Hessian矩阵的主导子空间虽然对减少损失贡献甚微,但在小批量SGD中降低锐度方面起着关键作用。文章推导了由主导方向上的小批量噪声引起的锐度校正项。
本文分析了平坦最小值附近固定步长SGD的缩放极限,表明对于平坦度指数m≥2的目标函数,不变分布集中在尺度α^(1/m)上,且当m>2时收敛到非高斯平稳分布。
本文为无调度梯度下降和无调度随机梯度下降在非凸优化中提供了最坏情况收敛性分析,建立了最优速率和严格鞍点规避,从而从理论上证明了其实验成功。
本文首次对带动量的原始SGD在重尾噪声下(无需梯度裁剪或归一化)进行了全面的收敛性分析,揭示了其收敛速率劣于经过裁剪的变体,并在合成函数上进行了实验验证。
本文重新审视了体积假说,该假说认为过参数化网络的泛化能力主要归因于权重空间中良好泛化区域更大的体积,而非SGD的隐式偏差。通过对二元网络的实验,作者表明,随着训练数据规模的增大,梯度学习相对于随机采样的泛化优势逐渐减弱,这可能解决了先前相互矛盾的发现。
本文在冲击波理论与随机梯度下降的对称商学习动力学之间建立了数学上严谨的联系,表明在对称约化和粗粒化后,动力学满足粘性Hamilton-Jacobi方程和Burgers型方程,激波形成时间由损失曲率控制。
本文分析了离散参数空间中采用确定性或随机舍入的梯度下降(GD)和随机梯度下降(SGD)的泛化误差、一致稳定性和一致参数稳定性,表明舍入会降低GD的泛化性能,并为随机舍入引入了维度相关的误差。