跨层学习率平衡:线性神经网络中的精确两步动力学与最优缩放
摘要
本文推导了两层和三层线性神经网络在一步和两步梯度下降后梯度和测试损失的精确闭式表达式,刻画了最优学习率选择,并揭示了一个独特的早期训练阶段:在该阶段中,初始时不等层学习率是最优的。
arXiv:2606.00340v1 公告类型:新
摘要:我们研究训练用于学习线性目标函数的两层和三层线性神经网络中的最优学习率选择。具体而言,我们推导了一步和两步梯度下降后梯度和测试损失的精确闭式表达式,从而能够精确刻画早期训练动力学。我们描述了在前两步中梯度近似下学习率应如何缩放,并证明使用该近似进行更新可得到具有紧致且很小近似误差的可处理代理损失。该公式使得能够对分层学习率进行理论分析,并揭示了一个独特的早期训练阶段:在初始步骤中,可以通过不等学习率最小化测试损失,而在后续步骤中,相等学习率成为最优。我们的数值实验验证了该理论,并证明了在训练早期平衡分层学习率的重要性。代码可在以下网址获取:https://github.com/TDCSZ327/Layer-Balancing。
查看缓存全文
缓存时间: 2026/06/02 15:41
# 跨层学习率平衡:线性神经网络中的精确两步动态与最优缩放 来源:https://arxiv.org/abs/2606.00340 查看 PDF(https://arxiv.org/pdf/2606.00340) > **摘要**:我们研究了两层和三层线性神经网络在训练以学习线性目标函数时的最优学习率选择问题。具体而言,我们推导了梯度下降一步和两步后梯度和测试损失的精确闭式表达式,从而能够精确刻画早期训练动态。我们描述了在前两步的梯度近似下学习率应如何缩放,并证明使用该近似进行更新能够得到可处理的代理损失,且近似误差严格且小。这一公式为逐层学习率的理论分析提供了可能,并揭示了一个独特的早期训练阶段:在初始步中,使用不等学习率能最小化测试损失,而在后续步中,等学习率则变为最优。我们的数值实验验证了该理论,并展示了在训练早期平衡逐层学习率的重要性。代码见:this https URL(https://github.com/TDCSZ327/Layer-Balancing)。 ## 提交历史 来自:Tianyu Pang \[查看电子邮件(https://arxiv.org/show-email/83449265/2606.00340)\] **\[v1\]** 2026年5月29日(星期五)20:28:52 UTC(7,485 KB)
相似文章
深度标量线性网络中最优学习率缩放依赖于数据
本文证明,深度标量线性网络中的最优学习率缩放本质上依赖于数据,这与先前数据无关的缩放规则相矛盾。它表明,在依赖数据的缩放下,收敛变得与深度无关,包括在无限深度下。
大步长梯度下降恢复多路径深度线性网络中的对称性
本文证明,使用大步长的离散梯度下降能够恢复多路径深度线性网络中的对称性,这与梯度流所预测的对称性破缺相反,并导致跨路径的信号重新平衡。作者从理论上证明,平衡解比稀疏解更平坦(锐度更低),且大的学习率驱动网络朝着稳定、平衡的配置发展。
神经网络损失景观的谱渐近:曲率指数的精确分解
本文提出了神经网络损失景观中曲率指数α的精确分解,解释了为何该指数在不同层类型间存在差异。引入了谱对齐分解,并导出了一个谱传递恒等式,连接曲率、梯度秩衰减和Hessian指数,该恒等式已在多种架构和数据集上得到验证。
神经网络能否实现最优计算-统计权衡?对单指数模型的分析
本文证明,使用基于梯度的方法训练的两层神经网络能够实现学习高斯单指数模型的最优计算-统计权衡,对于所有生成指数,匹配SQ下界至多对数因子,并通过一种新颖的权重扰动技术扩展到稀疏设置。
扩展定律,谨慎解读(25分钟阅读)
全面概述深度学习中的扩展定律,追溯其理论基础和实证发现,并解释损失如何随模型大小、数据和计算量可预测地降低。