深度标量线性网络中最优学习率缩放依赖于数据

arXiv cs.LG 论文

摘要

本文证明,深度标量线性网络中的最优学习率缩放本质上依赖于数据,这与先前数据无关的缩放规则相矛盾。它表明,在依赖数据的缩放下,收敛变得与深度无关,包括在无限深度下。

arXiv:2607.07884v1 公告类型:new 摘要:在这篇简短的文章中,我们考虑了深度标量线性网络 $f(x) = \prod_{l=1}^L w_l x$ 的梯度下降动力学,该网络对任何整数深度都有精确的时间过程解。我们表明,即使在这个最小模型中,最优的逐深度学习率缩放也依赖于数据,而与数据无关的缩放规则无法跨深度迁移。在依赖于数据的最优缩放下,学习动力学与数据无关且与深度弱相关,从而在所有深度(包括无穷大)上产生恒定的线性收敛速度。我们进一步展示了在带有残差连接的深度标量线性网络中的类似数据依赖效应。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:16

# 深度标量线性网络中最优学习率缩放的数据依赖性
来源:https://arxiv.org/html/2607.07884
Yedi Zhang¹ Peter E. Latham¹ Leena Chennuru Vankadara¹ Andrew Saxe¹,² ¹Gatsby计算神经科学单元,伦敦大学学院 ²Sainsbury Wellcome Centre,伦敦大学学院 \{yedi,pel\}@gatsby\.ucl\.ac\.uk,\{l\.vankadara,a\.saxe\}@ucl\.ac\.uk

###### 摘要

在这篇短文中,我们考虑深度标量线性网络的梯度下降动力学,\(f(x)=\prod_{l=1}^L w_l x\),该网络对于任意整数深度都存在精确的时间过程解。我们证明,即使在这个最小模型中,最优的深度方向学习率缩放也依赖于数据,而与数据无关的缩放规则无法在不同深度间迁移。在数据依赖的最优缩放下,学习动力学与数据无关,且对深度的依赖较弱,从而在包括无穷深度的所有深度上实现恒定的线性收敛速率。我们进一步展示了在带残差连接的深度标量线性网络中也存在类似的数据依赖效应。

## 1 引言

现代神经网络的大规模已被经验证明在深度学习模型的快速进展中发挥了关键作用(Kaplan et al.,2020 (https://arxiv.org/html/2607.07884#bib.bib19);Hoffmann et al.,2022 (https://arxiv.org/html/2607.07884#bib.bib20))。规模的一个关键因素是深度。因此,理解如何实现跨深度的超参数迁移对于从规模中获得可预测的收益至关重要。尽管现有的关于超参数迁移的文献表明,与数据无关的学习率缩放可以实现深度方向的迁移(Yang et al.,2024 (https://arxiv.org/html/2607.07884#bib.bib49);Everett et al.,2024 (https://arxiv.org/html/2607.07884#bib.bib48);Noci et al.,2024 (https://arxiv.org/html/2607.07884#bib.bib47);Bordelon et al.,2024b (https://arxiv.org/html/2607.07884#bib.bib46);a (https://arxiv.org/html/2607.07884#bib.bib45);Bordelon and Pehlevan,2025 (https://arxiv.org/html/2607.07884#bib.bib53)),但我们证明,即使在深度标量线性网络的最小模型类中,最优学习率缩放本质上是数据依赖的。具体来说,学习率缩放规则包含一个数据依赖的修正项,该修正项无法由数据无关指数的幂律捕获,即使在常数因子已通过一个深度的数据校准的情况下也是如此。我们证明了考虑此数据依赖指数的学习率缩放可以跨深度迁移,而数据无关的缩放则不能。

我们考虑最简单的深度网络,即深度为 \(L\) 的标量线性链,定义为

\[
f(x; w) = \prod_{l=1}^L w_l x, \quad x, w_1, \cdots, w_L \in \mathbb{R}. \tag{1}
\]

基于并完善先前工作(Saxe et al.,2014 (https://arxiv.org/html/2607.07884#bib.bib4);2019 (https://arxiv.org/html/2607.07884#bib.bib15))的分析,我们写出了任意整数深度下完整梯度下降学习动力学的精确解,这些解通过特殊函数(即超几何函数和 Lambert W 函数)表示。在数据依赖的最优学习率缩放和平衡初始化方案下,梯度下降学习动力学与数据无关且弱依赖于深度。这导致了在所有深度(包括无限深度的极限情况)上恒定的线性收敛速度。此外,我们将分析扩展到块深度为 1 和 2 的深度标量线性残差网络,并发现它们的最优学习率缩放也是数据依赖的。

**相关工作**。Jelassi et al. (2023 (https://arxiv.org/html/2607.07884#bib.bib41)) 发现,在具有平均场初始化的深度 ReLU 网络中,保证一步梯度下降后预激活变化有界的学习率最大值随深度 \(L\) 按 \(L^{-3/2}\) 缩放。Bordelon et al. (2024b (https://arxiv.org/html/2607.07884#bib.bib46));Bordelon and Pehlevan (2025 (https://arxiv.org/html/2607.07884#bib.bib53)) 获得了简化的学习动力学,并研究了早期训练时间内无限深度线性残差网络中的超参数迁移,其中宽度和深度极限可交换(Hayou and Yang,2023 (https://arxiv.org/html/2607.07884#bib.bib39))。D

相似文章

数据受限训练的规定性缩放定律

Hugging Face Daily Papers

一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。

草图线性对比学习:近似、优化与统计缩放

arXiv cs.LG

本文推导了在高斯潜变量模型下的草图线性对比学习的缩放定律,分析了风险如何分解为近似项、优化项和统计项,并为对比学习中平衡模型规模、数据和计算提供了理论指导。