大步长梯度下降恢复多路径深度线性网络中的对称性

arXiv cs.LG 论文

摘要

本文证明,使用大步长的离散梯度下降能够恢复多路径深度线性网络中的对称性,这与梯度流所预测的对称性破缺相反,并导致跨路径的信号重新平衡。作者从理论上证明,平衡解比稀疏解更平坦(锐度更低),且大的学习率驱动网络朝着稳定、平衡的配置发展。

arXiv:2606.05219v1 Announce Type: new Abstract: 近期对多路径深度线性网络的分析使用梯度流预测了一种"赢家通吃"的特化,其中路径对称性破缺,每个特征集中在一个单一路径中。在这项工作中,我们证明使用大步长的离散梯度下降(GD)讲述了一个不同的故事。我们证明单路径解是尖锐最小值,而将信号分布到各路径会降低锐度,降低因子随路径数和深度增加而减小。因此,尽管早期训练重现了梯度流预测的深度驱动的对称性破缺,但随后在稳定边缘的振荡覆盖了这一趋势,并将网络驱动到一个重新平衡阶段,信号在各路径间重新分配。这些结果共同阐明了深度如何塑造路径竞争,并解释了为什么大步长梯度下降倾向于共享表示而非持续的单路径主导。
查看原文
查看缓存全文

缓存时间: 2026/06/05 08:09

# 大步长梯度下降恢复深度线性网络多路径对称性 来源:https://arxiv.org/html/2606.05219 ###### 摘要 近期对多路径深度线性网络的分析采用梯度流(Gradient Flow)预测出一种"赢家通吃"的专业化现象,即路径对称性被打破,每个特征集中到单一路径上。本文表明,采用大步长的离散梯度下降(GD)则呈现不同结果。我们证明单路径解是尖锐极小值,而将信号分散到多条路径上会降低尖锐程度,降低因子随路径数和深度增加而减小。因此,虽然早期训练重现了梯度流预测的深度驱动对称性破坏,但随后在稳定性边缘的振荡会覆盖这一趋势,驱动网络进入重新平衡阶段,信号在各路径间重新分配。这些结果共同揭示了深度如何塑造路径竞争,并解释了为何大步长GD偏向共享表征而非持续的单一路径主导。机器学习, ICML

## 1 引言

理解深度神经网络的训练动力学仍是深度学习理论的核心挑战。尽管深层架构具有高度表达能力,但优化算法如何在众多全局极小值中选择特定解——即优化器的隐式偏置——仍未被充分理解(Zhang 等,2017;Neyshabur 等,2017;Gunasekar 等,2017;Soudry 等,2018)。为刻画这一偏置,越来越多的研究在梯度流(GF)近似(假设学习率无穷小)下分析深度线性网络(DLN)(Saxe 等,2014;Arora 等,2018;Lampinen 和 Ganguli,2019;Shi 等,2022)。近期,Shi 等(2022)利用GF论证多路径DLN会发生"对称性破坏",收敛到稀疏的"赢家通吃"解,使得并行过参数化变得冗余。然而,这种连续时间分析忽略了具有大学习率的梯度下降(GD)的离散动力学,而后者正是实践训练中在稳定性边缘运行的特征(Cohen 等,2021)。鉴于GD主动与损失曲率交互以回避尖锐极小值,一个关键问题是:在大学习率GD下,对称性破坏现象是否依然存在?本文证明答案是否定的:尽管GF预测对称性破坏,但GD的离散性诱导出一种根本不同的现象,我们称之为**路径重新平衡**。通过分析损失景观的几何结构,我们证明稀疏的单路径解对应尖锐极小值,而在多条路径上均衡的解则显著更平坦。因此,当学习率足够大时,GD的隐式正则化驱动网络从不稳定的稀疏配置转向稳定的均衡配置。我们的主要贡献总结如下:

- **并行性带来的尖锐度降低**:我们从理论上推导了路径数$H$、深度$L$与全局极小值尖锐度之间的关系。我们证明将信号在$H$条路径上均衡分布可使尖锐度降低$H^{2/L-1}$倍(定理4.2)。
- **稳定性边缘的重新平衡动力学**:我们识别出大步长训练的两个不同阶段。初始阶段,网络表现出与GF类似的对称性破坏。但随着主导路径的尖锐化,模型进入**重新平衡**阶段。此时剧烈振荡迫使网络通过将信号分散到多条路径上来平坦化其景观。
- **最坏情况返回阈值**:基于**深度线性链**模型,我们推导出与深度相关的学习率上界,该上界保证轨迹能在剧烈振荡中存活。该阈值与经典稳定性极限的比值随深度增加,从而拓宽了重新平衡的窗口。超出多路径设置,我们的结果表明,基于梯度流(也是近期许多基于DLN模型分析的基础)预测的结构性偏置,在考虑离散动力学和有限学习率后可能需要重新审视。这突显了离散优化在塑造最终网络结构中的关键作用,并激励通过GD的视角重新审视基于GF的预测。

## 2 相关工作

**深度线性网络与多路径动力学**。深度线性网络(DLN)是隔离优化和表征学习机制的标准试验平台(Baldi 和 Hornik,1989;Saxe 等,2014;Arora 等,2018)。它们被广泛用于研究精确训练动力学和涌现现象(Saxe 等,2019;Lampinen 和 Ganguli,2019;J Dominé 等,2023;Nam 等,2025)。近期多分支架构受到关注。值得注意的是,Shi 等(2022)和 Saxe 等(2022)表明,在连续时间梯度流(GF)下,并行路径表现出"赢家通吃"的动力学。具体而言,他们发现某些路径主导了特征学习,要么由小的初始化不对称性驱动(Shi 等,2022),要么由结构不对称性(如深度或路径间的共享表征)驱动(Saxe 等,2022)。

**GD的隐式偏置与稳定性边缘**。与GF不同,具有大学习率的离散时间梯度下降(GD)会诱导出独特的动力学区域,通常运行在"稳定性边缘"(EoS)(Cohen 等,2021;Wu 等,2018)。理论和实证研究表明,该区域的不稳定性充当隐式正则化器,驱动模型走向更平坦的极小值(Damian 等,2023)或诱导有利于泛化的短暂"弹射"阶段(Lewkowycz 等,2020;Zhu 等,2024)。近期工作通过自稳定化(Damian 等,2023)和中心流(Cohen 等,2025)等机制形式化了这些离散动力学,强调了GD如何避开景观中最尖锐的方向。

**线性模型中的GD**。近期研究开始将这些见解专门桥接到线性模型。Marion 和 Chizat (2024) 以及 Even 等 (2023) 表明,线性网络中的GD明确偏好平坦极小值,这与GF的隐式偏置不同。与我们工作最相关的是,Ghosh 等 (2025) 分析了稳定性阈值之外的深度矩阵分解,识别出振荡行为以及违反GF预测的收敛性质。我们的工作将这些发现扩展到 Shi 等 (2022) 的多路径设置,证明大步长GD的稳定性约束覆盖了GF的对称性破坏倾向,迫使特征在各路径间**重新平衡**以降低尖锐度。

## 3 问题设定

我们研究一个有$H$条并行路径的深度线性网络,路径由$h\in[H]=\{1,\cdots,H\}$索引。路径$h$具有深度$L_h$,层$\ell\in[L_h]$的权重矩阵为$W_{h\ell}\in\mathbb{R}^{d\times d}$。该架构遵循 Shi 等 (2022) 的多路径公式。路径$h$的端到端映射是有序乘积:
$$\Omega_h \;:=\; W_{hL_h}W_{hL_h-1}\cdots W_{h1}.$$
(1)
网络的整体输入-输出映射是各路径映射的和:
$$M \;:=\; \sum_{h=1}^H \Omega_h.$$
(2)
与先前关于深度矩阵分解的理论工作(Ghosh 等,2025)一致,为便于理论分析,我们关注方形情况 $W_{h\ell}\in\mathbb{R}^{d\times d}$。

### 3.1 优化目标

令 $\Theta=\{W_{h\ell}\}_{h\in[H],\ell\in[L_h]}$ 表示所有参数。我们通过最小化平方Frobenius损失来拟合目标矩阵 $M_\star\in\mathbb{R}^{d\times d}$:
$$\mathcal{L}(\Theta) \;=\; \frac12\,\|M-M_\star\|_F^2.$$
(3)
我们考虑离散时间梯度下降更新:
$$W_{h\ell}(t+1) \;=\; W_{h\ell}(t) \;-\; \eta\,\nabla_{W_{h\ell}}\mathcal{L}(\Theta(t)),$$
(4)
其中步长 $\eta>0$。

### 3.2 目标对齐参数化与SVS集

设目标的SVD为 $M_\star=U_\star\Sigma_\star V_\star^\top$, $\Sigma_\star=\mathrm{diag}(\sigma_{\star 1},\cdots,\sigma_{\star d})$。
(5)
深度线性网络分析中的一个标准简化是将每条路径的端到端奇异向量与目标对齐,从而使得动力学在不同模式间解耦(Saxe 等,2014)。我们采用这种参数化的多路径扩展,即 Ghosh 等 (2025) 的**奇异向量静止** (SVS) 集。SVS集由参数配置 $\Theta$ 组成,其中每一层因子化为:
$$W_{h\ell}=Q_{h\ell+1}\Sigma_{h\ell}Q_{h\ell}^\top,\quad Q_{h1}=V_\star,\quad Q_{hL_h+1}=U_\star,$$
(6)
具有固定的正交矩阵 $\{Q_{h,\ell}\}$ 和对角阵 $\Sigma_{h\ell}$。在 (6) 下,相邻正交矩阵在乘积中抵消,因此每条路径的映射在目标基下是对角阵:
$$\Omega_h \;=\; U_\star\Big(\prod_{\ell=1}^{L_h}\Sigma_{h\ell}\Big)V_\star^\top.$$
(7)
梯度下降保持SVS集:若 $\Theta(t)$ 属于该集合,则 $\Theta(t+1)$ 也属于(附录E.1)。类似的目标对齐约化出现在 Saxe 等 (2014, 2022);Arora 等 (2019);Gidel 等 (2019);Varre 等 (2023);Chou 等 (2024);Kwon 等 (2024) 中。我们通过目标奇异向量对 $(u_{\star i},v_{\star i})$($U_\star$ 和 $V_\star$ 的第 $i$ 列)来索引模式,并跟踪标量**模式系数**:
$$\sigma_{hi}(t) \;:=\; u_{\star i}^\top \Omega_h(t) v_{\star i},$$
(8)
$$\sigma_i(t) \;:=\; u_{\star i}^\top M(t) v_{\star i} = \sum_{h=1}^H \sigma_{hi}(t).$$
(9)
在SVS集上,$\sigma_{hi}(t)$ 等于 $\Omega_h(t)$ 的第 $i$ 个奇异值,且学习动力学在不同模式 $i\in[d]$ 间解耦。

SVS集上的模式解耦将损失分解为独立的标量模式损失:
$$\mathcal{L}(\Theta)=\sum_{i=1}^d \mathcal{L}_i,\quad \mathcal{L}_i=\frac12\Big(\sum_{h=1}^H \sigma_{hi}-\sigma_{\star i}\Big)^2.$$
(10)

### 3.3 深度平衡初始化

我们初始化每条路径为:
$$W_{h\ell}(0) \;=\; \alpha_h^{1/L_h} I_d,$$
(11)
其中 $\alpha_h>0$ 是与路径相关的小尺度。该初始化将 $\Theta(0)$ 置于SVS集,并在每条路径内均衡层间奇异值。因此它位于**深度平衡流形**上,定义为:
$$\sigma_{hi}^{(\ell)} \;=\; \sigma_{hi}^{1/L_h},\qquad \forall\,h\in[H],\,\ell\in[L_h],\,i\in[d],$$
(12)
其中 $\sigma_{hi}^{(\ell)}$ 表示路径 $h$ 第 $\ell$ 层的第 $i$ 个奇异值。对于对称目标 $M_\star=V_\star\Sigma_\star V_\star^\top$,训练过程中轨迹保持在该流形(以及SVS集)上(附录E.1中的命题B.4)。尺度 $\alpha_h$ 可能在不同路径间不同。这种微小的初始化不对称性触发了第5节中分析的对称性破坏动力学。

## 4 多路径深度线性模型中的尖锐度降低

在本节中,我们推导深度平衡流形上全局极小值处路径数 $H$ 与损失尖锐度之间的关系。本节假设同质深度 $L_h=L$。我们证明将目标特征分散到多条路径上能显著降低尖锐度。所有结果的详细证明见附录C。

### 4.1 尖锐度分析

损失的尖锐度由全局极小值处($M=M_\star$)Hessian矩阵 $\nabla^2\mathcal{L}(\Theta)$ 的最大特征值决定。在SVS集(第3.2节)上,Hessian在不同模式间分解,因此我们可以独立分析每个模式 $i\in[d]$ 的Hessian贡献。

###### 命题 4.1(模式主导特征值)。在深度平衡流形限制下的SVS集内的任何全局极小值处,来自模式 $i$ 的Hessian贡献具有一个非零特征值,由下式给出:
$$\lambda_i = L \sum_{h=1}^H \sigma_{hi}^{2-\frac{2}{L}}.$$
(13)

由于在此流形上Hessian是模式间的分块对角阵,且每个块是秩一的,因此损失尖锐度等于 $\lambda_{\max}=\max_{i\in[d]} \lambda_i$。这一结果强调了尖锐度取决于总奇异值 $\sigma_{\star i}$ 如何在 $H$ 条路径间分布。我们现在陈述关于这些值最优分布的主要定理。

$$\eta < 2/S_1 \quad \eta > 2/S_1 \quad \eta = 2/\lambda_1^{\min}$$

相似文章

Flatland:大步长梯度下降的冒险

arXiv cs.LG

本文探讨了在非L-光滑目标上梯度下降收敛的最大步长这一开放问题,引入了在稳定性边缘运行且能够全局最小化尖锐度的自适应方法。

一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍

Hugging Face Daily Papers

本文挑战了异步流水线并行中一步梯度延迟天生不稳定的假设,表明性能下降取决于优化器的选择。研究证明,Muon等优化器对一步延迟具有鲁棒性,并引入了一种基于误差反馈的修正方法以进一步缓解陈旧的梯度问题,在高达10B参数的LLM预训练中实现了接近同步训练的性能。