无子空间可追踪:低秩训练中的不可辨识性与优化器状态
摘要
本文通过实验证明,在GaLore等低秩训练方法中,梯度的前r维子空间除了一个小的可复现核心外是不可辨识的,估计器噪声主导了表观旋转。文章分析了这对优化器状态传输的影响,并引入了LDAdam,它在困惑度上优于GaLore。
arXiv:2607.05872v1 公告类型:新
摘要:内存高效的优化器(如GaLore)通过将梯度投影到每T步重新计算的秩r子空间来训练大型语言模型,假设该子空间是一个缓慢漂移且可跟踪的对象。我们证明,除了一个小的可复现核心外,不存在这样的对象。在同一步骤中从不同小批量计算出的前r子空间的两个估计值,其差异与相隔T步的估计值相当(Pythia-160M,r=128时,分别为最大弦距离sqrt(2r)的0.73和0.74):每次刷新时的表观旋转主要由估计器噪声主导。这一结论在三个架构类别的四个模型族(参数从70M到6.9B)中均成立,且随规模扩大而增强,在视觉变换器中则较弱。在128个方向中,只有约39个方向在小批量间可复现,且平均化无法恢复其余方向:在N次平均下,梯度谱尾以N^(-1/4)而非纯噪声的N^(-1/2)衰减,因此任何平均预算都无法使子空间明确定义。相反,有效的做法是将每次刷新视为对Adam状态的坐标变换。盲目携带第二矩的效果比最佳盲旋转估计器差约(r-k*)/2,而第一矩通过旋转精确传输——这是各向同性梯度下的最优线性映射,也是LDAdam采用的规则。在1B模型上经过40k步(3个种子)训练,完整版LDAdam在beta2=0.999时达到18.7的困惑度,优于未传输的GaLore在其最佳beta2固定值下(19.3);将第二矩记忆缩短至beta2=0.99有助于刷新优化器,但对于经典GaLore效果甚微,且全秩对照则逆转此效应。一个可量化的事实——子空间不可辨识性——阐明了GaLore为何有效、哪些补丁有效,以及在信任低秩假设前应检查什么:可复现秩k*。
查看缓存全文
缓存时间: 2026/07/08 04:45
# 低秩训练中的不可辨识性与优化器状态 来源:https://arxiv.org/html/2607.05872
###### 摘要
内存高效的优化器(如 GaLore)通过将梯度投影到每 \( T \) 步重新计算的秩 \( r \) 子空间上来训练大语言模型,其假设是该子空间是一个缓慢漂移且可追踪的对象。我们证明,除了一小部分可复现的核心之外,并不存在这样的对象。在同一训练步上,从不同小批次计算出的前 \( r \) 子空间的两个估计值之间的差异,与间隔 \( T \) 步计算出的两个估计值之间的差异几乎一样大(在 Pythia-160M 上,\( r=128 \) 时,测得的弦距离最大值 \( \sqrt{2r} \) 的 0.73 对比 0.74):每次刷新时的表观旋转主要是由估计器噪声主导的。这一现象在四个模型家族(涵盖三种架构类别)中均成立,参数量从 70M 到 6.9B,并随规模增大而加强;在视觉 Transformer 中则稍弱。只有约 39 个方向(共 128 个)在不同小批次间是可复现的,并且平均化无法恢复其余方向:在 \( N \) 折平均下,梯度谱的尾部以 \( N^{-1/4} \) 的速率收缩,而非纯噪声下的 \( N^{-1/2} \),因此没有任何平均预算能使子空间被良好定义。在 Pythia-1B 上,基于一万步平均的基在每次刷新后仍然移动了约 84% 的几何最大值,而改变平均强度对困惑度的影响很小(困惑度跨度仅为 0.36)。实际上,有益的改进来自于将每次刷新视为对 Adam 状态的坐标变换。盲目携带二阶矩(second moment)的损失,与最优的旋转无关估计器相比,大约差了 \( (r - k^\star)/2 \);而一阶矩(first moment)在旋转中精确传输,这是各向同性梯度下的最优线性映射,也是 LDAdam 所用的规则。在 1B 参数、40k 步的三种子对比实验中,完整的 LDAdam 更新在默认 \( \beta_2 = 0.999 \) 下达到了 18.7 的困惑度,优于未迁移状态的 GaLore 在其最佳 \( \beta_2 \) 修复后的结果(19.3)。将二阶矩的记忆缩短至 \( \beta_2 = 0.99 \) 有助于刷新型优化器在其报告配方下,困惑度改善 1.8 到 26 不等,但对于标准 GaLore 而言,效果较小且对配方敏感;一个全秩对照组则反转了这一偏好。一个可测量的事实——子空间不可辨识性——阐明了 GaLore 为何有效、哪些补丁有效,以及在信任低秩假设之前应检查什么:可复现秩 \( k^\star \)。
## 1 引言
训练大型模型日益受到优化器内存的瓶颈限制:Adam 为每个参数存储两个矩,使得内存占用是权重本身的两倍。低秩梯度优化器(如 GaLore (Zhao et al., 2024))通过将每个梯度 \( G \in \mathbb{R}^{m \times n} \) 投影到其前 \( r \) 左奇异子空间上,在得到的 \( r \) 维空间中运行 Adam,并每隔 \( T \) 步重新计算一次子空间,从而绕过这个问题。这以较小的内存开销达到了与全秩 Adam 相当的效果,并衍生出一系列改进方法 (Robert et al., 2025; Rajabi et al., 2025b; Zmushko et al., 2024; He et al., 2024; Zhu et al., 2024)。整个方法背后有一个很少被明确阐述、据我们所知也从未被测量的几何前提:梯度的前 \( r \) 子空间是一个有意义的、缓慢变化的物体,刷新操作可以追踪它。如果这个前提成立,那么连续两次对子空间的估计应该几乎重合,而跨刷新携带优化器状态只会是一个小的修正。我们测量了这个前提,结果发现,除了一小部分可复现的核心之外,并不存在这样的物体。以弦距离 \( \|\Delta U\|_F \) 衡量的连续子空间之间的旋转,在每次刷新时都饱和到其几何最大值 \( \sqrt{2r} \) 的 96.7%–99.6%,并且在训练过程中的每个秩 \( r \in \{32, \dots, 256\} \) 上均是如此(Pythia-1B (Biderman et al., 2023);160M 行为相同):每次刷新都采用了一个几乎正交的框架。决定性的测量是去除了时间因素的那个。在一个预训练好的 Pythia-160M 检查点上,根据不相交的小批次在同一训练步计算出的前 \( r \) 子空间的两个估计值,相差 \( 0.725 \sqrt{2r} \),与子空间在完整的 160M 训练步刷新间隔内旋转的 \( 0.742 \sqrt{2r} \) 仅相差几个百分点(第 3.2 节的轨迹控制证实,这种差异在训练的各个阶段都很小)。表观旋转并不是运动。它是估计器噪声:在 GaLore 提取的 \( r=128 \) 个方向中,只有 \( k^\star \approx 39 \) 个方向能在同一个批次的两个半批之间复现,其余方向随着样本被重新抽取。(两个检查点数值均低于训练期间的饱和水平,原因论文中有量化:预训练梯度的可复现尖峰更强,并且 \( k^\star \) 共享方向将两个估计值拉近。)其原因在于谱特性,并且无法通过平均化来治愈。每个矩阵的梯度谱有一个小的主导尖峰,包含几个到约 20 个方向,这与 Gur-Ari 等人 (2018) 记录的分类任务中的微小梯度子空间一致,随后是一个平滑的尾部,在 GaLore 使用的秩附近没有任何间隙:当 \( r=128 \) 时,相邻奇异值的比值约为 \( \approx 1.005 \),有效秩跨越了这个截止点,前 \( r \) 块仅包含梯度核质量的 46%–68%。在无间隙的谱主体内部进行秩截断,会返回近乎简并的方向,这些方向会自由地重新采样(Davis–Kahan)。对 \( N \) 个梯度进行平均并不能打开一个间隙:谱深部尾部的收缩速度仅为 \( \approx N^{-1/4} \),而非纯噪声的 \( N^{-1/2} \),因为它本身是具有幂律谱的信号,因此没有任何平均预算能使前 \( r \) 框架被良好定义。
然而,GaLore 仍然有效,其原因并不耀眼:它捕捉了梯度能量中大致恒定的一部分,而这个框架是被重新抽取的,而非被追踪的(第 4 节)。重新抽取有一个具体的代价,并且我们现在可以对这些代价的补救措施进行排序。Adam 的二阶矩是一个慢速平均值,在默认的 \( \beta_2 = 0.999 \) 下,记忆时间 \( \tau_v = 1/(1-\beta_2) \approx 1000 \) 步;每 \( T \ll \tau_v \) 步就扰动一次的框架会使它长期失准。显而易见的修复方法——通过随时间平均投影来稳定基——正如几何所预测的那样失败了:在 Pythia-1B 上,基于一万步平均的基在每次刷新后仍然移动了最大值的 84%(相比之下,无平均时为 97%),并且最终的困惑度在四个数量级的平均窗口上基本平坦(困惑度跨度仅为 0.36)。有效的方法是移动状态,而不是移动框架。一阶矩通过旋转 \( R = U_{\rm new}^\top U_{\rm old} \) 精确传输;二阶矩通过 \( R \) 的平方项传输,而忽略 \( R \) 的携带方式与最优的盲替代方案相比,大约差了 \( \approx (r - k^\star)/2 \)(第 5 节,附录 B)。在 1B 参数的三种子控制对比实验中,采用传输状态(即 LDAdam 更新,它结合了传输与误差反馈)在默认 \( \beta_2 \) 下达到了 18.73 的困惑度,优于未传输状态的 GaLore 在其最佳 \( \beta_2 \) 修复后的结果(19.28)。更便宜的补救措施——将记忆缩短至 \( \beta_2 = 0.99 \)——有助于我们测试的刷新型优化器在它们匹配的配方下,困惑度改善 1.8 到 26 不等(效果的大小以及对于标准 GaLore 而言,效果的符号都取决于配方),而一个没有刷新操作的全秩对照组则反转了这一偏好,从而孤立出重新抽取是原因所在。
#### 贡献。
- • **这个对象并不存在。** 一个同一步控制实验表明,GaLore 子空间表观上的每次刷新旋转(\( \|\Delta U\|_F \approx \sqrt{2r} \),在不同秩和规模下饱和于 96.7%–99.6%)等于两个同时估计值之间的差异:该子空间在统计学上是不可辨识的,除了一小部分可复现的核心(\( k^\star \approx 39 \),共 128 个方向)之外(第 3 节)。同样的现象在四个模型家族(三种架构类别)、从 70M 到 6.9B 参数以及一个视觉 Transformer 中均成立,并且随规模增大而加强(第 3.6 节)。
- • **为什么如此,以及为什么平均化无法修复它。** 梯度谱在 \( r \) 处是无间隙的,其深部尾部是幂律信号,在 \( N \) 折平均下只以 \( \approx N^{-1/4} \) 的速度收缩;\( k^\star \) 可以从谱中预测出来(误差在直接计数的 8% 以内,各层的排序与测得的能量保持率一致),并且没有任何平均预算能打开一个间隙(第 3 节)。在 1B 模型上,一万步的基平均对实际旋转和最终困惑度都基本没有改变(第 5 节)。
- • **应该做什么,附带理论分析和控制测试。** 优化器状态应该通过每次刷新进行传输:一阶矩通过 \( R \) 传输,二阶矩通过 \( R \) 的平方项传输,盲携带被证明是 \( \approx (r - k^\star)/2 \) 次优的(附录 B)。一个在 1B/40K 上的三种子 \( 2 \times 2 \) 对比实验表明,在默认 \( \beta_2 \) 下的传输优于单独的 \( \beta_2 \) 修复(18.73 vs 19.28),并且两种补救措施是部分独立的(第 5 节)。
- • **一个处方和一个探针。** 对于任何刷新梯度子空间的优化器(已验证于标准 GaLore 和 LDAdam,并以 APOLLO-Mini 作为方向一致性检查,同时一个全秩对照组反转了偏好),将 \( \beta_2 \) 降至 0.99,并在信任某一秩之前先测量 \( k^\star \):如果 \( r > k^\star \),那么多余的方向就是正在被刷新的噪声(第 5 节)。我们的研究对象是这些方法所计算的梯度子空间,而非 LoRA 式的权重参数化(第 2 节)。
## 2 设置与符号
#### GaLore 系列优化器。
我们研究这样的优化器:通过在一个周期性地重新计算的梯度低秩子空间内运行 Adam,来训练权重矩阵 \( W \in \mathbb{R}^{m \times n} \)。在时刻 \( t \),梯度为 \( G_t = \nabla_W \mathcal{L} \in \mathbb{R}^{m \times n} \)。每 \( T \) 步,优化器计算当前梯度的前 \( r \) 左奇异子空间,即 \( U_t \in \mathbb{R}^{m \times r} \),满足 \( U_t^\top U_t = I_r \)(这些列是 \( G_t \) 的前导左奇异向量),并在接下来的 \( T \) 步内将其固定。在一个区间内,它将每个梯度投影到该子空间上:\( \tilde{G} = U^\top G \in \mathbb{R}^{r \times n} \),在那个 \( r \) 维空间中应用 Adam 更新,然后将结果映射回来:\( W \leftarrow W - \eta \, U \, \mathrm{Adam}(\tilde{G}) \)。这就是 GaLore (Zhao et al., 2024);同样的模板——**显式构建一个前 \( r \) 梯度子空间,每 \( T \) 步刷新一次**——是围绕它发展起来的系列方法的基础 (Robert et al., 2025; Rajabi et al., 2025b; Zmushko et al., 2024; He et al., 2024; Zhu et al., 2024)。我们的主张仅限于这个系列。LoRA 和其他低秩**参数化**方法,它们是在**更新**上施加低秩结构,并且从不计算梯度子空间,不在本文讨论范围内。
#### Adam 的两个时钟。
Adam (Kingma and Ba, 2015) 携带投影梯度的两个指数移动平均:一阶矩 \( m_t = \beta_1 m_{t-1} + (1-\beta_1) \tilde{g}_t \) 和二阶矩 \( v_t = \beta_2 v_{t-1} + (1-\beta_2) \tilde{g}_t^{\,2} \)。每个都是一个低通滤波器,其弛豫时间由其衰减率决定:
\[
\tau_m = \frac{1}{1-\beta_1} \approx 10, \quad \tau_v = \frac{1}{1-\beta_2} \approx 1000 \quad (\beta_1=0.9, \ \beta_2=0.999),
\]
所以二阶矩忘记过去的速度比一阶矩慢 100 倍。这两个时间尺度是需要与刷新间隔 \( T \) 进行比较的常数,而它们之间的不对称性是我们将在第 5 节中分析的状态过时问题的根源。
#### 测量子空间旋转。
为了量化基在刷新时变化了多少,我们比较刷新前后的基 \( U_{\rm old} \) 和 \( U_{\rm new} \in \mathbb{R}^{m \times r} \),通过它们的 \( r \) 个主角度 \( \theta_1, \dots, \theta_r \)(即 \( \mathrm{range}(U_{\rm old}) \) 和 \( \mathrm{range}(U_{\rm new}) \) 之间的角度)。奇异向量带有任意的每列符号,因此原始的 Frobenius 距离 \( \|U_{\rm new} - U_{\rm old}\|_F \) 主要由符号翻转而非旋转主导;我们先对齐符号(附录 A),然后报告校正符号后的距离:
\[
\|\Delta U\|_F = \Bigl(2r - 2\sum_{i=1}^{r} \cos \theta_i \Bigr)^{1/2}, \quad 0 \leq \|\Delta U\|_F \leq \sqrt{2r}.
\]
这是正交框架之间的弦(主角度)Frobenius 距离 (Bendokat et al., 2024):当子空间不变时,距离为 0,当两个基正交时(即对所有 \( i \) 有 \( \theta_i = \pi/2 \)),距离达到最大值 \( \sqrt{2r} \),这意味着新子空间与旧子空间没有共享任何方向。我们还追踪子空间捕获的梯度能量比例:
\[
\gamma_g = \frac{\|U U^\top G\|_F^2}{\|G\|_F^2} \in [0,1],
\]
这实际上是投影所保留的量,也是我们在第 4 节中将要返回讨论的量。
## 3 子空间是不可辨识的
GaLore 投影到的子空间每 \( T \) 步重新计算一次,并且它会移动。本节将阐明这种移动究竟是什么。测得的每次刷新基变化在所有秩和规模下都饱和于几何最大值(第 3.1 节)。然后一个同一步控制实验揭示了原因:在同一训练步、从不同小批次中获取的两个前 \( r \) 估计值之间的差异,已经与间隔 \( T \) 步获取的两个估计值之间的差异一样大(第 3.2 节)。因此,刷新并不是一个稳定物体的运动。在这些方法所使用的秩上,一个小批次梯度的前 \( r \) 子空间在统计学上是不可辨识的,仅除了一小部分可复现的核心。本节其余部分说明了原因:梯度谱在 \( r \) 处没有间隙(第 3.3 节);可辨识性(\( k^\star \))可以从谱形状中预测(第 3.4 节);并且即使是受控的平均化也无法打开一个间隙(第 3.5 节)。第 3.6 节在另外三个模型家族和一个视觉 Transformer 上重复了这一现象。相似文章
GRPO 下基于梯度的 LoRA 秩分配:一项实证研究
本研究通过实证表明,在监督微调中有效的基于梯度的 LoRA 秩分配,在基于 GRPO 的强化学习中会导致性能下降,原因在于梯度景观更为平缓以及存在梯度放大效应。
捕捉移动子空间:超越平稳性的低秩老虎机
本文研究了分段平稳的低秩线性上下文老虎机,提出了SPSC算法,该算法实现了与内在秩(而非环境维度)成比例的动态遗憾,并刻画了在标量反馈下子空间恢复的辨识边界。
分叉附近的状态空间NTK坍缩
本文发展了动力模型分叉附近梯度下降的局部理论,表明状态空间神经正切核坍缩为秩一算子,主导学习动力学,使优化有效低维且可从规范形式预测。
关于随机低秩自适应的收敛性
本文强化了LoRA的收敛性分析,将确定性预言机复杂度从指数级提升至O(epsilon^{-4}),并提出了随机变体LoRA-NSGDM和LoRA-STORM,其预言机复杂度分别改进为O(epsilon^{-8})和O(epsilon^{-6})。
通过梯度手术的持续学习低秩适配器初始化
该论文提出了Slice,一种基于梯度手术的LoRA适配器初始化方法,用于持续学习,通过调和当前任务和过去任务的冲突梯度来减少灾难性遗忘,实现了更好的稳定性-可塑性权衡。