在梯度与自然梯度之间:LoRA初始化的连续统
摘要
本文提出统一LoRA(ULoRA),一种用于低秩适配的双参数预条件梯度初始化家族,表明现有的LoRA初始化方法是该连续统上的点。作者证明,经过调优的ULoRA在RoBERTa-base上的GLUE任务中达到或超过全微调性能,并在LLaMA 2-7B上的GSM8K任务中具有竞争力,同时引入了ULoRA-Auto以实现零搜索部署。
查看缓存全文
缓存时间: 2026/07/30 09:56
# 梯度与自然梯度之间:LoRA初始化的连续谱
来源:https://arxiv.org/html/2607.26247
###### 摘要
低秩适配(LoRA)以全量微调成本的一小部分对大型预训练模型进行微调,但其性能强烈依赖于适配器的初始化方式。近期方案从下游损失梯度初始化适配器:有的将原始梯度投影到其主导方向,有的则先用损失曲率估计对梯度进行白化。我们证明,这些看似不同的方法实际上是同一个连续谱上的不同点:一个由谱白化指数和类Adam对角指数控制的两参数预条件梯度初始化族,我们称之为统一LoRA(ULoRA)。在完整学习率搜索下遍历该族,我们发现没有单一的固定预条件强度占据主导:最佳工作点取决于任务,并且通常严格位于族内,远离已发表的端点。作为该族的上界,经过调优的ULoRA配置在RoBERTa-base的所有五个GLUE任务上匹配或超越全量微调,并在LLaMA 2-7B的GSM8K上可与最强基线竞争。我们无需搜索的可部署变体ULoRA-Auto,根据测得的谱统计信息逐层选择指数,在无额外搜索成本下接近此上界,并在可部署LoRA方法中排名靠前或领先。我们的结果表明,LoRA初始化和曲率预条件的原则性设计空间应被视为一个可调维度,而非固定的设计决策。
## 引言
将大型预训练模型适配到下游任务已成为标准做法。全量微调性能强劲,但更新所有参数,成本高昂且往往不必要。低秩适配(LoRA)(Hu et al. 2022 (https://arxiv.org/html/2607.26247#bib.bib1)) 通过将权重更新限制为低秩形式 \(\Delta W = \frac{1}{\sqrt{r}} BA\) 来解决此问题,其中仅训练两个小矩阵 \(A \in \mathbb{R}^{r \times d_{\text{in}}}\) 和 \(B \in \mathbb{R}^{d_{\text{out}} \times r}\)。这使可训练参数减少几个数量级,同时保持预训练主干冻结。
尽管效率高,LoRA方法可能不如全量微调,尤其是在小数据集和复杂任务上。一个关键因素是 \(A\) 和 \(B\) 的初始化:标准LoRA使用 \(B=0\) 和随机 \(A\),这未提供关于目标任务的信息。近期工作表明,从任务数据中选择初始子空间能显著缩小性能差距。LoRA-GA (Wang and others 2024 (https://arxiv.org/html/2607.26247#bib.bib7)) 和 LoRA-One (Zhang et al. 2025 (https://arxiv.org/html/2607.26247#bib.bib20)) 将适配器与损失梯度的主导方向对齐。CG-LoRA (Zheng and Proutière 2026 (https://arxiv.org/html/2607.26247#bib.bib21)) 进一步使用Kronecker因子分解曲率(K-FAC)对梯度进行白化。
#### 差距。
尽管取得了进展,现有的基于梯度的方法在如何使用梯度进行初始化方面做出了僵化的选择。纯梯度方法(LoRA-GA,LoRA-One)完全忽略曲率,从而忽视了损失景观的二阶信息。曲率白化方法(CG-LoRA)应用固定的、理论驱动的白化指数 \(-1/2\),当曲率估计噪声较大时(这在实践中常见于小批量和非线性模型),这可能过于激进。关于不同程度的曲率预条件是否更好,尚未有人研究。
#### 我们的方法。
我们提出统一LoRA(ULoRA;图1 (https://arxiv.org/html/2607.26247#Sx3.F1)),它表明所有现有的基于梯度的初始化方法都是一个由两个标量参数化的通用框架的特例:
- **谱白化指数 (\(\alpha\))**,控制K-FAC特征值如何重新缩放梯度方向。\(\alpha=0\) 移除曲率缩放;\(\alpha=1\) 恢复CG-LoRA。
- **对角预条件指数 (\(\beta\))**,通过层输入和输出梯度的经验方差进行归一化,类似于Adam中的二阶矩缩放 (Kingma and Ba 2014 (https://arxiv.org/html/2607.26247#bib.bib22))。
这个两参数族再现了梯度投影 (\(\alpha=0, \beta=0\))、类Adam预条件 (\(\alpha=0, \beta>0\))、全曲率白化 (\(\alpha=1, \beta=0\)) 以及结合两者的混合策略。通过对 \((\alpha, \beta)\) 进行系统网格搜索,我们发现并非两大族中的某一个占主导,中间配置在所有评估任务上经常取得更优性能。
#### 贡献。
我们的贡献如下:
1. **我们提出ULoRA**,一个两参数的LoRA初始化策略族,将现有的基于梯度和基于曲率的方法统一在单一框架下。
2. **我们提供了 \(\alpha\) 和 \(\beta\) 的特征描述**,并展示了它们如何作为特例恢复已知方法,为LoRA初始化建立了一个原则性的设计空间。
3. **我们证明**,曲率预条件的最优水平既非零也非完整值,中间值在各个语言基准上始终更鲁棒。
作为该族的 oracle 上界,经过调优的ULoRA配置在RoBERTa-base的所有五个GLUE任务上匹配或超越全量微调,而可部署、无需搜索的ULoRA-Auto恢复了大部分增益,并在LLaMA 2-7B的GSM8K和GLUE任务上,在可部署LoRA方法中排名靠前或领先。
## 相关工作
#### 标准LoRA的变体。
标准LoRA (Hu et al. 2022 (https://arxiv.org/html/2607.26247#bib.bib1)) 初始化 \(B=0\) 和随机 \(A\),因此微调从预训练模型的零扰动开始。第一类后续工作改进的是适配器的训练方式而非起始点:rsLoRA (Kalajdzievski 2023 (https://arxiv.org/html/2607.26247#bib.bib23)) 通过 \(\gamma / \sqrt{r}\) 缩放更新以稳定高秩,LoRA+ (Hayou et al. 2024 (https://arxiv.org/html/2607.26247#bib.bib24)) 为 \(A\) 和 \(B\) 分配不同的学习率,DoRA (Liu et al. 2024 (https://arxiv.org/html/2607.26247#bib.bib25)) 将权重更新分解为幅度和方向分量,AdaLoRA (Zhang et al. 2023 (https://arxiv.org/html/2607.26247#bib.bib5)) 根据参数重要性在层间重新分配秩预算。这些方法均未使用任务数据来选择初始子空间,而这正是ULoRA所操作的维度。
#### 预训练信息驱动的初始化。
第二类工作通过使初始化本身依赖于数据来缩小与全量微调的差距。早期方法从模型而非任务中提取子空间:PiSSA (Meng et al. 2024 (https://arxiv.org/html/2607.26247#bib.bib4)) 从预训练权重 \(W_0\) 的主奇异分量初始化,LoftQ (Li et al. 2024 (https://arxiv.org/html/2607.26247#bib.bib26)) 联合优化量化和低秩初始化,EVA (Paisch et al. 2025 (https://arxiv.org/html/2607.26247#bib.bib27)) 使用激活向量的SVD来最大化捕获的激活方差。这些子空间反映的是预训练模型已经表示的内容,而非下游损失希望将其移动的方向。
#### 基于梯度的初始化。
与ULoRA最相关的方法直接从下游损失梯度推导子空间。LoRA-GA (Wang and others 2024 (https://arxiv.org/html/2607.26247#bib.bib7)) 将适配器与第一步全量微调梯度对齐,LoRA-One (Zhang et al. 2025 (https://arxiv.org/html/2607.26247#bib.bib20)) 证明在温和假设下,单步全梯度能产生接近最优的子空间对齐。CG-LoRA (Zheng and Proutière 2026 (https://arxiv.org/html/2607.26247#bib.bib21)) 更进一步:不使用原始梯度,而是用Kronecker因子分解曲率(K-FAC)(Martens and Grosse 2015 (https://arxiv.org/html/2607.26247#bib.bib18)) 对梯度进行白化后再提取子空间,其动机是函数空间对齐目标。因此,这些方法在恰好一个设计决策上有所不同,即在提取子空间之前,曲率信息以多大程度重塑梯度:完全不(LoRA-GA, LoRA-One)或完全逆平方根白化(CG-LoRA)。ULoRA使这一决策显式且连续,参数化了从未白化梯度投影、类Adam对角归一化到全谱白化之间的谱,并表明最佳工作点严格位于已发表的极端值之间。
#### 学习率敏感性:
LoRA对学习率选择高度敏感,且经过良好调优的标准LoRA可与更复杂的方法竞争 (Lee et al. 2026 (https://arxiv.org/html/2607.26247#bib.bib19))。这激发我们在所有方法和配置上进行完整的学习率扫描。
## 方法
参考图注图1:ULoRA概览。左上:由谱白化 (\(\alpha\)) 和对角缩放 (\(\beta\)) 张成的连续插值空间,以及现有方法(例如 CG-LoRA)。右上:预条件投影梯度 \(F^{\alpha,\beta}\)。下方:整个流程的示意图。### 预条件梯度:统一视角
优化器的主要区别在于它们在更新步之前如何对梯度 \(\nabla_W \mathcal{L}\) 进行预条件。普通梯度下降使用原始梯度,\(\Delta W \propto \nabla_W \mathcal{L}\)。Adam (Kingma and Ba 2014 (https://arxiv.org/html/2607.26247#bib.bib22)) 通过逆均方根对每个坐标重新缩放,\(\Delta W \propto \mathrm{diag}(v)^{-1/2} \odot \nabla_W \mathcal{L}\)。自然梯度下降使用全曲率,\(\Delta W \propto F^{-1} \nabla \mathcal{L}\) (Amari 1998 (https://arxiv.org/html/2607.26247#bib.bib9));在K-FAC的Kronecker分解 \(F \approx T \otimes S\) (Martens and Grosse 2015 (https://arxiv.org/html/2607.26247#bib.bib18)) 下,这变为 \(\Delta W \propto T^{-1} \nabla_W \mathcal{L} \, S^{-1}\)。Shampoo (Gupta et al. 2018 (https://arxiv.org/html/2607.26247#bib.bib39)) 使用四分之一次方因子在这些机制之间插值,\(\Delta W \propto T^{-1/4} \nabla_W \mathcal{L} \, S^{-1/4}\)。所有这些都是一个单一两参数族的实例:
\[
P_{\alpha,\beta} \;=\; T^{-\alpha/2}\Big[d_T^{-\beta/2} \odot \nabla_W \mathcal{L} \odot d_S^{-\beta/2}\Big] S^{-\alpha/2},
\tag{1}
\]
其中 \(\alpha\) 控制Kronecker因子分解曲率白化的强度,\(\beta\) 控制类Adam逐特征对角归一化,而 \(d_S, d_T\) 是 \(S, T\) 的对角线。设置 \((\alpha, \beta) = (0,0)\) 恢复原始梯度;\((0, \beta)\) 恢复类Adam对角缩放;\((2,0)\) 恢复K-FAC自然梯度;\((0.5, 0)\) 匹配Shampoo的四分之一次方预条件;\((1,0)\) 恢复逆平方根白化。
我们的关键观察是,基于梯度的LoRA初始化面临同样的设计选择。LoRA-GA (Wang and others 2024 (https://arxiv.org/html/2607.26247#bib.bib7)) 和 LoRA-One (Zhang et al. 2025 (https://arxiv.org/html/2607.26247#bib.bib20)) 从原始梯度提取适配器子空间,即 \(P_{0,0}\),而CG-LoRA (Zheng and Proutière 2026 (https://arxiv.org/html/2607.26247#bib.bib21)) 从白化后的梯度 \(T^{-1/2} \nabla_W \mathcal{L} \, S^{-1/2}\) 提取,即 \(P_{1,0}\)。ULoRA使这一选择显式且连续;我们从 \(P_{\alpha,\beta}\) 的前 \(r\) 维子空间初始化适配器,并在投影的Rayleigh-Ritz基中高效计算,如下所述。
### 曲率估计与梯度投影
对于具有预训练权重 \(W_0 \in \mathbb{R}^{d_{\text{out}} \times d_{\text{in}}}\) 的线性层,令 \(h_i \in \mathbb{R}^{d_{\text{in}}}\) 为层输入,\(\delta_i \in \mathbb{R}^{d_{\text{out}}}\) 为样本 \(i\) 的预激活输出梯度。在一个小的初始化批次上,损失Hessian矩阵的K-FAC近似 (Martens and Grosse 2015 (https://arxiv.org/html/2607.26247#bib.bib18)) 产生两个Kronecker因子:
\[
S = \frac{1}{n} \sum_i h_i h_i^\top \in \mathbb{R}^{d_{\text{in}} \times d_{\text{in}}}, \quad T = \sum_i \delta_i \delta_i^\top \in \mathbb{R}^{d_{\text{out}} \times d_{\text{out}}},
\tag{2}
\]
其中 \(S\) 捕获层输入的协方差,\(T\) 捕获批次内输出梯度的协方差。我们还收集逐特征二阶矩:
\[
d_S[j] = \frac{1}{n} \sum_i h_{ij}^2, \quad d_T[k] = \frac{1}{n} \sum_i \delta_{ik}^2,
\tag{3}
\]
它们是 \(S\) 和 \(T\) 的对角线元素。注意 \(d_S\) 和 \(d_T\) 是Adam用作对角曲率代理的逐坐标二阶矩。
以完整大小实例化 \(P_{\alpha,\beta}(G)\) 将与全量微调步一样昂贵,因此所有计算都在低维投影空间中进行。我们计算 \(S\) 和 \(T\) 的秩为 \(s\) (\(s = r + \text{oversample}\)) 的Rayleigh-Ritz近似,获得主特征向量和特征值:
\[
S \approx U_S D_S U_S^\top, \quad T \approx U_T D_T U_T^\top.
\tag{4}
\]
投影梯度定义为:
\[
\hat{F} = U_T^\top \, \nabla_W \mathcal{L} \, U_S \in \mathbb{R}^{s \times s}.
\tag{5}
\]
该矩阵表示压缩到Kronecker子空间中的损失梯度:它指示哪些输入和输出方向的组合包含最强的梯度信号。然后在此投影空间中应用式(1)的两个预条件指数。
### \(\beta\) 参数:类Adam对角预条件
在形成 \(\hat{F}\) 之前,我们使用对角统计量 \(d_S\) 和 \(d_T\) 对基向量 \(U_S\) 和 \(U_T\) 进行逐特征重新缩放:
\[
\tilde{U}_S = (d_S + \varepsilon_S)^{-\beta/2} \odot U_S, \quad \tilde{U}_T = (d_T + \varepsilon_T)^{-\beta/2} \odot U_T,
\tag{6}
\]
其中 \(\odot\) 表示逐元素行缩放,\(\varepsilon > 0\) 是小的数值稳定项。经验方差大(大的 \(d_S[j]\) 或 \(d_T[k]\))的特征被按比例降低权重。这直接反映了Adam中的自适应步长:正如Adam将梯度除以每个坐标的过去梯度的均方根,ULoRA将基向量除以每个特征的层输入和输出梯度的均方根。使用这些缩放基的投影梯度为:
\[
\hat{F}^\beta = \tilde{U}_T^\top \, \nabla_W \mathcal{L} \, \tilde{U}_S.
\tag{7}
\]
当 \(\beta=0\) 时,不应用对角校正,且 \(\hat{F}^0 = \hat{F}\)。当 \(\beta=1\) 时,每个特征维度由其经验标准差归一化。
### \(\alpha\) 参数:谱白化幂相似文章
超越 LoRA 与全参数微调:基于梯度引导优化器路由的大语言模型适配
本文提出了一种混合 LoRA 与全参数微调(MoLF)框架,利用梯度引导的优化器路由在 LoRA 和全参数微调之间进行自适应切换。旨在通过结合全参数微调的可塑性与 LoRA 的正则化特性,克服仅依赖静态适配方法的结构局限性。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
通过梯度手术的持续学习低秩适配器初始化
该论文提出了Slice,一种基于梯度手术的LoRA适配器初始化方法,用于持续学习,通过调和当前任务和过去任务的冲突梯度来减少灾难性遗忘,实现了更好的稳定性-可塑性权衡。
Aletheia:基于梯度引导的层选择方法,实现跨架构的高效LoRA微调
Aletheia 提出了一种基于梯度引导的层选择方法,用于高效的 LoRA 微调。该方法通过轻量级梯度探针识别与任务相关的 Transformer 层,并选择性地应用适配器,在 14 个模型上实现了 15%-28% 的训练加速,同时保持了在 MMLU、GSM8K 和 HumanEval 基准测试中的下游性能。
GRPO 下基于梯度的 LoRA 秩分配:一项实证研究
本研究通过实证表明,在监督微调中有效的基于梯度的 LoRA 秩分配,在基于 GRPO 的强化学习中会导致性能下降,原因在于梯度景观更为平缓以及存在梯度放大效应。