关于随机低秩自适应的收敛性
摘要
本文强化了LoRA的收敛性分析,将确定性预言机复杂度从指数级提升至O(epsilon^{-4}),并提出了随机变体LoRA-NSGDM和LoRA-STORM,其预言机复杂度分别改进为O(epsilon^{-8})和O(epsilon^{-6})。
arXiv:2607.21975v1 公告类型:新
摘要:低秩自适应(LoRA)优化 $J(B,A)=\mathcal L(W_\mathrm{base}+sBA)$,其中两个适配器 $B \in \mathbb{R}^{m \times r}$ 和 $A \in \mathbb{R}^{r \times n}$ 形成对冻结预训练权重矩阵 $W_\mathrm{base} \in \mathbb{R}^{m \times n}$ 的低秩更新。先前的分析表明,在确定性设置中,LoRA-GD 需要 $\exp\{\mathcal{O}(\epsilon^{-2})\}$ 次预言机调用才能找到满足 $\|\nabla J(B,A)\|\leq \epsilon$ 的 $\epsilon$-稳定点。我们强化了分析,并证明 $\mathcal{O}(\epsilon^{-4})$ 次全梯度评估足以满足同一阶条件。我们进一步研究了在无偏梯度估计和有限方差条件下的随机LoRA。我们提出了LoRA-NSGDM,它以 $\mathcal{O}(\epsilon^{-8})$ 的随机预言机复杂度找到 $\epsilon$-稳定点。在额外的均方光滑条件下,我们采用方差缩减策略并提出了LoRA-STORM,将随机预言机复杂度提升至 $\mathcal{O}(\epsilon^{-6})$。
查看缓存全文
缓存时间: 2026/07/27 07:43
# 随机低秩适配的收敛性研究 来源: https://arxiv.org/html/2607.21975 王茹¹,刘成龙²,¹¹footnotemark:1,John C.S. Lui¹ ¹香港中文大学 ²西湖大学 ###### 摘要 低秩适配(LoRA)优化 J(B,A)=L(W_base+sBA) 作用于两个适配器 B∈R^(m×r) 和 A∈R^(r×n),它们构成对冻结预训练权重矩阵 W_base∈R^(m×n) 的低秩更新。先前分析表明,在确定性设定下,LoRA-GD 需要 exp{O(ε^(-2))} 次 oracle 调用来找到满足 ‖∇J(B,A)‖≤ε 的 ε-平稳点。我们改进了分析,证明 O(ε^(-4)) 次全梯度计算足以达到相同的二阶准则。我们进一步研究在无偏梯度估计和有限方差下的随机 LoRA。我们提出 LoRA-NSGDM,该算法以 O(ε^(-8)) 的随机 oracle 复杂度找到 ε-平稳点。在附加均方光滑性条件下,我们采用方差缩减策略并提出了 LoRA-STORM,将随机 oracle 复杂度提升至 O(ε^(-6))。
## 1 引言
低秩适配(LoRA)冻结预训练权重矩阵 W_base∈R^(m×n),并将适配后的矩阵 W∈R^(m×n) 参数化为 W=W_base+sBA,其中 s>0 是固定缩放因子,B∈R^(m×r),A∈R^(r×n),通常 r≪min{m,n}。因此,BA 是可训练的低秩更新 (Hu et al., 2022 (https://arxiv.org/html/2607.21975#bib.bib2))。定义 F(X):=L(W_base+sX),LoRA 求解 min_{B,A} J(B,A):=F(BA)。这种参数化大幅减少了可训练参数量和优化器状态内存,使得 LoRA 成为适配大型模型的标准工具,包括在隐私保护的联邦和分散式微调中 (Sun et al., 2024 (https://arxiv.org/html/2607.21975#bib.bib3); Ghiasvand et al., 2025 (https://arxiv.org/html/2607.21975#bib.bib4))。LoRA 的动机与早期证据一致,即预训练语言模型可以在低维参数子空间中有效微调 (Aghajanyan et al., 2021 (https://arxiv.org/html/2607.21975#bib.bib1))。后续变体在互补方向上扩展了 LoRA:QLoRA 结合低秩适配与量化冻结模型 (Dettmers et al., 2023 (https://arxiv.org/html/2607.21975#bib.bib6));LoRA+ 使用因子特定的学习率 (Hayou et al., 2024 (https://arxiv.org/html/2607.21975#bib.bib7));PiSSA 从预训练权重的主奇异分量初始化因子 (Meng et al., 2024 (https://arxiv.org/html/2607.21975#bib.bib8));LoRA-GA 使用初始全微调梯度来选择因子初始化 (Wang et al., 2024 (https://arxiv.org/html/2607.21975#bib.bib9))。实证比较进一步表明,相似的下游准确率并不意味 LoRA 等同于全微调:两种方法在学习内容、遗忘内容以及权重更新的谱结构上可能不同 (Biderman et al., 2024 (https://arxiv.org/html/2607.21975#bib.bib11); Shuttleworth et al., 2025 (https://arxiv.org/html/2607.21975#bib.bib12))。
尽管实际成功,即使是简单的同步双因子 LoRA-GD 更新也难以分析。正如先前工作所指出的 (Sun et al., 2024 (https://arxiv.org/html/2607.21975#bib.bib3); Malinovsky et al., 2024 (https://arxiv.org/html/2607.21975#bib.bib5)),即使 F 具有 Lipschitz 梯度,因子化目标 J(B,A)=F(BA) 通常没有全局 Lipschitz 梯度于 (B,A),因为映射 (B,A)↦BA 是双线性的。因此标准的非凸光滑收敛理论不能直接应用于同步因子动力学。现有理论解决了几种互补问题。它刻画了 LoRA 的表达能力 (Zeng and Lee, 2024 (https://arxiv.org/html/2607.21975#bib.bib13)),在 NTK 和更一般区域的景观 (Jang et al., 2024 (https://arxiv.org/html/2607.21975#bib.bib10); Kim et al., 2025 (https://arxiv.org/html/2607.21975#bib.bib14)),以及矩阵分解的连续时间动力学 (Xu et al., 2025 (https://arxiv.org/html/2607.21975#bib.bib15))。其他分析依赖于无限宽度极限,或通过不等学习率、预条件或结构化因子修改因子更新 (Hayou et al., 2024 (https://arxiv.org/html/2607.21975#bib.bib7); Zhang and Pilanci, 2024 (https://arxiv.org/html/2607.21975#bib.bib16); Ding et al., 2026 (https://arxiv.org/html/2607.21975#bib.bib22))。这些结果并未对一般光滑非凸损失上原始的同步双因子 LoRA-GD 更新提供有限时间平稳性保证。
近期,Mu and Klabjan (2026 (https://arxiv.org/html/2607.21975#bib.bib23)) 对 F 的光滑性和下有界性条件下提供了 LoRA-GD 的非渐近分析。他们证明 LoRA-GD 以速率 min_{0≤t<T} ‖∇J(V_t)‖_F ≤ exp{O(ε^(-2))} 收敛。这提出了 O(exp(ε^(-2))) 的梯度复杂度,且指数依赖于 ε^(-2),因此在实际中可能很大。本文在以下方面进行了实质性改进:
1. **改进的确定性复杂度**。我们证明,O(ε^(-4)) 次全梯度计算足以达到 ‖∇J(V)‖_F ≤ ε。这取代了指数复杂度,因而是指数级的改进。
2. **随机 LoRA 及无界方差**。我们首次对 LoRA 随机梯度下降(LoRA-SGD)提供了收敛性分析。我们证明了即使是自适应步长,经验 LoRA-SGD 更新也会使方差在期望上爆炸。因此我们提出了 LoRA-NSGDM(算法 2),它使用动量平均和归一化步骤来确保稳定性,并达到 O(ε^(-8)) 的随机 oracle 复杂度。
3. **方差缩减**。在附加的均方光滑性条件下,我们提出了 LoRA-STORM(算法 3),该算法采用 STORM 风格的方差缩减,并将随机 oracle 复杂度改进至 O(ε^(-6))。
本文中的所有复杂度均以 ε 的小数位表示,并忽略对数因子。我们在表 1 中总结了结果,并与 Mu and Klabjan (2026) 的现有保证进行了对比。
| 方法 | 设定 | 保证 | 复杂度 |
|------|------|------|--------|
| LoRA-GD (先前) | 确定性 | ‖∇J(V)‖_F ≤ ε | exp{O(ε^(-2))} |
| LoRA-GD (本文) | 确定性 | ‖∇J(V)‖_F ≤ ε | O(ε^(-4)) |
| LoRA-NSGDM (本文) | 随机 | E‖∇J(V)‖_F ≤ ε | O(ε^(-8)) |
| LoRA-STORM (本文) | 随机+均方光滑 | E‖∇J(V)‖_F ≤ ε | O(ε^(-6)) |
## 2 预备知识
### 2.1 问题设定
令 s>0 为固定的 LoRA 缩放因子,令 B∈R^(m×r) 和 A∈R^(r×n) 为可训练因子。对于原始训练损失 L,定义
F(X):=L(W_base+sX) 且 J(B,A):=F(BA)。
LoRA 最小化 J(B,A)。所有后续的光滑常数均指 F;例如,如果 L 是 L-光滑的,则 F 是 s^2 L-光滑的。
### 2.2 因子几何与平稳性
为将收敛结果以单一变量表述,写作
V = [B; A^T] ∈ R^((m+n)×r) 且 J(V):=J(B,A)=F(BA)。
以下命题收集了该参数化的基本性质。
###### 命题 2.1 (Mu and Klabjan (2026 (https://arxiv.org/html/2607.21975#bib.bib23)))。我们有
‖V‖_F^2 = ‖B‖_F^2 + ‖A‖_F^2 且 ‖BA‖_F ≤ ‖B‖_F ‖A‖_F ≤ (1/2) ‖V‖_F^2。
因子化目标的梯度为
∇J(V) = [∇F(BA)A^T; ∇F(BA)^T B]。 (1)
然后我们定义因子空间中的一阶平稳性。
###### 定义 2.1。对于 ε≥0,因子空间中的点 V 被称为 J 的一个 *ε-一阶平稳点*,如果 ‖∇J(V)‖_F ≤ ε。
利用 (1),此条件等价于
‖∇J(V)‖_F^2 = ‖∇F(BA)A^T‖_F^2 + ‖B^T ∇F(BA)‖_F^2 ≤ ε^2。
下面的所有复杂度陈述均采用定义 2.1。对于确定性方法,我们报告返回满足 ‖∇J(V)‖_F ≤ ε 的 V 的全梯度复杂度。对于随机方法,我们报告返回随机变量 Ṽ 且满足 E‖∇J(Ṽ)‖_F ≤ ε 的随机 oracle 复杂度。
### 2.3 基本假设与随机 oracle
###### 假设 1。函数 F: R^(m×n) → R 是连续可微的。存在一个梯度-Lipschitz 参数 ρ≥1,使得对于任意 X,Y ∈ R^(m×n),
‖∇F(X) - ∇F(Y)‖_F ≤ ρ ‖X - Y‖_F。
###### 假设 2。存在一个有限下界 F_⋆ ∈ R,使得对于任意 X ∈ R^(m×n),
F(X) ≥ F_⋆。
固定任意初始化 V_0。记 Δ := J(V_0) - F_⋆ ≥ 0。
在随机设定中,我们通过随机梯度 oracle 访问 F,并施加以下标准无偏性和有限方差条件。
###### 假设 3。对于每个固定的 X ∈ R^(m×n),oracle Ĥ(X; ξ) ∈ R^(m×n) 满足
E_ξ[Ĥ(X; ξ)] = ∇F(X) 且 E_ξ[‖Ĥ(X; ξ) - ∇F(X)‖_F^2] ≤ σ^2
对于某个有限 σ ≥ 0。
该 oracle 在矩阵 X=BA 处估计 ∇F(X)。由链式法则,J 的相应随机梯度为
Ĝ(V; ξ):= [Ĥ(BA; ξ)A^T; Ĥ(BA; ξ)^T B]。
以下引理表明此 oracle 对 ∇J(V) 是无偏的,且其方差随 ‖V‖_F^2 缩放。
###### 引理 2.2。在假设 3 下,我们有
E_ξ[Ĝ(V; ξ)] = ∇J(V) 且 E_ξ[‖Ĝ(V; ξ) - ∇J(V)‖_F^2] ≤ σ^2 ‖V‖_F^2。 (2)
## 3 LoRA 梯度下降及其改进的迭代复杂度
在本节中,我们分析算法 1 中的确定性 LoRA 梯度下降。
算法 1 LoRA 梯度下降
1: B_0 ∈ R^(m×r), A_0 ∈ R^(r×n), 水平 T ≥ 1
2: for t=0,...,T-1 do
3: H_t ← ∇F(B_t A_t)
4: G_B,t ← H_t A_t^T 且 G_A,t ← B_t^T H_t
5: d_t ← ‖B_t‖_F^2 + ‖A_t‖_F^2 + ‖H_t‖_F
6: η_t ← min{(4√2 ρ d_t)^(-1), 1}
7: B_{t+1} ← B_t - η_t G_B,t 且 A_{t+1} ← A_t - η_t G_A,t
8: end for
9: t̂ ∈ argmin_{0≤t<T} ‖∇J(V_t)‖_F 且返回 V_t̂
算法 1 的步长 η_t 依赖于当前范数 ‖B_t‖_F、‖A_t‖_F 和梯度范数 ‖H_t‖_F。虽然这种依赖性确保更新有界的位移长度,但它也会产生非线性耦合,使得标准的下降引理无法直接适用。Mu and Klabjan (2026 (https://arxiv.org/html/2607.21975#bib.bib23)) 通过一个保持函数值有界的度量解决了这一困难,并推导出速率 exp{O(ε^(-2))}。
我们提供了一种新的分析,得到了显著改进的 O(ε^(-4)) 复杂度。关键思想是建立一个关于范数 ‖V_t‖_F 的非递增保证(引理 3.1),从而无需通过指数级的回溯来控制函数值。
###### 引理 3.1。假设 1 和 2 成立。令 {V_t} 由算法 1 生成。那么对于所有 t ≥ 0,
‖V_t‖_F ≤ L_J · max{1, (4√2 ρ d_t)^(-1)}。
(证明略)
利用引理 3.1,我们可以在步骤间建立函数值的下降,并推导出梯度范数的和界。
###### 定理 3.2。在假设 1 和 2 下,算法 1 在 T 次迭代后返回一个点 V_t̂,满足
min_{0≤t<T} ‖∇J(V_t)‖_F ≤ ε
当 T ≥ C · ε^(-4) 时成立,其中 C 是依赖于 Δ、ρ 的常数。因此,LoRA-GD 的梯度复杂度为 O(ε^(-4))。
## 4 随机 LoRA 及其归一化动量方法
### 4.1 标准 LoRA-SGD 的失败模式
如果我们直接使用随机梯度更新因子:
B_{t+1} = B_t - η_t Ĥ(B_t A_t; ξ_t) A_t^T, A_{t+1} = A_t - η_t B_t^T Ĥ(B_t A_t; ξ_t)。 (3)
步长 η_t > 0 可能依赖于所有历史样本和迭代,但在抽取 ξ_t 之前选定。以下命题表明,即使步长是自适应选择的,(3) 的迭代在期望上可能发散。
###### 命题 4.1。存在一个标量损失、随机 oracle 和初始化满足假设 1、2 和 3,使得对于任意步长规则(其中 η_t > 0 可能依赖于所有历史样本和迭代但在抽取 ξ_t 之前选定),(3) 的迭代对于所有 t ≥ 1 满足
E[J(V_t)] = +∞ 且 E‖∇J(V_t)‖_F = +∞。 (4)
这一困难也出现在直接的因子空间分析中。LoRA-SGD 更新 (3) 等价于 V_{t+1} = V_t - η_t Ĝ(V_t; ξ_t)。应用引理 A.1 中的修正下降引理,其中 U = -η_t Ĝ(V_t; ξ_t),得到
J(V_{t+1}) - J(V_t) ≤ -η_t ⟨∇J(V_t), Ĝ(V_t; ξ_t)⟩_F + η_t^2 (√2 ρ ‖V_t‖_F^2 + ‖H(V_t)‖_F) ‖Ĝ(V_t; ξ_t)‖_F^2 + √2 ρ η_t^3 ‖V_t‖_F ‖Ĝ(V_t; ξ_t)‖_F^3 + (√2 ρ/4) η_t^4 ‖Ĝ(V_t; ξ_t)‖_F^4。 (5)
假设 3 仅控制 oracle 噪声的二阶矩,因此无法控制 (5) 中的三次和四次项,这是 Mu and Klabjan (2026 (https://arxiv.org/html/2607.21975#bib.bib23)) 指出的核心挑战。
### 4.2 LoRA-NSGDM 及其收敛性
上述困难源于普通 LoRA-SGD 步长的随机长度 η_t ‖Ĝ(V_t; ξ_t)‖_F,这会在 (5) 中产生随机梯度的三次和四次项。我们首先对更新进行归一化,使得每一步都具有规定的长度 γ。这消除了控制随机梯度高阶矩的必要,但本身并不能使更新方向准确。实际上,引理 2.2 给出
E_ξ_t[‖Ĝ(V_t; ξ_t) - ∇J(V_t)‖_F^2] ≤ σ^2 ‖V_t‖_F^2,
因此因子梯度 oracle 可能随着 ‖V_t‖_F 的增长而变得噪声增大。因此我们在归一化结果方向之前,使用动量对随机梯度进行平均。算法 2 结合了这两种思想:它首先更新动量估计器,然后沿平均方向进行长度为 γ 的步长。
算法 2 LoRA-NSGDM
1: B_0 ∈ R^(m×r), A_0 ∈ R^(r×n), 水平 T ≥ 1
2: α ← T^(-1/2) 且 γ ← T^(-7/8)
3: M_{B,-1} ← 0 且 M_{A,-1} ← 0
4: for t=0,...,T-1 do
5: 抽取 ξ_t 并设置 Ĥ_t ← Ĥ(B_t A_t; ξ_t)
6: Q_{B,t} ← Ĥ_t A_t^T 且 Q_{A,t} ← B_t^T Ĥ_t
7: M_{B,t} ← (1-α) M_{B,t-1} + α Q_{B,t}
8: M_{A,t} ← (1-α) M_{A,t-1} + α Q_{A,t}相似文章
BaLoRA:大规模模型的贝叶斯低秩适应
BaLoRA 引入了低秩适应(LoRA)的贝叶斯扩展,通过缩小与全量微调之间的差距,提供校准良好的不确定性估计并提高预测准确性。
SOS-LoRA: 静态正交子空间低秩适应结合固定多尺度缩放
SOS-LoRA 通过将秩预算分解为具有固定多尺度缩放的静态正交低秩专家来扩展 LoRA,在不增加推理成本的情况下提升了在推理、NLU 和数学基准上的微调性能。
MoE$^2$-LoRA:当MoE模型遇上MoE风格的低秩适配
MoE2-LoRA 引入了一种双通道路由条件投影(Routing-Conditioned Projection)和一个全局 LoRA 专家池,以实现用于微调 MoE 模型的 MoE 风格低秩适配,在保留通用能力的同时取得了最先进的准确率。
超越LoRA:稀疏诱导的适配是否更好?
本文提出了对LoRA的稀疏诱导适配方法,包括廉价LoRA(cLA)和链式循环变体(c³LA),并提供了理论泛化界以及实证评估,结果显示在保持竞争性性能的同时,训练时间最多减少10%,峰值GPU内存节省最多15%。
AdaPreLoRA:Adafactor 预条件低秩适应
AdaPreLoRA 是一种新颖的 LoRA 优化器,它利用 Adafactor 对角 Kronecker 预条件来改进因子空间更新,同时保持低内存占用,在各种大语言模型(LLM)和任务中表现出具有竞争力的性能。