TaRA:训练感知的低秩适应初始化

arXiv cs.CL 论文

摘要

TaRA是一种针对低秩适应(LoRA)的训练感知初始化方法,它提高了梯度保真度,从而在各种任务中提升了大型语言模型的微调性能。

arXiv:2609.02639v1 公告类型:新 摘要:低秩适应(LoRA)已成为参数高效微调(PEFT)的事实标准,但由于低秩分解带来的信息瓶颈,其性能对初始化高度敏感。现有方法试图通过利用预训练权重、激活或梯度的主成分来构建高质量的LoRA初始化。然而,这些方法并未直接考虑全秩模型的训练动态。本文提出训练感知低秩适应初始化(TaRA),一种初始化LoRA的方法,使得低秩因子诱导的梯度紧密近似对应全秩权重矩阵的梯度。TaRA源自数学公式,在训练开始时提高梯度保真度,同时引入可忽略的计算开销。在各种具有挑战性的微调任务中,TaRA始终优于先前最先进的方法,为有效的LoRA初始化提供了一个简单、稳健且可扩展的解决方案。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:55

# TaRA:训练感知的低秩自适应初始化
来源:https://arxiv.org/html/2609.02639  
Eunhyeok Park 邮箱:[eh\.park@postech\.ac\.kr](mailto:[email protected])  
所属机构:计算机科学与工程系  
所属机构:人工智能研究生院  
浦项科技大学 (POSTECH)

###### 摘要

低秩自适应 (LoRA) 已成为参数高效微调 (PEFT) 的事实标准,但其性能由于低秩分解所施加的信息瓶颈而对初始化高度敏感。现有方法试图通过利用预训练权重、激活或梯度的主成分来构建高质量的LoRA初始化。然而,这些方法并未直接考虑全秩模型的训练动态。本文提出了训练感知低秩自适应初始化 (TaRA),该方法初始化LoRA的方式使得低秩因子所诱导的梯度能够紧密近似于相应全秩权重矩阵的梯度。TaRA源自数学公式推导,在训练开始时提高了梯度保真度,同时引入的计算开销可忽略不计。在各种具有挑战性的微调任务中,TaRA持续优于现有的最先进方法,为有效的LoRA初始化提供了一个简单、稳健且可扩展的解决方案。

## 1 引言

参数高效微调 (PEFT) 显著降低了适配大型语言模型 (LLMs) 的成本,使其在实际应用中得以广泛部署(Houlsby 等人,2019 (https://arxiv.org/html/2609.02639#bib.bib1);Li 和 Liang,2021 (https://arxiv.org/html/2609.02639#bib.bib3))。在PEFT方法中,低秩自适应 (LoRA)(Hu 等人,2022 (https://arxiv.org/html/2609.02639#bib.bib2))因其简单性、显著减少微调资源需求以及没有推理时开销(因为学习到的更新可以在训练后合并到基础权重中)而成为最广泛采用的方法。这些优势使LoRA成为高效LLM微调的事实标准。

图 1:梯度相似度,以组合LoRA适配器的单步梯度与全权重的单步梯度之间的余弦相似度衡量,与下游准确率相关。尽管有这些优势,LoRA引入了一个固有的权衡:低秩分解施加的结构化瓶颈改变了相对于全秩训练的优化轨迹,即使在模型容量充足的情况下也可能导致次优收敛。因此,在不牺牲其效率的前提下提高LoRA的有效性已成为一个重要的研究方向(Meng 等人,2024 (https://arxiv.org/html/2609.02639#bib.bib4);Buyukakyuz,2024 (https://arxiv.org/html/2609.02639#bib.bib62);Hayou 等人,2024 (https://arxiv.org/html/2609.02639#bib.bib63))。

一个有前景的方向是为低秩适配器设计更明智的初始化策略。虽然原始LoRA使用随机值或零值初始化其适配器,但后续研究表明,由预训练权重分布(例如 PiSSA(Meng 等人,2024 (https://arxiv.org/html/2609.02639#bib.bib4)))、联合权重-数据统计(例如 CorDA(Yang 等人,2024 (https://arxiv.org/html/2609.02639#bib.bib5)))或单次前向-后向传播的梯度(例如 LoRA-GA、LoRA-One(Wang 等人,2024 (https://arxiv.org/html/2609.02639#bib.bib7));Zhang 等人,2025 (https://arxiv.org/html/2609.02639#bib.bib6))指导的低秩初始化始终能提高微调性能。这些方法保留了LoRA的实际优势,同时缓解了由低秩约束引起的性能下降。

为了进一步解决这一局限性,我们提出了训练感知低秩自适应 (TaRA),一种新的LoRA初始化方法。与先前近似张量统计的方法不同,TaRA旨在保留对全权重训练的局部梯度行为重要的方向,使得低秩参数化在初始化时能更好地反映与训练相关的信息。TaRA基于数学公式推导,通过联合利用单次前向-后向传播的激活协方差、梯度协方差和预训练权重,推导出一种低秩初始化,该初始化在局部梯度场中保留与训练相关的方向。如图 1 (https://arxiv.org/html/2609.02639#S1.F1) 所示,这种初始化在相同秩下实现了比先前方法高得多的梯度对齐,从而带来一致的下游性能提升。在具有挑战性的推理任务(包括数学问题求解、代码生成和常识推理)上的大量实验表明,TaRA优于现有方法。

## 2 LoRA初始化的先前工作

图 2:我们的单层流程说明。我们收集激活X\\mathbf\{X\}和梯度G\\mathbf\{G\}以形成协方差ΣX\\mathbf\{\\Sigma\}\_\{X\}和ΣG\\mathbf\{\\Sigma\}\_\{G\}\。PiSSA对W\\mathbf\{W\}应用SVD;CorDA对WΣX\\mathbf\{W\}\\mathbf\{\\Sigma\}\_\{X\}应用SVD,并用ΣX−1\\mathbf\{\\Sigma\}\_\{X\}^\{\-1\}映射回原空间;LoRA-One对−G\-\\mathbf\{G\}应用SVD。相比之下,TaRA对ΣGWΣX\\mathbf\{\\Sigma\}\_\{G\}\\mathbf\{W\}\\mathbf\{\\Sigma\}\_\{X\}应用SVD,并用ΣG−1\\mathbf\{\\Sigma\}\_\{G\}^\{\-1\}和ΣX−1\\mathbf\{\\Sigma\}\_\{X\}^\{\-1\}映射回原空间。在原始LoRA中,输入侧因子矩阵A\\mathbf\{A\}是随机初始化的,而输出侧因子矩阵B\\mathbf\{B\}被设置为零。尽管这种设计确保了微调从预训练表示开始,但由此产生的初始化不包含任何有意义的任务相关信息,这可能导致早期优化缓慢和次优收敛(Wang 等人,2024 (https://arxiv.org/html/2609.02639#bib.bib7))。

受这些局限性的启发,许多研究探索了改进的LoRA初始化策略(图 2 (https://arxiv.org/html/2609.02639#S2.F2))。尽管分解路径产生非零更新,但微调仍然可以通过将此修改吸收到冻结的残差权重Wres=W0−BA\\mathbf\{W\}\_\{res\}=\\mathbf\{W\}\_\{0\}\-\\mathbf\{B\\mathbf\{A\}}中,从预训练权重W0\\mathbf\{W\}\_\{0\}开始。通过适当选择A\\mathbf\{A\}和B\\mathbf\{B\},正确初始化的模型可以加速训练,并且通常比随机初始化收敛到更好的解。

这项研究中一个关键的早期工作是PiSSA(Meng 等人,2024 (https://arxiv.org/html/2609.02639#bib.bib4)),它提出了一种数据无关的初始化方法,利用预训练权重矩阵W0∈Rdout×din\\mathbf\{W\}\_\{0\}\\in\\mathbb\{R\}^\{d\{out\}\\times d\_\{in\}\}\。具体而言,PiSSA执行奇异值分解 (SVD),W0=USV⊤\\mathbf\{W\}\_\{0\}=\\mathbf\{U\\mathbf\{S\\mathbf\{V\}^\{\\top\}},并使用前r个奇异分量初始化LoRA:

B\\displaystyle\\mathbf\{B\}=U\[:,:r\]S1/2\[:r,:r\]∈Rdout×r,\\displaystyle=\\mathbf\{U\}\{\[:,:r\]\}\\mathbf\{S\}^\{1/2\}\{\[:r,:r\]\}\\in\\mathbb\{R\}^\{d\{out\}\\times r\},\\(1\\)  
A\\displaystyle\\mathbf\{A\}=S1/2\[:r,:r\]V⊤\[:,:r\]∈Rr×din\.\\displaystyle=\\mathbf\{S\}^\{1/2\}\{\[:r,:r\]\}\\mathbf\{V\}^\{\\top\}\{\[:,:r\]\}\\in\\mathbb\{R\}^\{r\\times d\_\{in\}\}\\.\(2\\)

最近,CorDA(Yang 等人,2024 (https://arxiv.org/html/2609.02639#bib.bib5))通过结合输入统计信息扩展了这一思想,而不仅仅是预训练权重。CorDA首先从输入激活X\\mathbf\{X\}估计输入激活协方差ΣX=XX⊤\\mathbf\{\\Sigma\}\_\{X\}=\\mathbf\{X\\mathbf\{X\}^\{\\top\}},然后执行以下分解:

SVD\\(W0ΣX\\)ΣX−1=U ̄S ̄V ̄⊤\.\\text\{SVD\}\\(\\mathbf\{W\}\_\{0\\}\\mathbf\{\\Sigma\}\_\{X\}\\)\\mathbf\{\\Sigma\}\_\{X\}^\{\\-1\}=\\mathbf\{\\bar\{U\\}\\}\\mathbf\{\\bar\{S\\}\\}\\mathbf\{\\bar\{V\\}\\}^\{\\top\}\\.\(3\\)

生成的分量以与PiSSA相同的方式用于初始化B\\mathbf\{B\}、A\\mathbf\{A\}和Wres\\mathbf\{W\}\_\{res\}。PiSSA和CorDA都将LoRA子空间与来自预训练权重或输入相关统计的主成分对齐,从而实现更快的收敛和提高的准确率。

与这些方法正交,LoRA-GA(Wang 等人,2024 (https://arxiv.org/html/2609.02639#bib.bib7))及其后续工作LoRA-One(Zhang 等人,2025 (https://arxiv.org/html/2609.02639#bib.bib6))利用了梯度信息。这些方法的动机源于一个观察:LoRA的微调质量取决于其更新方向与全微调梯度的主要奇异子空间的对齐程度。基于此见解,LoRA-One对权重的单步全梯度G\\mathbf\{G\}执行SVD,

SVD\\(−G\\)=U^S^V^⊤,\\text\{SVD\}\\(\\-\\mathbf\{G\}\\)=\\mathbf\{\\hat\{U\}\\}\\mathbf\{\\hat\{S\}\\}\\mathbf\{\\hat\{V\}\\}^\{\\top\},\\(4\\)

并使用前r个奇异分量初始化LoRA。通过利用梯度信息,这些方法沿着部分由训练信号指导的方向初始化LoRA模块,在实践中通常能提高微调性能。

然而,尽管利用了预训练模型的内部张量统计,先前方法主要关注增强低秩分解的表示能力,而不是显式地将其与全微调的学习动态对齐。因此,性能差距仍然存在,仅仅通过增加秩或调整超参数无法有效弥合。

## 3 提出的方法:TaRA

在本节中,我们介绍TaRA,一种新颖的LoRA初始化方法,旨在严格低秩约束下提高微调质量。我们首先形式化目标,推导低秩解,然后描述其实际实现。

### 3.1 动机

TaRA背后的关键动机简单而基本:即使在LoRA施加的低秩瓶颈下,我们也旨在构建一种低秩参数化,其诱导的局部梯度行为紧密近似于相应全秩权重的局部梯度行为。换句话说,TaRA将与训练相关的局部梯度场方向嵌入到低秩结构中。这一观点自然引出以下问题:*在秩-r约束下,我们如何构建一种低秩参数化,以保留与全微调局部梯度行为最相关的方向?*

为了形式化这种直觉,我们考虑以下目标:

θ~=arg⁡minθ⁡‖∇L\\(θ\\)−∇L\\(θ0\\)‖F2,s\.t\.rank\\(θ\\)≤r,\\begin\{split\\}\\tilde\{\\theta\}=\\arg\\min\_\\{\\theta\}\\left\\lVert\\nabla\\mathcal\{L\}\\(\\theta\\)\-\\nabla\\mathcal\{L\}\\(\\theta\_\\{0\}\\)\\right\\rVert^\\{2\\}\_\\{F\},\\\\ \\quad\\text\{s\.t\. \\}\\mathrm\{rank\}\\(\\theta\\)\\leq r,\\end\{split\\}\\(5\\)

其中L\\mathcal\{L\}表示任务损失。直观上,此目标寻求一个秩约束的参数化,以保留θ0\\theta\_\\{0\}处对应全秩参数的局部梯度行为。

### 3.2 训练相关的分解

为了获得一个易于处理的公式,我们采用损失景观围绕初始化点的标准二阶视图。具体来说,我们关注初始化时的单步梯度(Wang 等人,2024 (https://arxiv.org/html/2609.02639#bib.bib7)),它捕捉了优化早期阶段的主要训练信号。在实践中,这个近似足以指导有效的低秩初始化,如第4.2节 (https://arxiv.org/html/2609.02639#S4.SS2) 的收敛结果所证明。

使用损失围绕θ0\\theta\_\\{0\}的二阶泰勒展开,我们得到

L⁡\\(θ\\)≈L\\(θ0\\)\\+∇L\\(θ0\\)⊤\\(θ−θ0\\)\\+12\\(θ−θ0\\)⊤H\\(θ−θ0\\),\\begin\{split\\}\\mathcal\{L\}\\(\\theta\\)\\approx\\{\\}&\\mathcal\{L\}\\(\\theta\_\\{0\}\\)\\+\\nabla\\mathcal\{L\}\\(\\theta\_\\{0\}\\)^\\{\\top\\}\\(\\theta\\-\\theta\_\\{0\}\\)\\\\ &\\+\\frac\\{1\\}\\{2\\}\\(\\theta\\-\\theta\_\\{0\\}\\)^\\{\\top\\}\\mathbf\{H\}\\(\\theta\\-\\theta\_\\{0\}\\),\\end\{split\\}\\(6\\)

其中H\\mathbf\{H\}表示在θ0\\theta\_\\{0\}处计算的海森矩阵。

在大型模型中,直接计算海森矩阵是不可行的。遵循常见做法,我们使用Fisher信息矩阵F\\mathcal\{F\}作为局部曲率的可行代理(Chekalina 等人,2025 (https://arxiv.org/html/2609.02639#bib.bib57);Martens,2020 (https://arxiv.org/html/2609.02639#bib.bib58))。使用K-FAC分解(Martens 和 Grosse,2015 (https://arxiv.org/html/2609.02639#bib.bib10)),Fisher矩阵可以写成

F≈ΣX⊗ΣG,\\mathcal\{F\}\\approx\\mathbf\{\\Sigma\}\_\\{X\}\\otimes\\mathbf\{\\Sigma\}\_\\{G\},\\(7\\)

其中ΣG=GG⊤\\mathbf\{\\Sigma\}\_\\{G\}=\\mathbf\{G\}\\mathbf\{G\}^\\{\\top\}表示梯度协方差。在此公式下,对方程 (6 (https://arxiv.org/html/2609.02639#S3.E6)) 关于θ\\theta求导得到(推导见附录):

∇L\\(θ\\)−∇L\\(θ0\\)≈ΣG\\(θ−θ0\\)ΣX\.\\begin\{split\\}\\nabla\\mathcal\{L\}\\(\\theta\\)\-\\nabla\\mathcal\{L\}\\(\\theta\_\\{0\}\\)\\approx\\mathbf\{\\Sigma\}\_\\{G\}\\(\\theta\\-\\theta\_\\{0\}\\)\\mathbf\{\\Sigma\}\_\\{X\}\\.\end\{split\\}\\(8\\)

此关系揭示了一个关键见解:参数更新所引起的梯度变化由损失的曲率结构调节。因此,与较大Fisher或海森值相关的方向对优化轨迹产生不成比例的大影响。因此,在秩受限的空间中保留这些方向对于忠实地近似全微调至关重要。

经验上,已知现代神经网络的海森谱表现出高度结构化的形式,由一小部分突出的离群特征向量和一个与其大致正交的近零主体组成(Gur-Ari 等人,2018 (https://arxiv.org/html/2609.02639#bib.bib8);Sagun 等人,2017 (https://arxiv.org/html/2609.02639#bib.bib9))。此外,先前的工作表明,梯度下降有效地在由顶部海森特征向量张成的较小子空间内演化(Gur-Ari 等人,2018 (https://arxiv.org/html/2609.02639#bib.bib8))。这些观察表明,主导的曲率方向为识别有效的低秩训练更新提供了自然准则。

受此见解的启发,我们寻求一个秩-r近似θ~\\tilde\{\\theta\},以最小化方程 (8 (https://arxiv.org/html/2609.02639#S3.E8)) 中曲率加权的梯度偏差:

θ~≈arg⁡minθ⁡∥ΣG\\(θ−θ0\\)ΣX∥F2,s\.t\.rank\\(θ\\)≤r\.\\begin\{split\\}\\tilde\{\\theta\}\\approx\\arg\\min\_\\{\\theta\}\\lVert\\mathbf\{\\Sigma\}\_\\{G\}\\(\\theta\\-\\theta\_\\{0\}\\)\\mathbf\{\\Sigma\}\_\\{X\}\\rVert^\\{2\\}\_\\{F\},\\\\ \\quad\\text\{s\.t\. \\}\\text\{rank\}\\(\\theta\\)\\leq r\.\\end\{split\\}\\(9\\)

这对应于一个经典的低秩矩阵近似问题。根据 Eckart-Young 定理(Eckart 和 Young,1936 (https://arxiv.org/html/2609.02639#bib.bib11);Golub 和 Van Loan,2013 (https://arxiv.org/html/2609.02639#bib.bib12)),通过保留分解的前r个奇异分量可获得最优解:

θ~≈ΣG−1SVDr⁡\\(ΣGθ0ΣX\\)ΣX−1,\\begin\{split\\}\\tilde\{\\theta\}\\approx\\mathbf\{\\Sigma\}\_\\{G\\}\\^\\{\\-1\\}\\operatorname\{SVD\\}\\_\\{r\\}\\(\\mathbf\{\\Sigma\}\_\\{G\\}\\theta\\_\\{0\\}\\mathbf\{\\Sigma\}\_\\{X\\}\\)\\mathbf\{\\Sigma\}\_\\{X\\}\\^\\{\\-1\\},\\end\{split\\}\\(10\\)

其中SVDr⁡\\(⋅\\)\\operatorname\{SVD\\}\\_\\{r\\}\\(\\cdot\\)表示截断的SVD。

111 这经常与 Fisher 加权模型压缩混淆

相似文章

归一化低秩适应

Hugging Face Daily Papers

归一化低秩适应 (NoRA) 通过归一化下投影矩阵来稳定 LoRA 训练,加速收敛并提高性能,无需额外参数或推理成本。

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。

在梯度与自然梯度之间:LoRA初始化的连续统

arXiv cs.LG

本文提出统一LoRA(ULoRA),一种用于低秩适配的双参数预条件梯度初始化家族,表明现有的LoRA初始化方法是该连续统上的点。作者证明,经过调优的ULoRA在RoBERTa-base上的GLUE任务中达到或超过全微调性能,并在LLaMA 2-7B上的GSM8K任务中具有竞争力,同时引入了ULoRA-Auto以实现零搜索部署。