基于可学习秩的参数高效微调

arXiv cs.CL 论文

摘要

来自阿德莱德大学的研究人员提出了 LR-LoRA(可学习秩 LoRA),这是一种参数高效微调方法,在训练过程中动态学习每个 Transformer 层的适配器秩,而非使用固定的全局秩。LR-LoRA 在语言理解和常识推理基准测试上达到了最先进的性能,超越了固定秩 LoRA 基线。

arXiv:2606.04325v1 公告类型:新论文 **摘要:** 低秩适配(LoRA)是一种广泛使用的参数高效微调(PEFT)方法,它将权重更新限制在低秩适配器中,通过在低维子空间中优化来引入固定的低秩归纳偏置。在本研究中,我们质疑固定秩约束是否是参数高效微调最有效的归纳偏置。我们提出了*可学习秩 LoRA(LR-LoRA)*,这是一种在训练过程中动态学习适配器秩的 PEFT 方法。LR-LoRA 不再为所有适配器层指定统一的秩,而是让优化器自主决定每一层的适当秩。通过这一方法,我们发现各层之间的学习秩存在显著差异,Transformer 模型中的注意力层和 MLP 层表现出系统性的不同秩偏好。在一系列语言理解和常识推理基准测试中,LR-LoRA 在大多数设置下均达到了最先进的性能,并持续优于强力 PEFT 基线,证明了可学习秩相比固定秩适配提供了更灵活、更有效的归纳偏置。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:13

# 具有可学习秩的参数高效微调

来源:https://arxiv.org/html/2606.04325

Arpit Garg
澳大利亚机器学习研究所
阿德莱德大学
arpit\.garg@adelaide\.edu\.au
&Simon Lucey
澳大利亚机器学习研究所
阿德莱德大学
simon\.lucey@adelaide\.edu\.au
&Hemanth Saratchandran
澳大利亚机器学习研究所
阿德莱德大学
hemanth\.saratchandran@adelaide\.edu\.au

###### 摘要

低秩适应(LoRA)是一种广泛使用的参数高效微调(PEFT)方法,它将权重更新限制在低秩适配器上,通过在低维子空间中优化来引入固定的低秩归纳偏置。在本工作中,我们质疑固定秩约束是否是参数高效微调中最有效的归纳偏置。我们提出了*可学习秩 LoRA(LR-LoRA)*,这是一种在训练过程中学习适配器秩的 PEFT 方法。LR-LoRA 不为所有适配器层统一规定固定秩,而是让优化器自行确定每一层的适当秩。采用这种方法后,我们发现各层学习到的秩存在显著差异,transformer 模型中的注意力层和 MLP 层在秩偏好上呈现出系统性的差异。在一系列语言理解和常识推理基准测试中,LR-LoRA 在大多数设置下达到最先进的性能,并持续优于强大的 PEFT 基线,证明了可学习秩相比固定秩适应提供了更灵活、更有效的归纳偏置。

## 1 引言

大型预训练模型正被越来越多地应用于各种下游任务、领域和用户场景。在这一范式下,主要的计算瓶颈已从预训练转移到*适应*——即在严格的内存、存储和延迟约束下对大型骨干模型进行专业化的过程\(Touvron et al\.,2023 (https://arxiv.org/html/2606.04325#bib.bib25); Grattafiori et al\.,2024 (https://arxiv.org/html/2606.04325#bib.bib27); Team and others,2024 (https://arxiv.org/html/2606.04325#bib.bib28); Abdin et al\.,2024 (https://arxiv.org/html/2606.04325#bib.bib29)\)。参数高效微调(PEFT)通过保持骨干模型固定、仅学习少量任务特定参数来应对这一挑战,相比全量微调可将可训练权重减少数个数量级,从而实现快速定制\(Hu et al\.,2022 (https://arxiv.org/html/2606.04325#bib.bib1); Han et al\.,2024 (https://arxiv.org/html/2606.04325#bib.bib31)\)。

在各类 PEFT 方法中,低秩适应(LoRA)及其变体凭借其简洁性、稳定性和易部署性,已成为事实上的标准\(Hu et al\.,2022 (https://arxiv.org/html/2606.04325#bib.bib1)\)。LoRA 通过低秩更新 $\Delta\mathbf{W}=\mathbf{BA}$ 来扩充所选层,由两个低秩适配器矩阵 $\mathbf{A}$ 和 $\mathbf{B}$ 参数化。这种构造施加了明确的归纳偏置:任务特定的更新被限制在一个低维秩-$r$ 集合中,其维度由所选秩决定。

尽管 LoRA 在实践中取得了成功,但它依赖于一个强假设且几乎未受质疑:适配器秩是固定的。实际上,通常会对所有层统一应用单一的全局秩,隐式地假设每一层需要相似的适应维度。鉴于 transformer 架构的已知特性,这一假设难以成立——各层在功能、表示几何结构和内在维度上随深度增加而存在显著差异\(Aghajanyan et al\.,2021 (https://arxiv.org/html/2606.04325#bib.bib23)\)。

近期研究尝试通过提升 LoRA 框架内的表达能力来缓解这一限制。例如,RandLoRA 采用随机基来逼近全秩更新,同时保持低秩参数化\(Albert et al\.,2025a (https://arxiv.org/html/2606.04325#bib.bib16)\);SineLoRA 通过固定正弦调制提升 MLP 适配器的秩\(Ji et al\.,2025 (https://arxiv.org/html/2606.04325#bib.bib17)\)。尽管这些方法引入了不同的归纳偏置,但它们所依赖的秩仍由外部指定,并在整个训练过程中保持固定。因此,它们缺乏一种机制,使模型能够以逐层或任务相关的方式*学习*适当的适应维度。

综合上述观察,我们提出了一个简单但根本性的问题:

> *对适配器更新施加固定秩约束,是否是在参数高效微调中实现强性能的最优归纳偏置?*

为回答这一问题,我们提出了**可学习秩 LoRA(LR-LoRA)**,一种在训练过程中学习适配器秩的 PEFT 方法。LR-LoRA 不在整个训练过程中为每一层规定固定秩,而是在适配器更新中引入逐元素非线性函数 $\phi$,得到:

$$\Delta\mathbf{W}=\phi(\mathbf{BA}),$$

其中 $\phi$ 与模型参数联合学习。通过对低秩乘积 $\mathbf{BA}$ 施加非线性函数,LR-LoRA 使更新的秩可以增大或减小,放宽了标准低秩适配器所施加的固定秩约束,并使优化器能够自适应地调整每一层更新的维度(在[第 3.3 节](https://arxiv.org/html/2606.04325#S3.SS3)中形式化)。

在语言理解、常识推理、视觉迁移和指令微调基准测试中,LR-LoRA 在近似参数预算相同的条件下持续优于强大的 PEFT 基线,在大多数设置下达到最先进的性能。在实验中,我们观察到各层学习到的秩存在显著变化,注意力适配器和 MLP 适配器表现出系统性不同的适应维度。这些发现表明,对 LoRA 等参数高效微调方法施加硬性固定秩约束是次优的。

本研究的主要贡献如下:

- **可学习秩 LoRA(LR-LoRA)**:一种在训练过程中学习逐层适配器秩的参数高效微调方法,为适应引入了更灵活的归纳偏置。
- **适应维度的基无关原理**:我们证明对 $\mathbf{BA}$ 施加任意可微的逐元素非线性函数可以消除秩-$r$ 约束,并提供直接的实验证据表明,性能提升源于*学习*逐层适应,而非仅仅是非线性函数的存在。
- **相比强大 PEFT 基线的持续改进**:在 7 种架构(参数量从 125M 到 13B)、19 个任务、四种评估范式(常识推理、GLUE 迁移、视觉迁移和指令微调)上取得新的最先进结果。

从更宏观的角度来看,本研究通过归纳偏置的视角重新审视了低秩适应。我们认为,适应维度不应作为固定的超参数,而应是模型的可学习属性,能够反映各层和各任务之间表示的异质性。这一观点建议从刚性的参数高效设计转向自适应机制,使模型能够将容量分配到最需要的地方。

## 2 相关工作

**参数高效微调。** 参数高效微调(PEFT)通过学习少量任务特定参数同时保持骨干模型冻结来适应大型预训练模型,实现跨多任务的高效存储和部署\(Houlsby et al\.,2019 (https://arxiv.org/html/2606.04325#bib.bib32); Ding et al\.,2023 (https://arxiv.org/html/2606.04325#bib.bib30); Han et al\.,2024 (https://arxiv.org/html/2606.04325#bib.bib31)\)。主要的 PEFT 方法族包括:适配器模块\(Houlsby et al\.,2019 (https://arxiv.org/html/2606.04325#bib.bib32)\)、提示和前缀微调\(Lester et al\.,2021 (https://arxiv.org/html/2606.04325#bib.bib39); Li and Liang,2021 (https://arxiv.org/html/2606.04325#bib.bib38)\)、乘性适应方法(如 IA3)\(Liu et al\.,2022 (https://arxiv.org/html/2606.04325#bib.bib48)\),以及轻量权重空间更新方法(如 BitFit)\(Zaken et al\.,2022 (https://arxiv.org/html/2606.04325#bib.bib40)\)。本工作属于权重空间 PEFT 范畴,专注于控制低秩权重更新的维度。

**低秩适应(LoRA)。** LoRA 在所选线性层中利用低秩更新 $\Delta\mathbf{W}=\mathbf{BA}$,施加任务特定权重变化位于低维秩-$r$ 集合中的归纳偏置\(Hu et al\.,2022 (https://arxiv.org/html/2606.04325#bib.bib1); Fu et al\.,2023 (https://arxiv.org/html/2606.04325#bib.bib24)\)。大量后续工作通过秩分配启发式方法\(Zhang et al\.,2023b (https://arxiv.org/html/2606.04325#bib.bib2); Valipour et al\.,2023 (https://arxiv.org/html/2606.04325#bib.bib3); Albert et al\.,2025b (https://arxiv.org/html/2606.04325#bib.bib7)\)、替代参数化\(Liu et al\.,2024 (https://arxiv.org/html/2606.04325#bib.bib4)\)、随机化或向量化适应\(Kopiczko et al\.,2023 (https://arxiv.org/html/2606.04325#bib.bib5)\)、改进初始化\(Meng et al\.,2024 (https://arxiv.org/html/2606.04325#bib.bib8)\)、训练改进\(Hayou et al\.,2024 (https://arxiv.org/html/2606.04325#bib.bib9)\)、内存高效训练\(Dettmers et al\.,2023 (https://arxiv.org/html/2606.04325#bib.bib10); Zhao et al\.,2024 (https://arxiv.org/html/2606.04325#bib.bib11); Zhang et al\.,2023a (https://arxiv.org/html/2606.04325#bib.bib13)\)和稳定性分析\(Kalajdzievski,2023 (https://arxiv.org/html/2606.04325#bib.bib14); Lialin et al\.,2023 (https://arxiv.org/html/2606.04325#bib.bib12)\)来改进 LoRA。尽管这些方法改进了低秩容量的*分配位置*或*分配数量*,但它们通常将秩视为外部指定的超参数。相比之下,我们通过允许适配器秩被学习来放宽这一假设。

此外,若干方法在保持紧凑参数化的同时提升了适配器的表达能力。RandLoRA 采用随机基在低秩框架内逼近更具表达力(包括近全秩)的更新\(Albert et al\.,2025a (https://arxiv.org/html/2606.04325#bib.bib16)\);VeRA 使用基于随机向量的适应\(Kopiczko et al\.,2023 (https://arxiv.org/html/2606.04325#bib.bib5)\)。另一类工作在适配器路径中引入非线性:SineLoRA 对适配器权重施加固定正弦调制,在不增加参数量的情况下获得高秩适配器更新,提升表示能力\(Ji et al\.,2025 (https://arxiv.org/html/2606.04325#bib.bib17)\)。近期自适应秩方法如 AdaLoRA\(Zhang et al\.,2023b (https://arxiv.org/html/2606.04325#bib.bib2)\)、DyLoRA\(Valipour et al\.,2023 (https://arxiv.org/html/2606.04325#bib.bib3)\)和 ElaLoRA\(Chang et al\.,2025 (https://arxiv.org/html/2606.04325#bib.bib54)\)在预先设定的固定总预算下,在训练期间重新分配每层的秩;非线性变体如 AuroRA\(Dong et al\.,2025 (https://arxiv.org/html/2606.04325#bib.bib55)\)和 ABBA\(Singhal et al\.,2025 (https://arxiv.org/html/2606.04325#bib.bib56)\)通过自适应非线性层和 Hadamard 乘积打破线性约束。在所有这些方法中,全局容量均由外部指定。

LR-LoRA 的不同之处在于有效秩的*产生方式*:优化器为 $\mathbf{BA}$ 学习一个逐层连续的逐元素非线性函数,隐式地设定每层的有效(稳定)秩,无需外部分配预算。我们还提供了受控实验,将可学习秩与非线性函数的单纯存在加以区分([第 4.3 节](https://arxiv.org/html/2606.04325#S4.SS3))。

## 3 方法

在本节中,我们描述可学习秩 LoRA(LR-LoRA)的基本方法,重点介绍可学习秩适配器更新的构造与学习过程。

### 3.1 低秩适应

低秩适应(LoRA)是一种参数高效微调方法,它保持网络的预训练权重 $\mathbf{W}\in\mathbb{R}^{m\times n}$ 冻结,并引入可训练的适配器矩阵 $\mathbf{A}\in\mathbb{R}^{r\times n}$ 和 $\mathbf{B}\in\mathbb{R}^{m\times r}$,其中 $r\ll\min(m,n)$。适应后的权重矩阵为:

$$\mathbf{W}+\mathbf{BA}.\tag{1}$$

在任务特定训练期间,只有适配器参数 $\mathbf{A}$ 和 $\mathbf{B}$ 被更新,而 $\mathbf{W}$ 保持固定。LoRA 的高效性来源于以下事实:$\mathbf{W}$ 包含 $mn$ 个参数,而适配器更新 $\mathbf{BA}$ 仅涉及 $r(m+n)$ 个参数,当 $r\ll\min(m,n)$ 时这一数量大幅减少。这种参数缩减以牺牲表达能力为代价:由于 $\mathrm{rank}(\mathbf{BA})\leq r$,LoRA 将任务特定更新限制在低维秩-$r$ 集合中。因此,LoRA 架构对适应过程施加了低秩归纳偏置。

### 3.2 采样理论预备知识

我们采用归一化 sinc 约定 $\mathrm{sinc}(x)=\sin(\pi x)/(\pi x)$($x\neq 0$)和 $\mathrm{sinc}(0)=1$,使得 Whittaker-Shannon 插值公式以标准形式成立。Nyquist-Shannon 采样定理\(Nyquist,1928 (https://arxiv.org/html/2606.04325#bib.bib51); Shannon,2006 (https://arxiv.org/html/2606.04325#bib.bib36); Martin,1997 (https://arxiv.org/html/2606.04325#bib.bib52)\)指出,任何最大频率为 $\omega_{\max}$ 的带限函数 $f\in L^{2}(\mathbb{R})$ 都可以从均匀网格上间距 $\tau\leq 1/(2\omega_{\max})$ 的采样 $\{f(x_i)\}$ 中精确重建:

$$f(x)=\sum_{i\in\mathbb{Z}}f(x_{i})\,\mathrm{sinc}\!\left(\omega(x-x_{i})\right),\qquad\omega:=\tfrac{1}{\tau},\quad x_{i}:=i\tau.\tag{2}$$

实际上,求和被截断为 $N$ 项(对于足够大的 $N$,近似误差有界),更一般地,$L^{2}(\mathbb{R})$ 中的函数可由具有可学习振幅 $\alpha_i$ 和带宽 $\omega_i$ 的移位 sinc 的混合很好地逼近:

$$\sum_{i=1}^{N}\alpha_{i}\,\mathrm{sinc}\!\left(\omega_{i}(x-x_{i})\right).\tag{3}$$

这一展开式构成了下文引入的可学习非线性函数的基础。更完整的推导见[附录 A](https://arxiv.org/html/2606.04325#A1)。

### 3.3 可学习适配器非线性函数

LR-LoRA 的核心思想是对适配器更新 $\mathbf{BA}$ 施加非线性函数 $\phi$,得到 $\phi(\mathbf{BA})$。我们使用灵活的移位 $\mathrm{sinc}$ 函数基来构造 $\phi$。具体而言,我们考虑在有界区间 $[-I, I]$ 上均匀分布的 $N$ 个网格点 $\{x_1, x_2, \ldots, x_N\}$。在每个网格点 $x_i$ 处,我们放置一个带宽为 $\omega_i$、振幅为 $\alpha_i$ 的 $\mathrm{sinc}$ 函数,得到形如 $\mathrm{sinc}\!\left(\omega_i(x-x_i)\right)$ 的基函数。由此定义的非线性函数为:

$$\phi(x)=\sum_{i=1}^{N}\alpha_{i}\,\mathrm{sinc}\!\left(\omega_{i}(x-x_{i})\right).\tag{4}$$

为使 $\phi$ 可学习,我们将参数 $\{(\omega_1,\alpha_1),\ldots$

相似文章

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。