SOS-LoRA: 静态正交子空间低秩适应结合固定多尺度缩放
摘要
SOS-LoRA 通过将秩预算分解为具有固定多尺度缩放的静态正交低秩专家来扩展 LoRA,在不增加推理成本的情况下提升了在推理、NLU 和数学基准上的微调性能。
查看缓存全文
缓存时间: 2026/07/21 06:47
# SOS-LoRA: 结合固定多尺度缩放的静态正交子空间低秩自适应 来源: https://arxiv.org/html/2607.16252 常宇鹏¹ 吴元¹¹¹通讯作者 常毅¹,²,³ ¹吉林大学人工智能学院 ²教育部知识驱动人机智能工程研究中心 ³吉林大学未来科学国际中心 [email protected], {yuanwu, yichang}@jlu.edu.cn ###### 摘要 低秩自适应(LoRA)是一种广泛应用于大型语言模型的参数高效微调(PEFT)方法。在固定秩预算下,LoRA 通过单个低维输入端通路参数化每个自适应权重,这可能会因共享输入端方向而耦合异构行为,并在优化过程中引发干扰。我们提出**静态正交子空间 LoRA**(SOS-LoRA),这是一种即插即用的扩展方法,将秩为 \(r_{\text{tot}}\) 的更新重新参数化为 \(K\) 个*静态*(始终开启、非路由)低秩专家之和。SOS-LoRA (i) 将总秩分解到各专家中,(ii) 应用*固定的*多尺度缩放方案以鼓励尺度分离的优化动力学,(iii) 通过跨专家正交初始化和轻量级正则化项促进输入端方向的多样性。SOS-LoRA 保持完全可合并性,合并后不会引入推理时参数或延迟。在推理与知识密集型基准(Llama 2/3)、基于编码器的 NLU 任务(GLUE)以及数学推理(GSM8K/MATH)上的实验表明,与匹配预算的 LoRA 基线及近期变体相比,SOS-LoRA 持续取得改进。代码可在 https://github.com/llm172/sos-lora 获取。 SOS-LoRA: 结合固定多尺度缩放的静态正交子空间低秩自适应 常宇鹏¹ 吴元¹¹¹通讯作者 常毅¹,²,³ ¹吉林大学人工智能学院 ²教育部知识驱动人机智能工程研究中心 ³吉林大学未来科学国际中心 [email protected], {yuanwu, yichang}@jlu.edu.cn ## 1 引言 参数高效微调(PEFT)广泛用于适配大型语言模型(LLMs)(Touvron et al., 2023; Chang et al., 2024; Han et al., 2024),当全参数微调在计算和操作上成本高昂时尤为适用。在 PEFT 策略中,低秩自适应(LoRA)(Hu et al., 2022) 因其简洁性、强大的实证性能以及部署友好的可合并性而成为标准选择。LoRA 的动机基于一个观察:特定任务的权重更新通常表现出低有效秩,这与微调中低内在维度的证据一致 (Aghajanyan et al., 2020)。具体地,LoRA 冻结预训练权重 \(W_0\),并学习一个秩为 \(r_{\text{tot}}\) 的更新量 \(\Delta W = \frac{\alpha}{r_{\text{tot}}} AB\),其中 \(A \in \mathbb{R}^{m \times r_{\text{tot}}}\),\(B \in \mathbb{R}^{r_{\text{tot}} \times n}\),得到适配后的权重 \(W_0 + \Delta W\)。由于更新是加性的且线性,可在训练后合并到 \(W_0\) 中,从而保留主干架构和推理效率 (Hu et al., 2022)。 尽管取得了成功,标准 LoRA 为每个被适配的矩阵分配了**单一**低秩更新通路。这引出一个自然的问题:在固定秩预算下,一个共享的低维通路能否充分支撑现代 LLM 所需的各种行为?在标准分解中,适配信号仅通过单个投影 \(XA\) 依赖于输入,即所有适配效果共享同一组输入端方向。因此,异构行为可能被迫在固定秩预算下共享并竞争相同的输入端方向,从而引发干扰和优化耦合。增加秩可以部分缓解该问题,但同时也增加了可训练参数,并且在固定预算下仍缺乏显式的结构化适配机制。 在本工作中,我们通过将低秩更新**结构化**为多个专家组件来缓解这种耦合,同时不增加总秩预算。我们提出**静态正交子空间 LoRA**(SOS-LoRA),这是一种标准 LoRA 的即插即用替代方案,它将秩为 \(r_{\text{tot}}\) 的更新重新参数化为 \(K\) 个*静态*(始终开启、非路由)低秩专家之和。每个专家使用自己的输入端方向,分配一个固定尺度,并被显式鼓励与其他专家在方向上保持区分。重要的是,SOS-LoRA 并没有扩大假设类到秩-\(r_{\text{tot}}\) 更新之外;相反,它在相同的低秩预算下引入了一种面向优化的归纳偏置,以促进方向多样的适配。 SOS-LoRA 通过三个组件实现这一归纳偏置。首先,**并行专家分解**将总秩预算拆分为 \(K\) 个秩为 \(r' = r_{\text{tot}}/K\) 的专家,与相同 \(r_{\text{tot}}\) 下标准 LoRA 的参数预算匹配。其次,**固定多尺度缩放**方案为每个专家分配一个从小到大的静态尺度;这会缩放进入每个专家的原始反向传播梯度,并鼓励尺度分离的学习动力学。第三,**输入端方向正交多样化**结合了跨专家正交初始化(初始更新为零)和一个正交性正则化项,惩罚输入端方向的跨专家相关性。 关键的是,SOS-LoRA 保留了 LoRA 的核心部署特性:训练后,所有专家更新可合并到预训练权重中,形成单一的有效更新矩阵。因此,部署时使用与基础模型相同的主干架构和每 token FLOPs,合并后不会引入额外推理延迟 (Hu et al., 2022)。 我们的贡献有三点: - • 我们识别出标准 LoRA 在固定秩预算下的一个关键局限:单个共享输入端投影可能通过共同的低维更新通路耦合异构行为,从而引发干扰和优化耦合。 - • 我们提出 SOS-LoRA,它将秩为 \(r_{\text{tot}}\) 的 LoRA 更新重新参数化为 \(K\) 个*静态*低秩专家之和,采用固定多尺度缩放和输入端方向的显式跨专家多样化,同时保留 LoRA 的可合并性和推理效率。 - • 我们在推理与知识密集型基准、基于编码器的 NLU 任务(GLUE)以及数学推理(GSM8K/MATH)上对 SOS-LoRA 进行实证评估,在统一的训练和评估流程下,与匹配预算的 LoRA 基线和近期 LoRA 变体相比,显示出持续改进。 参见图标注: 图1:静态正交子空间 LoRA(SOS-LoRA)概述,采用行向量约定 \(y = xW_0\),\(W_0 \in \mathbb{R}^{m \times n}\),\(x \in \mathbb{R}^{1 \times m}\),\(y \in \mathbb{R}^{1 \times n}\)。 (a) LoRA 冻结 \(W_0\) 并学习单一秩-\(r_{\text{tot}}\) 更新 \(\Delta W = \frac{\alpha}{r_{\text{tot}}} AB\),其中 \(A \in \mathbb{R}^{m \times r_{\text{tot}}}\),\(B \in \mathbb{R}^{r_{\text{tot}} \times n}\),得到 \(y = x(W_0 + \Delta W)\);在该参数化下,适配器仅通过共享投影 \(xA\) 依赖于输入。 (b) SOS-LoRA 将相同的总秩预算重新参数化为 \(K\) 个*静态*(始终开启、非路由)秩-\(r'\) 专家 \(\{ (A_k, B_k) \}_{k=1}^K\),其中 \(r' = r_{\text{tot}}/K\),通过固定多尺度尺度 \(\{s_k\}\) 组合,并通过关于 \(\{A_k\}\) 的正交性正则化项鼓励使用多样化的输入端方向。合并后的更新为 \(\Delta W = \sum_{k=1}^K s_k A_k B_k\),可吸收到 \(W_0\) 中,合并后无需额外的推理时参数或延迟。 ## 2 相关工作 参数高效微调(PEFT)通过仅更新一小部分参数来适配大型预训练模型 (Han et al., 2024)。代表性方法包括添加轻量级模块如 Adapters (Houlsby et al., 2019)、优化连续提示或前缀的基于提示的微调 (Lester et al., 2021; Li and Liang, 2021) 以及权重更新的低维重参数化。其中,低秩自适应(LoRA)(Hu et al., 2022) 及其后续扩展 (Chang et al., 2026, 2025) 冻结预训练权重并学习高效的低秩更新,使基于 LoRA 的方法成为一个广泛使用的 PEFT 家族。 越来越多的工作沿多个方向扩展 LoRA。面向优化和训练的变体旨在改进收敛性或更新质量(例如 LoRA+ (Hayou et al., 2024)、LoRA-GA (Wang et al., 2024a)、LoRA-Pro (Wang et al., 2024b)),而基于正交性的方法鼓励干扰更少的低秩更新(例如 O-LoRA (Wang et al., 2023),主要在持续学习中研究)。其他方向通过 token 相关的路由探索多个 LoRA 专家(例如 MixLoRA (Li et al., 2024)),通过可学习门控组合多个*训练好的* LoRA(例如 MoLE (Wu et al., 2024)),或跨层引入多尺度设计(例如 MSPLoRA (Zhao et al., 2025))。关于增强专业化或表达能力的思想也在非线性 LoRA 设计和神经元级混合框架中得到探索 (Dong et al., 2025, 2026)。相比之下,SOS-LoRA 保留了 LoRA 的可合并性和固定的总秩预算,但将**每个适配权重内部**的更新重新参数化为 \(K\) 个*静态*(始终开启、非路由)低秩专家之和。它还采用*固定的*多尺度缩放方案,并通过正交性正则化项显式促进*输入端方向的跨专家多样性*,同时在相同总秩下与标准 LoRA 在表达能力上等价。 ## 3 方法 我们提出**静态正交子空间 LoRA**(SOS-LoRA),一种旨在固定低秩预算下改进*有效*适配的参数高效微调(PEFT)方法。SOS-LoRA 通过以下方式实现: (i) 将单个秩-\(r_{\text{tot}}\) 更新分解为多个*静态*(始终开启、非路由)低秩专家; (ii) 使用*预先指定的*多尺度缩放计划(可选地带有轻度*与输入无关的*校准)来促进稳定、尺度分离的优化动力学; (iii) 通过初始化和轻量级正则化项显式鼓励*输入端方向的跨专家多样性*。与标准 LoRA (Hu et al., 2022) 一样,SOS-LoRA 可*合并*到线性层中:微调后,学习到的低秩更新可合并到基础权重中,合并后不产生任何额外的推理时参数和延迟。图1 提供了标准 LoRA 参数化和 SOS-LoRA 设计的概览。 ### 3.1 问题形式化:固定秩预算下的输入端耦合 设 \(W_0 \in \mathbb{R}^{m \times n}\) 是 Transformer 线性层中的预训练权重矩阵。设 \(X \in \mathbb{R}^{N \times m}\) 表示 \(N\) 个 token 实例(跨批和序列展平)的输入激活,\(Y \in \mathbb{R}^{N \times n}\) 表示对应的输出。标准低秩自适应(LoRA)(Hu et al., 2022) 冻结 \(W_0\) 并参数化一个秩至多为 \(r_{\text{tot}}\) 的加性更新 \(\Delta W\): \[ Y = X(W_0 + \Delta W) = X\left(W_0 + \frac{\alpha}{r_{\text{tot}}} AB\right), \tag{1} \] 其中 \(A \in \mathbb{R}^{m \times r_{\text{tot}}}\),\(B \in \mathbb{R}^{r_{\text{tot}} \times n}\),\(\alpha\) 是缩放标量。 ##### 共享输入端通路。 公式 (1) 意味着 LoRA 通路仅通过单个低维投影依赖于输入。记 \(Z = XA \in \mathbb{R}^{N \times r_{\text{tot}}}\),则有 \(XAB = ZB\),因此 LoRA 贡献仅通过 \(Z\) 依赖于 \(X\)。特别地,对于任何满足 \(X_1 A = X_2 A\) 的 \(X_1, X_2\),LoRA 通路产生相同输出 \(X_1 AB = X_2 AB\)。等价地,对于单个 token 行 \(x \in \mathbb{R}^{1 \times m}\),LoRA 通路仅通过 \(xA\)(或 \(A^\top x^\top\))依赖于 \(x\)。在固定秩预算下,这意味着所有输入敏感的适配效果都通过相同的共享秩-\(r_{\text{tot}}\) 输入投影来中介。 ##### 固定秩预算下的优化耦合。 增加 \(r_{\text{tot}}\) 会增加 \(\Delta W\) 的最大秩,但也增加了可训练参数数量。在*固定的* \(r_{\text{tot}}\) 下,单个分解 \(AB\) 可能通过迫使异构适配信号共享并竞争 \(A\) 中的相同输入端方向来耦合这些信号。SOS-LoRA 引入结构化参数化和显式的跨专家方向正则化,以将优化偏向更多样的输入方向,同时保持相同的总体秩预算。 ### 3.2 SOS-LoRA:架构设计 SOS-LoRA 用 \(K\) 个并行的秩-\(r'\) 专家替换单个秩-\(r_{\text{tot}}\) 适配器,其中 \(r' = r_{\text{tot}} / K\)(假设 \(K\) 整除 \(r_{\text{tot}}\))。该设计包含三个组件:(i) 并行专家分解,(ii) 多尺度缩放,(iii) 通过正交初始化和正则化实现的输入端多样化。 ##### 表达能力等价性(假设类)。 SOS-LoRA 并*没有*扩大可表示的秩-\(r_{\text{tot}}\) 更新集合,相比标准 LoRA;相反,它通过尺度分离的优化和跨专家方向多样性提供了面向优化的归纳偏置。形式上: ###### 命题1(表达能力等价性)。 令 \(\{ (A_k, B_k) \}_{k=1}^K\),其中 \(A_k \in \mathbb{R}^{m \times r'}\),\(B_k \in \mathbb{R}^{r' \times n}\),并令 \(s_k\) 为标量。定义列拼接 \(A_{\mathrm{cat}} = [A_1, \ldots, A_K] \in \mathbb{R}^{m \times r_{\text{tot}}}\) 和行拼接 \(B_{\mathrm{cat}} = [s_1 B_1; \ldots; s_K B_K] \in \mathbb{R}^{r_{\text{tot}} \times n}\),则 \[ \Delta W
相似文章
BaLoRA:大规模模型的贝叶斯低秩适应
BaLoRA 引入了低秩适应(LoRA)的贝叶斯扩展,通过缩小与全量微调之间的差距,提供校准良好的不确定性估计并提高预测准确性。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
基于可学习秩的参数高效微调
来自阿德莱德大学的研究人员提出了 LR-LoRA(可学习秩 LoRA),这是一种参数高效微调方法,在训练过程中动态学习每个 Transformer 层的适配器秩,而非使用固定的全局秩。LR-LoRA 在语言理解和常识推理基准测试上达到了最先进的性能,超越了固定秩 LoRA 基线。
MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning
# Paper page - MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning Source: [https://huggingface.co/papers/2605.07850](https://huggingface.co/papers/2605.07850) We propose**MatryoshkaLoRA**, a general, Matryoshka\-inspired training framework for LoRA that learns accurate hierarchical low\-rank representations by inserting a fixed, carefully crafted diagonal matrix**P**between the existing LoRA adapters to scale their sub\-ranks accordingly\. By introducing
超越LoRA:稀疏诱导的适配是否更好?
本文提出了对LoRA的稀疏诱导适配方法,包括廉价LoRA(cLA)和链式循环变体(c³LA),并提供了理论泛化界以及实证评估,结果显示在保持竞争性性能的同时,训练时间最多减少10%,峰值GPU内存节省最多15%。