ReCoLoRA:面向连续大语言模型微调的频谱感知递归整合方法
摘要
ReCoLoRA 是一个频谱感知框架,用于大型语言模型的连续微调。它通过递归整合低秩适配器来防止灾难性遗忘,在多个骨干网络的连续 GLUE 任务上取得了更优的性能。
arXiv:2607.07719v1 公告类型: 新论文
摘要: 参数高效微调能够以较低成本使大型语言模型适应单一任务,但在任务序列中,LoRA 类方法会持续在相同的冻结权重上堆叠低秩更新,导致每个新任务倾向于覆盖之前的任务。我们提出了 ReCoLoRA(低秩适配器的递归整合),这是一种面向连续微调的频谱感知框架:适配器从预训练权重的随机奇异值分解(SVD)初始化,通过肘部准则选择每层的有效秩,并在开放残差容量之前对主子空间进行适配。在每项新任务开始前,ReCoLoRA 将当前有效权重(而非原始权重)重新分解为冻结残差、缓慢更新的主成分和一个新的适配器(递归整合),从而使每个任务都从已经吸收了先前任务的模型开始。在四个 7-8B 骨干网络的六项连续 GLUE 任务序列中,ReCoLoRA 在三个骨干网络上取得了优于遍历秩的 LoRA、PiSSA、AdaLoRA 和 DoRA 基线的最高平均分,同时训练参数更少;一个基于 oracle 路由的任务库变体在完全任务隔离下作为上界。代码: https://github.com/bhqy666/ReCoLoRA。
查看缓存全文
缓存时间: 2026/07/10 06:10
# ReCoLoRA:面向持续大语言模型微调的频谱感知递归整合
来源:https://arxiv.org/html/2607.07719
###### 摘要
参数高效微调能以较低成本将大语言模型适配到单个任务,但在任务序列上,LoRA风格的微调方法会不断在同个冻结权重上叠加低秩更新,导致每个新任务倾向于覆盖之前任务的知识。我们提出*ReCoLoRA*(低秩适配器的递归整合),这是一个面向持续微调的频谱感知框架:适配器通过预训练权重的随机化奇异值分解初始化,每层有效秩通过肘部准则选取,主子空间先进行适配,随后逐步开放残差容量。在每个新任务前,ReCoLoRA将*当前*有效权重(而非原始权重)重新分解为一个冻结残差、一个缓慢更新的主成分以及一个全新的适配器(递归整合),使得每个任务均从已吸纳前序任务的模型出发。在基于四个7–8B骨干模型的六任务持续GLUE序列上,ReCoLoRA在三个骨干模型上取得了最佳最终平均得分(对比经过秩扫描的LoRA、PiSSA、AdaLoRA和DoRA基线),同时训练参数更少;基于Oracle路由的ReCoLoRA任务库变体在完全任务隔离下提供了上界。代码:https://github.com/bhqy666/ReCoLoRA。
## 1 引言
大语言模型通常在静态语料上训练,但部署系统必须适应不断变化的任务、领域和用户需求。每当新数据到来时重新训练整个LLM通常不可行,因此下游适配常通过PEFT进行。LoRA[1 (https://arxiv.org/html/2607.07719#bib.bib1)]是一种代表性PEFT方法:它冻结预训练权重矩阵W₀,并学习一个低秩更新:
Weff = W₀ + ΔW, ΔW = BA, (1)
其中B ∈ R^{d_out × r}, A ∈ R^{r × d_in},且r ≪ min(d_out, d_in)。LoRA大大减少了可训练参数,且便于部署,因为适配器可以在训练后合并至基权重。
然而,常见的单任务PEFT假设在持续使用场景中过于薄弱。在持续学习中,数据或任务按顺序到达,学习者必须获取新知识,同时保留先前阶段的有用行为[2 (https://arxiv.org/html/2607.07719#bib.bib2),3 (https://arxiv.org/html/2607.07719#bib.bib3)]。这造成了经典的稳定性-可塑性困境:高可塑性的模型能快速适应新任务但可能忘记旧任务,而高稳定性的模型能保留旧行为但可能对新任务欠拟合。近期LLM研究表明,灾难性遗忘也可能发生在持续指令微调和微调过程中,包括领域知识、推理和阅读理解能力的退化[4 (https://arxiv.org/html/2607.07719#bib.bib4),5 (https://arxiv.org/html/2607.07719#bib.bib5)]。因此,PEFT并不能自动解决遗忘问题;低秩适配器仍然可能过度特化于最新任务。
现有LoRA变体针对相关问题进行了改进。AdaLoRA[6 (https://arxiv.org/html/2607.07719#bib.bib6)]在训练过程中动态重新分配秩预算。PiSSA[7 (https://arxiv.org/html/2607.07719#bib.bib7)]利用预训练权重的主奇异向量初始化适配器,相比随机初始化LoRA收敛更快。DoRA[8 (https://arxiv.org/html/2607.07719#bib.bib8)]分离权重大小和方向以提升适配器表达能力。正交LoRA系列方法(如O-LoRA[9 (https://arxiv.org/html/2607.07719#bib.bib9)])通过将新任务分配到正交低秩子空间来显式减少干扰。这些方法启发了我们的核心问题:我们能否利用预训练权重谱本身来决定哪些子空间应该先改变,哪些应稍后恢复?
我们提出ReCoLoRA(低秩适配器的递归整合),一种用于持续微调的频谱感知分阶段LoRA变体。ReCoLoRA将每个预训练权重分解为主子空间和残差子空间,利用随机化SVD初始化主适配器,通过肘部准则选取每层有效秩,并分两个阶段训练:第一阶段适配主承载预训练主导结构的子空间,第二阶段当主子空间单独无法拟合时逐步开放残差容量。更难的问题是如何应对任务序列。一种自然的初步尝试——我们尝试过——是通过冻结已经使用的秩或在参数空间中锚定来保护单个共享适配器中的旧知识;实验表明这不可靠,因为强保护抑制可塑性,弱保护则让旧行为漂移。因此,ReCoLoRA的核心机制是递归整合。ReCoLoRA不是将每次新更新不断叠加到原始冻结权重W₀上,而是将每个完成的任务折叠回模型:在下个任务前,将当前有效权重重新分解为一个冻结残差、一个缓慢可训练的肘部压缩主成分以及一个全新的快速适配器。这样,每个任务都是从已整合的模型出发,先前任务的知识被保留在慢主子空间中,而不是暴露在被覆盖的风险下。最终得到一个可直接部署的单一演化模型。为了衡量显式记忆机制能恢复多少,我们还研究了ReCoLoRA-TaskBank,它为每个任务训练一个隔离的频谱初始化ReCoLoRA分支,冻结已完成分支,并通过Oracle路由器将每次评估路由到对应分支。TaskBank通过构造消除了覆盖问题;我们将其视为上界而非可部署的任务无关解决方案。
我们的贡献如下:
- **我们提出ReCoLoRA**,一个面向持续微调的频谱感知PEFT框架:通过预训练权重的随机化SVD初始化适配器,通过肘部准则选取每层有效秩,先适配主子空间后适配残差子空间。
- **我们引入递归整合**作为ReCoLoRA的持续机制:每个完成的任务通过将当前有效权重重新分解为冻结残差、缓慢可训练主成分和全新适配器来折叠回模型。这产生一个单一可部署模型,并且在我们的实验中,比在单个共享适配器中冻结或锚定秩更可靠地保留旧任务。
- **我们引入ReCoLoRA-TaskBank**,一个基于Oracle路由的任务增量变体,为每个任务隔离一个频谱初始化分支。通过构造消除覆盖问题,并提供保留能力的上界。
- **在覆盖Qwen3-8B、Llama-3.1-8B-Instruct、Mistral-7B-v0.3和InternLM2.5-7B-Chat的六任务持续GLUE序列上**,对比经过秩扫描的基线,ReCoLoRA在三个骨干模型上达到了最佳最终平均得分,且可训练参数远少于最强秩-256基线;而ReCoLoRA-TaskBank在Qwen3-8B上(三个种子,Oracle路由)取得0.8957±0.0026的最终平均得分和0.0000±0.0000的平均遗忘。
## 2 背景与相关工作
### 2.1 持续学习设定与指标
持续学习研究模型按序列接收数据而非固定独立同分布训练集的情况。一般性综述区分了几种常见设定[2 (https://arxiv.org/html/2607.07719#bib.bib2)]:实例增量学习改变任务内的输入流;领域增量学习改变输入分布但保持标签语义相似;任务增量学习引入任务序列,通常在评估时可获得任务身份;类别增量学习在测试时引入新标签且无任务身份;在线持续学习限制训练为单次或少量遍历流式数据。LLM持续学习常按训练阶段组织:持续预训练更新事实、领域或语言;持续指令微调更新任务、技能和领域;持续对齐更新偏好或价值观[5 (https://arxiv.org/html/2607.07719#bib.bib5)]。
本文聚焦于任务增量持续微调。我们顺序训练一个模型,处理一系列下游语言理解任务。模型在每阶段结束后对所有已见任务进行评估。该设定接近持续指令式适应,因为每个分类任务被转化为自然语言提示并用因果语言模型解决。它不使用先前任务的重放数据,所有基线方法共享相同的任务顺序和评估协议。
典型的NLP/LLM持续学习基准包括GLUE和SuperGLUE风格的任务序列[10 (https://arxiv.org/html/2607.07719#bib.bib10),11 (https://arxiv.org/html/2607.07719#bib.bib11)]、终身语言学习流(如LAMOL五任务设定[12 (https://arxiv.org/html/2607.07719#bib.bib12)])、指令微调集合(如T0/FLAN风格任务混合[13 (https://arxiv.org/html/2607.07719#bib.bib13)])以及能力保留套件(评估微调后的领域知识、推理和阅读理解能力[4 (https://arxiv.org/html/2607.07719#bib.bib4)])。对于首个完整实现,我们选择GLUE,因为其公开、轻量(适合重复8B模型运行),且包含异构任务格式:情感分类、释义检测、蕴含、作为蕴含的问题回答、重复问题检测以及多体裁推理。
设 a_{i,j} 为模型训练到任务 i 后在任务 j 上的得分。经过 T 个任务后的最终平均得分为:
FinalAvg = (1/T) * Σ_{j=1}^{T} a_{T,j}. (2)
一种标准的遗忘度量将每个任务的最终得分与该任务在序列中先前观测到的最高得分进行比较[2 (https://arxiv.org/html/2607.07719#bib.bib2)]:
F_j = max_{i∈{j,...,T}} a_{i,j} - a_{T,j}, AvgForget = (1/T) * Σ_{j=1}^{T} F_j. (3)
注意 F_T = 0 根据定义:序列中的最后一个任务只在其自身训练后立即评估一次,因此无论何种方法都不会记录遗忘。因此 AvgForget 不仅依赖于方法,还依赖于哪个任务占据最后位置。我们报告 FinalAvg 和 AvgForget,它们捕捉了本文最相关的两个维度:最终效用和记忆稳定性。
### 2.2 PEFT与低秩适配
LoRA[1 (https://arxiv.org/html/2607.07719#bib.bib1)]冻结骨干网络并学习低秩更新。后续工作从多个方向改进了LoRA。AdaLoRA[6 (https://arxiv.org/html/2607.07719#bib.bib6)]通过估计组件重要性自适应分配秩。DyLoRA[14 (https://arxiv.org/html/2607.07719#bib.bib14)]支持单个训练适配器中多个秩。DoRA[8 (https://arxiv.org/html/2607.07719#bib.bib8)]将预训练权重分解为大小和方向。VeRA[15 (https://arxiv.org/html/2607.07719#bib.bib15)]通过共享随机投影减少可训练参数。LoRA+[16 (https://arxiv.org/html/2607.07719#bib.bib16)]通过对LoRA因子使用不同学习率改进优化。
### 2.3 NLP与LLM持续学习
NLP中的持续学习不同于视觉,因为任务可能具有不同的输入输出格式、标签语义和指令风格[3 (https://arxiv.org/html/2607.07719#bib.bib3)]。LAMOL[12 (https://arxiv.org/html/2607.07719#bib.bib12)]是一种早期的语言终身学习方法,训练语言模型解决任务并生成伪样本用于重放。Continual-T0[13 (https://arxiv.org/html/2607.07719#bib.bib13)]研究了多任务上的持续指令学习,并认为指令微调语言模型在适当训练下可以保留广泛技能。Progressive Prompts[17 (https://arxiv.org/html/2607.07719#bib.bib17)]保持基础模型冻结,为每个任务学习一个新的软提示,按顺序连接提示以减少遗忘。
对于LoRA风格的持续学习,O-LoRA[9 (https://arxiv.org/html/2607.07719#bib.bib9)]在正交低秩子空间中学习新任务并修复旧任务以限制干扰,而C-LoRA[18 (https://arxiv.org/html/2607.07719#bib.bib18)]使用路由矩阵管理跨任务的参数更新,使得学到的子空间可以重用而不需维护大量独立适配器。ReCoLoRA同意子空间干扰是核心问题,但以不同方式解决:它从预训练权重谱出发,并在每个任务后从当前有效权重重新计算一个慢主子空间,使得先前知识在一个演化模型内部被前向传递。TaskBank变体则处于另一个极端,类似于适配器隔离和路由方法:它为每个任务分配一个频谱初始化分支,并在本文中使用Oracle路由作为上界(在引入学得的、输入条件路由器之前)。
## 3 方法
ReCoLoRA沿三个轴修改LoRA:谱初始化、自适应有效秩和分阶段残差恢复。图1 (https://arxiv.org/html/2607.07719#S3.F1)总结了流程。
该方法基于两个观察。第一,预训练Transformer权重并非各向同性:它们的奇异谱通常呈现少量主导方向后跟长尾。第二,序列微调中的灾难性遗忘不仅由参数数量引起,还取决于更新应用的位置。随机低秩因子可能利用其容量来适应当前任务的方向,同时干扰先前行为。因此,ReCoLoRA要求优化器首先使用对预训练模型已经重要的方向,仅在之后使用残差容量。
[图1标题:ReCoLoRA流程。每个目标预训练权重通过随机化SVD近似分解。肘部启发式选择有效秩并生成秩掩码。训练首先适配主子空间,然后通过适配器参数(而非解冻整个骨干)逐渐恢复残差容量。]
### 3.1 LoRA更新的谱视角
考虑一个预训练矩阵 W₀ ∈ R^{d_out × d_in},其奇异值分解为
W₀ = U Σ V^⊤ = U_r Σ_r V_r^⊤ + U_⊥ Σ_⊥ V_⊥^⊤. (4)
第一项包含前 r 个主导奇异方向,称为主成分。剩余项为残差分量。标准LoRA并未显式使用该分解;其低秩因子随机初始化,必须通过任务梯度发现有用方向。PiSSA使用主奇异方向进行初始化[7 (https://arxiv.org/html/2607.07719#bib.bib7)]。ReCoLoRA遵循相同的谱动机,但增加了两个持续学习机制:自适应秩掩码和残差恢复。
ReCoLoRA将有效权重表示为
Weff(t) = W₀ + ΔW_p(t) + γ(t) ΔW_r(t), (5)相似文章
CRMA: 一种用于LLM模块化持续微调的谱界主干
CRMA引入了一种谱界残差适配器,通过Sinkhorn归一化强制实现双随机混合矩阵,使LLM能够持续微调而不发生灾难性遗忘。在Mistral-7B和Gemma-2-9B上的实验结果表明,与冻结基底的基线相比,后向迁移得到改善,遗忘减少。
CARE-LoRA: 基于压缩激活重建的内存高效LoRA微调框架
CARE-LoRA提出了一种压缩激活重建框架,通过利用低秩投影来减少LoRA微调过程中的内存消耗。该方法在降低内存占用的同时,实现了具有竞争力的性能。
JumpLoRA:大语言模型持续学习的稀疏适配器
JumpLoRA 引入了一个新颖的稀疏适配器框架,用于大语言模型的持续学习。该方法使用 JumpReLU 门控来动态隔离任务参数并防止灾难性遗忘。它增强了基于 LoRA 的方法,并超越了 ELLA 等最先进的持续学习方法。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
超越 LoRA 与全参数微调:基于梯度引导优化器路由的大语言模型适配
本文提出了一种混合 LoRA 与全参数微调(MoLF)框架,利用梯度引导的优化器路由在 LoRA 和全参数微调之间进行自适应切换。旨在通过结合全参数微调的可塑性与 LoRA 的正则化特性,克服仅依赖静态适配方法的结构局限性。