JumpLoRA:大语言模型持续学习的稀疏适配器

arXiv cs.CL 论文

摘要

JumpLoRA 引入了一个新颖的稀疏适配器框架,用于大语言模型的持续学习。该方法使用 JumpReLU 门控来动态隔离任务参数并防止灾难性遗忘。它增强了基于 LoRA 的方法,并超越了 ELLA 等最先进的持续学习方法。

arXiv:2604.16171v1 公告类型:交叉领域 摘要:基于适配器的方法已成为大语言模型持续学习的具有成本效益的方法,通过为每个任务顺序学习低秩更新矩阵来实现。为了缓解灾难性遗忘,最先进的方法对新适配器相对于之前适配器施加约束,目标是要么子空间干扰要么坐标级干扰。本文提出 JumpLoRA,一个通过使用 JumpReLU 门控在低秩适配块中自适应地引入稀疏性的新颖框架。该方法实现了动态参数隔离,有助于防止任务干扰。我们证明了该方法高度模块化,与基于 LoRA 的持续学习方法兼容。具体而言,它显著提升了 IncLoRA 的性能,并超越了领先的最先进持续学习方法 ELLA。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:30

# 大型语言模型持续学习中的稀疏适配器
来源:https://arxiv.org/html/2604.16171
Alexandra Dragomir1 Bitdefender &Ioana Pintilie1 Bitdefender &Antonio Barbalau1 Bitdefender &Marius Dragoi1 Bitdefender &Florin Brad1 Bitdefender &Cristian Daniel Paduraru1 Bitdefender &Alexandru Tifrea1 Bitdefender &Elena Burceanu1 Bitdefender &Radu Tudor Ionescu2,布加勒斯特大学

###### 摘要

基于适配器的方法已成为大型语言模型(LLM)持续学习(CL)的一种具有成本效益的方法,通过为每个任务顺序学习低秩更新矩阵。为了缓解灾难性遗忘,最先进的方法通过针对子空间或坐标层面的干扰来对新适配器施加约束。在本文中,我们提出了 JumpLoRA,一种通过使用 JumpReLU 门控来自适应地在低秩适配(LoRA)块中引入稀疏性的新颖框架。该方法实现动态参数隔离,有助于防止任务干扰。我们证明了我们的方法高度模块化,并与基于 LoRA 的 CL 方法兼容。具体而言,它显著提升了 IncLoRA 的性能,并超越了领先的最先进 CL 方法 ELLA。

## 1 引言

大型语言模型(LLM)的快速发展已经彻底改变了自然语言处理(Vaswani 等,2017;Brown 等,2020),在各种生成和推理任务上实现了前所未有的性能(Zhao 等,2023;Minaee 等,2024)。然而,LLM 一旦训练完成通常是静态的,缺乏在不进行昂贵重新训练的情况下集成新数据的能力。持续学习(CL)(Wu 等,2024;Shi 等,2026;Chen 等,2026)旨在通过允许模型从任务的顺序流中获取新知识来解决这个问题。

持续学习中的一个根本挑战是缓解灾难性遗忘(McCloskey 和 Cohen,1989;French,1999;Kirkpatrick 等,2016),其中顺序获取新信息会导致先前学到的知识突然丧失。这种现象本质上源于稳定性-可塑性权衡(Grossberg,1987;Abraham 和 Robins,2005;Dohare 等,2024;Lange 等,2022),因为模型必须足够灵活以学习新任务,同时保持维护现有知识所需的稳定性。

参数高效微调(PEFT)方法(Houslby 等,2019)解决了为每个新任务对 LLM 进行全量微调所带来的计算成本。基于模型更新具有低内在维数的观察(Li 等,2018;Aghajanyan 等,2021),低秩适配(LoRA)(Hu 等,2021)已成为 CL 的标准及其变体。LoRA 通过两个可训练低秩矩阵的乘积近似权重更新,同时冻结原始权重矩阵,大大减少了内存占用。

尽管具有参数效率,但为每个新任务天真地训练低秩适配器往往会导致任务干扰,造成早期任务的显著遗忘(Liang 和 Li,2024;Wang 等,2023a)。当前最先进的 CL 方法通过对适配器更新施加约束来解决这个问题。子空间分割方法将更新限制在与之前任务正交的范围内。例如,O-LoRA(Wang 等,2023a)强制连续低秩矩阵之间的正交性,而 InfLoRA(Liang 和 Li,2024)将梯度投影到先前任务子空间的正交补集上,以消除干扰。或者,坐标层面的方法(如 ELLA)(Biswa 等,2026)限制在学习新任务时可以修改的特定参数集。虽然 ELLA 等方法能有效缓解遗忘,但它们在密集参数更新制度下运作,其中所有低秩坐标对每个任务都保持活跃。这种密集方法的根本限制是它无法实现完全的参数隔离。由于每个权重在每一步都受到优化,更新必须在日益受约束的景观中导航,以同时满足所有先前的对齐约束。随着任务流的增长,这种结构分离的缺乏可能导致容量饱和或梯度干扰的积累,最终削弱模型在学习新信息的同时保持旧知识的能力。

在本文中,我们推出 JumpLoRA,一种旨在实现自适应参数隔离的方法。我们的方法利用 JumpReLU(Rajamanohan 等,2024)作为激活函数,在 LoRA 块中自适应地引入稀疏性。与传统的正则化方法不同,JumpLoRA 动态地消除冗余或干扰权重,创建稀疏适配器,最大程度地减少与先前知识的重叠。我们在图 1 中说明了我们的方法。

参考图 1:使用 JumpLoRA 的持续学习。我们构造能够通过重新利用 JumpReLU 激活函数进行细粒度干预的 LoRA 更新,使其可以在训练期间应用于权重更新。对于每个任务,我们训练一个可学习阈值 τ 与 LoRA 权重一起,用于切断低幅度更新,使适配器能够特别针对只有最相关的参数。这一变化有效地减少了适配器对基础权重的影响,同时减少了不同任务适配器之间的重叠。

我们工作的主要贡献如下:

- •我们引入 JumpLoRA,据我们所知,是*首个集成可学习 JumpReLU 门控的框架*用于低秩适配器。这种机制通过优化阈值与适配器参数并行,实现权重更新中精确的坐标层面稀疏性。
- •我们在 CL 设置中改进了 JumpLoRA 框架,它为每个任务引入自适应稀疏性。这允许不同的适配器占据不相交的参数坐标,帮助缓解任务干扰。
- •我们通过将 JumpLoRA 应用于现有 CL 框架之上来展示其模块化和有效性。通过广泛的基准测试,我们展示了 JumpLoRA 在标准 CL 基准(Zhang 等,2015)和长序列基准(Razdaibidin 等,2023)上改进了 IncLoRA 和 ELLA 等现有方法。

## 2 相关工作

在顺序任务上训练神经网络会导致灾难性遗忘(McCloskey 和 Cohen,1989),其中学习新任务会降低模型在先前学过的任务上的性能。持续学习(CL)是一个研究领域,涵盖旨在随时间学习新任务同时缓解灾难性遗忘的方法。

CL 方法属于 3 个主要类别:基于回放的、基于正则化的和基于架构的。基于回放的方法(Lopez-Paz 和 Ranzato,2017;de Masson d'Autume 等,2019;Riemer 等,2019)在回放缓冲区中存储过去的示例,在当前任务的训练期间利用。

基于正则化的方法对优化过程施加约束以保护先前任务的知识。这通常通过惩罚项或梯度约束实现。一个基础方法是弹性权重整合(EWC)(Kirkpatrick 等,2016),它计算费舍尔信息矩阵以建立参数重要性。类似地,无回放蒸馏用于在处理新任务时保留先前任务的输出(Li 和 Hoiem,2018)。Farajtabar 等(2020)通过将当前更新投影到与先前任务梯度正交的子空间上来防止干扰。正交隔离后来被扩展到 PEFT CL 设置,其中 O-LoRA(Wang 等,2023a)添加损失项以惩罚不与过去适配器正交的新 LoRA 适配器。InfLoRA(Liang 和 Li,2024)通过将梯度投影到先前任务子空间的正交补集上来实现无干扰适配,防止新更新干扰早期任务,而无需显式正交性损失。

除了子空间感知方法外,其他方法执行坐标层面的更新以在共享参数内实现更细粒度的隔离。ELLA(Biswa 等,2026)防止与历史上在先前任务中具有高幅度的权重坐标的干扰。Piggyback(Mallya 等,2018)基于网络量化和剪枝的思想,通过学习端到端二进制掩码来改进冻结的骨干网络以适应新任务,这些掩码有选择性地激活现有权重,使持续学习无需修改共享参数或遭受灾难性遗忘成为可能。类似地,MIGU(Du 等,2024)通过掩盖与高幅度神经元连接的权重对应的梯度来执行坐标层面隔离,而 HAT(Serra 等,2018)通过反向传播学习任务特定的近乎二进制的注意力掩码来门控网络单元,调节梯度以冻结对先前任务重要的权重,同时动态分配网络容量。最近,Zhang 等(2025)通过将 LoRA 矩阵 A 冻结为随机投影,并对扩展矩阵 B 应用校准的稀疏掩码 M 来防止参数干扰。稀疏掩码 M 首先通过固定稀疏比率 s 获得。随后从 B 矩阵中参数幅度的 s 分位数导出任务特定阈值 τ_t,这些在初始校准集上学习。最后,通过保留其值大于阈值 τ_t 的索引来生成 B 的掩码。相比之下,我们的方法 JumpLoRA 提供了一个更自适应的框架,通过使用*可学习的 JumpReLU 门控*来获得稀疏掩码 M。因此,我们的方法不依赖于固定的稀疏比率 s,而是动态改变阈值 τ_t 以基于任务特定的复杂性在 LoRA 适配器中诱导不同级别的稀疏性。

基于架构的方法通过在专用参数或子网络内隔离任务知识来防止干扰。这可以通过在训练期间动态重用或扩展底层模型的层(Yoon 等,2018;Li 等,2019),或通过冻结先前的任务权重并为新任务通过横向连接逐步添加新列(Rusu 等,2016)来实现。更近期的方法使用参数高效微调(PEFT)来避免修改基础模型。这通过学习任务特定的软提示(Razdaibidin 等,2023)或为每个任务学习新适配器并在测试时选择相关适配器(Wang 等,2023b)来实现。虽然这些方法隔离了任务特定的参数,但它们需要在测试时知道任务 ID 或定义一个为未知输入选择适当适配器的程序。我们的方法将现有的任务适配器合并为单个适配器,允许在测试时处理看不见的任务,而无需依赖任务 ID。

## 3 方法

持续学习设置。我们考虑预训练大型语言模型的具有挑战性的无回放持续学习设置和任务无关推理。在这种设置中,模型无法访问来自先前任务的数据,并且必须在不知道输入任务身份的情况下生成预测。给定一组任务 $\mathcal{T}$,对于每个监督任务 $T \in \mathcal{T}$,定义为 $T = \{(x_i^T, y_i^T)\}_{i=1}^{n_T}$,我们为每个基础权重矩阵 $W_{\text{base}} \in \mathbb{R}^{d_{\text{in}} \times d_{\text{out}}}$ 训练一个低秩适配器 $\Delta W = A \cdot B$,其中 $A \in \mathbb{R}^{d_{\text{in}} \times r}$,$B \in \mathbb{R}^{r \times d_{\text{out}}}$,$r \ll \min(d_{\text{in}}, d_{\text{out}})$。基础层的输出 $h = x \cdot W_{\text{base}}$ 因此变为 $h = x \cdot (W_{\text{base}} + \Delta W)$。完成每个任务的训练后,适配器合并到基础权重中:$W_{\text{base}} \leftarrow W_{\text{base}} + \Delta W$。

提议的方法。由于 $\Delta W$ 是两个低秩矩阵的乘积,执行针对 $W_{\text{base}}$ 的特定参数的细粒度干预在设计上是困难的,甚至是难以处理的。因此,我们引入了一种机制,使低秩适配器能够对任务相关参数的子集执行有针对性的更新。具体而言,我们通过梯度幅度来实现任务相关性:累积更大梯度的参数被认为对当前任务更重要。遵循 Wang 等(2023a),我们将 $\Delta W$ 解释为 $W_{\text{base}}$ 在当前任务上的累积梯度的代理。因此,我们设计了一种能够识别、保留和仅训练 $\Delta W$ 的暂定最高幅度元素的机制,有效地启用稀疏、有针对性的更新。我们额外施加约束,即每层的稀疏度水平不应被视为可调超参数。这样做会使该方法的成本高得令人望而却步,因为它需要在所有任务上重复训练运行以评估每个候选稀疏度水平。我们设计我们的方法,使每层能够学习选择最适当界定相关更新的稀疏度水平。

JumpReLU。我们通过重新利用 JumpReLU 函数来实现所提议的方法,使其能够应用于权重更新而非激活。JumpReLU 函数由 Rajamanohan 等(2024)引入

相似文章

超越LoRA:稀疏诱导的适配是否更好?

arXiv cs.LG

本文提出了对LoRA的稀疏诱导适配方法,包括廉价LoRA(cLA)和链式循环变体(c³LA),并提供了理论泛化界以及实证评估,结果显示在保持竞争性性能的同时,训练时间最多减少10%,峰值GPU内存节省最多15%。

Code2LoRA:超网络生成的适配器,用于软件演进中的代码语言模型

Hugging Face Daily Papers

Code2LoRA 引入了一个超网络,该超网络能够从代码仓库中一次性前向传播生成 LoRA 适配器,使得冻结的代码大语言模型无需额外 token 即可适应仓库上下文,并高效支持不断演进的代码库。此外,它还提供了 RepoPeftBench,一个用于仓库条件代码建模的基准测试。

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。