CRMA: 一种用于LLM模块化持续微调的谱界主干
摘要
CRMA引入了一种谱界残差适配器,通过Sinkhorn归一化强制实现双随机混合矩阵,使LLM能够持续微调而不发生灾难性遗忘。在Mistral-7B和Gemma-2-9B上的实验结果表明,与冻结基底的基线相比,后向迁移得到改善,遗忘减少。
arXiv:2606.00382v1 公告类型:新
摘要:对大型语言模型进行顺序微调迫使我们需要做出选择:要么让共享基底继续学习并接受灾难性遗忘,要么在第一个任务后冻结它并放弃跨任务优化。逐任务适配器方法(LoRAHub、AdapterFusion、PackNet、Progressive Networks)选择了第二条路径。我们引入了CRMA(约束残差混合适配器),这是一种残差适配器,其内部混合矩阵M通过Sinkhorn归一化在每次前向传播时都是双随机的,因此根据Birkhoff定理,||M||_2 <= 1在构造上成立——这是一个结构约束,而非惩罚项。CRMA的谱界主干提供了一个持续训练的共享基底,这是早期模块化方法所无法实现的,同时保留了它们关于遗忘的保证。在Mistral-7B上,跨越5个顺序域和3个随机种子,基于CRMA主干的模块化逐任务LoRA将损失相对漂移从+42.96% ± 5.5(朴素顺序微调)降低到-0.17% ± 0.17,且各种子范围不重叠,并在匹配的冻结基底基线上将先前任务的留出损失改善了1.99% ± 0.54。三个独立的实验设置(Mistral-7B 4域控制消融、TinyLlama 3域污染控制复现、Mistral-7B 7B跨域探测)均显示出正的后向迁移——无需回放缓冲区、无需增加每任务内存、无需蒸馏。在Gemma-2-9B上的推理时消融证实了CRMA介导了对顺序训练知识的访问:在相同权重和相同问题下,仅切换CRMA注入,结果从38/100变为98/100。867个记录的训练步骤验证了在float32精度下||M||_2 = 1.0(最大偏差1.2×10^-7)。该遗忘预防效果在1.1B-9.2B参数和四个架构族中保持一致。
查看缓存全文
缓存时间: 2026/06/02 15:42
# CRMA:用于大语言模型模块化持续微调的谱约束骨干网络 来源:https://arxiv.org/html/2606.00382(2026年4月) ###### 摘要 大语言模型的顺序微调面临两难选择:要么让共享底层持续学习并承受灾难性遗忘,要么在第一个任务后冻结底层而放弃跨任务优化。每任务适配器方法(LoRAHub、AdapterFusion、PackNet、Progressive Networks)选择了后一条路径。我们引入CRMA(Constrained Residual Mixing Adapter),一种残差适配器,其内部混合矩阵 M 通过Sinkhorn归一化在每次前向传播中都是双随机的,因此根据Birkhoff定理,‖M‖₂ ≤ 1 由构造保证——这是一个结构性约束,而非惩罚项。CRMA的谱约束骨干网络提供了一个*持续训练*的共享底层,这是早期模块化方法无法实现的,同时保留了它们的遗忘保证。在Mistral-7B上跨5个顺序领域和3个随机种子的实验中,基于CRMA骨干网络的模块化每任务LoRA在先前任务保持损失上比匹配的冻结底层模块化基线提升了1.99%±0.54——在平均值上每个种子均为正;每个任务上的符号有所不同(CRMA在法律和代码任务上低于FROZEN,在医学和金融任务上高于FROZEN;详见§6.1.3 (https://arxiv.org/html/2606.00382#S6.SS1.SSS3))。在同一协议下,模块化CRMA将损失相对漂移从+42.96%±5.5(朴素顺序微调)降低到−0.17%±0.17,且各种子范围不重叠。¹¹¹符号约定:损失相对漂移;正值表示遗忘(先前任务损失增加),负值表示保持。这与Lopez-Paz和Ranzato(2017)基于准确率的BWT惯例符号相反;详细讨论见§6.1.3 (https://arxiv.org/html/2606.00382#S6.SS1.SSS3)。在Gemma-2-9B上的推理时消融实验证实,CRMA介导了对顺序训练知识的访问:在相同权重和相同问题下,仅切换CRMA注入,得分分别为98/100和38/100。三个独立的实验设置均显示出正向后向迁移:Mistral-7B控制训练消融实验(表6 (https://arxiv.org/html/2606.00382#S6.T6)和7 (https://arxiv.org/html/2606.00382#S6.T7),MODULAR漂移在3个种子上平均为−0.1%)、TinyLlama污染控制复制实验(表9 (https://arxiv.org/html/2606.00382#S6.T9),−0.110 NLL / +0.020 EM)以及7B规模的Mistral-7B跨领域探针实验(D1-探针在三个顺序阶段中存活)。867个记录的训练步骤验证了‖M‖₂ = 1.0在float32精度内(最大偏差1.2×10⁻⁷)。遗忘预防效果无需修改即可在1.1B–9.2B参数和四个架构家族间迁移;CRMA相对于冻结底层基线的1.99%学习优势在7B规模出现,但在1.1B规模不存在,这与较大模型从稳定骨干网络中受益更多一致(§6.1.3 (https://arxiv.org/html/2606.00382#S6.SS1.SSS3))。 ## 1 引言 ##### 问题所在。微调是一种受控的表征变化行为,像任何此类行为一样,它可能出错。将模型推向新目标的梯度更新也会扰动先前学习能力所依赖的内部激活。当这些扰动过大时,先验知识就会退化。这种现象已有充分记录[1 (https://arxiv.org/html/2606.00382#bib.bib1), 2 (https://arxiv.org/html/2606.00382#bib.bib2)],并且在规模上非常严重:在TRACE基准[10 (https://arxiv.org/html/2606.00382#bib.bib10)]上,LLaMA-2 13B在GSM8K上的准确率在朴素顺序微调下从28.8%下降到2%。Dohare等人[19 (https://arxiv.org/html/2606.00382#bib.bib19)]展示了权重矩阵中的谱坍塌是结构性根本原因。为一个新癌症类型更新的放射学模型可能会悄然失去对先前可检测癌症的敏感性;为检测新欺诈手段而重新训练的欺诈检测器可能会忘记旧手段。受监管行业对此感受最深——FDA的预定变更控制计划[23 (https://arxiv.org/html/2606.00382#bib.bib23)]要求设备制造商证明更新保留了先前的性能——但潜在的失效模式是普遍的。 ##### 论点。共同线索是*表征干扰*:当单个适配器学习一系列任务时,任务N的梯度更新会重写先前任务所依赖的表征部分。标准的持续学习机制(正则化、回放、梯度投影)在训练时与这种干扰协商,但并未消除它。我们转而采用结构性路线。每个任务都有自己的全新每任务LoRA适配器;这些每任务适配器在推理时组合,从不原地覆盖。它们共享一个CRMA骨干网络,其内部混合矩阵在每次前向传播中都是双随机的,因此根据Birkhoff定理,其谱范数由构造保证不超过1——这是一个定理,而非损失项。结果是一个模块化架构,其中添加新任务是在稳定底层上的加法操作,而非对移动目标的破坏性覆盖。 ##### CRMA是什么。我们引入CRMA(Constrained Residual Mixing Adapter),一种残差适配器,其内部混合矩阵M在每次前向传播中都是双随机的。双随机矩阵的谱范数受限于1(Birkhoff),因此‖M‖₂ ≤ 1由构造保证,而非通过惩罚、裁剪或调参。该约束通过在前向传播中应用Sinkhorn归一化[14 (https://arxiv.org/html/2606.00382#bib.bib14)]获得,并且不能由梯度幅度、学习率或领域偏移覆盖。适配器以接近恒等式的配置初始化,因此在步骤0时它几乎不改变预训练模型,并在训练过程中在谱约束内逐步增加其贡献。CRMA与每任务LoRA适配器配对,这些适配器孤立地学习每个新领域,而谱约束的CRMA骨干网络提供了一个稳定的共享底层,每任务适配器可以无干扰地与之组合。 ##### CRMA的具体贡献是什么。模块化每任务适配器已经可以防止灾难性遗忘;这是现有技术(LoRAHub[32 (https://arxiv.org/html/2606.00382#bib.bib32)]、X-LoRA[38 (https://arxiv.org/html/2606.00382#bib.bib38)]、LoRAMoE[39 (https://arxiv.org/html/2606.00382#bib.bib39)]、AdapterFusion[37 (https://arxiv.org/html/2606.00382#bib.bib37)]、PackNet[27 (https://arxiv.org/html/2606.00382#bib.bib27)]、Progressive Networks[26 (https://arxiv.org/html/2606.00382#bib.bib26)])。CRMA的贡献不在于遗忘预防,而在于结构性保证,使得共享骨干网络能够跨任务持续训练,而*不破坏*在其上拟合的每任务适配器。冻结底层模块化方法以遗忘预防为代价,在任务1后停止底层学习;CRMA的谱约束使得持续训练的底层变得安全,消除了这一代价。这一区别在第7节 (https://arxiv.org/html/2606.00382#S7)(“为什么不直接用冻结底层模块化LoRA?”)中详细阐述,并在第6.1.3节 (https://arxiv.org/html/2606.00382#S6.SS1.SSS3)中量化:在Mistral-7B 5领域顺序数据上的FROZEN与MODULAR比较显示,MODULAR在3个种子上比FROZEN实现了1.99%±0.54更低的保持损失,每个种子均为正。 ##### 本文证明的内容。四个互补的证据表明,模块化CRMA架构在我们测试的模型和协议上将大语言模型持续微调中的灾难性遗忘降低到测量噪声水平以内: - •多种子持续学习消融实验。在Mistral-7B上跨5个顺序领域,基于CRMA骨干网络的模块化LoRA在先前任务保持损失上实现了损失相对漂移−0.17%±0.17(n=3个种子,样本标准差),而NAIVE遗忘为+42.96%±5.5(n=3个种子,样本标准差);每个种子的范围均不重叠。 - •推理时消融实验。相同的Gemma-2-9B模型权重和相同的100个保留问题,仅切换CRMA注入,使用CRMA得分为98/100,不使用为38/100——直接证据表明CRMA是顺序训练知识的访问机制。 - •谱范数结构不变量。在Gemma-2-9B上跨5个顺序领域记录867个训练步骤,验证了每一步在float32精度内‖M‖₂ = 1.0(最大偏差<1.2×10⁻⁷)。双随机约束在数值精度(float32)内精确成立;残差处于Sinkhorn迭代的底限,而非零。 - •规模与架构不变性。该架构在5个模型和4个架构家族(LLaMA、Phi、Mistral、Gemma)上,参数从1.1B到9.2B,无需模型特定调参即可运行。 ##### 已知局限:全局基准漂移。虽然CRMA将训练领域上的灾难性遗忘降低到测量噪声水平,但我们观察到某些全局基准上的非平凡退化(Gemma-2-9B:MMLU -6.5个百分点,GSM8K -10.2个百分点;HellaSwag/ARC-C/TruthfulQA/WinoGrande保持在1.7–3.7个百分点范围内)。我们将其视为已知局限,而非已解决问题;机制隔离(相同协议下仅LoRA与LoRA+CRMA的比较)被识别为最高优先级的后续工作,见第8.3节 (https://arxiv.org/html/2606.00382#S8.SS3)。 ##### CRMA的应用方式。第6.1节 (https://arxiv.org/html/2606.00382#S6.SS1)详细报告了持续学习结果——跨5个模型的多模型问答、Gemma-2-9B上的标准基准保持、带3种子鲁棒性检查的控制训练消融实验(v2–v8.1),以及推理时消融实验。第6.2节 (https://arxiv.org/html/2606.00382#S6.SS2)报告了由一位未参与原始算法开发的共同作者主导的、基于污染控制虚构数据的复制实验,以及7B规模的跨领域迁移探针研究(§6.3 (https://arxiv.org/html/2606.00382#S6.SS3))。关于子空间重叠作为路由信号的补充团队内研究见附录A (https://arxiv.org/html/2606.00382#A1)。 ##### 贡献。 1. 1.一种结构非扩张残差适配器。命题1 (https://arxiv.org/html/2606.00382#Thmproposition1)通过混合矩阵的双随机参数化,由构造保证‖M‖₂ ≤ 1。该约束在float32精度内精确成立:在Gemma-2-9B上跨5个顺序领域记录的867个训练步骤验证了每一步‖M‖₂ = 1.0,最大偏差1.2×10⁻⁷,无需裁剪或重新归一化。 2. 2.用于模块化每任务适配器的持续训练共享底层。早期模块化适配器方法(LoRAHub、AdapterFusion、PackNet、Progressive Networks)在任务1后冻结共享底层以防止干扰。CRMA的结构谱约束使得底层能够跨任务持续训练,而不会覆盖早期的每任务适配器;在Mistral-7B上3个种子下,这比匹配的冻结底层基线带来了1.99%±0.54的保持损失优势,每个种子均为正。 3. 3.跨四个架构家族的经验验证。相同的架构无需修改即可应用于TinyLlama-1.1B(LLaMA)、Phi-4-mini、Mistral-7B、Saul-7B和Gemma-2-9B(1.1B–9.2B参数)。Mistral-7B上的3种子主要证据;Gemma-2-9B上的佐证单种子证据(标准基准+推理时消融实验)以及由未开发该算法的共同作者在污染控制合成领域上进行的黑盒复制。 4. 4.7B规模下无需回放的正向后向迁移。在Mistral-7B 4领域控制消融实验(表6 (https://arxiv.org/html/2606.00382#S6.T6)、7 (https://arxiv.org/html/2606.00382#S6.T7))和TinyLlama 3领域污染控制复制实验(表9 (https://arxiv.org/html/2606.00382#S6.T9))中,先前任务性能与其更新前水平在统计上无显著差异,且所有三个设置(Mistral-7B 5领域、TinyLlama 3领域、Mistral-7B跨领域探针)的方向性偏移一致为非负——无需回放缓冲区、无需增加每任务内存、无需蒸馏。3种子的Mistral-7B结果(−0.17%±0.17)处于测量噪声水平;TinyLlama和跨领域结果为单种子。我们将其视为正向后向迁移,但明确说明3种子结果处于噪声底限,单种子结果需要重复验证。据我们所知,在7B大语言模型规模下,针对真实世界顺序领域,在这种特定配置(模块化每任务LoRA + 谱约束骨干网络,无回放,无增加内存)下,尚无可比的方向性正BWT结果,尽管与基于回放和蒸馏的持续学习方法的全面正面比较留作未来工作。 ##### 声明总结。对于时间有限的评审者和读者,我们总结声明的四个范围。*已证明:*混合矩阵M是非扩张的,‖M‖₂ ≤ 1,通过Birkhoff定理应用于Sinkhorn投影的双随机参数化(命题1 (https://arxiv.org/html/2606.00382#Thmproposition1))。*架构保证:*每任务LoRA适配器不能相互覆盖(模块化设计),持续训练的骨干网络用有界操作组合M,其谱范数经验验证维持在1.0(§5.2 (https://arxiv.org/html/2606.00382#S5.SS2))。*经验建立:* (i) 在Mistral-7B上n=3个种子时,先前任务的损失相对漂移处于测量噪声水平(§6.1.3 (https://arxiv.org/html/2606.00382#S6.SS1.SSS3));(ii) 7B规模下比匹配的冻结底层模块化基线有1.99%±0.54的保持损失优势;(iii) 跨架构和污染控制合成领域复制;(iv) Gemma-2-9B上的推理时CRMA切换消融实验(98/100 vs 38/100)。*未声明:*所有类别的全局基准保持(见上文“已知局限”)、全流水线Lipschitz边界的形式化证明、在相同基准上优于所有已发布持续学习方法(与O-LoRA、InfLoRA等的正面比较留作未来工作)、或仅基于本文的完全可复现实现(专利保留条款扣留了足够多的实现细节,以至于经验包在没有配套报告披露的情况下无法由外部复现)。 ## 2 定位:为什么不用冻结底层模块化LoRA? 冻结底层上的每任务适配器方法(LoRAHub[32 (https://arxiv.org/html/2606.00382#bib.bib32)]、X-LoRA[38 (https://arxiv.org/html/2606.00382#bib.bib38)]、LoRAMoE[39 (https://arxiv.org/html/2606.00382#bib.bib39)]、AdapterFusion[37 (https://arxiv.org/html/2606.00382#bib.bib37)]、PackNet[27 (https://arxiv.org/html/2606.00382#bib.bib27)]、Progressive Networks[26 (https://arxiv.org/html/2606.00382#bib.bib26)])已经在结构上防止了灾难性遗忘:每个任务都有自己的适配器,共享底层被冻结,因此每任务适配器不能相互覆盖。一个自然的问题是,CRMA的谱约束骨干网络在这些方法已经提供的功能之外还能增加什么。CRMA的具体贡献并非遗忘预防——模块化每任务适配器已经提供了这一点。其贡献在于结构性保证。
相似文章
ReCoLoRA:面向连续大语言模型微调的频谱感知递归整合方法
ReCoLoRA 是一个频谱感知框架,用于大型语言模型的连续微调。它通过递归整合低秩适配器来防止灾难性遗忘,在多个骨干网络的连续 GLUE 任务上取得了更优的性能。
使用ART微调多模态大语言模型:基于艺术强化训练
ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。
联邦MLLM微调中基于弹性正则化与合成回放的持续学习
提出FedCMM,一个面向多模态大模型的联邦持续学习框架,利用模态感知的弹性权重巩固、本地生成式回放以及任务相似性感知的梯度聚合来缓解灾难性遗忘。
基于边际自校正的大规模快速遗忘
介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。
自蒸馏作为大语言模型的性能恢复机制:对抗压缩和灾难性遗忘
本文介绍了自蒸馏微调(SDFT)作为大语言模型性能恢复机制,用于解决灾难性遗忘、量化和剪枝导致的性能下降问题。作者利用中心核对齐(CKA)提供了理论证明,表明自蒸馏能够使学生模型的高维流形与教师模型的最优结构对齐,从而有效恢复丧失的能力。