光谱裁剪能否在低秩自适应中实现更好的学习同时减少遗忘?
摘要
本文研究了LoRA中的奇异分量,并提出SCLoRA,一种使用光谱裁剪来提高任务自适应能力同时减少预训练知识灾难性遗忘的方法。
arXiv:2608.12332v1 公告类型:新
摘要:近年来,低秩自适应(LoRA)已成为一种重要范式,它冻结预训练权重并引入小型可学习适配器,而不是微调全部参数。在这项工作中,我们基于奇异值分解(SVD)揭示了关于网络参数奇异分量的几个关键见解。首先,预训练网络参数中具有较大奇异值的主要奇异分量可以在微调过程中被有效复用,而具有较小奇异值的次要分量更具任务特异性,需要大量自适应调整。其次,我们首次建立了理论联系,即LoRA适配器中奇异值的不受控增长会导致预训练知识的遗忘——这一众所周知的问题被称为灾难性遗忘。基于这些观察,我们提出了SCLoRA,它以一种感知预训练模型谱分布的方式,将参数化的奇异分量与光谱裁剪注入预训练模型。SCLoRA通过专注于更新需要自适应的分量来有效适应新任务,同时缓解灾难性遗忘。我们进行了大量实验,证明SCLoRA不仅提升了下游性能,还能有效保留预训练知识。
查看缓存全文
缓存时间: 2026/08/14 09:24
# 谱裁剪能否让低秩适配在遗忘更少的同时实现更好的学习? 来源:https://arxiv.org/abs/2608.12332 查看 PDF (https://arxiv.org/pdf/2608.12332) > 摘要:近年来,低秩适配(LoRA)已成为一种重要范式,它冻结预训练权重,并引入小型可学习适配器,而不是微调全部参数。在这项工作中,我们基于奇异值分解(SVD)揭示了网络参数奇异分量的几个关键见解。首先,预训练网络参数中具有较大奇异值的主奇异分量可以在微调中被有效复用,而具有较小奇异值的次要分量更具任务特异性,需要大幅调整。其次,我们首次建立了理论联系:LoRA适配器中奇异值的无节制增长会导致预训练知识遗忘——即众所周知的灾难性遗忘问题。基于这些观察,我们提出了SCLoRA,它以感知预训练模型谱分布的方式,将参数化的奇异分量与谱裁剪注入预训练模型。SCLoRA通过聚焦于需要调整的分量进行更新,有效适应新任务,同时缓解灾难性遗忘。我们进行了大量实验,证明SCLoRA不仅提升了下游性能,还有效保留了预训练知识。 ## 提交历史 来自:Hyowon Wi [查看电子邮件](https://arxiv.org/show-email/e9e722fd/2608.12332) **\[v1\]** 2026年6月2日星期二 12:49:42 UTC (941 KB)
相似文章
超越LoRA:稀疏诱导的适配是否更好?
本文提出了对LoRA的稀疏诱导适配方法,包括廉价LoRA(cLA)和链式循环变体(c³LA),并提供了理论泛化界以及实证评估,结果显示在保持竞争性性能的同时,训练时间最多减少10%,峰值GPU内存节省最多15%。
SOS-LoRA: 静态正交子空间低秩适应结合固定多尺度缩放
SOS-LoRA 通过将秩预算分解为具有固定多尺度缩放的静态正交低秩专家来扩展 LoRA,在不增加推理成本的情况下提升了在推理、NLU 和数学基准上的微调性能。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
CERSA:一种用于内存高效微调的累积能量保留子空间自适应方法
本文介绍了 CERSA,这是一种新颖的参数高效微调方法,它利用奇异值分解来保留主成分,在显著降低内存使用的同时,其表现优于 LoRA 等现有方法。
BaLoRA:大规模模型的贝叶斯低秩适应
BaLoRA 引入了低秩适应(LoRA)的贝叶斯扩展,通过缩小与全量微调之间的差距,提供校准良好的不确定性估计并提高预测准确性。