基于广义瑞利商优化的基础保留适应
摘要
提出FoLoRA,一种遗忘感知优化框架,用于微调基础模型,通过广义瑞利商优化平衡任务效用和遗忘惩罚,更好地保留非目标能力。
arXiv:2606.00132v1 公告类型:新
摘要:虽然微调能有效地将基础模型适配到专门的下游任务,但也会损害预训练期间获得的非目标能力。现有的遗忘感知方法通常通过专门的初始化或固定约束来寻求更安全的更新,但未能在训练过程中调节适应与保留之间的权衡。我们提出了基础保留LoRA(FoLoRA),一种遗忘感知优化框架。在一阶保持条件的指导下,FoLoRA对预训练代理激活定义遗忘惩罚,对下游任务激活定义任务效用。然后,它通过广义瑞利商根据单位遗忘惩罚的任务效用来对更新方向进行评分。由此产生的谱坐标系实现了方向级门控Adam更新,在训练过程中减弱低效用-惩罚比的方向。为了估计遗忘惩罚,FoLoRA通过从预训练模型中采样来构建预训练代理校准数据,而不是依赖单一代理数据集。在数学、代码和指令跟随适应上的实验表明,FoLoRA在基线上实现了最强的保留适应平衡,提高了目标任务性能,同时最好地聚合保留了非目标能力。
查看缓存全文
缓存时间: 2026/06/02 15:39
# 通过广义瑞利商优化的基础保持适配方法 来源:https://arxiv.org/abs/2606.00132 查看 PDF (https://arxiv.org/pdf/2606.00132) > 摘要:虽然微调能有效将基础模型适配到特定的下游任务,但它可能会削弱预训练阶段获得的非目标能力。现有的遗忘感知方法通常通过专用初始化或固定约束寻求更安全的更新,但并未在训练过程中调节适配与保持的权衡。我们提出FoLoRA(Foundation Preserving LoRA,基础保持型LoRA),一个遗忘感知的优化框架。在一阶保持条件的指导下,FoLoRA在预训练代理激活上定义遗忘惩罚,在下游任务激活上定义任务效用。然后通过广义瑞利商,以每单位遗忘惩罚的任务效用对更新方向进行评分。由此产生的谱坐标系支持方向感知的Adam更新,能够在训练过程中衰减低效用-惩罚比的方向。为估计遗忘惩罚,FoLoRA通过从预训练模型中采样来构建预训练代理校准数据,而非依赖单一代理数据集。在数学、代码和指令跟随适配任务上的实验表明,FoLoRA在保持与适配的平衡上优于基线方法,在提升目标任务性能的同时,实现了对非目标能力的最佳聚合保持。 ## 提交历史 来自:Dongjun Kim [查看邮件 (https://arxiv.org/show-email/3a8d65cc/2606.00132)] **\[v1\]** 2026年5月28日 星期四 21:22:31 UTC (1,246 KB)
相似文章
超越 LoRA 与全参数微调:基于梯度引导优化器路由的大语言模型适配
本文提出了一种混合 LoRA 与全参数微调(MoLF)框架,利用梯度引导的优化器路由在 LoRA 和全参数微调之间进行自适应切换。旨在通过结合全参数微调的可塑性与 LoRA 的正则化特性,克服仅依赖静态适配方法的结构局限性。
FoRA: Fisher正交秩适应实现参数高效微调
FoRA提出了一种参数高效微调方法,通过Fisher评分选择任务相关层,并在Stiefel流形上训练LoRA下投影,在保持精度的同时减少参数。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
RAFT:缓解遗忘的领域微调中的数据优化与自适应蒸馏
RAFT是一个两阶段框架,用于LLM的领域特定微调。它通过优化监督数据和使用带有自适应损失平衡的在线策略蒸馏来解决灾难性遗忘问题,在提升领域精度的同时恢复通用能力,取得了显著改进。
LoRA如何记忆?面向LLM微调的参数化记忆定律
本文使用LoRA作为探针,研究了大语言模型中参数化记忆的定量极限,建立了幂律关系,并引入了一种名为MemFT的阈值引导优化方法,以提升记忆性能。