CT-Merging: 共识方向与任务级缩放用于LoRA适配器合并
摘要
CT-Merging 提出了一种通过从任务子空间投影器估计共识方向并分配任务级RMS系数缩放来合并LoRA适配器的方法,在DC-Merge CLIP适配器基准上取得了优越的性能。
查看缓存全文
缓存时间: 2026/07/24 05:12
# CT-Merging:LoRA适配器合并中的共识方向与任务级别缩放
来源:https://arxiv.org/html/2607.20561
Keumseo RyumJoonhyuk Kang KAIST 大田广域市,韩国 keumseo@kaist\.ac\.kr jkang@kaist\.ac\.kr
###### 摘要
LoRA适配器提供了一种高效的方式,将预训练模型特化为多个下游任务,但每个任务部署一个适配器需要在推理时进行适配器存储和任务选择。模型合并通过将独立训练的适配器组合成一个多任务适配器来解决这一问题。近年来基于SVD的LoRA合并方法主要关注构建共享或特定于任务的方向,而分配给最终方向的系数通常直接来自原始任务的SVD。在固定的合并基底下,继承的系数保留了组件的顺序,具有较高的秩相关性,但其幅度与任务更新所诱导的系数存在显著差异。为了解决这种不匹配,我们提出了CT-Merging,一种感知LoRA的合并算法,该算法从平均任务子空间投影器中估计共识方向,并在最终更新中分配任务级RMS系数尺度。CT-Merging利用任务SVD子空间中的重复支持来构建公共基,同时在方向构建后减少对按秩SVD幅度的依赖。在DC-Merge CLIP适配器基准上,CT-Merging在平均归一化精度上优于最先进的合并方法,并且在ViT-B/32和ViT-L/14的KnOTS训练检查点上,相比DC-Merge分别提升了2.56和1.51个百分点。
## 1 引言
大型预训练视觉和视觉语言模型越来越多地通过参数高效微调来特化到下游任务,因为完全微调在内存和存储上代价高昂\[9 (https://arxiv.org/html/2607.20561#bib.bib20)\]。低秩适应(LoRA)\[10 (https://arxiv.org/html/2607.20561#bib.bib8)\]已经成为存储这种特化的标准方法。LoRA将预训练模型的权重更新表示为两个低秩矩阵的乘积,允许单个预训练模型与许多轻量级任务适配器配对。随着这些适配器在数据集、领域和用户需求中的积累,一个实际问题出现了:适配器应该被组合成一个可部署的适配器,该适配器可以服务于多个任务,而无需联合训练、无需重新访问原始训练数据,也不必为每个任务保留单独的适配器。
模型合并通过将独立训练的模型或任务更新组合成一组权重来解决这个问题\[30 (https://arxiv.org/html/2607.20561#bib.bib11),12 (https://arxiv.org/html/2607.20561#bib.bib3),34 (https://arxiv.org/html/2607.20561#bib.bib24)\]。合并对于LoRA适配器是有益的,因为它可以在训练后组合任务特化,仅使用释放的适配器权重\[11 (https://arxiv.org/html/2607.20561#bib.bib21),25 (https://arxiv.org/html/2607.20561#bib.bib28)\]。早期的方法直接在参数空间中操作,通过直接平均微调后的检查点\[30 (https://arxiv.org/html/2607.20561#bib.bib11)\],或组合通过减去预训练权重获得的任务向量\[12 (https://arxiv.org/html/2607.20561#bib.bib3),23 (https://arxiv.org/html/2607.20561#bib.bib26)\]。由于直接求和可能导致干扰,后来的方法通过符号解析、修剪、随机丢弃、掩码、局部化或学习合并权重来减少坐标级别的冲突\[33 (https://arxiv.org/html/2607.20561#bib.bib9),36 (https://arxiv.org/html/2607.20561#bib.bib10),29 (https://arxiv.org/html/2607.20561#bib.bib27),35 (https://arxiv.org/html/2607.20561#bib.bib23)\]。这些方法广泛适用,但它们将每个参数坐标视为基本的合并单元,因此没有直接利用LoRA更新所暴露的低秩结构。
最近的一系列工作专门将合并特化为LoRA模块,通过将每个任务更新分解为奇异向量,然后从这些组件重新组合一个合并更新。最近的方法构建公共或特定于任务的子空间,跨任务对齐奇异方向,过滤冲突组件,或重塑合并后的谱\[28 (https://arxiv.org/html/2607.20561#bib.bib5),5 (https://arxiv.org/html/2607.20561#bib.bib16),19 (https://arxiv.org/html/2607.20561#bib.bib1),37 (https://arxiv.org/html/2607.20561#bib.bib12),17 (https://arxiv.org/html/2607.20561#bib.bib13)\]。然而,重新组合仍然取决于最终方向如何与系数配对。在公共和残差方向被投影和对齐后,一个常见的选择是将每个奇异值从原始任务SVD按组件复制。这些复制的幅度是在投影和对齐之前测量的,因此它们不需要为重新组合的方向保持校准。一个合并的适配器还必须避免严重的任务崩溃。在多任务部署中,高平均分数可能隐藏一个失败的任务,特别是当一个适配器期望为所有任务服务而不需要每输入路由时。
基于这一分析,我们提出了CT-Merging,一种无数据的LoRA适配器合并方法,通过共识方向和任务级系数分配。CT-Merging首先从任务SVD子空间的平均投影器中估计一个公共基。投影器形式避免了单个奇异向量的符号歧义,并选择那些在任务适配器之间获得重复支持的方向。CT-Merging然后通过从每个任务SVD方向中移除公共组件来构建任务残差方向。
系数规则使用残差能量从任务SVD系数中获取。来自同一任务的所有残差方向接收一个RMS尺度,因此分配给该任务的总系数能量得以保留,而按秩的奇异值幅度被丢弃。这种设计针对投影和对齐后观察到的系数不匹配,同时不会抹去任务尺度差异。在DC-Merge基准上,CT-Merging在大多数模型上取得了最佳结果,并且在KnOTS检查点上,CT-Merging在ViT-B/32和ViT-L/14上相比DC-Merge取得了更大的提升。我们的贡献如下:
- •LoRA合并中的系数转移分析:我们分析了当在孤立任务SVD基中测量的奇异值在投影和基构建后被重用时会发生什么。分析表明,秩顺序可以保持稳定,而系数幅度在最终基中会发生显著变化。
- •具有任务级缩放的共识方向:我们提出了CT-Merging,它从平均投影器中构建共识方向,从任务残差方向中移除公共组件,并从任务级RMS能量分配系数。该规则为每个任务保留单独的残差能量预算,而不直接复制按秩的奇异值幅度。
- •在发布的CLIP LoRA基准上的实证验证:我们在DC-Merge和KnOTS风格的CLIP适配器检查点上评估了CT-Merging。CT-Merging在DC-Merge基准的九个设置中的八个上取得了最佳结果,并在KnOTS风格的检查点上取得了更大的提升。我们提供了超参数贡献和共识来源的消融实验。
参见图注图1:CT-Merging概述。CT-Merging从任务SVD子空间中估计共识方向,将任务残差方向投影出共识子空间,并使用任务级RMS系数重新组合合并的适配器。系数规则保留了任务能量,同时消除了对齐后不可靠的逐组件幅度。
## 2 相关工作
##### 模型合并
模型合并将独立微调的模型或任务更新组合成一个单一模型,无需联合训练。早期的方法直接在权重空间中操作。模型汤平均微调后的权重\[30 (https://arxiv.org/html/2607.20561#bib.bib11)\],任务算术组合通过减去预训练权重获得的任务向量\[12 (https://arxiv.org/html/2607.20561#bib.bib3)\]。由于直接求和可能引入干扰,后来的方法通过符号解析、剪枝、随机丢弃、掩码或学习合并权重来减少坐标级别的冲突\[33 (https://arxiv.org/html/2607.20561#bib.bib9),36 (https://arxiv.org/html/2607.20561#bib.bib10),29 (https://arxiv.org/html/2607.20561#bib.bib27),35 (https://arxiv.org/html/2607.20561#bib.bib23)\]。数据依赖的方法,如Fisher合并和RegMean,使用曲率或特征统计来指导合并\[20 (https://arxiv.org/html/2607.20561#bib.bib6),13 (https://arxiv.org/html/2607.20561#bib.bib18)\]。CT-Merging遵循无数据设置,并专注于LoRA任务更新暴露的低秩结构。
##### LoRA感知合并
基于SVD的合并方法通过SVD分解任务更新,构建共享或特定于任务的方向,并从奇异方向和系数重新组合一个合并更新。Task Singular Vectors正交化特定于任务的奇异方向以减少干扰\[5 (https://arxiv.org/html/2607.20561#bib.bib16)\]。KnOTS执行堆叠任务更新的联合SVD,并在旋转的基中合并\[28 (https://arxiv.org/html/2607.20561#bib.bib5)\]。Iso-CTs结合公共和特定于任务的子空间,并对结果谱应用各向同性缩放\[19 (https://arxiv.org/html/2607.20561#bib.bib1)\]。DC-Merge平滑主导的奇异值,并在共享的正交子空间中对齐任务更新\[37 (https://arxiv.org/html/2607.20561#bib.bib12)\]。AdaRank适应每个任务更新的有效秩\[17 (https://arxiv.org/html/2607.20561#bib.bib13)\]。SVC研究已经合并的更新中的谱过计数,并校准膨胀的奇异值,同时保持合并的奇异方向固定\[18 (https://arxiv.org/html/2607.20561#bib.bib15)\]。这些工作表明,奇异值分配在合并中很重要。CT-Merging专注于基于SVD的方向构建后的系数分配。
## 3 关于重新组合系数的观察
基于SVD的LoRA合并方法将每个任务更新分解为奇异组件,然后在新的基中重新组合一个合并更新。在这个过程中,来自孤立任务SVD的奇异值通常被重用作为重新组合方向的系数。这些值是在投影和重新组合之前测量的,因此它们的幅度不需要在最终基中保持校准。我们在一个固定的重新组合基上检查这种转移,将系数分配的影响与方向选择分开。
对于每个任务\(t\)和LoRA模块\(\ell\),设\(C_{t,\ell}\)为通过将任务更新\(\Delta_{t,\ell}\)在重新组合基中表达而获得的系数矩阵,
\[
C_{t,\ell}=\widetilde{U}_{\ell}^{\top}\Delta_{t,\ell}\widetilde{V}_{\ell},\qquad d_{t,\ell}=\operatorname{diag}(C_{t,\ell}).
\]
这里,\(d_{t,\ell,j}\)是任务更新在第\(j\)个最终方向上诱导的系数,而\(s_{t,\ell,j}\)是从孤立任务SVD继承的系数。跨层任务对,\(s_{t,\ell}\)和\(d_{t,\ell}\)保持了很强的秩相关性。在CLIP ViT B/32上,中位数Spearman相关系数为0.9956,在CLIP ViT L上为0.9912,且对角项中没有符号翻转。因此,当任务更新在重新组合基中表达时,组件顺序在很大程度上保持稳定。
然而,系数幅度发生了显著变化。在层任务级别上,中位数向量相对距离\(\lVert d_{t,\ell}-s_{t,\ell}\rVert_{2}/\lVert s_{t,\ell}\rVert_{2}\)在ViT B/32上为0.35,在ViT L上为0.39。在组件级别上,中位数相对系数误差在两个主干上约为0.20,其中
\[
e_{t,\ell,j}=\frac{|d_{t,\ell,j}-s_{t,\ell,j}|}{|s_{t,\ell,j}|+\epsilon}.
\]
参见图注图2:CLIP LoRA适配器上按秩的系数误差。对于每个残差秩\(j\),曲线显示\(e_{t,\ell,j}\)在八个任务和所有LoRA模块上的中位数,阴影区域显示四分位距。主导的残差秩在两个主干上显示出最大的系数误差。参见图注图3:任务SVD能量在CLIP ViT B/32 LoRA适配器上差异很大。值通过平均任务能量进行归一化。图2绘制了\(\operatorname{median}_{t,\ell}e_{t,\ell,j}\)对于每个残差秩\(j\),显示任务和模块上的四分位距。主导的残差秩具有最大的误差,并且这种不匹配在保留的秩范围内仍然可见。这些测量表明,继承的系数保留了一个有用的排序信号,但它们的幅度没有直接为重新组合的基校准。
同样的诊断也显示了为什么所有任务不应该被折叠到一个共享的残差尺度上。对于任务\(t\),我们计算跨模块的平均原始SVD能量:
\[
E_{t}^{\mathrm{raw}}=\frac{1}{L}\sum_{\ell=1}^{L}\sum_{j}s_{t,\ell,j}^{2},\qquad\bar{E}^{\mathrm{raw}}=\frac{1}{T}\sum_{t}E_{t}^{\mathrm{raw}}.
\]
图3显示了在CLIP ViT B/32上的\(E_{t}^{\mathrm{raw}}/\bar{E}^{\mathrm{raw}}\)。跨任务的相对任务能量范围从0.10到2.47。为所有残差方向分配相同的RMS幅度将抹去这些跨任务的差异。因此,CT-Merging使用一个每任务RMS规则作为简单的默认设置。该规则避免了直接复制孤立SVD基中的按秩幅度,同时为每个任务保留了一个单独的残差能量预算。
## 4 方法
CT-Merging在基于SVD的LoRA合并中,将方向构建与系数分配分开。方向步骤从独立训练的适配器中构建一个公共子空间和任务残差方向。系数步骤然后向构建的方向分配任务级RMS尺度。这种分离遵循了第3节中的观察,即在孤立任务SVD基中测量的奇异值在重新组合后不一定提供校准的幅度。
**算法1** CT-Merging
1: LoRA更新 \(\{\Delta_t = B_t A_t\}_{t=1}^T\),公共秩 \(k\),残差秩 \(r_{\mathrm{res}}\),合并尺度 \(\gamma\)
2: \(\triangleright\) 任务SVD
3: **for** \(t = 1,\ldots,T\) **do**
4: 计算 \(\Delta_t \approx U_t S_t V_t^{\top}\)
5: 保留前 \(r_{\mathrm{res}}\) 个方向和系数 \((U_t, V_t, s_t)\)
6: **end for**
7: \(\triangleright\) 共识方向
8: \(P_U \leftarrow T^{-1}\sum_{t=1}^T U_t U_t^{\top}\)
9: \(U_c \leftarrow \operatorname{TopEig}_k(P_U)\)
10: \(R_U \leftarrow T^{-1}\sum_{t=1}^T U_c^{\top} \Delta_t\)
11: 计算 \(R_U = P \Sigma_c V_m^{\top}\)
12: \(U_{\mathrm{com}} \leftarrow U_c P\),\(V_{\mathrm{com}} \leftarrow V_m\),\(s_c \leftarrow \operatorname{diag}(\Sigma_c)\)
13: \(\triangleright\) 残差方向
14: **for** \(t = 1,\ldots,T\) **do**
15: \(U_t^{\perp} \leftarrow (I - U_c U_c^{\top}) U_t\)
16: \(V_t^{\mathrm{res}} \leftarrow V_t\)
17: **end for**
18: \(U_{\mathrm{rec}} \leftarrow [U_{\mathrm{com}} \mid U_1^{\perp} \mid \cdots \mid U_T^{\perp}]\)相似文章
B空间拥挤:为LoRA融合校准共享方向
# 论文页 - B空间拥挤:为LoRA融合校准共享方向 来源:[https://huggingface.co/papers/2604.16826](https://huggingface.co/papers/2604.16826) 发布于4月18日 · 由[https://huggingface.co/yixuantt](https://huggingface.co/yixuantt)提交 [](https://huggingface.co/yixuantt) [yixuan](https://huggingface.co/yixuantt) 于4月21日上传 ## 摘要 通过校准共享方向,可提升LoRA适配器融合性能。
PermDoRA——理解语言模型中的适配器干扰:参数空间几何的局限性
本文介绍了DoRA-RBAC,一个用于组合LLM适配器的框架,并测试了几何感知合并是否能提升多域性能。结果显示,与标准平均方法相比,没有一致的改进,表明适配器干扰并非主要由参数空间几何驱动。
ReCoLoRA:面向连续大语言模型微调的频谱感知递归整合方法
ReCoLoRA 是一个频谱感知框架,用于大型语言模型的连续微调。它通过递归整合低秩适配器来防止灾难性遗忘,在多个骨干网络的连续 GLUE 任务上取得了更优的性能。
基于输出空间投影的模型合并
本文提出了一种新的模型合并框架,将问题转化为关于残差更新的凸二次规划,以最小化平方输出的校准目标。该框架涵盖现有的启发式方法,并提供了一种闭式诊断指标来预测合并质量,在语言和视觉基准测试中持续取得改进。
CRMA: 一种用于LLM模块化持续微调的谱界主干
CRMA引入了一种谱界残差适配器,通过Sinkhorn归一化强制实现双随机混合矩阵,使LLM能够持续微调而不发生灾难性遗忘。在Mistral-7B和Gemma-2-9B上的实验结果表明,与冻结基底的基线相比,后向迁移得到改善,遗忘减少。