CORAM:用于模型合并的一致正交旋转
摘要
CORAM 提出了一种用于模型合并的一致正交旋转方法,该方法将权重矩阵分割为行切片,在基础模型的帧中使用奇异值分解(SVD),并在流形上合并更新,以提高现有技术的准确性。
arXiv:2608.17366v1 公告类型:新
摘要:合并微调模型可以组合专门化能力,无需联合训练或访问原始数据。大多数方法在欧几里得权重空间中使用线性算术操作,无法携带更新的几何结构。正交模型合并(OrthoMerge)对每个权重矩阵使用单个正交变换,但这种变换无法改变奇异值。我们提出CORAM,它将每个目标矩阵分割为行切片,在相应基础模型的SVD帧中通过奇异值分解表示每个专家切片,并在相应流形上合并任务特定因子。因为流形平均会收缩合并更新,CORAM应用一个放大系数$\lambda=\kappa\hat{c}$。尺度c_hat从专家和合并更新范数估计,对于更新幅度相当的N个专家,大约为$\sqrt{N}$。恢复强度kappa从专家更新的离散性中选择,无需评估候选合并模型。此规则在所有评估套件中与最佳扫描值相差不超过0.72分。CORAM还包括分散切片以将高度更新的行分布到各切片中,以及用于非目标层的残差路径。在涵盖三个模型家族、3B到9B规模以及语言和视觉语言专家的四个套件中,CORAM比OrthoMerge提高了0.25到1.35分,并匹配或超过最强的权重空间基线。
查看缓存全文
缓存时间: 2026/08/19 10:27
# CORAM:模型合并的相干正交旋转法
来源:https://arxiv.org/html/2608.17366
###### 摘要
合并微调模型无需联合训练或访问原始数据,即可组合专门能力。多数方法在欧几里得权重空间通过线性算术操作,无法承载更新的几何结构。正交模型合并对每个权重矩阵使用单一正交变换,但此类变换无法改变奇异值。我们提出CORAM方法,将每个目标矩阵划分为行切片,通过基础模型SVD框架的奇异值分解表示每个专家切片,并在其对应流形上合并任务特定因子。由于流形平均会压缩合并更新,CORAM应用放大系数λ=κc^。尺度c^由专家更新范数和合并更新范数估算,对于具有相似更新幅度的N个专家,该值约为√N。恢复强度κ通过专家更新的离散度选择,无需评估候选合并模型。该规则在所有评估套件中与最优扫描值的差距不超过0.72分。CORAM还包含分散切片法,用于将高度更新的行分布到不同切片,并为非目标层设置残差路径。在涵盖三个模型家族、30亿至90亿参数规模、语言及视觉语言专家的四个套件中,CORAM相比正交模型合并提升0.25至1.35分,并达到或超越最强权重空间基线。
## 引言
模型合并提供了一种无需训练的机制,可将独立微调的能力(如编码、数学推理和多语言理解)整合到单一模型中,无需联合训练或访问原始训练数据。现有方法大多将每个微调模型表示为欧几里得权重空间中的任务向量,并通过线性算术组合这些向量。尽管简单有效,但此公式忽略了权重更新的几何结构。特别是,微调权重矩阵会改变其奇异子空间和奇异值谱,这些变化无法通过直接的欧几里得加法自然表示。
近期研究通过结构化几何空间上的模型合并来解决此局限。例如,正交模型合并使用正交变换对齐微调权重。然而,它为整个权重矩阵估计单一变换。矩阵级粒度可能具有限制性,因为微调更新通常集中在低维和异构子空间中。因此,单一矩阵级变换可能将强更新方向与基本不变的方向混合。
 **图1**:CORAM概览。每个专家切片在基础框架中被分解为旋转、频谱偏移dS_i=S_iS_0^{-1}-I和右因子。每个因子在其自身空间中求平均。系数λ由公式(3)给出。
更精细的表示由CORA提供,它使用行级权重切片参数化模型适配。然而,CORA处理的是单个模型的适配,而非合并多个独立微调模型。将此表示扩展到模型合并会带来两个额外问题。首先,每个切片的任务特定因子位于不同的弯曲空间,必须使用几何兼容操作进行组合。其次,在这些空间上的平均可能显著减小所得更新的幅度。
我们提出CORAM,一种用于模型合并的切片级流形方法,如图1所示。CORAM将每个目标权重矩阵划分为行切片,并通过相对于基础模型切片的SVD表示每个专家切片。它在其自然空间中合并三个因子:旋转通过对特殊正交群的对数欧几里得均值合并;相对频谱偏移通过线性平均合并;右因子通过Stiefel流形上的极化均值聚合。我们还引入了冲突感知变体,在聚合前掩盖每个切片中专家更新方向不一致的神经元列。这将正交模型合并的冲突处理机制适配到切片级。
核心挑战在于流形平均会将合并更新向基础模型收缩。若不修正,这种收缩可能去除大量任务特定信号。CORAM通过放大系数λ=κc^补偿收缩,其中c^估计收缩尺度,κ设置恢复强度。重要的是,这两项均无需评估候选合并模型。收缩尺度c^根据专家更新范数和合并更新范数计算,当N个专家贡献幅度相近的更新时,其近似值为√N(命题1)。
适当的恢复强度κ取决于专家修改基础模型的均匀程度。当专家更新幅度相近时,近乎完全的恢复是有效的。当幅度差异显著时(如我们研究中最强基础模型的情况),部分恢复效果更好。CORAM通过从专家更新计算的离散度统计量区分这两种情况,无需评估候选合并模型。所得到的规则无需扫描λ即可选择放大系数,并在所有评估套件中与最优扫描系数的差距不超过0.72分。
切片级公式激发了两项互补的改进。首先,*分散切片*根据更新幅度对行排序并分布到不同切片,减少高度更新行在少量切片中的集中。其次,*残差路径*恢复切片合并目标之外层的微调更新,将正交模型合并的残差解耦原则适配到层级残差。它们的有效性也取决于更新幅度的分布:当专家更新相对均匀时,分散切片本身就有益;而当更新强烈不均时,与残差路径结合效果最佳。
我们在四个异构模型合并套件中评估CORAM,涵盖三个模型家族、30亿至90亿参数规模、语言及视觉语言专家。主要贡献如下:
- •免扫描放大。我们提出规则λ=κc^,其中收缩尺度c^从专家和合并更新范数估算,恢复强度κ使用零评估离散度统计量选择。预测系数在每个评估套件中与扫描最优值的差距不超过0.72分。
- •切片级流形合并。我们使用特殊正交群、欧几里得频谱空间和Stiefel流形上的几何兼容操作合并切片级SVD因子。
- •几何驱动改进。我们引入分散切片,并展示其有效性如何随专家更新幅度的离散度变化。
- •异构设置评估。在四个涵盖三个模型家族、30亿至90亿参数规模、语言及视觉语言任务的套件中,CORAM在统一评估协议下相比正交模型合并提升0.25-1.35分,并达到或超越最强评估权重空间基线。
## 相关工作
#### 欧几里得权重空间合并。
大多数模型合并方法将每个微调专家表示为任务向量,并在欧几里得权重空间中组合向量。均匀平均、费舍尔或回归加权合并以及任务算术主要区别在于更新的加权方式。TIES、DARE和Localize-and-Stitch通过符号一致性、稀疏化或参数定位进一步减少干扰。这些方法简单且强大,但将权重矩阵视为平坦向量,未显式建模其旋转和频谱结构。
#### 几何与子空间合并。
为超越直接权重算术,现有方法对齐模型单元、在切线空间合并,或从任务更新的SVD构建子空间。与CORAM最接近的是正交模型合并,它对每个权重矩阵平均一个正交变换,并常规合并剩余残差。正交变换无法改变奇异值,因此更新的频谱部分仍留在残差中。CORA提供更精细的切片级SVD表示,但研究的是模型适配而非多专家合并。CORAM将此切片级表示用于模型合并,并在其空间中平均旋转、相对频谱偏移和右因子。其冲突感知变体和残差路径将正交模型合并的冲突处理和残差解耦适配到切片和非目标层。
#### 模型合并中的系数选择。
在这些结构化空间上合并引发进一步问题:如何设置合并更新的尺度。任务算术使用固定常数,基准协议为每个套件选择一个值。AdaMerging在测试时优化每层系数,而Model Stock为相同任务微调的模型推导几何规则。CORAM将系数与几何合并的收缩相关联。收缩尺度从专家和合并更新范数测量,恢复强度从专家更新幅度的离散度选择。此选择受到先前观察的启发:合并行为随基础模型变化,且避免了对λ的每基准扫描。
## 方法
### 基础框架中的切片表示
遵循CORA,我们将每个目标权重矩阵W∈R^{d_out×d_in}划分为G=d_out/h个高度为h的行切片W^{(g)}=W[gh:(g+1)h,:],并在基础框架中工作。每个基础切片分解为W_0^{(g)}=U_0S_0V_0^⊤。对于每个专家i∈{1,...,N}和每个切片,我们使用三个量表示专家权重相对于此框架:旋转Q_i∈SO(h)通过U_0^⊤U_i的极化因子获得,将专家左奇异基与U_0对齐;相对频谱偏移dS_i=S_iS_0^{-1}-I;以及右因子V_i。在形成Q_i前,我们联合基础对(U_0,V_0)解决每个奇异方向的符号歧义:每个(u,v)对一起翻转,保持W_i不变。三元组(Q_i, dS_i, V_i)位于结构化空间的乘积上:特殊正交群SO(h)、相对频谱偏移空间和Stiefel流形St(d_in,h),此结构决定了因子应如何平均。
### 逐切片流形合并
给定逐专家切片三元组,CORAM通过其空间的原生均值合并每个因子(图1,面板2):
*旋转。*我们通过对数欧几里得均值平均{Q_i}在SO(h)上,将每个旋转映射到李代数、平均后再映射回:
\[ \bar{Q} = \exp\!\Big(\frac{1}{N}\sum_i \log Q_i\Big). \]
因为so(h)是线性空间,指数内的操作是普通平均,非线性仅通过指数和对数映射引入。
*频谱偏移。*相对频谱偏移线性平均:
\[ \overline{dS} = \sum_i \frac{1}{N} dS_i. \]
*右因子。*我们通过Stiefel流形上的极化均值平均{V_i},形成加权欧几里得和并通过极化分解投影回流形:
\[ \bar{V} = \mathrm{polar}\!\big(\sum_i \frac{1}{N} V_i\big). \]
合并切片在基础框架中重构为:
\[ W_{\mathrm{merge},g} = \big(U_0\,\bar{Q}\big)\,S_0\,\big(I+\overline{dS}\big)\,\bar{V}^{\top} + \bar{\eta}^{(g)}, \]
其中\bar{\eta}^{(g)}是冲突残差,在下面冲突感知变体中定义,若未应用掩码则为零。堆叠合并切片得到矩阵的W_{\mathrm{merge}}。对所有目标矩阵应用相同过程产生模型的几何合并。
### 冲突感知变体
专家可能在单个神经元上严重分歧,在此分歧上平均会稀释每个专家的贡献。将正交模型合并的冲突处理思想适配到切片级,我们的冲突感知变体在每个切片和每列检测更新方向与共识相悖的专家:设τ_i=W_i^{(g)}-W_0^{(g)}相似文章
基于输出空间投影的模型合并
本文提出了一种新的模型合并框架,将问题转化为关于残差更新的凸二次规划,以最小化平方输出的校准目标。该框架涵盖现有的启发式方法,并提供了一种闭式诊断指标来预测合并质量,在语言和视觉基准测试中持续取得改进。
CABS+:通过冲突感知稀疏化与自适应权重分配实现高效可扩展的模型合并
本文提出了 CABS+,一种增强的模型合并方法,利用冲突感知稀疏化和自适应权重分配来提高多任务模型合并的效率和性能,在 27 个数据集上相较于先前方法取得了显著提升。
COEC: 大语言模型结构化剪枝的校准正交等效补偿
本文提出COEC,一种用于大语言模型结构化剪枝的无需训练补偿框架,通过应用正交旋转和校准来减少输出误差,并在列移除后提高准确性。
PACT:在任务向量中保留锚定核心以进行模型合并
本文识别了预训练模型中的“承重墙”维度,这些维度保留了模型合并中任务向量未完全捕获的任务特定知识,并提出了PACT(PreserveAnchoredCores)来保留这些核心,在多个基准测试中实现了最先进的性能。
矩阵正交化提升循环模型的记忆能力
这项工作提出对mLSTM循环模型的记忆矩阵进行正交化,以提高其在噪声关联回忆任务上的性能。实验表明,与基线mLSTM相比,使用牛顿-舒尔茨迭代进行只读正交化可提升验证准确率。