CoMerge:基于冲突驱动的偏好优化方法用于多任务模型合并
摘要
CoMerge是一个基于冲突驱动的偏好优化框架,用于合并多任务LLMs,采用自监督策略来减轻参数干扰,并在如MergeBench等基准测试中实现高性能。
arXiv:2609.02273v1 公告类型:新
摘要:模型合并提供了一种高效的范式,用于构建多任务大型语言模型(LLMs),无需完整模型重新训练,但仍然面临参数干扰的挑战。现有方法旨在保留各个专家模型的能力并减轻干扰,但通常没有直接从朴素合并所暴露的可能降级行为中学习。在本文中,我们提出了一种用于模型合并的冲突驱动偏好优化框架(CoMerge),将模型合并重新表述为偏好优化问题。该方法采用自监督、冲突驱动的策略,利用朴素合并方法(例如任务算术)的缺陷作为硬负样本,在没有外部注释的情况下构建偏好对。通过应用偏好优化来细化轻量级的张量级合并系数,CoMerge使模型能够在保留任务特定能力的同时减轻参数空间中的冲突。大量实验表明,CoMerge在MergeBench上实现了平均归一化性能0.9968,优于所有评估的无数据和有数据驱动的模型合并基线。此外,在Llama-3.1-8B-Instruct上,CoMerge在冲突敏感任务如指令遵循和安全性方面取得了显著改进,同时尽管仅优化了1,445个标量系数,仍与全参数微调具有高度竞争力。
查看缓存全文
缓存时间: 2026/09/03 06:04
# 冲突驱动的多任务模型合并偏好优化
来源:https://arxiv.org/html/2609.02273
郑明杰†
单位:中国珠海,中山大学软件工程学院
单位:中国杭州,海智研究院
陈文清††
†† 通讯作者。
单位:中国珠海,中山大学软件工程学院
袁伟乐
单位:中国珠海,中山大学软件工程学院
储志轩
单位:中国杭州,浙江大学区块链与数据安全国家重点实验室
余建兴
单位:中国珠海,中山大学人工智能学院
单位:中国珠海,文化和旅游部可持续旅游智能评估技术重点实验室
郑子彬
单位:中国珠海,中山大学软件工程学院
###### 摘要
模型合并提供了一种构建多任务大语言模型(LLMs)的高效范式,无需完整的模型重训练,但它仍然面临参数干扰的挑战。尽管现有方法旨在保留各个专家模型的能力并减轻干扰,但它们通常没有直接从朴素合并所暴露的潜在性能退化行为中学习。在本文中,我们提出了一种用于模型合并的冲突驱动偏好优化框架(CoMerge),将模型合并重新表述为一个偏好优化问题。该方法采用自监督、冲突驱动的策略,利用朴素合并方法(例如,任务算术)的缺陷作为硬负样本,在无需外部标注的情况下构建偏好对。通过应用偏好优化来细化轻量级的张量级合并系数,CoMerge使模型能够在保留任务特定能力的同时减轻参数空间冲突。大量实验表明,CoMerge在MergeBench上实现了0.9968的平均归一化性能,超越了所有评估的无数据和数据驱动的模型合并基线。此外,在Llama-3.1-8B-Instruct上,CoMerge在指令遵循和安全性等冲突敏感任务上取得了显著提升,尽管仅优化了1,445个标量系数,但在性能上仍与全参数微调保持高度竞争力。
图1:CoMerge示意图。通过从专家(正例)和朴素合并(负例)输出中构建偏好对,我们的方法显式地优化合并系数以缓解冲突。
## 1 引言
在通用大语言模型(LLMs)快速发展的推动下,OpenAI (2023) (https://arxiv.org/html/2609.02273#bib.bib34),面向特定任务的专家模型已在编码、数学和安全等领域可用,He et al. (2025b) (https://arxiv.org/html/2609.02273#bib.bib21)。模型合并已成为从头构建统一模型的一种资源高效的替代方案。它通过在参数空间内整合多个微调过的专家模型来工作。然而,模型合并可能会因参数干扰而受挫,Yadav et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib40); Zhou et al. (2025) (https://arxiv.org/html/2609.02273#bib.bib45)。由于任务向量可能表现出冲突的方向,直接的算术聚合可能导致性能下降,Yadav et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib40)。为缓解这一问题,近期研究采用了基于启发式的静态技术或数据驱动的优化策略,Yadav et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib40); Yu et al. (2024) (https://arxiv.org/html/2609.02273#bib.bib42); Yang et al. (2024) (https://arxiv.org/html/2609.02273#bib.bib41); He et al. (2025a) (https://arxiv.org/html/2609.02273#bib.bib20)。尽管这些方法在参数或系数层面解决了干扰问题,但它们并未直接使用朴素合并模型的输出作为行为层面的负面反馈。如图1所示,当合并一个指令遵循专家与一个安全专家时,得到的模型可能会因参数干扰而失去其安全防护。从这个意义上说,它们主要保留了合并模型“应该做什么”,而CoMerge额外学习了它“应该避免什么”,将此类输出视为拒绝的响应。
为了解决这些局限性,我们将多任务模型合并重新表述为一个自监督的偏好优化问题。我们引入了CoMerge,一个冲突驱动的偏好优化框架。CoMerge采用自监督、冲突驱动的策略,利用朴素合并方法的缺陷作为硬负样本,在无需外部标注的情况下构建偏好对。通过应用偏好优化来细化轻量级的张量级合并系数,CoMerge使模型能够减轻参数空间冲突。与无约束的全参数微调相比,这种设计可以减少GPU资源的使用,并作为结构性的正则化。我们的主要贡献总结如下:
- 我们引入了CoMerge,一个将多任务模型合并重新表述为自监督偏好优化问题以显式减轻参数干扰的框架。
- 我们提出了一种自监督策略,该策略从朴素合并的固有缺陷中合成硬负样本,在无需标注校准数据集的情况下缓解冲突。
- CoMerge在使用Llama-3.1-8B-Instruct的MergeBench上达到0.9968,超越了评估的模型合并基线,并且在仅优化1,445个系数的情况下,当两种方法使用相同的预构建偏好数据集时,达到峰值性能所需的GPU时间减少了60.1%,接近Full-DPO的性能。
代码、评估脚本、配置文件和完整的环境规格将在发表时于https://github.com/Zheng-Jay/CoMerge发布。
## 2 相关工作
我们回顾三个与我们工作密切相关的领域:无数据权重合并、数据驱动的合并策略以及大语言模型的偏好优化。
**无数据模型合并。** 在参数空间中合并微调模型提供了一种无需重新训练即可组合能力的方法。早期方法平均模型权重,Izmailov et al. (2018) (https://arxiv.org/html/2609.02273#bib.bib26); Wortsman et al. (2022) (https://arxiv.org/html/2609.02273#bib.bib39) 或其更新量,即任务向量,Ilharco et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib25)。然而,简单的平均可能导致参数干扰。为了缓解这一问题,无数据方法通过符号解析、稀疏化、丢弃并重新缩放操作或几何分解来操作任务向量更新。TIES-Merging修剪冗余更新并解决符号冲突,Yadav et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib40)。DARE对delta参数采用随机丢弃并重新缩放,而DELLA则通过基于幅度的随机剪枝和基于符号的delta选择扩展了这一思想,Yu et al. (2024) (https://arxiv.org/html/2609.02273#bib.bib42); Deep et al. (2024) (https://arxiv.org/html/2609.02273#bib.bib12)。与稀疏化正交,TSV-M将任务更新分解为任务奇异向量,以减少在低维子空间中的干扰,Gargiulo et al. (2025) (https://arxiv.org/html/2609.02273#bib.bib19)。这些静态方法是高效的,但可能缺乏适应不同层和任务间变化冲突的灵活性,这可能导致在具有强烈任务间或层间冲突的任务上性能次优。
**数据驱动的模型合并。** 为了克服无数据合并方法的局限性,数据驱动方法使用任务数据、有限的标注或未标注样本、模型响应或中间表示来校准融合过程。一条工作线学习连续的合并系数:AdaMerging Yang et al. (2024) (https://arxiv.org/html/2609.02273#bib.bib41) 通过在未标注样本上最小化熵来优化任务级或层级系数,而AdaMMS Du et al. (2025) (https://arxiv.org/html/2609.02273#bib.bib9) 利用生成一致性为异构MLLM合并选择插值系数。另一条工作线学习局部区域或结构化掩码:Localize-and-Stitch He et al. (2025a) (https://arxiv.org/html/2609.02273#bib.bib20) 通过二进制掩码识别包含紧凑技能的区域,并将定位的任务更新拼接到预训练模型中,CALM Yan et al. (2025) (https://arxiv.org/html/2609.02273#bib.bib10) 使用通过类别平衡熵最小化选择的可靠样本优化共识感知掩码。第三条线通过参数重要性统计或表示匹配校准合并参数:Fisher Merging Matena and Raffel (2022) (https://arxiv.org/html/2609.02273#bib.bib30) 使用对角Fisher信息从任务特定数据估计参数重要性,并执行Fisher加权参数平均;RegMean Jin et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib27) 从输入激活统计中推导每个线性层的闭式解以匹配候选模型的相应线性层输出;RegMean++ Nguyen et al. (2026) (https://arxiv.org/html/2609.02273#bib.bib33) 通过前面合并层产生的表示结合层内和跨层依赖关系;以及LOT Merging Sun et al. (2025) (https://arxiv.org/html/2609.02273#bib.bib11) 最小化任务向量空间中的层级特征漂移。与这些方法不同,CoMerge将朴素合并的输出视为拒绝响应,为偏好优化增加了行为层面的负面反馈。结合正向的专家响应,这为合并模型应该保留什么以及应该避免什么提供了信号。
**偏好优化。** 偏差优化通常用于使模型与人类价值观对齐,Ouyang et al. (2022) (https://arxiv.org/html/2609.02273#bib.bib35); Bai et al. (2022) (https://arxiv.org/html/2609.02273#bib.bib14)。像直接偏好优化(DPO)这样的方法直接在偏好数据上优化策略,无需奖励模型,Rafailov et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib36)。最近,偏好优化(PO)也在模型合并中进行了探索。例如,WRPO Yang et al. (2025) (https://arxiv.org/html/2609.02273#bib.bib46) 和InfiFPO Gu et al. (2025) (https://arxiv.org/html/2609.02273#bib.bib47) 利用PO进行隐式模型合并,通过输出或分布对齐将能力从异构源模型蒸馏到目标策略中。虽然对于知识转移有效,但这些方法使用计算密集型的蒸馏流程;在其报告的设置中,使用了外部奖励模型在偏好数据构建期间对候选响应进行排序。与这些隐式方法相比,CoMerge进一步探索了PO在显式参数空间合并中的应用。此外,CoMerge不使用人类标注或奖励模型排名来构建偏好对,而是使用专家输出作为选择的响应,朴素合并的失败案例作为拒绝的响应。通过将任务算术模型中潜在冲突的输出视为负样本,CoMerge重新利用PO来显式减轻参数干扰——这是权重合并固有的根本挑战。通过将更新限制在由预处理的任务向量分量诱导的结构化参数子空间中,CoMerge在没有与蒸馏相关的沉重训练开销的情况下,实现了高效的多任务合并。
## 3 方法
参见图注
图2:CoMerge框架。CoMerge提取稀疏任务向量,从专家和任务算术输出合成自监督偏好对,并优化张量级系数Λ以实现冲突感知的模型合并。
### 3.1 问题形式化
令θpre∈ℝd 表示在通用语料上预训练或微调过的LLM的参数。我们考虑N个专家模型,其参数为{θft¹,...,θftᴺ} ⊂ ℝd,每个模型都是通过对θpre在特定下游任务上进行微调得到的。遵循任务算术,Ilharco et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib25),任务i的特定知识由一个任务向量τᵢ捕获,定义为:
τᵢ = θftⁱ − θpre。
(1)
遵循原始任务算术形式化,Ilharco et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib25),多任务模型合并首先对任务向量求和并应用共享的缩放系数:
θTA = θpre + α∑ᵢ₌₁ᴺ τᵢ,
(2)
其中α是一个共享的标量系数。然而,当不同的任务向量在共享参数坐标上诱导冲突的更新时,直接聚合可能导致参数干扰,从而可能降低θTA的性能,Yadav et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib40)。
**数据驱动的模型合并。** 为了克服静态启发式权重的局限性,数据驱动方法将模型合并表述为由有限校准集Dcal引导的优化问题。与依赖固定缩放的朴素方法不同,这些方法旨在通过最小化校准目标或代理信号来估计合适的合并规则或一组合并参数Λ(范围从全局标量到逐元素掩码)。形式上,给定预训练模型θpre和任务向量{τᵢ}ᵢ₌₁ᴺ,问题定义为:
Λ* = argmin_Λ 𝔼_{x∼Dcal} [Lcal(Φ(x; M(θpre, {τᵢ}, Λ)), Yref(x))],
(3)
其中M表示由Λ参数化的合并函数,Φ(⋅)指定合并模型的观测空间,如最终预测、模型响应、线性层输出或中间表示,Yref表示相应的参考信号,Lcal(⋅)表示损失函数。Λ和Lcal的具体实例各不相同:AdaMerging Yang et al. (2024) (https://arxiv.org/html/2609.02273#bib.bib41) 使用熵最小化优化标量系数,而Localize-and-Stitch He et al. (2025a) (https://arxiv.org/html/2609.02273#bib.bib20) 学习逐元素掩码。RegMean Jin et al. (2023) (https://arxiv.org/html/2609.02273#bib.bib27) 从输入激活统计中推导每个线性层的闭式解以匹配候选模型的相应线性层输出。虽然这些策略通过熵最小化、掩码优化或线性层输出匹配来校准合并,但它们并未直接使用朴素合并的输出作为行为层面的负面反馈。
### 3.2 使用偏好合成进行冲突挖掘
为了显式引导合并相似文章
贝叶斯模型合并
介绍贝叶斯模型合并(BMM),这是一个即插即用的双层优化框架,用于将多个任务特定的专家模型合并为一个单一模型,在视觉和语言基准测试上实现了最先进的性能。
CT-Merging: 共识方向与任务级缩放用于LoRA适配器合并
CT-Merging 提出了一种通过从任务子空间投影器估计共识方向并分配任务级RMS系数缩放来合并LoRA适配器的方法,在DC-Merge CLIP适配器基准上取得了优越的性能。
CABS+:通过冲突感知稀疏化与自适应权重分配实现高效可扩展的模型合并
本文提出了 CABS+,一种增强的模型合并方法,利用冲突感知稀疏化和自适应权重分配来提高多任务模型合并的效率和性能,在 27 个数据集上相较于先前方法取得了显著提升。
基于输出空间投影的模型合并
本文提出了一种新的模型合并框架,将问题转化为关于残差更新的凸二次规划,以最小化平方输出的校准目标。该框架涵盖现有的启发式方法,并提供了一种闭式诊断指标来预测合并质量,在语言和视觉基准测试中持续取得改进。
UniMoMo:基于专家合并的大型推荐模型MoE加速
UniMoMo通过基于功能行为和路由流量合并专家来压缩基于MoE的推荐模型,在加速推理的同时保持质量。