模型合并作为微调参数空间中的概率推理
摘要
本文将模型合并视为在专家乘积场景下的概率推断,表明现有方法是其特例,并提出一种重尾柯西专家设计,能更准确地捕捉实际残差行为,在多个任务和架构上相对于现有最优基线取得了显著改进。
arXiv:2607.01689v1 Announce Type: new
摘要:模型合并旨在将现有的单任务解决方案组合成多任务解决方案,而无需额外的数据驱动微调。当前大多数方法利用局部解空间的几何性质来实现这一目标。然而,这种几何观点在合并过程中为评估每个任务特定更新方向在跨任务中的统计有用性提供的指导有限。为了解决这一问题,我们从专家乘积(PoE)场景下的概率推断新视角出发,将每个单任务解决方案定义为对合并参数的基于能量的专家模型(EBM)。我们证明,在能量设计对合并模型与任务特定模型之间的方向残差施加隐式高斯假设的情况下,现有几种模型合并方法是我们框架的特例。实验发现,这些残差通常呈现重尾分布,这与施加的轻尾高斯结构存在不匹配。我们通过基于柯西专家的重尾PoE设计来解决这一问题,该设计能更好地捕捉观察到的残差行为,同时具备可证明收敛的推断过程。跨多个任务和架构的实验表明,该方法相对于现有最优基线取得了显著改进。我们的代码可在 https://github.com/MinhLong210/PoE-EBM-Merging.git 获取。
查看缓存全文
缓存时间: 2026/07/03 05:43
# 将模型合并视为微调参数空间中的概率推断
来源:https://arxiv.org/html/2607.01689
Tuan Anh Le VanHanoi University of Science and TechnologyTung Phi DucHanoi University of Science and TechnologyPhi Le NguyenHanoi University of Science and TechnologyJana DoppaWashington State UniversityTrong Nghia HoangWashington State University
###### 摘要
模型合并旨在将现有的单任务解决方案组合成一个多任务解决方案,而无需额外的数据驱动微调。大多数现有方法利用局部解空间的几何属性来实现这一点。然而,这种几何视角在合并过程中,对于评估每个任务特定更新方向在跨任务中的统计有用性,提供的指导有限。为了解决这个问题,我们从概率推断的新视角来阐述模型合并,将其置于一个专家乘积(PoE)场景下,其中每个单任务解决方案定义了一个关于合并参数的能量基专家模型(EBM)。我们证明,在能量设计中,一些现有的模型合并方法是我们框架的特例,这些设计对合并模型与任务特定模型之间的方向残差施加了隐含的高斯假设。实验发现,这些残差通常具有重尾分布,这揭示了与所施加的轻尾高斯结构的不匹配。我们基于柯西专家设计了一种重尾PoE模型来解决这个问题,该模型能更好地捕捉观察到的残差行为,同时允许一个可证明收敛的推断过程。跨多个任务和架构的实验表明,该方法显著优于最先进的基线。我们的代码可在https://github.com/MinhLong210/PoE-EBM-Merging.git获取。
## 1 引言
大规模预训练基础模型及其针对特定任务微调的变体[achiam2023gpt, touvron2023llama]已越来越广泛地应用于各种下游任务。这类专门化模型的日益普及推动了模型合并的研究,其目标是将多个任务特定模型组合成一个单一的多任务模型,而无需额外的数据驱动微调[hoang2019collective, NghiaNeurIPS19, NghiaICML20, NghiaICML21, yang2024model, li2023deep, hoang2024fewshot]。例如,可以将单语模型合并以获得一个单一的多语言模型[ahmadian2024mix]。这类模型合并方法在许多实际生产系统[Su2018ARS]中尤其有价值,因为这些系统中的本地数据集和训练管道无法集中和同步。尽管不需要额外的训练数据,模型合并通常能够达到与完整的、但在这种设置下可能不切实际的多任务微调相竞争的性能。当存储资源有限时,例如在边缘设备[voghoei2018deep, narayanswamy2024scaling]上,或者当访问隐私敏感的任务特定数据受到限制[liang2025vision, zhang2024challenges, pan2024federated]时,模型合并也很有吸引力。
**先前工作。** 模型合并的一个常见范式是用一个微调模块来表示每个任务特定模型,例如低秩适应(LoRA)矩阵[hu2022lora]或一个捕捉微调参数与预训练参数差异的任务向量[ilharco2022editing]。然后,模型合并简化为将这些任务特定更新聚合成一个单一的多任务模型。大多数现有方法利用局部解空间的几何属性来执行这种聚合。
最简单的方法,包括权重平均和任务算术[wortsman2022robust, ilharco2022editing],假设任务特定更新位于一个共同的解流形中,可以直接组合。更复杂的方法,如Fisher加权平均[matena2022merging]和基于Gram的加权[jin2022dataless],在聚合过程中引入曲率或数据相关的几何信息,以更好地解释局部解空间之间的差异。另一项工作明确寻求在合并前对齐局部解空间。例如,DOGE[wei2025modeling]构建了一个共享的切空间,而KnOTS[stoica2024model]使用奇异值分解推导出一个共同的低维子空间。然后,任务特定模型在聚合之前被投影到这些对齐的表示上。
---
**图1:** 方向残差 r = (ζ − θ)^⊤ θ 的经验分布,它衡量合并更新 ζ 从任务更新 θ 沿该任务自身更新方向漂移的程度。我们比较了合并7个微调后的ViT-L/14模型时,不同合并方法产生的残差。对数尺度密度图显示,经验分布的尾部衰减速度远慢于拟合的高斯分布,而与拟合的柯西分布更吻合,这表明模型合并中存在显著的重尾残差行为,揭示了与先前工作(隐含的)高斯专家结构的不匹配。
**局限性。** 这些方法主要将每个任务特定的微调模块视为一个确定性点估计,并通过一些几何引导的操作进行聚合。然而,这种确定性观点对于每个更新方向在不同任务中的有用性提供的信息很少。结果,仅对单个任务有效的更新方向可能与跨任务持续有用的方向一起被聚合。然后,这些任务特定的方向可能会抵消或主导有用的跨任务方向,使合并更新偏离有益于多个任务的共享方向。这表明,模型合并不仅应该聚合更新方向,还应该估计每个方向应如何自信地影响合并模块。
**动机与解决方案展望。** 基于上述直觉,我们研究了一个更广泛的概率框架下的模型合并,其中每个任务更新在候选共享更新方向上诱导一个分布,而不是一个单一点估计。每个候选方向分配到的局部概率分数反映了该方向被对应任务支持的程度。在这种观点下,合并变成了证据聚合。被多个任务支持的方向获得更高的聚合置信度,而仅被单个任务支持的方向则从其余任务中获得低支持度,并被降权。
我们通过将模型合并视为微调参数空间中,在任务特定能量基专家乘积下的最大后验(MAP)推断来具体实现这一想法。这种观点将现有的合并规则恢复为特定能量设计下的特例,并揭示了它们隐含施加的不确定性假设。特别是,二次能量恢复经典的均值类方法,并对应于高斯专家。这种方法也与daheim2023model最近提出的不确定性感知梯度匹配方法密切相关,该方法通过其拉普拉斯近似解释隐含地施加了高斯专家设计。虽然这种方法为概率模型合并的有效性提供了重要的经验证据,但我们的分析表明,其隐含的高斯结构与个别更新和合并更新之间方向残差的分布并不匹配。特别地,我们表明这些方向残差表现出显著的重尾行为,而高斯模型本质上是轻尾的(见图1)。为了解决这个局限性,我们开发了一个带有重尾能量基专家模型(EBM)的专家乘积(PoE)公式。我们的解决方案方法由以下技术贡献支持:
1. **一个统一的概率模型合并框架。** 我们将模型合并表述为微调参数空间中,在任务特定能量基专家乘积下的MAP推断。在这种观点下,每个微调模块在候选合并更新和任务特定更新之间的方向残差上诱导一个能量。然后,合并后的模块对应于在所得专家乘积下的MAP估计。我们证明,现有的合并规则,包括均匀平均和Fisher加权平均,是特定能量设计下的特例。这为这些方法提供了一个统一的视角,并揭示了它们聚合规则所隐含的概率假设(第3节和第4节)。
2. **具有收敛保证的重尾合并。** 在上述概率框架下,我们表明现有的合并方法对应于方向残差 r = (ζ − θ)^⊤ θ 上的轻尾分布,该残差衡量候选合并更新 ζ 从任务更新 θ 沿该任务自身更新方向漂移的程度。我们的实证分析表明,这些残差表现出重尾行为,揭示了与先前工作通常隐含假设的高斯专家结构的不匹配。为了解决这个问题,我们开发了一种新颖的重尾柯西基专家设计,以及一个具有收敛保证的高效定点MAP推断算法(第5节)。
3. **跨视觉和语言模型的评估。** 我们评估了跨多个模型家族的不同视觉和语言基准测试的提议框架。我们的方法持续优于最先进的(SOTA)基线,提升了合并模型的性能(第6节)。
## 2 问题设置与背景
模型合并旨在聚合 N 个现有模型,这些模型从一个大型预训练模型 W_0 在不同下游数据集上微调而来。每个微调后的任务特定模型具有参数 W_i,这些参数是从本地数据集 D_i 中学习得到的。为了提取任务 i ∈ [N] 的任务特定信息,ilharco2022editing 引入了任务向量 θ_i = W_i − W_0。任务向量编码了任务特定信息,并允许分析单个任务的特征。模型合并的目标是通过设计一个聚合算法 A 来组合任务向量,找到在所有任务上表现良好的合并参数 W_m:
W_m = A(W_0, θ_1, ..., θ_N)。
ilharco2022editing 表明,我们可以通过对任务向量 θ_1, θ_2, ..., θ_N 执行简单的任务算术运算来得到多任务模型 W_m:
W_m = W_0 + λ ∑_{i=1}^{N} θ_i, (1)
其中 λ 是一个缩放系数,通常在验证集上调整。当 λ = 1/N 时,等式(1) 简化为对 W_i 执行权重平均 [wortsman2022robust]。matena2022merging 通过用其相应的 Fisher 信息矩阵 F_i 缩放局部参数进一步推广了这一思想,得到以下 Fisher 平均:
W_m = ∑_{i=1}^{N} α_i (∑_{t=1}^{N} α_t F_t)^{-1} F_i θ_i, (2)
其中
F_i = E_{x∼D_i} [ E_{y∼p_{W_i}(y|x)} ] G_i G_i^⊤, (3)
且 G_i = ∇_{W_i} log p_{W_i}(y|x)。
或者,RegMean [jin2022dataless] 通过在每一线性层对齐合并模型和任务特定模型的激活来匹配模型行为。这引出了一个由任务特定数据矩阵 X_i 定义的线性回归问题,该问题引入了另一种合并规则:
W_m = (∑_{i=1}^{N} (1/N_i) X_i^⊤ X_i)^{-1} (∑_{i=1}^{N} (1/N_i) X_i^⊤ X_i θ_i). (4)
总的来说,现有的合并方法在如何对齐局部解空间方面有所不同。然而,它们基本上将任务更新视为要聚合的确定性量,而不衡量它们在不同任务中的统计有用性(第1节)。因此,我们寻求一种微调模块的概率处理方式,它不仅考虑局部更新几何,还估计每个方向应如何自信地影响合并模块。
## 3 模型合并的专家乘积(PoE)视角
在本节中,我们为模型合并开发一个新的视角,其中任务特定的微调模块可以解释为共享潜在参数的观测值,该参数捕获了跨任务的公共信息。合并后的模型可以看作是从一个专家乘积(PoE)模型中抽取的样本,该模型结合了这些局部能量基密度(第3.1节)。在这种观点下,模型合并可以被公式化为MAP推断,这也为现有的合并规则提供了统一的概率解释。特别地,我们证明了权重平均、Fisher加权平均和RegMean是特定任务能量函数选择下的特例,从而使其隐含的分布假设变得明确(第3.2节)。然后,第4节表明这些隐含假设与观察到的候选合并更新和任务特定模块之间的经验偏差不匹配,并引入了局部能量函数的重新设计以减轻这种不匹配。
### 3.1 模型合并的PoE公式
能量基模型(EBM)[teh2003energy, lecun2006tutorial, song2021train] 通过一个称为*能量* E(ζ) 的未归一化函数来定义概率分布,对更可能的输入 ζ 分配较低的能量。所得分布由下式给出:
p(ζ) = Z^{-1} ⋅ exp(−E(ζ)), (5)
其中 Z ≜ ∫ exp(−E(ζ)) dζ 是配分函数,确保分布积分为1。在这种观点下,能量较低的输入对应较高的概率。这个公式只需要通过能量来指定兼容性,而无需显式归一化。
现在,考虑合并 N 个任务特定模型的问题。我们假设...相似文章
贝叶斯模型合并
介绍贝叶斯模型合并(BMM),这是一个即插即用的双层优化框架,用于将多个任务特定的专家模型合并为一个单一模型,在视觉和语言基准测试上实现了最先进的性能。
基于输出空间投影的模型合并
本文提出了一种新的模型合并框架,将问题转化为关于残差更新的凸二次规划,以最小化平方输出的校准目标。该框架涵盖现有的启发式方法,并提供了一种闭式诊断指标来预测合并质量,在语言和视觉基准测试中持续取得改进。
我们是否在合并正确的模型?专家训练时长对LLM模型合并的影响
本文挑战了关于模型合并中领域专家应训练至最优验证损失的常见假设,表明最优训练时长在很大程度上取决于合并方法。简单平均法会因过拟合而性能下降,而基于稀疏化的方法则能从超出最优点的训练中获益。研究建议训练时长与合并方法应联合选择。
大语言模型中的模型合并扩展定律
本文建立了语言模型合并的实证扩展定律,确定了模型规模、专家数量与性能之间的幂律关系,从而能够为最佳模型组合提供预测性规划。
如何扩展混合专家模型:从muP到最大化尺度稳定参数化
本文为混合专家(MoE)架构提出了一套具有理论基础的缩放理论,引入了最大化尺度稳定参数化(MSSP),确保在宽度、深度、专家宽度和专家数量上的稳定训练和超参数迁移,并通过实验验证。