贝叶斯模型合并

arXiv cs.LG 论文

摘要

介绍贝叶斯模型合并(BMM),这是一个即插即用的双层优化框架,用于将多个任务特定的专家模型合并为一个单一模型,在视觉和语言基准测试上实现了最先进的性能。

arXiv:2605.12843v1 公告类型:新 \n摘要:模型合并在不进行联合重训练的情况下,将多个任务特定的专家模型组合成一个单一模型,当数据访问或计算预算有限时,提供了多任务学习的一种实用替代方案。然而,现有方法存在两个关键限制:(1)它们忽略了强锚模型的有价值的归纳偏差,并从零开始估计合并后的权重;(2)它们依赖网络不同模块之间的共享超参数设置,缺乏全局优化策略。本文介绍了贝叶斯模型合并(BMM),这是一个即插即用的双层优化框架,其中内层将模型合并形式化为在由锚模型诱导的强先验下的基于激活的贝叶斯回归,从而得到高效的闭式解;外层利用贝叶斯优化过程基于小验证集全局搜索模块特定的超参数。此外,我们揭示了激活统计量与任务向量之间的关键对齐,从而能够推导出BMM的无数据变体,该变体无需任何辅助数据即可估计用于回归的格拉姆矩阵。在广泛的基准测试中,包括视觉领域的多达20个任务合并和语言领域的5个任务合并,BMM始终优于所有即插即用的锚基线方法(例如TA、WUDI-Merging和TSV)。特别地,在ViT-L/14基准测试的8任务合并中,单个合并模型达到了95.1,与八个任务特定专家的平均性能(95.8)非常接近。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:19

# 贝叶斯模型合并 来源:https://arxiv.org/html/2605.12843 Kaiyang Li¹  Shaobo Han²  Qing Su¹  Shihao Ji¹  
1 School of Computing, University of Connecticut, Storrs, CT 06269 \{kaiyang\.li, qing\.2\.su, shihao\.ji\}@uconn\.edu  
2 Optical Networking and Sensing, NEC Labs America, Princeton, NJ 08540 shaobo@nec\-labs\.com  

###### 摘要  

模型合并旨在将多个任务特定的专家模型合并为单个模型,而无需联合重新训练,从而在数据访问或计算预算受限时为多任务学习提供一种实用的替代方案。然而,现有方法面临两个关键限制:(1)它们忽略了强锚点模型的宝贵归纳偏差,从零开始估计合并权重;(2)它们依赖跨网络不同模块共享的超参数设置,缺乏全局优化策略。本文提出**贝叶斯模型合并**(BMM),一个*即插即用*的双层优化框架。内层将模型合并形式化为基于激活的贝叶斯回归,并在锚点模型诱导的强先验下获得高效的闭式解;外层利用贝叶斯优化过程,基于小型验证集全局搜索模块专属超参数。此外,我们揭示了激活统计量与任务向量之间的关键对齐关系,从而能够推导出 BMM 的无数据变体,无需任何辅助数据即可估计用于回归的 Gram 矩阵。在广泛的基准测试中(包括视觉领域多达 20 个任务的合并以及语言领域 5 个任务的合并),BMM 始终优于所有即插即用锚点基线(如 TA、WUDI-Merging 和 TSV)。特别地,在 ViT-L/14 上针对 8 个任务合并的基准中,单个合并模型达到了 **95.1**,与八个任务特定专家的平均性能(95.8)非常接近。  

## 1 引言  

通过微调将基础模型适配到下游任务已成为标准做法,但为每个任务维护独立的专家模型会带来大量的存储、部署和运维开销。虽然多任务学习提供了一种统一的替代方案[1](https://arxiv.org/html/2605.12843#bib.bib1),但它需要联合数据访问,并且计算成本高昂,在数据孤岛、隐私约束或有限计算预算下往往不可行。模型合并[2](https://arxiv.org/html/2605.12843#bib.bib2), [3](https://arxiv.org/html/2605.12843#bib.bib3), [4](https://arxiv.org/html/2605.12843#bib.bib4)]提供了一种实用解决方案。通过直接将多个专家模型合并为单一架构,它能够在不重新访问原始训练数据或承担联合重新训练成本的情况下实现统一推理。随着 Hugging Face 平台[5](https://arxiv.org/html/2605.12843#bib.bib5)上开源模型生态的繁荣,这种范式变得越来越重要,该平台提供了丰富的任务特定专家模型可供集成。  

模型合并的一个核心挑战是如何在辅助数据有限或不可用时有效地合并专家模型。现存方法根据是否使用辅助数据分为两大类。**数据辅助**方法,如 Fisher Merging[2](https://arxiv.org/html/2605.12843#bib.bib2)] 和 RegMean[6](https://arxiv.org/html/2605.12843#bib.bib6)],依赖一个小型校准集来估计经验统计量进行合并。**无数据**方法,包括 Task Arithmetic (TA)[3](https://arxiv.org/html/2605.12843#bib.bib3)]、TIES[4](https://arxiv.org/html/2605.12843#bib.bib4)]、WUDI-Merging[7](https://arxiv.org/html/2605.12843#bib.bib7)]、TSV[8](https://arxiv.org/html/2605.12843#bib.bib8)] 和 ISO-CTS[9](https://arxiv.org/html/2605.12843#bib.bib9)],避免使用辅助数据来估计合并参数,尽管其中一些方法仍会使用预留的验证集进行轻量级超参数选择。尽管存在差异,但这两类方法都受到两个重要限制。首先,它们通常从零开始估计合并权重,而没有利用强锚点模型的先验知识,宝贵的归纳偏差未被充分利用。其次,许多先进方法主要通过隔离的模块级合并来操作,并且为了调参方便而采用跨不同模块共享的超参数设置,忽略了模块异质性并缺乏全局超参数搜索策略。  

为了解决这些限制,我们提出**贝叶斯模型合并**(BMM),一个构建在两个关键思想之上的*即插即用*双层优化框架。首先,BMM 不从头估计合并权重,而是利用来自强锚点模型(如 TA[3](https://arxiv.org/html/2605.12843#bib.bib3)]、RegMean[6](https://arxiv.org/html/2605.12843#bib.bib6)] 或 TSV[8](https://arxiv.org/html/2605.12843#bib.bib8)])的先验知识,形成一种基于激活的贝叶斯回归,具有高效的闭式解用于模块级合并。其次,BMM 不依赖跨所有模块共享的超参数设置,而是执行全局协调的架构感知贝叶斯优化,以适应网络异构模块间的正则化强度。此外,我们在理论和实验上揭示了激活统计量与模块级任务向量之间的关键对齐关系,从而能够推导出 BMM 的无数据变体,同时保留闭式解。实验表明,BMM 在视觉和语言模型合并中均有效。在来自两个模型家族的四个骨干网络和七个即插即用锚点模型上,BMM 在数据辅助和无数据两种设置下均始终优于每个锚点,在较弱锚点上相对提升高达 27%,同时仍然改进了最强锚点。特别地,在标准 ViT-L/14 基准上,单个合并模型达到了 **95.1%**,与八个任务特定专家的平均性能(95.8%)非常接近。我们还进行了广泛的消融研究,以进一步验证 BMM 的主要组件和设计选择。  

## 2 相关工作  

**免训练模型合并** 在不完全数据访问或昂贵的联合重新训练条件下高效地组合专家检查点。现有方法根据对辅助数据的依赖通常分为两大类:数据辅助和无数据。  

**数据辅助方法** 利用小型校准集或激活统计量来指导合并。例如,Fisher Merging[2](https://arxiv.org/html/2605.12843#bib.bib2)] 执行任务特定模型的 Fisher 加权平均,而 RegMean[6](https://arxiv.org/html/2605.12843#bib.bib6)] 将线性层合并视为回归,具有闭式解。  

**无数据方法** 消除了对辅助数据的需求,完全依赖专家模型的权重。在该类方法中,Task Arithmetic (TA)[3](https://arxiv.org/html/2605.12843#bib.bib3)] 是开创性的基线。后续工作主要通过稀疏化来缓解模型间干扰,包括 TIES[4](https://arxiv.org/html/2605.12843#bib.bib4)]、DARE[10](https://arxiv.org/html/2605.12843#bib.bib10)]、PCB-Merging[11](https://arxiv.org/html/2605.12843#bib.bib11)] 和 Localize-and-Stitch[12](https://arxiv.org/html/2605.12843#bib.bib12)]。另一类工作(如 TSV[8](https://arxiv.org/html/2605.12843#bib.bib8)] 和 ISO-CTS[9](https://arxiv.org/html/2605.12843#bib.bib9)])利用结构化低秩子空间来隔离任务特定特征或对齐任务相关子空间。近来,诸如 WUDI-Merging[7](https://arxiv.org/html/2605.12843#bib.bib7)] 和 DOGE[13](https://arxiv.org/html/2605.12843#bib.bib13)] 等方法优化了显式的无数据合并目标,但未利用来自强锚点模型的先验知识,并且为网络的不同模块学习统一的超参数设置。我们的 BMM 是对这些方法的补充:它利用现有的合并解作为锚点,具有模块级合并的高效闭式解,并利用双层优化进行跨不同模块组的超参数搜索。  

#### 表示几何、神经坍缩与微调后的对齐  

越来越多的文献研究了训练后的神经网络中结构化几何的出现。神经坍缩[14](https://arxiv.org/html/2605.12843#bib.bib14)] 表明,在训练的终末期,最后一层的特征坍缩到其类均值,分类器权重与相同的单纯形几何对齐。神经特征假设[15](https://arxiv.org/html/2605.12843#bib.bib15)]和 Deep RFM[16](https://arxiv.org/html/2605.12843#bib.bib16)] 将这一观点扩展到网络级别的特征学习,并将层级的权重结构与平均梯度外积联系起来。Liu 等人[17](https://arxiv.org/html/2605.12843#bib.bib17)]的最新分析进一步表明,潜在表示、网络权重和梯度在隐藏层间相互对齐。最近的一些工作[18](https://arxiv.org/html/2605.12843#bib.bib18), [19](https://arxiv.org/html/2605.12843#bib.bib19), [20](https://arxiv.org/html/2605.12843#bib.bib20)]还将神经坍缩与迁移学习和微调联系起来,包括受坍缩启发的微调、可迁移性估计以及对下游几何复杂性的分析,但这些研究主要集中在最后一层坍缩、可迁移性或下游微调行为方面。相比之下,我们从任务特定的检查点出发研究模型合并,每个检查点都是在特定下游任务上微调至收敛的。我们建立了任务向量的 Gram 矩阵与对应激活的二阶矩统计量之间的模块级对齐关系,并利用它推导出带有闭式解的 BMM 无数据变体。  

## 3 问题定义  

#### 符号表示。  
令 θ<sub>pre</sub> ∈ R<sup>d</sup> 表示预训练基础模型的参数,{θ<sup>(t)</sup>}<sub>t=1</sub><sup>T</sup> 表示从 θ<sub>pre</sub> 在不同下游任务上微调得到的 T 个不同模型的参数。所有模型共享相同架构,并在相同的参数空间 R<sup>d</sup> 中操作。  

#### 任务向量。  
遵循 Task Arithmetic (TA)[3](https://arxiv.org/html/2605.12843#bib.bib3)] 的框架,我们使用任务向量来表示任务特定的参数偏移。具体地,第 t 个模型的任务向量定义为 τ<sup>(t)</sup> = θ<sup>(t)</sup> − θ<sub>pre</sub>,其中 t ∈ {1,⋯,T}。  

#### 目标。  
给定一个预训练模型 θ<sub>pre</sub> 和任务向量 {τ<sup>(t)</sup>}<sub>t=1</sub><sup>T</sup>,我们的目标是设计一个聚合策略 A,将 T 个任务向量组合成一个单一的合并模型,参数化为:  
θ<sub>merged</sub> = θ<sub>pre</sub> + A(τ<sup>(1)</sup>,⋯,τ<sup>(T)</sup>),          (1)  
使得合并模型尽可能保留所有微调模型的任务特定能力。我们在无法访问原始任务特定训练数据的情况下考虑模型合并,因此多任务学习不适用。相反,我们研究两种标准的模型合并设置:(i) 数据辅助,其中有一个小型*无标签*校准集可用于指导合并;(ii) 无数据,其中合并过程本身不使用任何辅助数据。遵循 TA[3](https://arxiv.org/html/2605.12843#bib.bib3)] 的开创性工作,无数据合并意味着没有使用辅助数据来估计激活统计量,而一个小型验证集仍严格用于超参数调优。  

## 4 方法论  

### 4.1 模型合并作为贝叶斯线性回归  

#### 模块级分解。  
虽然式 (1) 在完整参数空间 R<sup>d</sup> 上定义了合并目标,但深度神经网络实际上由多个不同的模块(例如自注意力或 MLP 块中的线性投影)组成。为了计算上的可处理性,我们将完整参数空间 R<sup>d</sup> 分解为模块级参数分区,由 m = {1,⋯,M} 索引。遵循 WUDI-Merging[7](https://arxiv.org/html/2605.12843#bib.bib7)] 的方法,我们的聚合策略专门关注 2D 权重矩阵,同时保持所有偏置权重不变。下面,我们将以模块级别呈现我们的合并方法,该方法同等适用于网络的所有 M 个模块。  

令 W<sub>pre</sub> ∈ R<sup>d<sub>out</sub>×d<sub>in</sub></sup> 为 M 个预训练 2D 权重矩阵之一。我们将其模块级任务向量定义为第 t 个任务的参数偏移 U<sup>(t)</sup> = W<sup>(t)</sup> − W<sub>pre</sub>。我们的核心目标是聚合这些任务特定更新 {U<sup>(t)</sup>}<sub>t=1</sub><sup>T</sup> 为单个合并任务向量 U,使得最终的合并模块参数化为:  
W<sub>merged</sub> = W<sub>pre</sub> + s · U,          (2)  
其中 s 是一个缩放超参数,在验证集上调优。  

#### 基于激活的回归。  
我们将合并模块级任务向量 U 的估计构建为一个基于激活的回归问题。在数据辅助设置中,我们为第 t 个任务收集 N 个代表性激活,记为 {x<sub>n</sub><sup>(t)</sup>}<sub>n=1</sub><sup>N</sup>,其中 x<sub>n</sub><sup>(t)</sup> ∈ R<sup>d<sub>in</sub></sup>。这些激活通过将任务特定的无标签校准数据传入相应的微调模型来收集。为了保留任务特定能力,我们的目标是使由合并任务向量 U 诱导的残差输出与由原始任务特定任务向量 {U<sup>(t)</sup>}<sub>t=1</sub><sup>T</sup> 诱导的残差输出对齐。具体地,我们将残差输出定义为 y<sub>n</sub><sup>(t)</sup> = U<sup>(t)</sup> x<sub>n</sub><sup>(t)</sup> = (W<sup>(t)</sup> − W<sub>pre</sub>) x<sub>n</sub><sup>(t)</sup>。我们将所有 T 个任务的激活向量按列拼接,构建激活矩阵 X,类似地构建残差输出矩阵 Y:  
X = [ x<sub>1</sub><sup>(1)</sup>, ..., x<sub>N</sub><sup>(1)</sup>, ..., x<sub>1</sub><sup>(T)</sup>, ..., x<sub>N</sub><sup>(T)</sup> ],  
Y = [ y<sub>1</sub><sup>(1)</sup>, ..., y<sub>N</sub><sup>(1)</sup>, ..., y<sub>1</sub><sup>(T)</sup>, ..., y<sub>N</sub><sup>(T)</sup> ].          (3)  

我们假设一个线性观测模型,其中残差输出 Y 是由合并模块级任务向量 U 作用于 X 产生的,并受到高斯噪声 E 的污染:  
Y = U X + E,          (4)  
其中噪声矩阵满足 E<sub>:,j</sub> ∼ N(0, β<sup>−1</sup> I) 对于每个列索引 j 独立。在该线性观测模型下,给定 U 时观测到 Y 的似然函数为:...

相似文章

模型合并作为微调参数空间中的概率推理

arXiv cs.LG

本文将模型合并视为在专家乘积场景下的概率推断,表明现有方法是其特例,并提出一种重尾柯西专家设计,能更准确地捕捉实际残差行为,在多个任务和架构上相对于现有最优基线取得了显著改进。

基于输出空间投影的模型合并

arXiv cs.LG

本文提出了一种新的模型合并框架,将问题转化为关于残差更新的凸二次规划,以最小化平方输出的校准目标。该框架涵盖现有的启发式方法,并提供了一种闭式诊断指标来预测合并质量,在语言和视觉基准测试中持续取得改进。

通过可操控模型合并增强多语言推理

arXiv cs.CL

本文提出ST-Merge,一种可操控的模型合并框架,利用门控交叉注意力机制自适应地调节多语言模型和推理模型的贡献,在涵盖21种语言的多语言推理基准测试中优于固定合并方法。