我们是否在合并正确的模型?专家训练时长对LLM模型合并的影响
摘要
本文挑战了关于模型合并中领域专家应训练至最优验证损失的常见假设,表明最优训练时长在很大程度上取决于合并方法。简单平均法会因过拟合而性能下降,而基于稀疏化的方法则能从超出最优点的训练中获益。研究建议训练时长与合并方法应联合选择。
arXiv:2607.11997v1 公告类型:新
摘要:多任务模型合并将单独训练的专家模型组合成一个单一模型,无需共同训练即可处理所有任务。标准做法是在专家模型达到最优验证损失时进行合并。我们通过系统研究领域专家的训练时长如何影响合并模型的质量来挑战这一惯例。我们在五个领域(数学、代码、指令遵循、多语言和安全)上对专家模型进行微调,涉及三种模型规模(Qwen 3.5 0.8B、2B 和 4B),保存从最优训练步数的 25% 到 500% 的检查点,并在每个时长下评估五种合并方法。我们的发现揭示了一种显著的方法依赖模式:简单平均法会因过拟合而急剧下降,而基于稀疏化的方法在远超验证最优点的训练中达到最佳性能。我们通过偏差-方差分解分析对此进行了形式化,类比随机森林——其平均法受益于高方差的个体学习器。这些结果表明,训练时长和合并方法应联合选择,而非独立决定。
查看缓存全文
缓存时间: 2026/07/15 04:17
# 我们合并的模型是正确的吗?专家训练时长对LLM模型合并的影响
来源:https://arxiv.org/html/2607.11997
###### 摘要
多任务模型合并将单独训练的专家模型组合成一个能处理所有任务的单一模型,而无需共同训练。标准实践是在专家的最佳验证损失点进行合并。我们通过系统研究领域专家的训练时长如何影响合并模型的质量来挑战这一惯例。我们在三个模型规模(Qwen 3.5 0.8B、2B 和 4B)上对五个领域(数学、代码、指令遵循、多语言和安全)的专家进行微调,从最佳训练步数的25%到500%保存检查点,并在每个时长评估五种合并方法。我们的发现揭示了一种显著的、依赖于方法的模式:简单平均随着过拟合急剧下降,而基于稀疏化的方法在远超验证最优点的位置达到最佳性能。我们通过偏差-方差分解分析形式化了这一现象,并与随机森林进行类比,其中平均受益于高方差的个体学习器。这些结果表明,训练时长和合并方法应联合选择,而非独立选择。
## 1 引言
模型合并已成为一种将单独训练的专家模型组合成单一多任务模型的实用方法(Wortsman et al., 2022 (https://arxiv.org/html/2607.11997#bib.bib1);Ilharco et al., 2023 (https://arxiv.org/html/2607.11997#bib.bib2))。通过直接在权重空间操作,合并避免了多任务联合训练的计算开销以及随之而来的数据共享需求。与模型集成或混合专家方法不同,权重空间合并不会增加推理延迟或内存占用,因为所有单独的专家都被合并到一个模型中。这些优势使得模型合并对于训练成本高昂且推理延迟必须保持较低的大型语言模型(LLM)尤其有吸引力。
模型合并文献中的一个常见假设是,领域专家在合并前应训练至最佳验证损失。这一惯例隐含在主要基准测试和方法比较中:专家使用标准的早停或固定轮次协议进行微调,然后在最佳验证检查点冻结后再进行组合(He et al., 2025 (https://arxiv.org/html/2607.11997#bib.bib5);Yadav et al., 2023 (https://arxiv.org/html/2607.11997#bib.bib3);Yu et al., 2024 (https://arxiv.org/html/2607.11997#bib.bib4))。隐含的假设是,每个专家在其个体最优状态冻结时,将其最佳知识贡献给合并模型。
最近的工作开始质疑这一假设:Horoi et al. (2025 (https://arxiv.org/html/2607.11997#bib.bib6)) 展示了,对于视觉(CLIP)和编码器-解码器(T5)模型,训练远超其个体最优点的专家实际上会*损害*合并模型。我们针对使用参数高效适配器微调的仅解码器LLM重新审视这个问题,并发现了一个更微妙的图景:合适的训练时长强烈依赖于合并方法。
本文挑战了这一假设。从集成学习理论中汲取类比,随机森林有意将每棵决策树生长到高深度后再平均预测(Breiman, 2001 (https://arxiv.org/html/2607.11997#bib.bib20)),我们假设合并的最佳训练时长可能不同于个体模型性能的最佳时长。我们研究当合并微调后的LLM专家时,权重空间中是否也存在类似的机制:某些合并方法是否像随机森林中的平均步骤一样,受益于故意过度训练的专家?
我们关注小型开源LLM,因为它们在工业微调流程中很常见。企业通常微调8B以下的模型,以一小部分成本和延迟匹配或超越更大通用模型的任务特定质量(Belcak et al., 2025 (https://arxiv.org/html/2607.11997#bib.bib22);Abdin et al., 2024 (https://arxiv.org/html/2607.11997#bib.bib24))。模型合并在这种场景下尤其相关,因为部署多个专用模型通常比部署一个具有相当能力的合并模型成本更高。
我们在3个模型规模(Qwen 3.5 0.8B, 2B, 4B)、5个任务领域(数学、代码、指令遵循、多语言、安全)和5种合并方法(简单平均、任务算术、TIES-Merging、DARE+TIES、Greedy Soup)上进行了系统研究。我们的贡献如下。
首先,我们系统研究了领域专家的训练时长如何影响合并后的仅解码器LLM的质量,涵盖了不同的模型规模、领域和合并方法。其次,我们展示了最佳训练时长依赖于方法:简单平均在训练不足的专家处达到峰值,任务算术和Greedy Soup处于中间区域,而基于稀疏化的方法(TIES, DARE+TIES)在过拟合的专家处达到峰值。我们通过偏差-方差-协方差分解和模式连通性分析解释了这些结果,表明过拟合的专家提供了更高的多样性,这有利于具有干扰解决机制的合并方法,类似于方差减少使随机森林中的过拟合树受益。
总之,这些发现转化为实际指导:在使用基于稀疏化的合并方法时,将每个专家训练到验证最优点之后,而不是提前停止。
## 2 相关工作
权重空间模型合并无需重新训练即可组合单独微调的模型。Model Soups (Wortsman et al., 2022 (https://arxiv.org/html/2607.11997#bib.bib1)) 证明了平均使用不同超参数微调的模型权重可以提高准确性和鲁棒性。最近的工作提出了超越简单平均的合并方法。Task Arithmetic (Ilharco et al., 2023 (https://arxiv.org/html/2607.11997#bib.bib2)) 形式化了任务向量(来自预训练的权重增量),可以相加来组成多任务模型。TIES-Merging (Yadav et al., 2023 (https://arxiv.org/html/2607.11997#bib.bib3)) 通过修剪、符号选举和不相交合并来解决任务向量之间的干扰。DARE (Yu et al., 2024 (https://arxiv.org/html/2607.11997#bib.bib4)) 在合并前随机丢弃并重新缩放delta参数。最近的MergeBench套件 (He et al., 2025 (https://arxiv.org/html/2607.11997#bib.bib5)) 提供了跨5个领域的8种合并方法的全面评估,我们采用该套件进行实验。
这些工作大多固定合并配方,并通过标准微调协议(带有早停或为个体模型质量选择的固定预算)生成专家,将训练时长的选择视为与合并步骤正交。ATM (Zhou et al., 2024 (https://arxiv.org/html/2607.11997#bib.bib7)) 则将调优和合并交错进行,将任务算术重新解释为朝向联合目标的单一噪声梯度步骤,这同样将优化轨迹与合并耦合。我们则固定合并方法,显式变化专家训练时长,并表明这一维度实际上与合并方法的选择紧密耦合。
另一条工作线研究单一训练轨迹上的权重平均。Stochastic Weight Averaging (SWA) (Izmailov et al., 2018 (https://arxiv.org/html/2607.11997#bib.bib9)) 平均训练后期的检查点以达到更泛化的最小值,LAWA (Kaddour, 2022 (https://arxiv.org/html/2607.11997#bib.bib12)) 将其扩展为维护一个最近检查点的FIFO队列,即使单个检查点已过验证最优点也能获得增益。与我们的动机最直接相关的是,Post-Hoc Reversal (Ranjan et al., 2024 (https://arxiv.org/html/2607.11997#bib.bib11)) 证明了验证最优的单个模型检查点并不是这些模型集成的验证最优检查点,这表明为个体模型设计的选择标准一旦涉及聚合就可能产生误导。所有这些工作研究的是*单一轨迹时间*平均(单任务内)。而我们研究的是*跨任务*合并,其中专家在不相交的数据上训练,并寻找合并模型的停止规则。
与我们工作最直接相关的是,Horoi et al. (2025 (https://arxiv.org/html/2607.11997#bib.bib6)) 也变化了跨合并方法的专家训练时长,并发现过训练的专家在完整微调和LoRA下会损害CLIP和T5模型的合并,将其效应追溯到合并丢弃的困难样本的记忆化。我们的研究检验了同样的问题,但针对使用量化低秩适配器微调的、规模显著更大的仅解码器LLM,并发现这种情况下的图景是依赖于方法的;我们在第4节 (https://arxiv.org/html/2607.11997#S4) 讨论与他们发现的关系。DiWA (Rame et al., 2022 (https://arxiv.org/html/2607.11997#bib.bib10)) 为权重平均模型提供了偏差-方差-协方差分解,表明当方差主导误差预算时平均成功。Tran et al. (2026 (https://arxiv.org/html/2607.11997#bib.bib17)) 通过这种分解显式分析了模型汤。我们应用这一框架来理解为什么过拟合的专家可能有益于基于稀疏化的模型合并方法。
## 3 实验设置
我们使用Qwen 3.5模型家族 (Qwen Team, 2026 (https://arxiv.org/html/2607.11997#bib.bib25)) 的三个规模:0.8B、2B和4B总参数量。所有专家使用QLoRA (Dettmers et al., 2024 (https://arxiv.org/html/2607.11997#bib.bib18)) 微调,即在4位量化基础模型之上,秩r=16的低秩适配器,针对所有注意力和MLP投影模块。我们使用恒定的学习率2×10⁻⁴,带100步线性预热,有效批次大小为8,优化器为AdamW。无衰减的恒定调度确保学习率在验证最优损失检查点之后仍然活跃,允许每个专家过拟合。
遵循MergeBench (He et al., 2025 (https://arxiv.org/html/2607.11997#bib.bib5)) 的设置,我们采用5个任务领域,每个领域有专门的微调数据集和评估基准。对于每个数据集,我们仅使用该领域的训练数据微调一个Qwen 3.5专家。所有单独的专家随后使用全部5个领域的LoRA适配器进行合并。我们在四个基于准确率的领域上聚合指标;安全领域测量拒绝回答率(越高越好),在第4.2节 (https://arxiv.org/html/2607.11997#S4.SS2) 报告。
对于每个领域和模型规模,我们独立确定验证最优点T*,定义为在该领域保留验证集(1000个样本)上损失最小的训练步数。由于T*是分别按领域和规模选择的,其对应的绝对步数在各专家之间不同,因此所有训练时长均表示为每个专家自身T*的倍数,而非绝对步数。我们继续训练至5×T*,并在8个检查点保存LoRA适配器:{0.25, 0.5, 0.75, 1.0, 1.5, 2.0, 3.0, 5.0} × T*,涵盖从严重训练不足到极度过拟合的专家。
| 领域 | 训练数据 | 评估基准 | 指标 |
|------|----------|----------|------|
| 数学 | DART-Math (Wei et al., 2024) | GSM8K (Cobbe et al., 2021) | 精准匹配准确率 |
| 代码 | Magicoder (Luo et al., 2024) | HumanEval (Chen et al., 2021) | Pass@1 |
| 指令 | TULU-3 (Lambert et al., 2024) | IFEval (Zhou et al., 2023) | 提示级别准确率 |
| 多语言 | Aya (Singh et al., 2024) | ARC (Clark et al., 2018) | 归一化准确率 |
| 安全 | BeaverTails (Ji et al., 2024) | HarmBench (Mazeika et al., 2024) | 拒绝回答率 |
表1:任务领域、数据集和基准。训练数据集被子采样到10K训练样本和1K验证样本。
我们评估了5种属于不同家族的合并方法:
- **Simple Averaging** (Wortsman et al., 2022 (https://arxiv.org/html/2607.11997#bib.bib1)):专家的等权重线性组合(wi=1/N)。
- **Task Arithmetic** (Ilharco et al., 2023 (https://arxiv.org/html/2607.11997#bib.bib2)):在组合前将任务向量乘以λ,λ∈{0.5,1.0,1.5}通过网格搜索选择。
- **TIES** (Yadav et al., 2023 (https://arxiv.org/html/2607.11997#bib.bib3)):修剪小幅度参数,解决符号冲突,以密度k=0.5合并值。
- **DARE+TIES** (Yu et al., 2024 (https://arxiv.org/html/2607.11997#bib.bib4)):在TIES合并前随机丢弃并重新缩放delta参数,密度k=0.5。
- **Greedy Soup** (Wortsman et al., 2022 (https://arxiv.org/html/2607.11997#bib.bib1)):迭代地向合并中添加专家,仅在专家能改善合并模型在保留集上的分数时保留。
## 4 结果
这里我们首先展示合并模型作为训练时长函数的平均多领域准确率结果,按合并方法和模型规模细分。我们聚合了四个领域的质量分数:数学、代码、指令、多语言。完整结果见附录A (https://arxiv.org/html/2607.11997#A1)。然后,我们展示HarmBench上拒绝回答率(%)随训练时长的变化结果。
### 4.1 训练时长 vs 合并模型质量

*图1:训练时长对合并模型性能的影响。每条线代表一种合并方法;x轴显示训练步数(以每专家的最优验证检查点T*的倍数表示)。绿色阴影表示训练不足区域(<T*)。结果基于四个基于准确率的领域平均。最佳T步数因方法而异。*
图1 (https://arxiv.org/html/2607.11997#S4.F1) 中的结果揭示了一种显著的、依赖于方法的模式。简单平均在训练不足区域(0.25–0.75×T*)达到最佳性能,并随着训练时间延长而退化,在5×T*时平均下降14–23个百分点(在数学等个别领域高达45点)。相比之下,TIES-Merging在远超T*(0.8B和2B为1.5–3×T*,4B为3–5×T*)处达到峰值,超过其T*分数2.5–8.7个百分点。DARE+TIES显示出相似但更平坦的轮廓,在整个训练时长内保持稳定,并略微偏好过拟合的专家。任务算术处于中间区域:它在某些领域(尤其是数学,在0.25×T*处达到峰值)退化,但在其他领域容忍中等程度的过拟合。Greedy Soup基于验证改进选择性包含专家,对于较小的LLM规模倾向于训练不足的专家,但在4B时显示出更平衡的选择。由于其贪心选择在每个训练时长包含不同的专家子集,其曲线明显不如其他方法平滑。
我们将这种差异归因于每种方法处理专家间干扰的方式。简单平均对每个专家的每个参数赋予相同权重,因此过训练专家中的任何噪声或专门化参数直接污染合并的适配器。相似文章
Extra-Merge: 追踪语言模型预训练中模型合并的 Rank-1 子空间
本文发现在 LLM 预训练轨迹中存在 Rank-1 子空间现象,并提出 Extra-Merge,一种无需训练的策略,沿该子空间外推以最小化损失,在 GPT-2 和 LLaMA 系列模型(最高 2B 参数)上实现了零样本准确率的一致提升。
模型合并作为微调参数空间中的概率推理
本文将模型合并视为在专家乘积场景下的概率推断,表明现有方法是其特例,并提出一种重尾柯西专家设计,能更准确地捕捉实际残差行为,在多个任务和架构上相对于现有最优基线取得了显著改进。
大语言模型中的模型合并扩展定律
本文建立了语言模型合并的实证扩展定律,确定了模型规模、专家数量与性能之间的幂律关系,从而能够为最佳模型组合提供预测性规划。
LLM微调中数据选择的长期影响
本文研究了多阶段LLM微调中数据选择策略的长期影响,揭示了短视选择会损害未来适应能力。为此,提出了一种长期视角感知选择(LHAS)目标以缓解这些问题。
结合语言模型何时有益?——路由、投票与多智能体混合在67个前沿模型中的共失败上限
本文揭示了多模型LLM系统的一个基本约束:准确率受制于所有模型在同一查询上同时出错的比率。在67个前沿模型中,常见指标显著低估了全错率,从而限制了投票、路由和集成策略的收益。