基于输出空间投影的模型合并
摘要
本文提出了一种新的模型合并框架,将问题转化为关于残差更新的凸二次规划,以最小化平方输出的校准目标。该框架涵盖现有的启发式方法,并提供了一种闭式诊断指标来预测合并质量,在语言和视觉基准测试中持续取得改进。
arXiv:2605.29101v1 公告类型:新
摘要:模型合并将多个微调检查点组合成单一的多任务模型,无需重新训练。现有方法(如任务算术、模型汤、TIES 和 DARE)计算效率高且经验成功,但依赖启发式设计选择,缺乏形式上的最优性保证。我们证明,合并可以表述为关于残差更新的凸二次规划,通过使用校准输入和微调模型输出,得到最小化平方输出校准目标的权重,并将现有方法作为特例包含在内。我们的框架产生了一个闭式诊断指标——选定基所捕获的残差能量比例——仅使用校准集即可预测下游合并质量。实验上,该二次规划在单层设置中匹配或优于现有方法,并且我们描述了最优基在何种情况下比更便宜的逐元素对角二次规划提供显著增益。我们通过顺序逐层算法扩展到多层合并,并在语言和视觉基准上展示了持续的改进。
相似文章
模型合并作为微调参数空间中的概率推理
本文将模型合并视为在专家乘积场景下的概率推断,表明现有方法是其特例,并提出一种重尾柯西专家设计,能更准确地捕捉实际残差行为,在多个任务和架构上相对于现有最优基线取得了显著改进。
贝叶斯模型合并
介绍贝叶斯模型合并(BMM),这是一个即插即用的双层优化框架,用于将多个任务特定的专家模型合并为一个单一模型,在视觉和语言基准测试上实现了最先进的性能。
Extra-Merge: 追踪语言模型预训练中模型合并的 Rank-1 子空间
本文发现在 LLM 预训练轨迹中存在 Rank-1 子空间现象,并提出 Extra-Merge,一种无需训练的策略,沿该子空间外推以最小化损失,在 GPT-2 和 LLaMA 系列模型(最高 2B 参数)上实现了零样本准确率的一致提升。
稀疏性诅咒:从模型合并理解RLVR模型参数空间
本文研究了合并RLVR模型中的“稀疏性诅咒”,发现稀疏更新导致近乎正交的参数方向,阻碍了聚合,并提出了SAR-Merging方法,该方法利用Fisher信息和稀疏化来解决冲突,提高在数学和编程任务上的合并性能。
大语言模型中的模型合并扩展定律
本文建立了语言模型合并的实证扩展定律,确定了模型规模、专家数量与性能之间的幂律关系,从而能够为最佳模型组合提供预测性规划。