FeatCal: 后合并模型的特征校准

Hugging Face Daily Papers 论文

摘要

FeatCal是一种校准方法,通过逐层权重更新(无需梯度下降)来缩小后合并模型的性能差距,在CLIP和GLUE基准测试上以高样本效率取得了优异结果。

模型合并将多个任务专家组合成一个模型,避免了联合训练、重新训练或部署多个专家模型,但合并后的模型往往仍然不如任务专家表现好。我们通过特征漂移(即合并模型与专家模型对同一输入产生的特征之间的差异)来研究这一性能差距。我们的理论将这一漂移分解为上游传播和局部不匹配,追踪其如何以前向顺序在后继层中传播和组合,并将最终的特征漂移与输出漂移联系起来。这一观点启发了FeatCal,它使用一个小型校准集,以前向顺序逐层校准合并后的模型权重,在减少特征漂移的同时保持与合并权重的接近,从而保留模型合并的优势。FeatCal采用高效的闭式解来更新模型权重,无需梯度下降、迭代优化或额外模块。在主要的CLIP和GLUE基准测试上,FeatCal击败了Surgery和ProbSurgery这两个最接近的后合并校准基线:在CLIP-ViT-B/32任务算术(TA)上达到85.5%对比77.0%/78.8%,在FLAN-T5-base GLUE上达到85.2%对比83.7%/82.2%。在CLIP-ViT-B/32上,每个任务8个样本即可达到82.9%,每个任务256个样本仅需53秒,比两个基线都快约4倍,展示了更好的样本效率和更低的校准成本。
查看原文
查看缓存全文

缓存时间: 2026/05/14 12:18

论文页面 - FeatCal:后融合模型的特征校准

来源:https://huggingface.co/papers/2605.13030

摘要

模型融合中的特征漂移分析催生了 FeatCal,一种通过逐层权重更新(无需梯度下降)来减小性能差距的校准方法,在基准测试中取得了更优结果,且效率更高。

模型融合(https://huggingface.co/papers?q=Model%20merging)将多个任务专家(https://huggingface.co/papers?q=task%20experts)整合为一个模型,避免了联合训练、重新训练或部署多个专家模型,但融合后的模型往往仍不及任务专家(https://huggingface.co/papers?q=task%20experts)。我们通过特征漂移(https://huggingface.co/papers?q=feature%20drift)——即融合模型与专家模型在同一输入上产生的特征之间的差异——来研究这一性能差距。我们的理论将这种漂移分解为上游传播和局部不匹配,追踪其如何按前向顺序(https://huggingface.co/papers?q=forward%20order)在后续层中传播和组合,并将最终的特征漂移(https://huggingface.co/papers?q=feature%20drift)与输出漂移联系起来。这一观点催生了 FeatCal,它使用一个小型校准集(https://huggingface.co/papers?q=calibration%20set),按前向顺序(https://huggingface.co/papers?q=forward%20order)逐层校准融合后的模型权重(https://huggingface.co/papers?q=model%20weights),在减小特征漂移(https://huggingface.co/papers?q=feature%20drift)的同时保持与融合权重接近,从而保留模型融合(https://huggingface.co/papers?q=model%20merging)的优势。FeatCal 采用高效的闭式解(https://huggingface.co/papers?q=closed-form%20solution)来更新模型权重(https://huggingface.co/papers?q=model%20weights),无需梯度下降、迭代优化或额外模块。在主要的 CLIP 和 GLUE 基准测试上,FeatCal 优于最接近的后融合校准基线 Surgery 和 ProbSurgery:在 CLIP-ViT-B/32 任务算术(TA)上达到 85.5% vs. 77.0%/78.8%,在 FLAN-T5-base GLUE 上达到 85.2% vs. 83.7%/82.2%。在 CLIP-ViT-B/32 上,每任务仅需 8 个样本即可达到 82.9%,每任务 256 个样本仅需 53 秒,比两个基线快约 4 倍,展现了更好的样本效率(https://huggingface.co/papers?q=sample%20efficiency)和更低的校准成本(https://huggingface.co/papers?q=calibration%20cost)。

查看 arXiv 页面(https://arxiv.org/abs/2605.13030)查看 PDF(https://arxiv.org/pdf/2605.13030)项目页面(https://github.com/egangu/featcal)GitHub2(https://github.com/egangu/featcal)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.13030)

在您的代理中获取本论文:

hf papers read 2605\.13030

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0

无模型链接本论文

请在模型 README.md 中引用 arxiv.org/abs/2605.13030,以便从本页面链接。

引用本论文的数据集0

无数据集链接本论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.13030,以便从本页面链接。

引用本论文的 Spaces0

无 Space 链接本论文

请在 Space README.md 中引用 arxiv.org/abs/2605.13030,以便从本页面链接。

包含本论文的收藏集1

相似文章

基于输出空间投影的模型合并

arXiv cs.LG

本文提出了一种新的模型合并框架,将问题转化为关于残差更新的凸二次规划,以最小化平方输出的校准目标。该框架涵盖现有的启发式方法,并提供了一种闭式诊断指标来预测合并质量,在语言和视觉基准测试中持续取得改进。