通过激活引导剪枝实现跨模型尺度的无训练知识迁移

arXiv cs.LG 论文

摘要

本文提出激活-剪枝-合并(APM),一个无训练的跨尺度融合框架,通过使用更大的供体模型来改进较小的语言模型,无需语义对齐,在多个基准测试中取得了性能提升。

arXiv:2608.13596v1 公告类型:新 摘要:异构模型融合旨在结合在任务、初始化、架构或规模上不同的模型。我们研究了一个未充分探索的跨尺度设置:尽管架构存在显著不匹配,但使用更强的供体来改进小型受体语言模型。我们询问是否可以在没有显式神经元级语义对齐的情况下转移有用的能力。基于观察到将大模型截断到较小的架构并注入微小混合权重已经可以改进受体,我们提出了激活-剪枝-合并(APM),一个激活引导的跨尺度融合框架。APM在供体上构建任务条件化的激活图,选择显著的层、隐藏维度、注意力头和MLP神经元,将其剪枝以适应受体架构,并使用微小的插值系数将得到的供体片段注入原始受体。这种表述将供体视为集中功能组件的来源,而不是需要精确的结构移植。在涵盖推理、数学、代码生成、指令遵循和分类的16个基准测试中,APM将原始3B受体的整体平均准确率从55.5%提高到60.6%。RTE准确率从64.3%增加到82.3%,QNLI从52.3%增加到65.7%,BoolQ从70.8%增加到79.2%。对注入比率和顺序多阶段融合的分析进一步表明,激活引导的提取提高了可转移供体片段的质量,同时保持了小比率融合机制。这些结果提供了证据,表明当供体贡献足够集中且仔细选择时,跨尺度异构融合可以在没有显式语义对齐的情况下成功。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:09

# 通过激活值引导剪枝实现跨模型尺度的无训练知识迁移
来源:https://arxiv.org/html/2608.13596
###### 摘要

异构模型融合结合了在任务、初始化、架构或规模上存在差异的模型。我们研究了一个尚未充分探索的跨尺度场景:尽管存在显著的架构不匹配,仍能使用更强大的供体模型来改进较小的受体语言模型。我们探讨在没有显式逐神经元语义对齐的情况下,是否能转移有用的能力。基于将大模型截断为较小架构并以极小混合权重注入能改进受体这一观察,我们提出了 **激活-剪枝-融合**(APM),一个用于跨尺度融合的激活值引导框架。APM在供体模型上构建任务条件激活图,选择显著的层、隐藏维度、注意力头和MLP神经元,将其剪枝以匹配受体架构,然后使用微插值系数将得到的供体切片注入原始受体模型。该方法将供体视为浓缩功能组件的来源,而非要求精确的结构移植。在涵盖推理、数学、代码生成、指令跟随和分类的16个基准测试中,APM将原始3B受体模型的整体平均准确率从55.5%提升至60.6%。RTE准确率从64.3%提升至82.3%,QNLI从52.3%提升至65.7%,BoolQ从70.8%提升至79.2%。对注入比例和顺序多阶段融合的分析进一步表明,激活值引导的提取提升了可转移供体切片的质量,同时保持了小比例融合的特性。这些结果表明,当供体贡献足够集中且经过精心选择时,无需显式语义对齐,跨尺度异构融合也能成功。

参见图注图1:交集-融合(IM)与激活值引导的跨尺度融合对比。
## 引言

模型融合将多个已训练模型的能力结合在一个模型中,并已被证明对于整合微调检查点、组合特定任务技能以及构建多任务或领域专用模型是有效的(Wortsman等,2022 (https://arxiv.org/html/2608.13596#bib.bib47);Ilharco等,2023 (https://arxiv.org/html/2608.13596#bib.bib23);Yadav等,2023 (https://arxiv.org/html/2608.13596#bib.bib48);Yu等,2024 (https://arxiv.org/html/2608.13596#bib.bib51))。

经典的同构融合方法通过参数平均、向量运算、冲突解决或稀疏化来合并检查点或任务向量(Wortsman等,2022 (https://arxiv.org/html/2608.13596#bib.bib47);Matena和Raffel,2022 (https://arxiv.org/html/2608.13596#bib.bib29);Ilharco等,2023 (https://arxiv.org/html/2608.13596#bib.bib23);Yadav等,2023 (https://arxiv.org/html/2608.13596#bib.bib48);Yu等,2024 (https://arxiv.org/html/2608.13596#bib.bib51))。然而,它们要求模型共享相同的架构和兼容的参数化,这极大地限制了可直接融合的模型集合。异构迁移的方法包括知识蒸馏和基于适配器或投影的转换,而基于对齐的方法则在融合前建立特征或语义对应关系(Hinton, Vinyals, 和 Dean,2015 (https://arxiv.org/html/2608.13596#bib.bib21);Pfeiffer等,2021 (https://arxiv.org/html/2608.13596#bib.bib31);Gu等,2025 (https://arxiv.org/html/2608.13596#bib.bib15);Stoica等,2024 (https://arxiv.org/html/2608.13596#bib.bib37))。然而,其中许多方法需要额外的训练、学习到的转换、优化或显式的跨模型对齐,使得异构融合变得更加复杂。

先前工作引入了 **交集-融合**(IM),该方法通过保留前导参数索引直接将大模型截断为目标架构,并将得到的供体切片以极小的混合权重注入到较小的模型中(Fan等,2026 (https://arxiv.org/html/2608.13596#bib.bib12))。不同规模的大语言模型表现出一种令人惊讶的迁移能力:一个更强的供体可以在没有神经元级语义对齐的情况下改进较小的受体。从这个角度看,IM提供了一个粗略选择的供体切片。基于这一基线,我们提出了一个更尖锐的问题:我们能否提取一个更具任务相关性的供体切片,使得相同的微注入预算产生更大的提升?

我们提出了 **激活-剪枝-融合**(APM),一个无训练框架,无需显式的逐神经元语义对齐,即可从强大的供体中提取任务相关结构(图1 (https://arxiv.org/html/2608.13596#S0.F1))。给定任务数据,APM首先运行供体模型并在指定的令牌范围内收集激活统计数据。然后,它使用生成的激活图来选择显著的层、隐藏维度、注意力头和MLP神经元。这些组件被剪枝并排列成受体的精确架构,随后,得到的供体切片被注入原始受体模型,并使用一个微小的插值系数。APM在融合前集中了供体贡献,同时保留受体作为融合模型的主要组成部分。

在推理、数学、代码生成、指令跟随和分类任务上的实验表明,APM不仅提升了原始的3B受体模型,也优于IM方法。在自然语言推理和推理基准测试上的提升尤为显著。在小注入比例下,跨尺度异构融合的行为不太像需要严格语义对齐的逐神经元移植,而更像向受体添加一个浓缩的供体提取物。对注入比例和顺序多阶段融合的进一步分析表明,激活值引导的提取在小融合系数下仍然有效,并且APM融合的模型可以继续受益于后续的供体注入。这些发现共同支持了“浓缩迁移”作为理解跨尺度异构融合的一个有用视角。

我们的贡献有三方面:

1. 1\. APM框架。我们引入了APM,一个激活值引导的异构融合流程,它结合了供体激活映射、目标形状剪枝和向较小受体模型的微注入。在相同的微注入规则下,激活值引导的剪枝将跨尺度迁移提升到超越IM的水平,表明APM提取了更有效且与任务相关的供体切片。
2. 2\. 迁移视角。我们的结果支持一种“浓缩迁移”观点:小比例异构融合依赖于集中的任务相关供体信息,而非严格的逐神经元语义对应。这解释了为什么在相同的微注入预算下,激活值引导的选择可以优于粗略的截断。
3. 3\. 广泛评估。我们在不同的基准测试系列、注入比例和顺序融合设置下评估了APM,涵盖数学推理、代码生成、指令跟随、语言理解、常识知识和多任务推理。结果表明,其提升超越了单一基准测试或融合配置,包括在重复小比例注入的情况下。

## 相关工作

### 同构模型融合

同构模型融合结合了共享架构模型的参数或任务更新(Lu等,2024 (https://arxiv.org/html/2608.13596#bib.bib28);Song 和 Zheng,2026 (https://arxiv.org/html/2608.13596#bib.bib35);Yang等,2026 (https://arxiv.org/html/2608.13596#bib.bib50)),其几何基础在于兼容解之间的低损耗路径和线性模式连通性(Garipov等,2018 (https://arxiv.org/html/2608.13596#bib.bib14);Frankle等,2020 (https://arxiv.org/html/2608.13596#bib.bib13))。检查点平均和Fisher加权融合直接合并参数,而任务算术、TIES-Merging、DARE、Model Breadcrumbs和任务定位则通过对任务向量进行算术、修剪、符号解决、稀疏化或选择性更新来操作(Wortsman等,2022 (https://arxiv.org/html/2608.13596#bib.bib47);Matena 和 Raffel,2022 (https://arxiv.org/html/2608.13596#bib.bib29);Ilharco等,2023 (https://arxiv.org/html/2608.13596#bib.bib23);Yadav等,2023 (https://arxiv.org/html/2608.13596#bib.bib48);Yu等,2024 (https://arxiv.org/html/2608.13596#bib.bib51);Davari 和 Belilovsky,2024 (https://arxiv.org/html/2608.13596#bib.bib9);He等,2024 (https://arxiv.org/html/2608.13596#bib.bib17))。补充性工作研究了无数据知识融合、任务子空间匹配和任务信息定位(Jin等,2023 (https://arxiv.org/html/2608.13596#bib.bib24);Tam, Bansal, 和 Raffel,2024 (https://arxiv.org/html/2608.13596#bib.bib40);Wang等,2024 (https://arxiv.org/html/2608.13596#bib.bib44)),而基准测试和规模分析则考察了专用LLM融合、模型选择以及融合次数或模型规模增长时的性能(He等,2025 (https://arxiv.org/html/2608.13596#bib.bib18);Yadav等,2024 (https://arxiv.org/html/2608.13596#bib.bib49);Wang等,2025 (https://arxiv.org/html/2608.13596#bib.bib45);Hitit, Girrbach, 和 Akata,2026 (https://arxiv.org/html/2608.13596#bib.bib22))。无训练对齐方法如Git Re-Basin和REPAIR在融合结构兼容模型之前建立参数对应关系或修正激活统计数据(Ainsworth, Hayase, 和 Srinivasa,2023 (https://arxiv.org/html/2608.13596#bib.bib1);Jordan等,2023 (https://arxiv.org/html/2608.13596#bib.bib25))。

### 异构和跨尺度模型融合

异构融合涉及具有不同架构或规模的模型(Chen等,2026 (https://arxiv.org/html/2608.13596#bib.bib4);Soro等,2026 (https://arxiv.org/html/2608.13596#bib.bib36));HM3通过融合具有不同输出的相同架构分类器来处理标签空间异构性(Hackmann,2024 (https://arxiv.org/html/2608.13596#bib.bib16))。知识蒸馏通过在供体的输出分布上训练受体来转移行为,而不合并不匹配的参数(Hinton, Vinyals, 和 Dean,2015 (https://arxiv.org/html/2608.13596#bib.bib21)),而基于适配器的方法学习特定任务的中间件并通过额外的融合机制组合它们(Pfeiffer等,2021 (https://arxiv.org/html/2608.13596#bib.bib31))。基于对齐的方法在融合前建立语义、特征或结构对应关系(Gu等,2025 (https://arxiv.org/html/2608.13596#bib.bib15))。ZipIt!通过匹配和合并中间特征扩展了无训练跨任务融合,同时适应有限的架构差异(Stoica等,2024 (https://arxiv.org/html/2608.13596#bib.bib37))。其他方法将知识封装为模块化技能、融合聊天模型能力,或优化异构多模态模型的融合系数(Du等,2025a (https://arxiv.org/html/2608.13596#bib.bib10);Wan等,2024a (https://arxiv.org/html/2608.13596#bib.bib41), b (https://arxiv.org/html/2608.13596#bib.bib42);Du等,2025b (https://arxiv.org/html/2608.13596#bib.bib11))。许多这类方法需要训练、优化、学习到的中间件或显式对应;APM则使用激活值来对供体内部组件进行排序,无需训练或跨模型特征或逐神经元语义对齐。

### 交集-融合

Fan等人(2026 (https://arxiv.org/html/2608.13596#bib.bib12))提出了 **交集-融合**(IM),该方法保留供体的前导层和参数索引,直到供体匹配受体形状,然后应用非常小的线性插值系数。IM表明,目标形状的供体切片无需训练或显式语义对齐即可转移能力。然而,其静态的前对齐提取并未基于评估的任务进行条件化。APM保留相同的跨尺度注入机制,但用任务条件化的供体选择替换了这一规则。

### 激活值引导的结构化剪枝

基于激活值的重要性估计广泛用于结构化剪枝。Minitron根据校准激活值对层、头、隐藏维度和MLP神经元进行评分,而SliceGPT和Wanda提供了互补的表示或激活感知剪枝策略(Muralidharan等,2024 (https://arxiv.org/html/2608.13596#bib.bib30);Ashkboos等,2024 (https://arxiv.org/html/2608.13596#bib.bib2);Sun等,2023 (https://arxiv.org/html/2608.13596#bib.bib38))。这些方法优化了一个独立的压缩模型。而APM则分析任务条件化的供体,提取受体形状的切片,并将其微注入一个独立训练的受体中。其新颖之处在于,在无训练的跨尺度融合中,使用激活值显著性进行面向迁移的供体选择。

## 方法

参见图注图2:APM中任务条件激活分析和层选择概述。任务示例分为生成式和多项选择设置。激活策略指定哪些提示、生成或答案选择令牌有助于激活统计数据。生成的分数支持三种目标深度剪枝策略:first-nn、均匀和激活引导的层选择。
### 预备知识

#### 问题形式化

设 \(M_s = (\mathcal{A}_s, \theta_s)\) 为小型受体模型,\(M_l = (\mathcal{A}_l, \theta_l)\) 为来自同一模型家族的较大供体。它们的深度、宽度和注意力结构不同。给定任务数据 \(\mathcal{D}\),我们寻求一个融合模型,该模型保留 \(M_s\) 的架构和推理成本,同时吸收任务相关的供体组件。形式上,我们寻求一个无训练的提取算子 \(\mathcal{P}_{\mathcal{D}}: \theta_l \mapsto \tilde{\theta}_l\),使得 \(\tilde{\theta}_l\) 具有架构 \(\mathcal{A}_s\) 并且可以直接与 \(\theta_s\) 融合。APM通过任务条件激活分析和目标形状剪枝,然后进行微注入来实例化这个算子。图2 (https://arxiv.org/html/2608.13596#Sx3.F2) 说明了提取阶段。

#### 交集-融合

**交集-融合**(IM)是APM的直接起点(Fan等,2026 (https://arxiv.org/html/2608.13596#bib.bib12))。令 \(\mathcal{I}^{\mathrm{front}}(\mathcal{A}_l, \mathcal{A}_s)\) 包含受体所需的每个张量维度的前导供体层和前导索引。IM通过以下方式构建目标形状的供体:
\[
\theta_l^{\mathrm{IM}} = \mathcal{P}_{\mathrm{front}}\left(\theta_l; \mathcal{I}^{\mathrm{front}}(\mathcal{A}_l, \mathcal{A}_s)\right), \quad \operatorname{shape}(\theta_l^{\mathrm{IM}}) = \operatorname{shape}(\theta_s).
\]
并使用一个小的插值系数将其注入:
\[
\theta_{\mathrm{IM}} = (1 - \mu)\theta_s + \mu\theta_l^{\mathrm{IM}}, \qquad 0 < \mu \ll 1.
\]
因此,IM无需训练或语义对齐即可解决跨尺度张量不匹配,但其供体选择是固定的且与任务无关。APM将公式2 (https://arxiv.org/html/2608.13596#Sx3.E2) 作为受控融合规则,并用任务条件算子 \(\mathcal{P}_{\mathcal{D}}\) 替换了固定的前对齐算子 \(\mathcal{P}_{\mathrm{front}}\)。

相似文章