SHAPE: 面向稀疏混合专家大语言模型的联盟感知专家剪枝

arXiv cs.LG 论文

摘要

SHAPE提出了一种面向稀疏MoE大语言模型的联盟感知专家剪枝框架,该框架利用路由轨迹上的Shapley式归因来识别关键专家,在20-40%剪枝率下实现了有竞争力的准确率,并降低了GPU内存占用。

arXiv:2606.09886v1 公告类型:新 摘要:稀疏混合专家(MoE)大语言模型以较低的每token计算量实现了高质量,但其部署常受限于内存墙:必须保留完整的专家池以支持依赖token的路由。专家剪枝是一种直接解决方案,但先前的标准通常独立评分专家,忽略了MoE推理本质上是\emph{联盟式的},输出来源于路由的top-$k$专家组合。我们提出\textbf{SHAPE},这是一个任务驱动的剪枝框架,明确建模\emph{层内}专家协作。SHAPE将小型校准集上的路由轨迹表述为经验合作博弈,并通过观察到的top-$k$联盟上的Shapley式归因分配交互感知的专家价值,从而能够识别出对高效用协作至关重要的专家,而不仅仅是频繁出现的专家。为了在全局剪枝预算下保持MoE拓扑,SHAPE进一步引入了\emph{质量-覆盖率}选择规则,该规则在每一层保留覆盖非负Shapley质量$\alpha$比例的最小专家子集,同时使用二分法匹配目标保留率。在三个现代MoE骨干网络(Qwen3-30B-A3B、GPT-OSS-20B和DeepSeek-V2-Lite)上的多种基准测试表明,SHAPE在全局和逐层剪枝变体上持续提升了鲁棒性,在20%和40%专家剪枝率下无需额外训练即可保持有竞争力的准确率,并显著降低了GPU峰值内存占用。开源代码可在 https://github.com/Alizen-1009/Shapley-Moe 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:16

# SHAPE: 面向稀疏混合专家大语言模型的联盟感知专家剪枝
来源:https://arxiv.org/html/2606.09886
###### 摘要

稀疏混合专家(MoE)大语言模型以较低的每词元计算量实现了高质量,但其部署常受限于存储墙:必须保留完整专家池以支持基于词元的路由。专家剪枝是一种直接解决方案,但现有评估标准通常独立地对专家进行打分,忽略了 MoE 推理本质上是**联盟式**的——输出由路由选择的 top-k 专家组合共同产生。我们提出 SHAPE,一种任务驱动的剪枝框架,显式建模**层内**专家协作。SHAPE 在小规模校准集上将路由轨迹形式化为一种经验性合作博弈,并通过基于 Shapley 值的归因方式,在观测到的 top-k 联盟上分配交互感知的专家价值,从而识别出对高收益协作至关重要的专家(而非仅仅是频繁出现的专家)。为在全局剪枝预算下保持 MoE 拓扑结构,SHAPE 进一步引入**质量-覆盖**选择规则,在每层保留覆盖非负 Shapley 值 α 比例的最小专家子集,同时使用二分法匹配目标保留率。在三个现代 MoE 主干(Qwen3-30B-A3B、GPT-OSS-20B 和 DeepSeek-V2-Lite)上的多基准实验表明,SHAPE 在全局和逐层剪枝变体中持续提升鲁棒性,在 20% 和 40% 的专家剪枝下无需额外训练即可保持有竞争力的精度,并显著减少 GPU 峰值内存占用。开源代码可在 https://github.com/Alizen-1009/Shapley-Moe 获取。

## I 引言

大语言模型(LLMs)的格局已被稀疏混合专家(SMoE)架构的广泛采用所根本改变。GShard [17](https://arxiv.org/html/2606.09886#bib.bib20) 和 Switch Transformers [11](https://arxiv.org/html/2606.09886#bib.bib12) 等开创性工作,以及随后包括 gpt-oss [22](https://arxiv.org/html/2606.09886#bib.bib41) 和 DeepSeek-V3.2 [8](https://arxiv.org/html/2606.09886#bib.bib39) 在内的最先进开源模型,已证明模型容量可通过亚线性训练成本增长扩展到数千亿甚至数万亿参数。通过将总参数量与每词元活跃计算量解耦,SMoE 架构实现了模型容量与推理延迟之间的有利权衡,在复杂推理与编码任务上展现出强劲性能 [30](https://arxiv.org/html/2606.09886#bib.bib38)。

然而,尽管其计算效率优越,大规模 MoE 模型的部署仍面临一个关键瓶颈:“存储墙”。条件式计算确保了每词元浮点运算量(FLOPs)较低,但**整个**专家池必须驻留在 GPU 内存中,以支持动态、基于词元的路由决策。例如,服务于 671B 参数的 DeepSeek-V3.2 模型需要多节点 GPU 集群和 TB 级显存,无论其稀疏激活模式如何 [8](https://arxiv.org/html/2606.09886#bib.bib39)。这种高昂的内存需求从根本上限制了高容量 MoE 模型在资源受限环境中的可部署性,从而迫切需要一种训练后压缩技术,能在显著减少服务参数规模的同时,保留路由专家子网络的功能行为。

在新兴的压缩策略中,**专家剪枝**已成为一种减少混合专家模型参数规模的重要方法,通过选择性移除专家实现。与降低数值精度的量化 [12](https://arxiv.org/html/2606.09886#bib.bib37), [15](https://arxiv.org/html/2606.09886#bib.bib49) 或融合专家参数、可能改变底层功能子空间的专家合并 [18](https://arxiv.org/html/2606.09886#bib.bib22), [34](https://arxiv.org/html/2606.09886#bib.bib25) 不同,剪枝旨在通过选择推理时服务的专家子集来减小模型规模。早期剪枝方法主要依赖启发式的专家级指标,如激活频率 [4](https://arxiv.org/html/2606.09886#bib.bib32) 或门控权重幅度 [21](https://arxiv.org/html/2606.09886#bib.bib34)。近期方法则结合训练动态或激活统计来细化专家重要性估计,包括路由器权重偏移指标 [5](https://arxiv.org/html/2606.09886#bib.bib35) 和激活感知评分方法 [19](https://arxiv.org/html/2606.09886#bib.bib36), [16](https://arxiv.org/html/2606.09886#bib.bib26)。

尽管方法上有所进步,仍存在根本性的建模差距:现有剪枝标准主要采用**专家中心**视角 [28](https://arxiv.org/html/2606.09886#bib.bib43), [3](https://arxiv.org/html/2606.09886#bib.bib44), [33](https://arxiv.org/html/2606.09886#bib.bib45),隐含假设专家对模型输出的贡献是独立的。这一假设与 MoE 推理的本质相冲突,后者本质上是**联盟式**的。对于每个词元,模型输出由路由器选择的特定 top-k 专家联盟的非线性组合产生 [25](https://arxiv.org/html/2606.09886#bib.bib11)。因此,专家功能的效用根本上取决于其在路由联盟中共同激活的专家集合;一个专家可能单独效用有限,但与语义主导的专家配对时却能提供不可或缺的互补功能 [26](https://arxiv.org/html/2606.09886#bib.bib46)。相反,路由频率高的专家若其贡献被联盟中其他成员所吸纳,则可能在功能上冗余。忽视这种层内协作交互,专家中心式的剪枝可能破坏高收益联盟,导致复杂下游任务上性能不成比例地下降。

为应对这一建模局限,我们提出 SHAPE,一种基于 Shapley 值的剪枝框架,将专家选择显式建模为协作过程。SHAPE 不依赖静态的专家中心启发式,而是在校准集 [7](https://arxiv.org/html/2606.09886#bib.bib47), [23](https://arxiv.org/html/2606.09886#bib.bib48) 上将 MoE 推理形式化为一种合作博弈,其中路由选择的 top-k 专家构成一个玩家联盟。我们采用满足标准公平性公理的唯一估值方案——Shapley 值 [24](https://arxiv.org/html/2606.09886#bib.bib1),将每个专家对路由联盟效用的边际贡献进行归因。这种交互感知的估值使 SHAPE 能够区分仅被频繁选中的专家与对高收益联盟协作至关重要的专家。此外,为避免过度剪枝导致结构崩溃,我们引入一种**Shapley 质量覆盖**机制,根据协作价值的分布强制逐层保留。

参照图注 图 1:SHAPE 概述。我们在小的任务特定数据集上运行离线校准步骤,提取路由/共激活轨迹并估计协作专家贡献。基于这些估计,SHAPE 执行 Shapley 引导的质量覆盖专家选择,以剪枝冗余专家,生成紧凑的 MoE 模型用于高效推理。SHAPE 的整体工作流程如图 1 所示,突出了从专家联盟分析到基于 Shapley 值的剪枝以及剪枝后网络的过程。我们的贡献总结如下:

1. 1. **联盟专家估值**。我们引入了基于 Shapley 值的 MoE 剪枝协作公式,提供了一种有原则的机制来归因专家在路由联盟中的贡献。这项工作将剪枝从专家中心的重要性估计重新定义为联盟感知的贡献建模。
2. 2. **结构保持的剪枝策略**。我们提出一种拓扑感知的选择机制,通过根据专家累积 Shapley 值而非固定专家数量来保留专家,从而保持逐层协作能力。
3. 3. **协作剪枝的经验验证**。在包括 Qwen3-MoE、GPT-OSS 和 DeepSeek-V2-Lite 在内的现代 MoE 架构上的大量实验表明,保留专家协作对于有效压缩至关重要。SHAPE 在推理密集型基准上实现了高达 40% 的专家剪枝,且性能下降可忽略不计。

## II 相关工作

### II-A MoE 压缩与专家剪枝

MoE 大语言模型通过将词元路由至稀疏的专家子集实现**条件式计算**,但实际推理服务仍需要存储和访问庞大的专家池,导致显著的内存占用和带宽压力 [35](https://arxiv.org/html/2606.09886#bib.bib13), [20](https://arxiv.org/html/2606.09886#bib.bib14)。为降低部署成本,先前工作探索了通过结构化剪枝 [6](https://arxiv.org/html/2606.09886#bib.bib2), [9](https://arxiv.org/html/2606.09886#bib.bib15)、专家合并或重参数化 [34](https://arxiv.org/html/2606.09886#bib.bib25), [18](https://arxiv.org/html/2606.09886#bib.bib22)、量化 [15](https://arxiv.org/html/2606.09886#bib.bib49), [12](https://arxiv.org/html/2606.09886#bib.bib37) 和知识蒸馏 [29](https://arxiv.org/html/2606.09886#bib.bib9), [31](https://arxiv.org/html/2606.09886#bib.bib3) 等 MoE 压缩方法。其中,**专家剪枝**对服务特别有吸引力,因为它直接减少了必须加载、缓存和调度的专家数量,从而立即降低内存和推理开销。

近期剪枝标准通常无需训练或轻量化,且主要依赖**专家中心**的信号。SEAP [19](https://arxiv.org/html/2606.09886#bib.bib36) 利用稀疏激活统计在固定预算下剪枝专家,面向领域的方法使用少样本演示来选择最能支持目标评估的专家 [9](https://arxiv.org/html/2606.09886#bib.bib15)。虽然有效,但这些方法在很大程度上孤立地对专家进行评分,可能忽略 top-k 路由(每 MoE 层同时激活并聚合多个专家)中的交互效应。

### II-B 专家协作与路由结构化剪枝

MoE 推理的一个独特特征是其输出由路由选择的 top-k **专家联盟**聚合形成。这种联盟结构意味着专家的效用可能高度依赖于上下文:移除一个专家可能改变其余共激活专家的行为,其影响无法通过边际激活频率单独预测。受此启发,近期研究分析并利用了 MoE 中的结构化协作模式。MoE Pathfinder [32](https://arxiv.org/html/2606.09886#bib.bib18) 利用路由轨迹指导专家选择,HSDL [27](https://arxiv.org/html/2606.09886#bib.bib19) 通过编码功能角色的专家共激活结构揭示了隐藏的协作模式。这些工作表明,**层内**共激活是剪枝的有意义信号,且路由分布包含超越全局专家用法的丰富信息。

然而,现有的路由感知方法通常将轨迹或共激活模式用作启发式,而非对路由联盟下**边际贡献**的有原则度量。特别是,层内联盟效应——在任务驱动路由下,一个专家与同时激活的其他专家**组合**时有多大帮助——在剪枝目标中仍未被充分探索。我们的工作通过根据专家对路由联盟的协作贡献来评估专家价值,从而填补这一空白,做出的剪枝决策能更好地保留任务相关的协作。

### II-C 基于 Shapley 的协作归因与可扩展近似

Shapley 值 [24](https://arxiv.org/html/2606.09886#bib.bib1) 是一种经典的合作博弈论归因方法,量化每个参与者在所有联盟中的平均边际贡献。它已被应用于神经网络,用于识别负责组件并指导结构化剪枝,相较于纯基于幅度的方法在捕获冗余和交互效应方面展现出优势 [14](https://arxiv.org/html/2606.09886#bib.bib8), [1](https://arxiv.org/html/2606.09886#bib.bib7)。然而,精确计算 Shapley 值是 NP 难的,因此对于大型模型,可扩展近似至关重要。

实用的 Shapley 估计通常依赖于蒙特卡洛采样及相关估计器 [13](https://arxiv.org/html/2606.09886#bib.bib6), [10](https://arxiv.org/html/2606.09886#bib.bib5)。尽管有这些进展,大多数基于 Shapley 的方法聚焦于神经元/通道或数据估值,并未直接处理联盟形成受路由支配的条件式计算架构。MoE 模型是协作归因的自然候选,因为其推理本质上是基于联盟的(路由 top-k 专家),然而 Shapley 值尚未被系统发展为任务驱动路由分布下的专家级剪枝标准。我们的工作通过引入一种针对 MoE 路由专家联盟的高效 Shapley 风格近似,填补了这一空白,用于 MoE 专家选择。

## III 方法论

本节介绍 SHAPE,一种用于稀疏混合专家(SMoE)模型的任务导向专家剪枝框架。给定预训练的 MoE 语言模型和目标下游任务,SHAPE 在**无需重新训练**的情况下剪枝大量专家,同时保持任务性能。

SHAPE 的动机源于 SMoE 推理的联盟性质:在每个 MoE 层,路由激活一组 top-k 专家,其输出共同聚合,因此专家的价值取决于其在路由联盟中的**协作贡献**,而非孤立贡献。为捕获这种交互效应,SHAPE 执行 (i) 在小型任务特定校准集上进行**协作分析**,通过高效的 Shapley 风格近似估计逐层协作贡献,以及 (ii) **Shapley 覆盖剪枝**,选择满足全局保留率预算同时保持逐层贡献质量的紧凑专家子集。

### III-A 任务驱动校准与符号

我们考虑一个预训练的稀疏混合专家(SMoE)语言模型,具有 L 个 MoE 层。每个 MoE 层 ℓ ∈ {1,...,L} 包含固定的专家集合 Nℓ = {E1,...,En}。给定词元隐藏表示 h,层 ℓ 的路由器计算专家上的门控分数,并根据 top-k 路由策略激活固定数量 k 的专家。MoE 层的输出通过聚合所选专家输出来获得。在本工作中,我们不修改路由策略或专家参数,而是专注于预训练模型引发的路由行为。

令 T 表示下游任务集合。对于每个任务 t ∈ T,我们使用与评估集相同的提示格式构建一个小型校准数据集 Dt^cal。校准的目的不是适应模型,而是将路由策略暴露给来自

相似文章

TENP: 用于混合专家的梯形专家神经元剪枝

arXiv cs.LG

TENP 提出了一种用于混合专家大语言模型的结构化剪枝框架,该框架保留重要专家,对较不重要的专家进行神经元剪枝,从而在 Qwen 和 DeepSeek 模型上实现高稀疏度且精度损失极小。

修剪不良专家需要MAESTRO

arXiv cs.CL

本文介绍了Maestro,一种针对混合专家语言模型的结构化剪枝框架。该框架利用马尔可夫链对专家激活轨迹进行建模,实现全局感知剪枝,在50%压缩率下,性能优于基线模型最高达10.61%。

SlimQwen:探索大规模MoE模型预训练中的剪枝与蒸馏

Hugging Face Daily Papers

本文探讨了在预训练阶段压缩大规模混合专家(MoE)模型的结构化剪枝和知识蒸馏技术。研究表明,渐进式剪枝以及结合多标记预测蒸馏等策略,能够提升下游任务的性能。例如,通过将Qwen3-Next-80A3B压缩为更高效的23A2B模型,展示了这一方法的有效性。