修剪不良专家需要MAESTRO

arXiv cs.CL 论文

摘要

本文介绍了Maestro,一种针对混合专家语言模型的结构化剪枝框架。该框架利用马尔可夫链对专家激活轨迹进行建模,实现全局感知剪枝,在50%压缩率下,性能优于基线模型最高达10.61%。

arXiv:2607.08601v1 公告类型:新 摘要:稀疏激活的混合专家(MoE)语言模型通过每个Token仅激活少量参数实现了显著的推理效率,但其全部专家库始终驻留在内存中,造成了高昂的部署瓶颈。现有的结构化剪枝方法主要针对稠密Transformer设计,它们使用局部启发式方法评估专家重要性,忽略了MoE路由的相互依赖性。我们提出了MAESTRO(基于转换路由的马尔可夫链近似专家稀疏化),一种专为MoE架构设计的结构化剪枝框架。该框架将自回归专家激活轨迹建模为遍历马尔可夫链,其平稳分布编码了跨层依赖关系,从而产生全局感知的重要性启发式方法。在包括安全、偏见和伦理在内的五个不同领域的评估中,MAESTRO在严格的50%压缩条件下,平均性能保持率比最先进的基线方法高出10.61%,同时表现出显著更低的跨任务方差,这表明全局且与路由一致性的剪枝能够产生在不同任务上更一致泛化的模型。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:15

# 剪枝低效专家需有"大师"之才 来源:https://arxiv.org/html/2607.08601

Palaash Goel  
印度理工学院德里分校,印度  
goelpalaash@scai\.iitd\.ac\.in

Ayush Maheshwari  
NVIDIA,印度  
aymaheshwari@nvidia\.com

###### 摘要

稀疏激活的混合专家(MoE)语言模型通过每词元仅激活一小部分参数实现了显著的推理效率,但其全部专家库始终驻留在内存中,形成了难以部署的瓶颈。现有结构化剪枝方法主要针对密集型Transformer设计,采用局部推导的启发式规则评估专家重要性,忽视了MoE路由的相互依赖特性。我们提出**Maestro**(基于马尔可夫链的路由转移近似专家稀疏化),这是一种专为MoE架构设计的结构化剪枝框架,它将自回归的专家激活轨迹建模为遍历马尔可夫链,其平稳分布编码了跨层依赖关系,从而形成全局感知的重要性启发式。在包括安全、偏见与伦理在内的五个不同领域评估中,Maestro在严格的50%压缩率下,平均性能保持率比现有最优基线高出最多10.61%,同时跨任务方差显著更低,表明全局、与路由一致的剪枝能产生更稳定泛化于异构任务的模型。

剪枝低效专家需有"大师"之才

Palaash Goel  
印度理工学院德里分校,印度  
goelpalaash@scai\.iitd\.ac\.in

Ayush Maheshwari  
NVIDIA,印度  
aymaheshwari@nvidia\.com

Tanmoy Chakraborty  
印度理工学院德里分校,印度  
tanchak@iitd\.ac\.in

## 1 引言

稀疏激活的混合专家(MoE)架构已成为扩展大语言模型的主要方案,且不会成比例地增加推理计算量(Jiang et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib68); DeepSeek-AI, 2025 (https://arxiv.org/html/2607.08601#bib.bib64); Yang et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib65); OpenAI et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib66); NVIDIA et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib67))。通过将每个Transformer层的密集前馈模块替换为一组E个专家子网络,以及一个学习得到的路由器(该路由器将每个词元仅派发到k≪E个专家),MoE模型将参数量与每词元FLOPs解耦。此类模型通常拥有数百亿甚至上千亿参数,但每词元仅激活数十亿参数,推理吞吐量与远小于它的密集模型相当。

然而,正是这一设计选择带来了尖锐矛盾性的部署特征。虽然MoE模型在推理时计算效率高,但它们在空间上仍难以接受:全部专家库必须驻留内存,无论对任何给定词元选择了多少专家。这导致了部署瓶颈:最先进的MoE模型无法装入通用加速器,即使在数据中心硬件上托管也成本高昂,并且实际上被排除在设备端、边缘和内存受限场景之外——而这些场景本应是其每词元计算配置的理想选择。因此,缩小激活参数与总参数之间的差距,是现代MoE大语言模型部署的核心实际问题。

一个自然的应对方法是结构化剪枝:永久性地移除模型参数,使计算量和内存同时下降。然而,关于大语言模型(LLM)剪枝的文献绝大多数针对密集型Transformer(Ma et al., 2023 (https://arxiv.org/html/2607.08601#bib.bib63); Ashkboos et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib62); Men et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib61); Guo et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib60); Shopkhoev et al., 2026 (https://arxiv.org/html/2607.08601#bib.bib59); Song et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib58); Sengupta et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib54))。诸如基于幅度(Han et al., 2016 (https://arxiv.org/html/2607.08601#bib.bib57))、激活值(Sun et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib56))和梯度(Ma et al., 2023 (https://arxiv.org/html/2607.08601#bib.bib63); Frantar et al., 2022 (https://arxiv.org/html/2607.08601#bib.bib55))的剪枝方法、层丢弃(Shopkhoev et al., 2026 (https://arxiv.org/html/2607.08601#bib.bib59); Song et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib58); Men et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib61))以及宽度缩减(Ma et al., 2023 (https://arxiv.org/html/2607.08601#bib.bib63); Ashkboos et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib62); Sengupta et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib54))均基于一个假设:每个参数参与每一次前向传播,因此可以通过全局的、词元平均的信号对其进行评分。这些假设忽视了MoE模型中存在的路由行为和远程专家间依赖关系,因此无法直接迁移到MoE模型。

此外,先前以MoE为中心的努力往往依赖于局部的、层隔离的启发式,例如移除一组专家后的边际性能下降(Lu et al., 2024b (https://arxiv.org/html/2607.08601#bib.bib53))或每层路由器加权的激活值(Xie et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib16))。此类准则将每个MoE层和/或专家视为独立,忽略了路由决策在层间相互关联的事实。一个在第ℓ层中等程度使用的专家,实际上可能只有那些随后访问第ℓ+1层中罕用专家的词元才会到达它;其对模型行为的真实贡献是路由轨迹联合分布的性质,而非任何单层边际分布的性质。因此,用于MoE剪枝的原则性重要性信号应当捕捉路由如何流经整个专家库堆叠,而不仅仅是每个专家被独立命中的频率。

在本工作中,我们以**Maestro**框架的形式引入了这样的信号,即一种基于马尔可夫链的路由转移近似专家稀疏化方法。我们将词元访问的(layer, expert)对序列建模为MoE模型中所有专家槽位上的马尔可夫链,并通过自回归方式在一个小型校准语料库上经验性地估计转移概率。这产生了一个单一的时间齐次核,其平稳分布反映了全局的专家间依赖关系,并为每个专家槽位赋予一个长期质量:在该模型自身的生成分布下,路由过程在此槽位上花费的时间分数。平稳质量最小的专家,按构造就是所有路由轨迹中被访问频率最低的,也是移除的自然候选。通过利用MoE模型中出现的全局路由轨迹,我们提出的框架避免了做出局部短视的剪枝决策,而是将专家重要性建立在模型自身的自回归生成行为之上,捕获了逐层启发式在结构上无法捕捉的跨架构联合依赖。

**贡献。** 我们的贡献如下:
- • 我们提出了一种新颖的剪枝框架Maestro,它将MoE语言模型中的专家级路由形式化为一个在(layer, expert)形式状态上的循环马尔可夫链。
- • 我们利用该链的平稳分布作为理论上有依据的专家重要性启发式,该启发式与全局路由决策一致,从而产生了一种直接纳入跨层依赖的剪枝机制,而非从局部信号计算剪枝配置。
- • 我们证明,即使在严格的50%压缩率下,Maestro在平均性能保持率上持续超越当前最先进的基线,最高达10.61%,同时表现出显著较低的逐任务标准差。我们的评估在涵盖五个不同领域的17个基准测试上进行,包括安全、偏见与伦理,涉及两个当代MoE系列:GPT-OSS和Qwen 3。

(参见图1说明)

图1:Maestro方法的示意图。Maestro将MoE语言模型中的专家路由可视化为遍历马尔可夫链,并利用其平稳分布作为全局启发式,从每一层移除冗余专家。

## 2 相关工作

随着大语言模型不断扩展,由于架构的过度参数化,其计算需求大幅增长(Frankle and Carbin, 2019 (https://arxiv.org/html/2607.08601#bib.bib31); Michel et al., 2019 (https://arxiv.org/html/2607.08601#bib.bib30); Ma et al., 2023 (https://arxiv.org/html/2607.08601#bib.bib63); Ke et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib32))。虽然量化(Bhandare et al., 2019 (https://arxiv.org/html/2607.08601#bib.bib29); Yao et al., 2022 (https://arxiv.org/html/2607.08601#bib.bib28); Frantar et al., 2023 (https://arxiv.org/html/2607.08601#bib.bib27); Liu et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib26))和运行时激活稀疏性(Liu et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib25); Wang et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib24); Luo et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib23); Hou et al., 2026 (https://arxiv.org/html/2607.08601#bib.bib22))等技术降低了内存和延迟成本,但它们并未触及底层的结构冗余。模型剪枝直接解决了这一问题。非结构化方法在高稀疏率下实现了出色的性能保持(Sun et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib56); Frantar and Alistarh, 2023 (https://arxiv.org/html/2607.08601#bib.bib21)),但若无硬件特定的稀疏内核,仅凭稀疏性无法带来实际加速。这促使研究转向结构化剪枝,后者移除连续的参数组,如神经元(Ma et al., 2023 (https://arxiv.org/html/2607.08601#bib.bib63); Ashkboos et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib62); Sengupta et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib54))、MLP模块(Zhong et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib18); Zhang et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib17))、注意力头(Michel et al., 2019 (https://arxiv.org/html/2607.08601#bib.bib30); Chen et al., 2025a (https://arxiv.org/html/2607.08601#bib.bib20); Zayed et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib19))或整个层(Men et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib61); Song et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib58); Shopkhoev et al., 2026 (https://arxiv.org/html/2607.08601#bib.bib59)),从而得到更小、更精简、更快的模型,且无需专用内核支持。

尽管取得了这些进展,但进展大多局限于密集型Transformer架构。许多现有方法要么根本不支持MoE模型,要么将密集剪枝启发式简单移植到MoE架构上。例如,MoE-Pruner(Xie et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib16))将Wanda的权重幅度乘以激活值的启发式(Sun et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib56))扩展到MoE模型,仅将其与路由器权重相乘。虽然这加入了一个MoE特定信号,但它忽视了源于专家中心设计的更深层结构属性和组件间依赖。这促使了以MoE为中心的剪枝方法(Lu et al., 2024a (https://arxiv.org/html/2607.08601#bib.bib49); Lee et al., 2025 (https://arxiv.org/html/2607.08601#bib.bib13); Hu et al., 2026 (https://arxiv.org/html/2607.08601#bib.bib50); Lasby et al., 2026 (https://arxiv.org/html/2607.08601#bib.bib14))的出现,这些方法提出了激活变异性分数(Hu et al., 2026 (https://arxiv.org/html/2607.08601#bib.bib50))和路由器加权专家范数(Lasby et al., 2026 (https://arxiv.org/html/2607.08601#bib.bib14))等启发式,以更好地捕捉架构细节。虽然有效,但这些方法存在一个关键缺陷:它们使用局部推导的启发式来驱动全局剪枝决策。我们假设,这种短视的启发式必然忽视重要的全局依赖,导致压缩后性能下降。

除了剪枝之外,专家合并已成为压缩MoE模型的补充策略。合并方法(He et al., 2023 (https://arxiv.org/html/2607.08601#bib.bib3); Chen et al., 2025b (https://arxiv.org/html/2607.08601#bib.bib4); Li et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib2); Muqeeth et al., 2024 (https://arxiv.org/html/2607.08601#bib.bib1))并非直接丢弃专家,而是将冗余专家合并为较小的集合,保留跨专家编码的集体知识。例如,MEO(He et al., 2023 (https://arxiv.org/html/2607.08601#bib.bib3))采用路由器加权平均专家权重,基于路由相似性合并专家。相比之下,HC-SMoE(Chen et al., 2025b (https://arxiv.org/html/2607.08601#bib.bib4))利用层次聚类合并功能相似的专家。虽然有效,但Lasby等人(2026 (https://arxiv.org/html/2607.08601#bib.bib14))近期表明,专家合并方法由于丢失细粒度路由器控制而引入了不可避免的误差,这有力地推动了探索更先进的剪枝策略。

## 3 方法论

图1 (https://arxiv.org/html/2607.08601#S1.F1)展示了我们提出的、用于结构化剪枝MoE语言模型的校准驱动过程。核心思想是将模型中的top-k专家路由形式化为一个马尔可夫链,该链的状态为形如(layer, expert),并通过该链的稳态概率识别并移除冗余专家(稳态概率最小的专家)。由于专家张量在推理时是物理切分而非掩码,因此得到的模型在总参数量和内存占用上严格更小。

### 3.1 预备知识与问题设置

令 \( \mathcal{M} \) 表示一个包含 \( L \) 层的 MoE 模型,每层含有一组 \( E \) 个专家 \(\{f_{\ell,1},\dots,f_{\ell,E}\}\) 和一个路由器 \( g_\ell: \mathbb{R}^d \to \mathbb{R}^E \)。对于层 \( \ell \) 的输入词元表示 \( h \in \mathbb{R}^d \),路由器产生路由权重 \( r_\ell \),其中专家 \( e \) 的路由权重计算如下:

\[
r_\ell^{(e)} = \frac{\exp\big[g_\ell(h)_e\big]}{\sum_{e'}\exp\big[g_\ell(h)_{e'}\big]}, \quad 1 \leq e' \leq E
\tag{1}
\]

路由器的 top-k 算子选择一个索引集 \( \mathcal{E}_\ell(h) \subset \{1,\dots,E\} \),满足 \( |\mathcal{E}_\ell(h)| = k \)。层输出 \( A_\ell \) 是所选专家的加权和,权重使用公式 1 (https://arxiv.org/html/2607.08601#S3.E1) 中在 \( \mathcal{E}_\ell(h) \) 上重新归一化的路由权重。形式化地,

\[
A_\ell = \sum_{e \in \mathcal{E}_\ell(h)} \hat{r}_\ell^{(e)}(h) \, f_{\ell,e}(h)
\tag{2}
\]

其中 \(\hat{r}_\ell^{(e)}(h) = \frac{r_\ell^{(e)}}{\sum_{e' \in \mathcal{E}_\ell(h)} r_\ell^{(e')}} \)。

相似文章

TENP: 用于混合专家的梯形专家神经元剪枝

arXiv cs.LG

TENP 提出了一种用于混合专家大语言模型的结构化剪枝框架,该框架保留重要专家,对较不重要的专家进行神经元剪枝,从而在 Qwen 和 DeepSeek 模型上实现高稀疏度且精度损失极小。

用于剪枝稀疏混合专家语言模型的通用专家覆盖方法

arXiv cs.AI

提出了Generic TB-Coverage,一种覆盖感知的专家剪枝方法,用于稀疏Mixture-of-Experts语言模型,该方法仅使用通用文本语料库进行校准,并保留跨语料库专家覆盖,从而提高了准确率并减少了困惑度下降。