超越无重训练MoE压缩:后压缩调整的成本标准化研究
摘要
本文认为,无重训练的MoE压缩检查点应被视为受益于小型后压缩调整的压缩初始化。研究表明,仅使用3,000个样本和一个周期,语言模型微调即可恢复性能损失的大部分,并且比知识蒸馏更具成本效益。
arXiv:2609.06076v1 公告类型:新
摘要:无重训练的MoE压缩通过剪枝或合并专家来减少部署内存,但通常将压缩检查点视为最终产物。我们认为这种观点不完整:压缩的MoE检查点应更好地理解为受益于微小后压缩调整阶段的压缩初始化。跨两个MoE LLM骨干网络、四种剪枝/合并方法、三种专家保留率和28个基准测试,我们在匹配的小数据预算和测量的GPU成本下比较了语言模型微调和基于教师的知识蒸馏。仅使用3,000个C4样本和一个调整周期,全参数微调平均恢复了原始到压缩性能差距的37.3%。此外,语言模型微调比标准令牌级知识蒸馏更具成本效益,全参数调整在测试范围内提供了最强的成本-恢复权衡。这些结果表明,无重训练压缩应与小型后压缩调整相结合,以恢复压缩过程中丢失的大部分性能。
查看缓存全文
缓存时间: 2026/09/10 08:31
# 成本归一化视角下的压缩后调整研究
来源:https://arxiv.org/html/2609.06076
## 超越免重训MoE压缩:压缩后调整的成本归一化研究
###### 摘要
免重训的MoE压缩通过剪枝或合并专家来降低部署内存占用,但通常将压缩后的检查点视为最终产物。我们认为这种观点并不完整:压缩后的MoE检查点应更准确地理解为“压缩初始化”,它们受益于一个微小的压缩后调整阶段。在两个MoE LLM骨干网络、四种剪枝/合并方法、三种专家保留比例以及28个基准测试中,我们在匹配的小数据预算和可度量的GPU成本下,比较了语言模型微调与基于教师的知识蒸馏。仅使用3,000个C4样本并进行一个epoch的调整,全参数微调平均恢复了原始至压缩性能差距的37.3%。此外,语言模型微调比标准的基于token的知识蒸馏更具成本效益,而在测试的调整范围中,全参数调整提供了最强的成本-恢复权衡。这些结果表明,免重训压缩应与微小的压缩后调整相结合,以恢复压缩过程中损失的大部分性能。
## 1 引言
大型语言模型展现出强大性能,但随着参数规模增加,其内存占用和部署成本急剧增长(Kaplan et al., 2020)。混合专家模型(MoE)(Shazeer et al., 2017; Lepikhin et al., 2020)通过仅为每个token激活专家子集来降低计算成本,但在推理时仍需将所有专家参数加载到内存中,这使得在资源受限环境中部署变得困难。免重训的MoE压缩是缓解这一内存瓶颈的有吸引力的方案。对于普通研究者或开发者而言,准备大规模训练数据和足够的GPU资源来部署或压缩大规模MoE LLM是沉重的负担。因此,近期许多研究强调免重训或免校准的压缩,在无需全面重训的情况下减少MoE LLM的内存占用。特别是,由于大部分MoE参数集中在专家中,先前工作聚焦于专家侧压缩,例如专家剪枝(Liu et al., 2026b)和专家合并(Li et al., 2024b)。
然而,免重训并不一定意味着零成本。许多方法仍然使用校准样本、模型推理和GPU计算来计算专家重要性(Lu et al., 2024)、专家相似性(Chen et al., 2025a)、路由统计信息(Li et al., 2024b)等等。这一点促使我们再次追问:仅靠免重训压缩是否足够?如果已允许少量数据和GPU计算,将它们仅用于压缩过程本身是否真正最优?
在本文中,我们重新审视了现有对免重训MoE压缩的观点。我们认为,压缩检查点不应被视为最终产物,而应视为“压缩初始化”。专家剪枝和专家合并改变了原始MoE的专家格局,会留下残余误差,如路由偏移、专家功能扭曲以及路由器-专家交互误差。因此,如果目标是接近原始的恢复,免重训压缩后的微小调整并非额外步骤,而是一个实际重要的恢复阶段。此处,“压缩后调整”指的是对压缩检查点应用少量通用域文本和简短梯度更新以减少残余性能差距的过程。这显然区别于需要大规模语料库或长时间训练计划的全面重训。
我们的目标不是引入另一种压缩器,而是定义并评估压缩后调整作为MoE压缩中缺失的设计维度。我们不再仅问哪个免重训压缩器产生最佳的即时检查点,而是问哪个“压缩-调整”流水线在相同的小数据预算和可度量的GPU成本下产生最佳恢复。
为验证压缩后调整的必要性,我们在专家剪枝和专家合并之间进行了大规模对比实验。具体来说,我们使用两个MoE LLM骨干网络、来自专家剪枝和专家合并的四种主要压缩方法,以及三种专家参数保留比例构建了多种压缩检查点,并对所有检查点应用相同的微小调整数据预算和超参数。然后,我们在28个下游基准测试上评估性能恢复程度和GPU成本,从而分析不依赖于特定压缩器的通用压缩后恢复阶段。
此外,为深入分析压缩后调整的设计选择,我们比较了两个目标:因果语言建模(LM)损失(Radford et al., 2018)和基于教师的知识蒸馏(KD)(Hinton et al., 2015),并评估了若干可训练参数范围:仅路由器、路由器+top-k专家、路由器+所有专家以及全参数调整。特别地,对于top-k专家,我们将k扩展到8、16和50,并分析所选专家数量、恢复增益与GPU成本之间的权衡。由此,我们测试了精心选择和调整一小部分参数是否真正具有成本效益。
我们的实验呈现了三个实用经验:
(1) 仅通过一个epoch、基于3,000个C4样本的压缩后调整,压缩后的MoE LLM平均恢复了原始至压缩性能差距的37.3%。这意味着免重训压缩应被视为产生对压缩后调整友好的初始化,而非最终产物。
(2) 在微小的通用域调整预算下,我们场景中的因果LM微调比标准的基于token的教师蒸馏更具成本效益。压缩后,当学生的专家格局和可行函数类别发生改变时,直接模仿教师分布可能并非总是最高效的局部修复方向。相比之下,LM微调无需教师前向传播即可直接提升观测到的下一个token的似然,提供了一种更简单且更具成本效益的修复信号。
(3) 全参数因果LM调整简单但极具竞争力。尽管它更新更多参数并可能需要更多优化器内存,但其端到端的GPU时间可能具有竞争力,因为它避免了专家选择开销,并且每次运行产生大得多的恢复。在我们测量的GPU成本协议下,它成为测试范围中最强的默认策略。仅路由器调整可以缓解一些路由不匹配,但不足以恢复专家功能扭曲和路由器-专家交互误差。路由器+top-k专家调整限制了可训练参数的数量,但额外增加了识别频繁激活专家的选择成本。
因此,本文并不反对免重训MoE压缩的近期趋势,而是将其重新诠释为更实用的两阶段流水线。免重训是一个强有力的起点,但未必是终点。本文的核心教训是,为实现接近原始的MoE恢复,不仅压缩器本身,压缩后调整阶段也应协同设计。
## 2 相关工作
**专家剪枝**移除冗余专家子集。策略包括最小化重建损失(Lu et al., 2024)、可微选择(Bai et al., 2025)以及利用路由器幅度(Lasby et al., 2025)。其他方法利用输出差异界限(Liu et al., 2026a)、token变化性(Dong et al., 2025)、基于轨迹的重要性(Yang et al., 2025)或更粗粒度的层级剪枝(He et al., 2025)。**专家合并**基于模型合并假设(Wortsman et al., 2022; Matena and Raffel, 2022)。该方法通过输出相似性聚类(Chen et al., 2025a)、选择性双掩码(Zhao et al., 2025)或压缩矩阵(Miao et al., 2025)来综合专家。
一些MoE压缩研究包含恢复阶段,例如剪枝后的专家级KD(Xie et al., 2024)、精简层微调(Cao et al., 2026)、混合压缩后基于LoRA的恢复(Yang et al., 2024)或子空间专家合并后的微调(Li et al., 2025a);更大的系统则进一步依赖蒸馏或在更大规模数据上的持续训练(Li et al., 2025c; Tang et al., 2026)。然而,这些工作并未系统性地追问:对于已经可部署的专家压缩MoE检查点,免重训压缩本身是否足够?在微小校准预算下,哪种压缩后目标、可训练范围和GPU成本权衡是最优的?我们的工作填补了这一空白,将压缩后调整视为MoE压缩的一等组件,而非特定方法的附加组件。扩展的相关工作见附录H。
## 3 性能下降的原因
免重训MoE压缩改变了原始模型的计算路径。这种改变可能源于移除专家或将多个专家合并为更小的集合。因此,压缩模型可能通过两个耦合来源偏离原始模型:路由器可能分配不同的混合权重,且被选择的专家功能或专家路径可能不再与原始匹配。本节中,我们以专家剪枝作为代表案例,正文仅保留核心公式。专家剪枝和专家合并的完整推导分别见附录C和D。我们采用Hyeon and Do (2026)的MoE符号和剪枝场景分析。为隔离局部压缩源,以下推导在相同的参考隐藏状态输入 **x** 下评估原始和压缩的MoE层映射。由实现的端到端状态偏移引起的差异在下面的传播分析中单独处理。
设 **S** 为原始MoE层选择的top-k专家集,设 **P** ⊆ {0, ..., N-1} 为剪枝后保留的专家集,设 **S'** ⊆ **P** 为剪枝层在相同参考输入 **x** 下选择的top-k集合。对于任意激活集 **A**,令 **g̃_i^{o, A}(x)** 和 **g̃_i^{p, A}(x)** 分别表示在 **A** 上重归一化的原始和剪枝路由器权重。为可读性,下文省略 **x**,并写作 **E_i = E_i(x)**。基于先前的三部分剪枝分析,我们将残差重组为共享路径路由器重加权和激活路径替换。重叠定义在实际被选择的专家集之间:
**T** = **S** ∩ **S'**
**D** = **S** \ **S'**
**R** = **S'** \ **S**
因此,**S** = **T** ∪ **D**,**S'** = **T** ∪ **R**。
##### 最佳场景。最有利的情况是 **S' = **S**,这已经蕴含了 **S** ⊆ **P**。则
‖y_orig − y_pruned^{best}‖ = ‖∑_{i∈**S**} (**g̃_i^{o, **S**} − g̃_i^{p, **S**}) E_i‖。
在相同参考输入下,激活的专家函数相同,因此局部残差仅能包含共享路径路由器重加权。如果纯剪枝保持路由器和门控实现不变,则 **g̃_i^{p, **S**}(x) = g̃_i^{o, **S**}(x)**,此时该相同输入最佳情况残差恰好为零。然而,通过上游隐藏状态偏移,实现的端到端偏差可能仍然存在。如果门控实现已更改或路由器随后被调整,那么在 **S' = **S** 时,路由器对齐是唯一需要的局部修正。
##### 最常见场景。在部分重叠情况(0 < |**T**| < k)下,输出偏差可分为:
1) **共享路径重加权**(**T** 中专家的权重变化)
2) **激活路径替换**(用 **R** 中专家替换 **D** 中专家)
3) **路由器门控失配**(因可用集 **P** 改变导致路由概率重新归一化)
##### 最坏场景。最不利的情况是 **S'** 与 **S** 完全不相交(**T** = ∅)。此时,原始top-k专家均被移除,压缩模型依赖于完全不同的专家集合。残差达到最大,包含完整的路由偏移和所有专家函数替换。相似文章
ConMoE: 基于原型重分配的专家池整合实现MoE压缩
ConMoE提出了一种无需训练的混合专家模型压缩框架,通过选择一部分专家作为可重用原型,并确定性地将原始专家调用重新映射到这些原型,从而在不更新权重或微调的情况下减少内存占用。
通过自蒸馏,后训练MoE可跳过一半专家
ZEDA是一种低成本框架,通过注入零输出专家并使用自蒸馏,将后训练的静态MoE模型转换为动态模型,在基准测试中实现了超过50%的专家FLOP减少,且精度损失极小。
面向校准引导的大语言模型压缩的输出空间分配成本:一项实证研究
本文实证研究了在无需训练的LLM压缩方法ROCKET中,使分配成本与输出空间目标对齐是否能提升压缩模型保真度。结果显示准确率与困惑度之间存在权衡,且在高压缩比下效果更为显著。
通过增加MOE(Qwen 35B A4B+)中每个token的活跃参数,推理token减少8.5%——无需训练或微调!
一篇论文介绍了一种针对稀疏MoE模型的推理时优化方法,通过调整后期transformer层中的专家选择,在无需重新训练的情况下,将推理token减少8.5%,延迟降低10.9%,同时保持准确性。
SlimQwen:探索大规模MoE模型预训练中的剪枝与蒸馏
本文探讨了在预训练阶段压缩大规模混合专家(MoE)模型的结构化剪枝和知识蒸馏技术。研究表明,渐进式剪枝以及结合多标记预测蒸馏等策略,能够提升下游任务的性能。例如,通过将Qwen3-Next-80A3B压缩为更高效的23A2B模型,展示了这一方法的有效性。