SlimQwen:探索大规模MoE模型预训练中的剪枝与蒸馏
摘要
本文探讨了在预训练阶段压缩大规模混合专家(MoE)模型的结构化剪枝和知识蒸馏技术。研究表明,渐进式剪枝以及结合多标记预测蒸馏等策略,能够提升下游任务的性能。例如,通过将Qwen3-Next-80A3B压缩为更高效的23A2B模型,展示了这一方法的有效性。
查看缓存全文
缓存时间: 2026/05/12 07:27
论文页面 - SlimQwen:探索大型 MoE 模型预训练中的剪枝与蒸馏
来源:https://huggingface.co/papers/2605.08738 发布于 5月9日
·
由 https://huggingface.co/Shengkun 提交
Tang (https://huggingface.co/Shengkun)于 5月12日
摘要
研究表明,结构化剪枝和知识蒸馏能有效压缩大规模混合专家模型,渐进式剪枝与联合蒸馏策略可提升性能。
结构化剪枝 (https://huggingface.co/papers?q=Structured%20pruning) 和知识蒸馏 (KD) 是压缩大语言模型的典型技术,但目前尚不清楚如何在预训练规模 (https://huggingface.co/papers?q=pretraining%20scale) 上应用这些技术,尤其是针对最近的混合专家 (MoE) (https://huggingface.co/papers?q=mixture-of-experts) 模型。在本工作中,我们系统研究了大规模预训练中的 MoE 压缩,重点关注三个关键问题:剪枝是否比从头训练提供更好的初始化、专家压缩 (https://huggingface.co/papers?q=expert%20compression) 选择如何影响持续训练 (https://huggingface.co/papers?q=continued%20training) 后的最终模型,以及哪种训练策略最有效。我们得出以下发现:首先,在深度、宽度和专家压缩 (https://huggingface.co/papers?q=expert%20compression) 方面,对预训练 MoE 进行剪枝始终优于在相同训练预算下从头训练目标架构。其次,不同的一次性专家压缩 (https://huggingface.co/papers?q=expert%20compression) 方法在经过大规模持续预训练后收敛到相似的性能。基于此,我们提出了一种简单的部分保留专家合并 (https://huggingface.co/papers?q=partial-preservation%20expert%20merging) 策略,该策略在大多数基准测试中提升了下游性能。第三,将 KD 与语言建模损失结合优于单独使用 KD,尤其在知识密集型任务上表现更佳。我们进一步提出了多令牌预测 (MTP) 蒸馏,带来了稳定的性能提升。最后,在给定相同训练令牌的情况下,渐进式剪枝计划 (https://huggingface.co/papers?q=progressive%20pruning%20schedules) 优于一次性压缩,表明渐进的架构过渡能带来更优的优化轨迹。综上所述,我们将 Qwen3-Next-80A3B 压缩为 23A2B 模型,同时保留了具有竞争力的性能。这些结果为大规模高效 MoE 压缩提供了实践指导。
查看 arXiv 页面 (https://arxiv.org/abs/2605.08738) 查看 PDF (https://arxiv.org/pdf/2605.08738) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.08738)
在您的 agent 中获取此论文:
hf papers read 2605\.08738
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有链接到此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2605.08738 即可从此页面链接。
引用此论文的数据集 0
没有链接到此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2605.08738 即可从此页面链接。
引用此论文的 Spaces 0
没有链接到此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2605.08738 即可从此页面链接。
包含此论文的收藏集 0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
@rohanpaul_ai: 大型MoE模型可能浪费了一半的专家计算资源在几乎不需要专家帮助的token上。本文中50%的e…
一种名为Zero-Expert Self-Distillation Adaptation (ZEDA)的新方法,允许像Qwen3和GLM这样的MoE模型在简单token上跳过一半的专家计算,而精度损失极小,通过添加输出为空的虚拟专家,实现约20%的推理加速。
将混合专家模型剪枝与蒸馏为稠密语言模型
一个系统框架通过专家评分、选择、分组和知识蒸馏将混合专家模型转换为稠密架构,相比传统剪枝方法实现了更优的性能和效率。
基于归因引导和覆盖最大化的结构化MoE压缩剪枝
提出了一种针对MoE模型的结构化剪枝框架,通过基于归因的近似方法最大化通道分数覆盖,在结合4比特量化时实现50%或25%的剪枝,并在Qwen3-30B-A3B上将内存占用降低5.27倍。
@googledevs: 扩展前沿的混合专家(MoE)模型需要的不仅仅是试错调优。探索Qwen 3.5-397B是如何…
Google Cloud 详细介绍了他们如何在 Ironwood TPU 上使用模块化、模型无关的工程手册优化 Qwen 3.5-397B MoE,实现了 3.1 倍的解码性能和 4.7 倍的预填充性能提升。
TENP: 用于混合专家的梯形专家神经元剪枝
TENP 提出了一种用于混合专家大语言模型的结构化剪枝框架,该框架保留重要专家,对较不重要的专家进行神经元剪枝,从而在 Qwen 和 DeepSeek 模型上实现高稀疏度且精度损失极小。