SlimQwen:探索大规模MoE模型预训练中的剪枝与蒸馏

Hugging Face Daily Papers 论文

摘要

本文探讨了在预训练阶段压缩大规模混合专家(MoE)模型的结构化剪枝和知识蒸馏技术。研究表明,渐进式剪枝以及结合多标记预测蒸馏等策略,能够提升下游任务的性能。例如,通过将Qwen3-Next-80A3B压缩为更高效的23A2B模型,展示了这一方法的有效性。

结构化剪枝和知识蒸馏(KD)是压缩大型语言模型的常用技术,但它们在预训练阶段的应用,尤其是在近期的混合专家(MoE)模型中的应用方式仍不明确。在本研究中,我们系统地研究了大规模预训练中的MoE压缩,重点关注以下三个关键问题:剪枝是否比从头训练提供更好的初始化、专家压缩选择如何影响最终模型在继续训练后的表现,以及哪种训练策略最为有效。我们的研究得出以下结论:首先,在深度、宽度和专家压缩方面,剪枝预训练MoE始终优于在相同训练预算下从头训练目标架构。其次,不同的一次性专家压缩方法在大规模持续预训练后收敛到相似的最终性能。基于此,我们提出了一种简单的部分保留专家合并策略,该策略在大多数基准测试中提升了下游任务的性能。第三,结合KD与语言建模损失的效果优于单独使用KD,特别是在知识密集型任务中。我们进一步提出了多标记预测(MTP)蒸馏,这种方法带来了稳定的性能提升。最后,在相同的训练数据量下,渐进式剪枝计划优于一次性压缩,表明逐步的架构转换能带来更好的优化轨迹。综合以上发现,我们将Qwen3-Next-80A3B压缩为23A2B模型,同时保持了竞争力。这些结果为高效的大规模MoE压缩提供了实用的指导。
查看原文
查看缓存全文

缓存时间: 2026/05/12 07:27

论文页面 - SlimQwen:探索大型 MoE 模型预训练中的剪枝与蒸馏

来源:https://huggingface.co/papers/2605.08738 发布于 5月9日

·

由 https://huggingface.co/Shengkun 提交

Tang (https://huggingface.co/Shengkun)于 5月12日

摘要

研究表明,结构化剪枝和知识蒸馏能有效压缩大规模混合专家模型,渐进式剪枝与联合蒸馏策略可提升性能。

结构化剪枝 (https://huggingface.co/papers?q=Structured%20pruning) 和知识蒸馏 (KD) 是压缩大语言模型的典型技术,但目前尚不清楚如何在预训练规模 (https://huggingface.co/papers?q=pretraining%20scale) 上应用这些技术,尤其是针对最近的混合专家 (MoE) (https://huggingface.co/papers?q=mixture-of-experts) 模型。在本工作中,我们系统研究了大规模预训练中的 MoE 压缩,重点关注三个关键问题:剪枝是否比从头训练提供更好的初始化、专家压缩 (https://huggingface.co/papers?q=expert%20compression) 选择如何影响持续训练 (https://huggingface.co/papers?q=continued%20training) 后的最终模型,以及哪种训练策略最有效。我们得出以下发现:首先,在深度、宽度和专家压缩 (https://huggingface.co/papers?q=expert%20compression) 方面,对预训练 MoE 进行剪枝始终优于在相同训练预算下从头训练目标架构。其次,不同的一次性专家压缩 (https://huggingface.co/papers?q=expert%20compression) 方法在经过大规模持续预训练后收敛到相似的性能。基于此,我们提出了一种简单的部分保留专家合并 (https://huggingface.co/papers?q=partial-preservation%20expert%20merging) 策略,该策略在大多数基准测试中提升了下游性能。第三,将 KD 与语言建模损失结合优于单独使用 KD,尤其在知识密集型任务上表现更佳。我们进一步提出了多令牌预测 (MTP) 蒸馏,带来了稳定的性能提升。最后,在给定相同训练令牌的情况下,渐进式剪枝计划 (https://huggingface.co/papers?q=progressive%20pruning%20schedules) 优于一次性压缩,表明渐进的架构过渡能带来更优的优化轨迹。综上所述,我们将 Qwen3-Next-80A3B 压缩为 23A2B 模型,同时保留了具有竞争力的性能。这些结果为大规模高效 MoE 压缩提供了实践指导。

查看 arXiv 页面 (https://arxiv.org/abs/2605.08738) 查看 PDF (https://arxiv.org/pdf/2605.08738) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.08738)

在您的 agent 中获取此论文:

hf papers read 2605\.08738

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有链接到此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2605.08738 即可从此页面链接。

引用此论文的数据集 0

没有链接到此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2605.08738 即可从此页面链接。

引用此论文的 Spaces 0

没有链接到此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2605.08738 即可从此页面链接。

包含此论文的收藏集 0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

TENP: 用于混合专家的梯形专家神经元剪枝

arXiv cs.LG

TENP 提出了一种用于混合专家大语言模型的结构化剪枝框架,该框架保留重要专家,对较不重要的专家进行神经元剪枝,从而在 Qwen 和 DeepSeek 模型上实现高稀疏度且精度损失极小。