形状变换专家压缩:LorExperts与BTExperts
摘要
本文介绍了LorExperts和BTExperts,这两种面向混合专家大语言模型的保留路由器压缩方法,通过聚类专家并将非主导成员表示为低秩修正,相较于D2-MoE等先前方法提升了压缩质量。
arXiv:2608.07814v1 公告类型:新
摘要:混合专家(Mixture-of-Experts, MoE)语言模型以较低的每词元计算成本提供高容量,但低成本部署需要压缩其众多专家权重矩阵。专家剪枝(如REAP)和合并降低了成本,但牺牲了准确性并需要重新训练路由器;专家的低秩增量分解(如D^2-MoE)保留了所有专家和路由器,但随着专家数量的增加性能急剧下降,因为单个共享组件无法近似许多接近正交的专家。
由于MoE专家权重接近正交,单个共享组件(如先前的增量分解)在专家数量增加时扩展性较差;我们表明,专家仍然会组织成功能性的共激活社区,这些社区与权重相似性脱钩。基于此,我们引入了LorExperts,一种保留路由器的压缩方法,它对专家进行聚类,每个聚类保留一个全精度主导专家,并将其余成员表示为对其局部主导专家的低秩修正。LorExperts保留了所有专家和原始路由器(无需重新训练路由器)。在Qwen3-30B-A3B和Gemma-4-26B-A4B上约50%的专家压缩下,LorExperts在大多数任务上比基线更好地保持了下游准确性和困惑度;与D^2-MoE的差距随着专家数量E的增加而扩大。我们进一步给出了LorExperts的重建微调流程,以及BTExperts,一种主导专家和修正的树形组织,能够在推理时摊销共享计算。
查看缓存全文
缓存时间: 2026/08/11 08:06
# 形态变换专家压缩:LorExperts 与 BTExperts
来源:https://arxiv.org/html/2608.07814
Inesh Chakrabarti Sourjya Roy11footnotemark:1Bowen Bao Thiago Crepaldi Spandan Tiwari Ashish Sirasao Advanced Micro Devices \{inesh\.chakrabarti, sourjya\.roy, bowen\.bao\}@amd\.com \{thiago\.crepaldi, spandan\.tiwari, ashish\.sirasao\}@amd\.com
\(2026 年 8 月 7 日\)
###### 摘要
混合专家 \(MoE\) 语言模型以较低的单 token 计算量提供了高容量,但要廉价部署它们,就需要压缩其众多专家权重矩阵。专家*剪枝*(如 REAP)和*合并*可以降低成本,但会牺牲准确性,并且需要*重新训练路由器*;专家的低秩*增量分解*(如 D2-MoE)保留了所有专家和路由器,但随着专家数量增长,其效果急剧下降,因为单个共享分量无法逼近许多近似正交的专家。
由于 MoE 专家权重近似正交,单个共享分量(如先前增量分解方法中的做法)在专家数量增加时扩展性很差;但我们表明,专家仍然会组织成功能性的*共激活社区*,且这些社区与权重相似性相解耦。基于此,我们提出了 LorExperts,一种*保留路由器*的压缩方法:它对专家进行聚类,每个簇保留一个全精度的*主导专家*,并将其余成员表示为对局部主导专家的低秩修正。LorExperts 保留了*所有*专家和*原始路由器*(无需重新训练路由器)。在 Qwen3-30B-A3B 和 Gemma-4-26B-A4B 上约 50% 的专家压缩下,LorExperts 在大多数任务上比基线更好地保持了下游准确性和困惑度;其相对 D2-MoE 的优势随专家数量 \(E\) 的增长而扩大。我们还给出了一种用于 LorExperts 的重构微调流程,以及 BTExperts——一种将主导专家和修正项组织成树结构的方法,能够在推理时摊销共享计算。
形态变换专家压缩:LorExperts 与 BTExperts
## 1 引言
大语言模型 \(LLMs\) 随着稠密 Transformer 扩展到数千亿参数而快速发展\(Brown et al\.,2020 (https://arxiv.org/html/2608.07814#bib.bib2); Chowdhery et al\.,2023 (https://arxiv.org/html/2608.07814#bib.bib4); Touvron et al\.,2023 (https://arxiv.org/html/2608.07814#bib.bib13)\)\. 然而,扩展稠密模型意味着每个 token 都要为每个参数付出代价。稀疏混合专家 \(MoE\) 架构通过增加容量同时保持每次前向传播的成本大致不变来缓解这一问题。一个 MoE 层包含 \(E\) 个独立的专家,对于每个 token,一个小型路由器仅激活其中 \(k\ll E\) 个,其余保持空闲\(Jiang et al\.,2024 (https://arxiv.org/html/2608.07814#bib.bib10); Yang et al\.,2025 (https://arxiv.org/html/2608.07814#bib.bib14); Dai et al\.,2024 (https://arxiv.org/html/2608.07814#bib.bib5)\)\. 由于总容量与每个 token 消耗的计算量解耦,模型可以增长到数千亿参数,而推理浮点运算次数 \(FLOPs\) 不会同比例增长。
难点在于,这种容量几乎完全存在于专家之中,而每个专家都相当于一个稠密前馈块。由于每个 token 只有少数专家被激活,MoE 推理的瓶颈在于加载专家权重的内存访问流量,而非算术运算\(Eliseev and Mazur,2023 (https://arxiv.org/html/2608.07814#bib.bib6)\)\. 近期的架构进一步推动了这一趋势,倾向于使用更多、更小且更专门化的专家,\(E=128\) 的配置如今已很常见\(Dai et al\.,2024 (https://arxiv.org/html/2608.07814#bib.bib5); Yang et al\.,2025 (https://arxiv.org/html/2608.07814#bib.bib14)\)\. 随着专家预算的增长,经济地服务这些模型的关键就归结为压缩专家。目标是在不损失质量、不干扰模型已经学到的路由方式的前提下,缩小它们的内存占用。
### 1\.1 相关工作
#### 专家剪枝。
剪枝会移除低重要性的专家。候选者按激活频率或重要性准则选择,如 REAP\(Lasby et al\.,2026 (https://arxiv.org/html/2608.07814#bib.bib11)\)\. 这种方法简单,同时减少了存储和每 token 计算量。然而,它*丢弃了模型容量*,并且*改变了路由器可以选择的专家集合*。因此,剪枝后路由器会失去校准,必须进行调整或重新训练。被移除专家所承载的能力也会导致准确性下降。剪枝与合并的相对优劣取决于基准。在困惑度和多项相似文章
PuzzleMoE:通过稀疏专家合并和位打包推理实现大型混合专家模型的高效压缩
PuzzleMoE 提出了一种成对双掩码专家合并算法和位级打包技术,用于压缩大型混合专家模型,在保持性能的同时减少存储并加速推理。
EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由
EntropyMoE 为无分词器大语言模型引入了一种熵感知的专家混合架构,使用动态字节补丁作为路由单元,以实现稀疏条件计算。实验表明,在保持下游精度的同时,它在基线中取得了最低的留出法每字节比特数(bits-per-byte)。
轻量级微调下的路由器灵敏度识别混合专家模型中的可剪枝专家
本文提出在轻量级微调(如 LoRA)下利用路由器权重灵敏度来识别并剪枝混合专家模型中的专家,从而在最小化精度损失的同时显著降低内存和延迟。
ConMoE: 基于原型重分配的专家池整合实现MoE压缩
ConMoE提出了一种无需训练的混合专家模型压缩框架,通过选择一部分专家作为可重用原型,并确定性地将原始专家调用重新映射到这些原型,从而在不更新权重或微调的情况下减少内存占用。
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。