GEMQ:面向MoE大语言模型的全局专家级混合精度量化方法
摘要
提出GEMQ,一种面向MoE大语言模型的全局专家级混合精度量化方法,利用线性规划和路由器微调来减少内存占用并加速推理,同时将精度损失降至最低。
arXiv:2605.23078v1 公告类型:新
摘要:混合专家大语言模型(MoE-LLMs)性能优异,但因海量专家参数导致内存开销巨大。混合精度量化通过根据专家重要性分配按专家粒度的位宽来缓解这一问题,逼近精度-内存帕累托前沿,并实现极低位量化。然而,现有方法依赖逐层重要性估计,且忽略了量化导致的路由偏移,导致分配和路由次优。本文提出全局专家级混合精度量化(GEMQ),通过以下方式克服这些局限:(1)基于量化误差分析的全局线性规划形式,捕捉模型级专家重要性;(2)高效的路由器微调,使路由适应量化后的专家。这些组件被集成到一个渐进式量化框架中,该框架迭代优化重要性估计和分配。实验表明,GEMQ显著减少了内存占用并加速了推理,同时精度损失极小。源代码见 https://github.com/jndeng/GEMQ 。
查看缓存全文
缓存时间: 2026/05/25 08:59
# GEMQ:MoE大语言模型的全局专家级混合精度量化 来源:https://arxiv.org/abs/2605.23078 查看 PDF (https://arxiv.org/pdf/2605.23078) > 摘要:混合专家大语言模型(MoE-LLMs)性能强劲,但由于大量专家参数导致显存开销巨大。混合精度量化通过根据专家重要性分配逐专家位宽来缓解这一成本,逼近精度-内存帕累托前沿,并实现极低位宽量化。然而,现有方法依赖逐层重要性估计,且忽略了量化引起的路由器偏移,导致分配和路由效果欠佳。本文提出全局专家级混合精度量化(GEMQ),通过以下方式克服这些局限:(1)一种基于量化误差分析、捕获模型全局专家重要性的全局线性规划公式;(2)高效的路由器微调,使路由适应量化后的专家。这些组件被集成到一个渐进式量化框架中,该框架迭代式地优化重要性估计和分配。实验表明,GEMQ在极小精度损失下显著减少显存并加速推理。源代码可从此 https URL (https://github.com/jndeng/GEMQ) 获取。 ## 提交历史 来自:Jianing Deng [查看邮箱 (https://arxiv.org/show-email/49ac9fb1/2605.23078)] **[v1]** 2026年5月21日 星期四 22:23:38 UTC (653 KB)
相似文章
MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化框架
本文介绍MODE,一种用于MoE多模态大语言模型的模态分解专家级混合精度量化框架,通过按模态分解选择频率并过滤冗余视觉标记来解决专家重要性估计中的偏差,在激进量化下实现极小的性能损失。
BitsMoE: 基于谱能引导的MoE大语言模型高效量化比特分配
BitsMoE提出了一种基于谱能引导的比特分配框架,用于量化混合专家大语言模型,在超低位宽量化下实现了显著的精度提升和加速。
MixQuant:大语言模型的自适应混合精度量化
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。
Colla-Q:通过最小最大精度平衡在MoE量化中实现协作专家
本文介绍了Colla-Q,一种基于激活熵的比特分配框架,用于量化混合专家模型,以平衡专家性能,提高整体模型效率并减少对校准数据集的依赖。
GEM:用于最优LLM数据策展的几何熵混合
GEM将LLM数据策展重新表述为超球面上的变分问题,使用几何熵混合和最小化-最大化算法来发现平衡的语义簇,在数据混合策略中实现了高达1.2%平均下游准确率的最先进改进。