GEMQ:面向MoE大语言模型的全局专家级混合精度量化方法

arXiv cs.LG 论文

摘要

提出GEMQ,一种面向MoE大语言模型的全局专家级混合精度量化方法,利用线性规划和路由器微调来减少内存占用并加速推理,同时将精度损失降至最低。

arXiv:2605.23078v1 公告类型:新 摘要:混合专家大语言模型(MoE-LLMs)性能优异,但因海量专家参数导致内存开销巨大。混合精度量化通过根据专家重要性分配按专家粒度的位宽来缓解这一问题,逼近精度-内存帕累托前沿,并实现极低位量化。然而,现有方法依赖逐层重要性估计,且忽略了量化导致的路由偏移,导致分配和路由次优。本文提出全局专家级混合精度量化(GEMQ),通过以下方式克服这些局限:(1)基于量化误差分析的全局线性规划形式,捕捉模型级专家重要性;(2)高效的路由器微调,使路由适应量化后的专家。这些组件被集成到一个渐进式量化框架中,该框架迭代优化重要性估计和分配。实验表明,GEMQ显著减少了内存占用并加速了推理,同时精度损失极小。源代码见 https://github.com/jndeng/GEMQ 。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:59

# GEMQ:MoE大语言模型的全局专家级混合精度量化
来源:https://arxiv.org/abs/2605.23078
查看 PDF (https://arxiv.org/pdf/2605.23078)

> 摘要:混合专家大语言模型(MoE-LLMs)性能强劲,但由于大量专家参数导致显存开销巨大。混合精度量化通过根据专家重要性分配逐专家位宽来缓解这一成本,逼近精度-内存帕累托前沿,并实现极低位宽量化。然而,现有方法依赖逐层重要性估计,且忽略了量化引起的路由器偏移,导致分配和路由效果欠佳。本文提出全局专家级混合精度量化(GEMQ),通过以下方式克服这些局限:(1)一种基于量化误差分析、捕获模型全局专家重要性的全局线性规划公式;(2)高效的路由器微调,使路由适应量化后的专家。这些组件被集成到一个渐进式量化框架中,该框架迭代式地优化重要性估计和分配。实验表明,GEMQ在极小精度损失下显著减少显存并加速推理。源代码可从此 https URL (https://github.com/jndeng/GEMQ) 获取。

## 提交历史

来自:Jianing Deng [查看邮箱 (https://arxiv.org/show-email/49ac9fb1/2605.23078)] **[v1]** 2026年5月21日 星期四 22:23:38 UTC (653 KB)

相似文章

MixQuant:大语言模型的自适应混合精度量化

arXiv cs.LG

MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。

GEM:用于最优LLM数据策展的几何熵混合

arXiv cs.LG

GEM将LLM数据策展重新表述为超球面上的变分问题,使用几何熵混合和最小化-最大化算法来发现平衡的语义簇,在数据混合策略中实现了高达1.2%平均下游准确率的最先进改进。