Colla-Q:通过最小最大精度平衡在MoE量化中实现协作专家

arXiv cs.LG 论文

摘要

本文介绍了Colla-Q,一种基于激活熵的比特分配框架,用于量化混合专家模型,以平衡专家性能,提高整体模型效率并减少对校准数据集的依赖。

arXiv:2609.18131v1 Announce Type: new 摘要:本文提出了一种基于激活熵的混合专家(MoE)量化方法。尽管量化可以降低内存和计算成本,但它可能显著降低性能。特别是在量化MoE模型中,性能下降更为明显,因为单个专家的参数数量较少,对低比特表示敏感。考虑到MoE作为集成模型运作,由路由专家协作贡献,量化导致特定专家性能显著下降会损害模型性能。因此,我们提出了Colla-Q,一种比特分配框架,通过基于激活熵的比特宽度分配算法来保持专家间的性能平衡。这种方法鼓励每个专家在量化模型中协作运行,从而1)提高整体MoE性能,2)减少对校准数据集的依赖。由于均匀调整每个专家的性能有助于提高MoE模型的鲁棒性和稳定性,所提出的MoE量化方法在不同校准数据集上能更一致地泛化。我们的代码可在以下地址获取:https://github.com/mmai-laboratory/Colla_Q
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:16

# 通过极小极大精度平衡实现混合专家模型量化中的协作专家
来源:https://arxiv.org/html/2609.18131
Jongbin Ryu††谢谢:通讯作者\.所属机构:韩国亚洲大学 电子邮件:[jongbinryu@ajou\.ac\.kr](mailto:)

###### 摘要

本文提出了一种基于激活熵的混合专家模型量化方法。虽然量化降低了内存和计算成本,但可能导致性能显著下降。在量化混合专家模型中,由于各个专家参数数量较少且对低比特表示敏感,性能下降尤为明显。考虑到混合专家模型作为协作路由专家的集成模型运行,某个专家因量化导致的性能显著下降会损害整体模型性能。因此,我们提出 CollaQ,一个比特分配框架,通过基于激活熵的比特宽度分配算法来保持专家间性能的平衡。该方法鼓励每个专家在量化模型中协同工作,从而 1)提升混合专家模型的整体性能;2)降低对校准数据集的依赖。由于均匀调整每个专家的性能有助于提高混合专家模型的鲁棒性和稳定性,所提出的量化方法能够在不同的校准数据集上实现更一致的泛化能力。我们的代码已开源:https://github.com/mmai-laboratory/Colla_Q

## 1引言

在近期的大语言模型中,混合专家模型已作为稀疏架构被广泛采用,以减少计算开销(Jiang et al., 2024 (https://arxiv.org/html/2609.18131#bib.bib2);Muennighoff et al., 2025 (https://arxiv.org/html/2609.18131#bib.bib3))。它通过在推理过程中将输入令牌路由到相关专家来降低开销(Shazeer et al., 2017 (https://arxiv.org/html/2609.18131#bib.bib1))。然而,尽管具有此效率,混合专家模型需要大量内存来加载所有专家参数,包括未被路由的专家。随着模型规模增大,这会导致过高的内存需求。因此,混合精度量化是解决混合专家模型这一局限性的有效方法。但是,为密集型大语言模型开发的混合精度量化方法由于混合专家架构的独特结构而不适用于混合专家模型。

参考图注\(a\)我们的方法与基线的准确度
\(b\)量化后各专家的性能
图 1:支持我们方法的初步研究。基线指的是随机分配专家比特宽度的量化模型。(a) 在不同比特宽度下,Mixtral 8×7B 在我们的方法与基线下的零样本性能 (%)。(b) 基线方法在量化后导致专家性能不平衡,而我们的方法分配更多比特以保持专家间性能相似。较强的专家在低比特宽度下性能下降往往较少。x 轴显示专家及其分配的比特宽度,y 轴显示通过我们指标衡量的专家性能。参考图注\(a\)基线
参考图注\(b\)我们的方法

图 2:所提方法的概念性示意图。(a) 给性能较低的专家分配较少比特会显著降低其性能,导致混合专家块聚合输出的性能欠佳。(b) 相反,我们的方法为性能较低的专家分配更多比特,从而改善聚合输出并保持混合专家块输出的整体质量。聚合输出 (Agg.) 表示通过组合路由专家的输出而获得的混合专家块聚合输出。与密集型大语言模型不同,混合专家模型由参数相对较少的各个专家组成,每个专家倾向于专注于不同的令牌上下文。因此,专家对低比特量化高度敏感,一些专家会经历显著的性能下降(Dong et al., 2019 (https://arxiv.org/html/2609.18131#bib.bib7))。这种下降在专家间是非均匀的,这可能放大性能差异并损害混合专家聚合输出的质量。这一现象与集成视角一致:先前的研究(Caruana et al., 2004 (https://arxiv.org/html/2609.18131#bib.bib5);An and Xu, 2023 (https://arxiv.org/html/2609.18131#bib.bib4);Yao et al., 2025 (https://arxiv.org/html/2609.18131#bib.bib6))表明,单个弱学习器会阻碍协作专家的贡献,进而降低聚合模型的整体性能。这一观点促使我们从集成角度审视混合专家架构,因为它以类似集成的方式聚合路由专家的贡献。我们在图 1 (https://arxiv.org/html/2609.18131#S1.F1) 中提供了支持这些观察的实验结果,该图展示了专家间性能平衡与整体模型性能之间的关系。因此,这一观察促使我们在混合专家量化中为较弱专家分配更合适的比特宽度,以进一步减少性能下降。

先前的研究(Huang et al., 2025 (https://arxiv.org/html/2609.18131#bib.bib15);Li et al., 2024 (https://arxiv.org/html/2609.18131#bib.bib14);Duanmu et al., 2025 (https://arxiv.org/html/2609.18131#bib.bib16))在优化混合专家比特宽度分配方面做出了类似努力。他们基于路由频率为专家分配不同的比特宽度。Huang et al. (2025) (https://arxiv.org/html/2609.18131#bib.bib15) 和 Li et al. (2024) (https://arxiv.org/html/2609.18131#bib.bib14) 通过计算校准数据集中令牌被路由到每个专家的频率来衡量其重要性。由于利用率更高,频繁路由的专家被认为更重要,因此获得更多的比特。Duanmu et al. (2025) (https://arxiv.org/html/2609.18131#bib.bib16) 也使用每个专家的路由结果来指导比特宽度分配。尽管这些方法对混合专家量化有效,但它们并未直接考虑保持较弱专家的性能。如图 1b (https://arxiv.org/html/2609.18131#S1.F1.sf2) 和图 2 (https://arxiv.org/html/2609.18131#S1.F2) 所示,为较弱专家分配更多比特表明,促进量化后专家间性能相似有助于保持混合专家块的聚合输出。此外,它们对专家重要性的估计依赖于校准分布,如图 3 (https://arxiv.org/html/2609.18131#S4.F3) 所示。

因此,我们强调保持专家间性能平衡的重要性,因为它支持协作专家贡献,并最终提升整体模型性能。此时的关键问题是如何估计专家性能以进行比特宽度分配。由于各个专家不直接生成令牌,我们需要一种无标签的方法,从输出激活值中估计专家性能。为此,我们提出激活熵指标,通过激活方差的视角,基于微分熵理论来估计专家性能。基于此指标,我们进一步引入极小极大精度平衡算法来保持专家间性能的平衡。我们将这个整体框架称为 CollaQ。

CollaQ 还表现出在不同校准数据集上更好的泛化能力。对于实际量化而言,这种跨校准数据集的泛化能力很重要,因为推理分布通常事先未知。然而,如表 4 (https://arxiv.org/html/2609.18131#S4.T4) 所示,混合专家量化中用于比特宽度分配的路由频率和权重往往更强烈地反映校准领域的属性。例如,当在包含数学问题的数据集上校准模型时,这些基于路由的指标可能更强调擅长数值推理的专家。相比之下,如图 3 (https://arxiv.org/html/2609.18131#S4.F3) 所示,我们的方法对校准领域的敏感度较低,因为它基于从输出激活值估计的专家性能来分配比特宽度。因此,这产生了更一致的比特宽度分配和跨校准数据集更小的性能变化。

## 2相关工作

### 2.1基于激活的大语言模型量化

训练后量化是一种无需额外训练即可量化预训练模型的方法,能有效减少大语言模型的内存占用。GPTQ (Frantar et al., 2023 (https://arxiv.org/html/2609.18131#bib.bib10)) 是一种代表性的训练后量化方法,它通过逐层优化实现低比特量化。它使用校准数据对每一层执行逐层优化,以最小化量化误差。同时,近期的方法如 LLM.int8() (Dettmers et al., 2022 (https://arxiv.org/html/2609.18131#bib.bib12))、OWQ (Lee et al., 2024 (https://arxiv.org/html/2609.18131#bib.bib13)) 和 AWQ (Lin et al., 2024 (https://arxiv.org/html/2609.18131#bib.bib11)) 表明,使用激活统计信息可以减少性能下降。特别是,AWQ 根据激活统计信息识别重要通道,并缩放其权重以在量化期间减少性能下降。这些结果表明,源自激活的信号对于增强权重量化的有效性很有用。

### 2.2混合专家大语言模型量化:从分配到精度平衡

量化被广泛应用于混合专家模型,以在减轻性能下降的同时减少内存占用。在多项研究中(Li et al., 2024 (https://arxiv.org/html/2609.18131#bib.bib14);Huang et al., 2025 (https://arxiv.org/html/2609.18131#bib.bib15);Duanmu et al., 2025 (https://arxiv.org/html/2609.18131#bib.bib16)),混合精度被应用于混合专家模型的不同组件,如混合专家块、专家和每个专家内的线性层。QuantMoE-Bench (Li et al., 2024 (https://arxiv.org/html/2609.18131#bib.bib14)) 提出了一种结构感知策略,并表明在相同预算下混合精度优于统一比特宽度。在此策略基础上,PMQ (Huang et al., 2025 (https://arxiv.org/html/2609.18131#bib.bib15)) 使用来自校准数据集的路由统计信息(如路由频率和权重)分配每个专家的比特宽度。MxMoE (Duanmu et al., 2025 (https://arxiv.org/html/2609.18131#bib.bib16)) 考虑了线性层量化敏感性、专家激活模式和硬件约束来分配比特宽度。总体而言,先前的工作为混合专家模型的不同组件设计了混合精度比特宽度。这些方法大多使用校准数据集的路由统计信息来确定专家重要性,隐含地假设激活更频繁的专家更重要。相比之下,我们的极小极大精度平衡方法并非基于路由统计信息分配比特宽度,而是主动平衡专家性能以保持整体集成的完整性。

## 3方法

先前关于集成模型的研究(Caruana et al., 2004 (https://arxiv.org/html/2609.18131#bib.bib5);An and Xu, 2023 (https://arxiv.org/html/2609.18131#bib.bib4);Yao et al., 2025 (https://arxiv.org/html/2609.18131#bib.bib6))已经证明,当单个弱学习器表现异常低下时,聚合集成模型的性能会显著下降。为了解决量化混合专家模型中的这种性能下降,我们采用集成视角作为方法的动机。基于此视角,我们提出 CollaQ,一个包含两个组成部分的比特分配框架:1) 用于专家性能估计的激活熵指标;2) 用于比特分配的极小极大精度平衡算法。

### 3.1从集成视角看混合专家

形式上,一个混合专家块的输出可以理解为 k 个路由专家的动态集成输出。给定输入 \mathbf{x},层输出 \hat{\mathbf{y}} 由专家输出的加权集成导出:
\[ \hat{\mathbf{y}} = \sum_{e\in\hat{E}} g_{e}(\mathbf{x}) \cdot e(\mathbf{x}), \tag{1} \]
其中 \hat{E} 是路由专家的集合,e(\mathbf{x}) 指专家输出,g_{e}(\mathbf{x}) 表示相应的路由权重。令 R_e 表示专家的期望误差,量化其个体性能缺陷。假设不同专家的误差不相关,我们可以通过个体误差的加权和来近似聚合集成的全局误差 \mathcal{E}_{ens}:
\[ \mathcal{E}_{ens} \approx \sum_{e\in\hat{E}} (\bar{g}_{e}(\mathbf{x}))^2 R_{e}. \tag{2} \]
为了增强模型的稳定性和鲁棒性,我们的目标是将全局集成误差 \mathcal{E}_{ens} 最小化。考虑专家误差总量固定(即 \sum_{e\in\hat{E}} R_{e} = \mathcal{A}),为简单起见,我们假设在许多令牌上的预期路由权重近似均匀,\bar{g}_{e} \triangleq \mathbb{E}_{\mathbf{x}}[g_{e}(\mathbf{x})] \approx \frac{1}{|\hat{E}|},作为负载平衡目标,旨在鼓励在许多令牌上平均利用专家(见附录 A.1 (https://arxiv.org/html/2609.18131#A1.SS1))。在这些假设下,我们可以将优化问题构建为最小化以下凸目标:
\[ \min_{\{R_{e}\}} \sum_{e\in\hat{E}} R_{e}^2 \quad \text{s.t.} \quad \sum_{e\in\hat{E}} R_{e} = \mathcal{A}. \tag{3} \]
由于目标函数是严格凸的,只有当所有路由专家的误差相同时,我们才能获得全局最小值:
\[ R_{e_{i}} \approx R_{e_{j}} \approx \frac{\mathcal{A}}{|\hat{E}|} \quad \forall e_{i}, e_{j} \in \hat{E}. \tag{4} \]
该分析表明,专家间期望误差的差异可能增加全局集成误差的下界。因此,根据集成视角,我们受到激励去鼓励所有专家间性能相似,以增强混合专家模型的鲁棒性。

### 3.2专家的激活熵

我们在 CollaQ 中引入激活熵指标,用于在不使用令牌标签的情况下估计专家性能。通常,语言模型性能通过交叉熵来衡量,它将生成的令牌与令牌标签进行比较。然而,这种方法在我们的方法中不可行,因为专家不直接生成令牌;相反,我们使用其连续值输出激活(即专家 FFN 输出)来评估每个专家,而无需令牌标签。因此,我们采用微分熵(Cover and Thomas, 2006 (https://arxiv.org/html/2609.18131#bib.bib8);Malinin and Gales, 2018 (https://arxiv.org/html/2609.18131#bib.bib9))的原理来量化不确定性,从而推导专家的熵,如下所示:
\[ H(x) = \frac{1}{2} \ln(2\pi e \sigma^2), \tag{5} \]
其中 H(x) 是微分熵,\pi 和 e 表示常数值,\sigma^2 代表 x 的方差。等式 5 (https://arxiv.org/html/2609.18131#S3.E5) 在 x 服从高斯近似 p(x) \sim \mathcal{N}(\mu, \sigma^2) 时成立,并且每个专家生成的激活值可由该分布合理近似(见附录 A.2 (https://arxiv.org/html/2609.18131#A1.SS2))。因此,通过应用等式 5 (https://arxiv.org/html/2609.18

相似文章

MixQuant:大语言模型的自适应混合精度量化

arXiv cs.LG

MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。