MixQuant:大语言模型的自适应混合精度量化
摘要
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。
arXiv:2607.23047v1 公告类型: 新
摘要: 混合精度量化通过为敏感层分配更高位宽来提高训练后量化的准确性,但现有方法仅针对单一固定内存预算进行分配。实践中预算因部署而异,并且在标定时未知。自适应量化通过一次离线标定来服务于任意预算,但当前方法在评估层敏感性时未考虑其与其他层量化水平的依赖关系。我们证明,层的敏感性强烈依赖于其上游层的位宽,且这种依赖关系会改变最终的优选位分配。我们提出MixQuant,一种与具体技术无关的自适应框架,可封装任何基础量化器。MixQuant通过随机量化上游配置边缘化每层的失真,以获得预算无关的分数;在分配器自身生成的方案上标定量化器参数;并惩罚将层置于最低位宽的分配。随后,单次贪心传递即可在部署时服务于任意预算。在Llama-3.2-3B、Llama-2-7B和Mistral-7B上,结合AWQ和GPTQ,MixQuant在所有设置中均优于自适应和混合精度基线,在最紧预算下平均准确率提升高达8个百分点,困惑度从12.43降至10.70,同时以可忽略的部署成本匹配ILP求解器。
查看缓存全文
缓存时间: 2026/07/28 06:24
# MixQuant:大型语言模型的自适应混合精度量化
来源:https://arxiv.org/html/2607.23047
Ashitabh Misra 伊利诺伊大学厄巴纳-香槟分校 misra8@illinois\.edu & Madhav Agrawal 伊利诺伊大学厄巴纳-香槟分校 madhav5@illinois\.edu & Arham Jain 伊利诺伊大学厄巴纳-香槟分校 arhamj3@illinois\.edu & Tarek Abdelzaher 伊利诺伊大学厄巴纳-香槟分校 zaher@illinois\.edu
###### 摘要
混合精度量化通过为敏感层分配更高的位宽来提高训练后量化的准确性,但现有方法仅针对单个固定的内存预算求解分配。实践中,预算在不同部署场景中变化,且在标定时未知。自适应量化通过一次离线标定即可服务于任意预算来解决这一问题,但当前方法在计算层敏感性时,未考虑其对其他层量化水平的依赖。我们发现,层的敏感性强烈依赖于其上游层的位宽,且这种依赖会改变最终的位分配偏好。我们提出**MixQuant**,一种与具体技术无关的自适应框架,可封装任意基础量化器。**MixQuant**通过将每个层的失真在随机量化的上游配置上进行边缘化,从而获得与预算无关的评分;在分配器自身生成的计划所对应的激活上校准量化器参数;并对将层保留在最低位宽的分配进行惩罚。部署时,单次贪心遍历即可服务于任意预算。在基于 AWQ 和 GPTQ 的 Llama-3.2-3B、Llama-2-7B 以及 Mistral-7B 模型上,**MixQuant**在所有设置下均优于自适应和混合精度基线,在最严格预算下平均准确率提升高达8个百分点,困惑度从12.43降至10.70,同时以极低部署成本匹敌 ILP 求解器。
## 1 引言
大型语言模型(LLMs)支撑着从对话系统、代码助手到搜索和文档理解等广泛应用(Touvron et al. 2023 (https://arxiv.org/html/2607.23047#bib.bib151); Lewis et al. 2020 (https://arxiv.org/html/2607.23047#bib.bib155); Islam et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib131))。其能力随规模增长,成本也随之增加:部署一个拥有数百亿参数的模型超出了大多数部署目标的内存和带宽(Touvron et al. 2023 (https://arxiv.org/html/2607.23047#bib.bib151); Kwon et al. 2023 (https://arxiv.org/html/2607.23047#bib.bib152))。在剪枝、蒸馏和低秩分解等压缩技术中(Liu et al. 2019 (https://arxiv.org/html/2607.23047#bib.bib107); Hinton et al. 2015 (https://arxiv.org/html/2607.23047#bib.bib109); Liu and Parhi 2023 (https://arxiv.org/html/2607.23047#bib.bib154)),训练后量化(PTQ)最为广泛采用,只需少量校准集且无需重新训练即可降低权重精度(Gholami et al. 2021 (https://arxiv.org/html/2607.23047#bib.bib129); Rokh et al. 2023 (https://arxiv.org/html/2607.23047#bib.bib130))。
混合精度量化扩展了均匀 PTQ,它利用了不同层敏感性差异显著这一事实:为敏感层分配更高位宽,而在其他层使用较低位宽,可在相同内存占用下获得更好精度(Wang et al. 2019 (https://arxiv.org/html/2607.23047#bib.bib56); Xu et al. 2022 (https://arxiv.org/html/2607.23047#bib.bib69))。我们展示了内存消耗相近的分配在质量上可能存在差异(表1 (https://arxiv.org/html/2607.23047#S1.T1))。内存预算本身并不决定精度,关键在于位分配的位置。现有的混合精度量化方法在**固定**资源约束下搜索最优分配(Wang et al. 2019 (https://arxiv.org/html/2607.23047#bib.bib56); Koryakovskiy et al. 2023 (https://arxiv.org/html/2607.23047#bib.bib54))。实际上,约束既非单一也非已知:同一模型部署在不同内存容量的设备上,且标定完成后可能出现新的部署目标。此外,如果标定速度慢于内存可用性变化,分配始终是过时的。多种预算使得逐预算标定在计算上不可行,未知预算则使其不可能。因此,解决方案必须进行一次标定,生成可从其在部署时廉价推导出任意预算位分配的度量(Jin et al. 2020 (https://arxiv.org/html/2607.23047#bib.bib49); Yu et al. 2021 (https://arxiv.org/html/2607.23047#bib.bib126))。
然而,现有的自适应量化方法存在三个局限性。首先,为卷积神经网络开发的自适应量化技术依赖于重新训练以恢复精度(Jin et al. 2020 (https://arxiv.org/html/2607.23047#bib.bib49); Bulat and Tzimiropoulos 2021 (https://arxiv.org/html/2607.23047#bib.bib48); Shkolnik et al. 2020 (https://arxiv.org/html/2607.23047#bib.bib68); Sun et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib52)),这在 LLM 规模下不可行。其次,针对 LLM 的训练后自适应量化方法,如(Dumitru et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib144)),在由 FP16 上游层生成的输入上计算逐层度量(我们称上游位分配为**上下文**)。这种上下文在部署时永远不会出现(部署时每层都是量化的),并且我们表明上下文的选择会改变度量及其产生的位分配(图2 (https://arxiv.org/html/2607.23047#S1.F2))。第三,诸如 Any-Precision LLM(Park et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib146))等方法依赖于单一基础量化方案(SqueezeLLM 的非均匀码本(Kim et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib139))),无法跨 PTQ 技术迁移。
参见标题图1:**MixQuant** 概述。**阶段1** 通过在每个模块(module, bitwidth)对在 \(K\) 个随机量化上游上下文下评分,构建与预算无关的失真表 \(\mathbf{D}\in\mathbb{R}^{L\times |\mathcal{B}|}\)(第4.1节 (https://arxiv.org/html/2607.23047#S4.SS1))。**阶段2** 在贪心求解器在可行预算范围内产生的锚定计划所诱导的激活上估计技术参数 \(\mu\),而非在 FP16 激活上估计(第4.2节 (https://arxiv.org/html/2607.23047#S4.SS2))。**阶段3** 添加尾部惩罚 \(\gamma\),将多余预算从最低位宽导向其他位宽(第4.3节 (https://arxiv.org/html/2607.23047#S4.SS3))。部署时,每个预算 \(M_i\) 通过对 \(\mathbf{D}\)、\(\mu\) 和 \(\gamma\) 进行一次贪心求解来服务。
#### 我们的解决方案。
我们提出 **MixQuant**,一个与具体技术无关的自适应 PTQ 框架,可封装任何基础量化器,如 AWQ、GPTQ 等(Lin et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib138); Frantar et al. 2022 (https://arxiv.org/html/2607.23047#bib.bib143))。它通过三个阶段解决上述局限性。**首先**,**MixQuant** 不是针对 FP16 网络评分每一层,而是在层的**上游**层的随机混合精度配置下测量每个(层,位宽)对的输出失真——这些上游层是唯一塑造其输入的层。然后通过蒙特卡洛采样将这种失真在随机配置上边缘化。边缘化消除了对未知上下文的依赖,得到的失真表仅依赖于层及其位宽,因此可服务于所有部署预算。**其次**,**MixQuant** 重新引入标定时已知的信息,即技术和求解器。它在求解器实际产生的分配所诱导的激活上估计技术参数(AWQ 缩放因子和裁剪范围,GPTQ Hessian),而不是在 FP16 激活上估计。**第三**,由于量化误差在前向传播中不可逆,低位分配具有不成比例的损害;**MixQuant** 添加一个**尾部正则化**项,将多余预算导向仍处于最低位宽的层。最后,我们将位分配表述为多选择背包问题,并使用贪心算法求解,该算法足够廉价,可在部署时为每个新预算运行。我们经验证明,其分配在下游准确率上与整数线性规划求解器相匹配(表5 (https://arxiv.org/html/2607.23047#S5.T5))。
总之,我们的主要贡献是:
- • 我们识别出自适应量化中的部署-上下文不匹配:基于 FP16 模型计算的逐层敏感性评分不能反映实际部署的全量化网络。我们提出一种均值场补救措施,通过在随机量化配置的上游层上边缘化每层误差,获得与预算无关的失真评分。
- • 我们开发了 **MixQuant**,一个端到端、与具体技术无关的自适应量化流水线,结合了解耦的失真评分、计划感知的技术参数估计以及尾部正则化贪心分配,使得一次离线标定即可在部署时为任何内存预算服务,只需一次廉价的贪心求解。
- • 我们在多个模型、数据集和常用校准度量上评估 **MixQuant**,并表明它始终比现有自适应和混合精度基线(Dumitru et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib144); Zhao et al. 2026 (https://arxiv.org/html/2607.23047#bib.bib145); Dong et al. 2020 (https://arxiv.org/html/2607.23047#bib.bib149); Jin et al. 2020 (https://arxiv.org/html/2607.23047#bib.bib49))产生更好的位分配。
表 1:从主要实验(表2 (https://arxiv.org/html/2607.23047#S5.T2)、3 (https://arxiv.org/html/2607.23047#S5.T3) 和 4 (https://arxiv.org/html/2607.23047#S5.T4))中在固定预算下为每个模型采样的计划。尽管内存几乎相等,但困惑度和准确率并不与未加权平均位宽成比例:最高位宽的计划并非最准确。精度在层间的分布方式(而非平均值)决定了质量。
参见标题(a) 跨上下文的度量变化。对于 Llama-3.2-3B(左)和 Llama-2-7B(右)的六个代表性模块,NMSE 和 KL 散度在上下文间的相对散度 \((\max-\min)/\min\)。两个度量变化幅度高达两到三个数量级。
参见标题(b) 跨上下文的分配变化。Llama-3.2-3B 的每线性层位宽散度 \((\max-\min)\),每个上下文一个计划,来自 MCKP 目标方程2 (https://arxiv.org/html/2607.23047#S3.E2) 上的 ILP 求解器。x 轴按变压器块编号线性层;y 轴变化内存界限。散度出现在所有内存界限上,表明上下文选择会改变位分配。
图 2:上游上下文的影响,在两个面板中都使用相同的 20 个随机量化上下文测量。每模块度量(顶部)及其诱导的下游计划(底部)均随上下文变化,因此在单个上下文中评分会使位分配产生偏差。**MixQuant** 通过对上下文取平均来消除这种依赖(第4.1节 (https://arxiv.org/html/2607.23047#S4.SS1))。
## 2 相关工作
**MixQuant** 建立在两条先前工作线之上:LLM 的训练后量化和自适应量化。我们逐一回顾。
### 2.1 LLM 的训练后量化
由于重新训练百亿参数模型成本过高,**训练后量化**(PTQ)已成为压缩 LLM 的主要方法。基于缩放的方法在权重和激活之间重新分布量化难度:SmoothQuant(Xiao et al. 2023 (https://arxiv.org/html/2607.23047#bib.bib137))通过逐通道等效变换将激活异常值迁移到权重中,而 AWQ(Lin et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib138))保护由激活幅度识别的少数显著权重通道。GPTQ(Frantar et al. 2022 (https://arxiv.org/html/2607.23047#bib.bib143))则利用二阶信息,逐列量化并使用近似 Hessian 来补偿每一步引入的误差。LQER(Zhang et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib140))采用修正路线,将残差量化误差吸收进激活缩放的低秩项中。基于旋转的方法则对网络进行预处理:QuaRot(Ashkboos et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib141))应用随机 Hadamard 旋转,SpinQuant(Liu et al. 2025 (https://arxiv.org/html/2607.23047#bib.bib142))学习这些旋转,两者在量化前抑制异常值。**混合精度**方法则在模型中非均匀地分配位:HAWQv2(Dong et al. 2020 (https://arxiv.org/html/2607.23047#bib.bib149))通过平均 Hessian 迹分配层位宽,AMQ(Lee et al. 2025 (https://arxiv.org/html/2607.23047#bib.bib158))搜索逐层精度以在预算下最小化精度损失,AQLM(Egiazarian et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib157))通过学习的加法码本将权重推至约 2 位,所有这些都是在目标预算下权衡精度。前述技术假设部署内存预算事先已知。在部署时约束动态变化的实时场景中,这一假设失效——为每个新预算重新求解分配是不切实际的。
### 2.2 自适应量化
**自适应量化**消除了这种依赖:一次离线标定生成逐层评分,部署时通过一次廉价求解即可从这些评分中恢复针对**任意**预算的分配。早期的自适应量化方法针对 CNN 和小型变压器开发,通过量化感知训练实现:AdaBits(Jin et al. 2020 (https://arxiv.org/html/2607.23047#bib.bib49))联合训练单个模型以运行一组固定位宽中的任意一个,BitMixer(Bulat and Tzimiropoulos 2021 (https://arxiv.org/html/2607.23047#bib.bib48))训练一个元网络在运行时选择任意混合精度配置,RobustQuant(Shkolnik et al. 2020 (https://arxiv.org/html/2607.23047#bib.bib68))正则化权重峰度,使层分布在不同精度下保持鲁棒。所有这些都通过梯度更新恢复精度,这在 LLM 规模下不可行;因此我们专注于 LLM 的免重训练自适应量化。LIM(Dumitru et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib144))通过输入和输出隐藏状态之间的余弦相似度对每个变压器块评分,这是一种无需求解器的单次通过度量。CoopQ(Zhao et al. 2026 (https://arxiv.org/html/2607.23047#bib.bib145))通过 Shapley 值归因每层的贡献,并使用 ILP 分配位宽。Any-Precision LLM(Park et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib146))存储一个模型以服务多个位宽,基于 SqueezeLLM(Kim et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib139))的非均匀码本。
## 3 问题设置
#### 设置。
预训练 LLM 包含线性模块 \(\ell\in\{1,\dots,L\}\),其中模块 \(\ell\) 有 \(P_\ell\) 个参数。每个模块通过 PTQ 技术 \(T\)(例如 AWQ 或 GPTQ(Lin et al. 2024 (https://arxiv.org/html/2607.23047#bib.bib138); Frantar et al. 2022 (https://arxiv.org/html/2607.23047#bib.bib143)))进行量化。该技术具有校准参数 \(\mu\),例如 AWQ 的平滑因子和裁剪范围,或 GPTQ 的 Hessian 估计。位宽从有序集合 \(\mathcal{B}\)(实验中 \(\mathcal{B}=\{3,\dots,8\}\))中选择,**计划**是一个向量 \(\mathbf{b}=(b_1,\dots,b_L)\in\mathcal{B}^L\),表示给每个模块指定位宽。量化后的模型大小由下式给出:\(S(\mathbf{b}) = \sum_{\ell=1}^L b_\ell\cdot P_\ell\),必须满足某个**内存预算**\(M\),即 \(S(\mathbf{b}) \le M\)。目标是找到最大化最终任务准确率的计划,但由于依赖上下文且上下文未知,我们使用与上下文无关的失真度量来近似。
(注意:由于原文后续公式和更多内容未完整给出,翻译截止到问题设置部分。如果需要继续翻译剩余部分,请提供完整文本。)相似文章
Mix-Quant: 量化预填充,精准解码的智能体大语言模型
Mix-Quant 提出了一种面向智能体大语言模型的阶段感知量化框架,在预填充阶段使用 NVFP4 量化以加速计算,同时在解码阶段保持 BF16 精度以维持准确性。该方法在智能体基准测试中实现了预填充速度提升最高 3 倍,且性能下降极小。
GEMQ:面向MoE大语言模型的全局专家级混合精度量化方法
提出GEMQ,一种面向MoE大语言模型的全局专家级混合精度量化方法,利用线性规划和路由器微调来减少内存占用并加速推理,同时将精度损失降至最低。
MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化框架
本文介绍MODE,一种用于MoE多模态大语言模型的模态分解专家级混合精度量化框架,通过按模态分解选择频率并过滤冗余视觉标记来解决专家重要性估计中的偏差,在激进量化下实现极小的性能损失。
E-PMQ:专家引导的合并后量化与合并权重锚定
本文介绍了E-PMQ,一种专家引导的合并后量化框架,解决了合并和量化带来的联合偏差,在CLIP-ViT和FLAN-T5等多任务合并模型上取得了显著的精度提升。
面向大语言模型的显著性感知正则化量化校准
本文提出了显著性感知正则化量化校准(SARQC),这是一个统一的框架,通过添加正则化项以保持权重接近度,从而改善大语言模型(LLM)的训练后量化(PTQ),提升泛化能力和性能。