饱和使量化误差可加:一种带证书的覆盖模型

arXiv cs.LG 论文

摘要

本文分析了混合精度神经网络中量化损失的结构,表明饱和使每层损失可加,并提出了一种覆盖模型,该模型用少量参数预测配置损失,在大规模模型上得到验证。

arXiv:2607.12266v1 公告类型:新 摘要:混合精度量化必须决定模型的哪些部分保持更高精度。一个常见的假设(由HAWQ和CoopQ等基于敏感度的方法共享)是,量化一组层的损失可以通过单独测量的逐层或成对敏感度重建。我们在当前部署的4位权重和激活精度下测试这一假设,将量化层集$S$引起的损失变化$f(S)$视为布尔立方体上的集合函数,并通过两种经典的基变换进行分析。该分析得出两个发现。首先,在从部署分布中抽取的配置中,$f$的85–93%方差仅由逐层效应解释。其次,逐层项之和的单调变换可以再现$f$的配置排序,最多错序2%的对。 我们提出覆盖模型$f(S)=c\bigl(1-\prod_{i\in S}(1-a_i)\bigr)$,该模型从其$L$个拟合的断裂率中,将$f$的测量方差轮廓再现到几个百分点以内。该结构支持两个预测配置损失的预测器,每个有$L+1$个参数。加性模型是最优的一阶预测器。根据帕塞瓦尔恒等式,其均方误差等于$f$未被逐层效应解释的方差,我们在完整格上测量该方差,在全网络规模上通过样本外估计,并将每个结果作为证书报告,说明任何加性模型能做到多好。覆盖模型本身是第二个预测器。 作为同等内存下的分配器,它们在30B到355B参数的模型上,在比较的分配器中取得了最低的KL散度。在低于4位的情况下,由此产生的分配继续在预算下解决代码和推理任务,而梯度敏感度的分配不再产生终止的生成结果。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:18

# 饱和度使量化误差呈现加性:一个带证书的覆盖模型  
来源:https://arxiv.org/html/2607.12266  
Inc. David R. Cheriton School of Computer Science, University of Waterloo  

###### 摘要  

混合精度量化需要决定模型的哪些部分保持较高精度。一个常见的假设——HAWQ 和 CoopQ 等基于灵敏度的方法都共享这一假设——是:量化一组层带来的损失,可以从隔离状态下测量的逐层或成对灵敏度中重构出来。我们在目前正在部署的 4 比特权重与激活精度下检验了这一假设,将量化层集 \(S\) 导致的损失变化 \(f(S)\) 视为布尔立方上的集函数,并通过两种经典的基变换对其进行分析。这一分析得出了两个发现。首先,在从部署分布中抽取的配置上,\(f\) 的方差的 85–93% 仅由逐层效应解释。其次,对逐层项之和进行单调变换,可以重现 \(f\) 对配置的排序,最多在 2% 的配对中出现错序。这两个发现都是损失**饱和**的结果。由于损失是有界的,每个被量化的层都会消耗剩余裕量(朝向一个上限 \(c\))的一个固定比例 \(a_i\)(其“击穿率”);由此得到的覆盖模型 \(f(S) = c\left(1 - \prod_{i \in S} (1 - a_i)\right)\) 能够从拟合出的 \(L\) 个击穿率出发,在百分之几的误差范围内重现 \(f\) 的实测方差剖面。这一结构支持两种预测器来预测某个配置的损失,每种都只有 \(L+1\) 个参数。加性模型是最优的一阶预测器。根据 Parseval 恒等式,其均方误差等于 \(f\) 中未被逐层效应解释的方差,我们通过完整格测量,在全网络规模下通过样本外估计,并在每个结果中作为证书报告——说明任何加性模型最多能做到多好。覆盖模型本身则是第二种预测器,两者预测效果相当。饱和度使得某一层在量化其他层之后对边际损失的影响发生变化,因此隔离状态下测量的灵敏度——包括 Hessian 迹(HAWQ-v2)——会以 71–376% 的误差误估配置的损失。一个奥曼–沙普利路径积分可以恢复出最优的加性系数(对应一个与层相关的有效部署密度),并精确保持各层的排序——我们在覆盖模型下证明了这一恢复。这两种预测器在部署前即可为配置定价,在测量预算较小时与黑箱代理模型相当,在对拟合的配置进行外推时退化不超过 2 倍,而代理模型则退化 22–5 倍。作为给定内存下的分配器,它们在从 30B 到 355B 参数的混合专家模型的有争议预算上,达到了所有对比分配器中最低的 KL 散度(在 Qwen3‑30B 上比生产的 ModelOpt 基线低 17–21%)。在低于 4 比特时,由此产生的分配能够在那些梯度灵敏度方法已无法产生有效生成的预算下,继续解决代码和推理任务。  

## 1 引言  

将 Transformer 量化到低位宽是目前实现低成本推理的主要途径,正在部署的格式同时将权重和激活量化到 4 比特。仍然需要设计选择的则是**混合精度**:在内存预算下,哪些层(或张量)应保持较高精度。这个选择至关重要,因为同一内存预算下的不同分配,输出保真度可能相差几十个百分点(第 7 节)。目前这个选择由逐层灵敏度启发式方法决定。这些启发式方法共享同一个结构假设:它们通过**基本上在隔离状态下**(即其他层未量化时)测量的灵敏度对每一层打分,例如 Hessian 特征值或迹(HAWQ;Dong 等人,2019, 2020)、平方梯度 Fisher 分数(ModelOpt;NVIDIA, 2024),或者最多是成对交互项(Deng 等人,2025),然后将这些分数聚合起来对层排序或估计联合配置的损失。据我们所知,量化**一组**层的损失在多大程度上可以从这种低阶测量中恢复,从未被直接检验过。本文中,项的**阶**是指它涉及的层的数量,因此逐层项是一阶,成对项是二阶。  

量化损失是一个定义在 \(L\) 层的所有 \(2^L\) 个子集(即布尔立方体 \(\{0,1\}^L\))上的**集函数**,对于任何实际深度的模型都无法完全枚举。为了直接测量这个函数的阶,我们将 \(f(S) = \text{L}_{\text{CE}}(S \text{ 量化}) - \text{L}_{\text{CE}}(\text{全精度})\) 定义为量化层集 \(S\) 的损伤(damage),通过评估部分量化模型得到,然后通过两种经典的基变换分析实测的 \(f\)。Walsh 变换(函数 ANOVA 分解)在**部署分布**下按阶分解 \(f\) 的方差——该分布中每层以概率 \(p\) 独立地被量化。Möbius 展开则将 \(f\) 重构为带符号的递增阶项之和。  

这一分析得出了两个发现。第一个发现是:损伤的方差几乎完全是一阶的。在从部署分布中抽取的配置上,\(f\) 的方差的 85–93% 由逐层效应解释;而在精确格(即 \(L\) 层的一个区块,其中所有 \(2^L\) 种配置都被测量)上,在扣除测量噪声后该比例上升到 98–99%(图 1,第 3 节)。因此,未解释的剩余部分充当了一个**证书**:一个单一的数字,可以在精确格上直接测量(由定理 1 保证是一个恒等式),也可以从全网络尺度下拟合的击穿率闭式预测(第 4.3 节),它预先说明任何加性模型最多能做到多好,并且我们在每个结果中都附带报告它。达到这一误差下限的加性模型也有闭式解(第 5 节)。  

第二个发现是:\(f\) 中被高阶项解释的方差,并不代表逐层结构的失败。根据定理 1,\(\ge 2\) 阶部分(即逐层效应未能解释的方差份额)等于最优加性拟合的均方误差除以方差(第 3 节)。即使损伤完全由逐层项描述,这一份额也可能非零。如果 \(f\) 在经过一个严格递增变换后是加性的,即存在逐层贡献 \(b_i\) 和严格递增函数 \(g\),使得 \(f(S) = g\left(\sum_{i \in S} b_i\right)\),那么与 \(g^{-1}\) 复合后的函数其 \(\ge 2\) 阶能量正好为零。\(f\) 是否属于这一类别可以在排序上单独检验(定理 2),并且我们测量了任何加性指标必须错序的最小成对配置比较比例——经测量噪声认证——这个比例最多为 2%,在某些模型上甚至无法与零区分,对变换的直接搜索结果也与此一致。因此,实测损伤具有 \(f(S) \approx g\left(\sum_{i \in S} b_i\right)\) 的形式。这一模型类别贯穿全文:它为第 4 节拟合的形式提供了依据,也限制了任何考虑交互的分配器在加性配置评分上的改进空间(第 7 节)。  

我们证明,一个单一的性质——**饱和度**——可以完美解释这两个发现。由于损失是有界的,可以定义**裕量** \(h(S) = c - f(S)\),即低于上限 \(c\) 的可用损伤空间。测量结果很好地被一个模型描述:每个被量化的层消耗剩余裕量的一个固定比例 \(a_i\),即 \(h(S \cup \{i\}) = (1 - a_i) h(S)\),与之前已量化的层无关。等价地,\(f(S) = c\left(1 - \prod_{i \in S} (1 - a_i)\right)\),我们称之为**覆盖模型**。该模型通过最小二乘拟合到采样配置的实测损失上。第二个发现中的模型类别并非随意选取。根据 Aczél 与 Ling 的表示定理(Aczél, 1966;Ling, 1965),任何通过固定运算逐层累加损伤的规则——如果该运算是可结合、连续且严格递增的——都可以重写为 \(g\left(\sum_i b_i\right)\) 的形式(附录 A)。将隔离灵敏度聚合起来,等价于拟合一个约束为“未量化网络时损伤为零”的加性模型;正是这个约束导致了现有启发式方法的失效:放宽一个截距参数,在 FP4 损伤较大的精确格上,\(R^2\) 从 0.13 跃升至 0.94(第 3 节)。由于饱和度会随着更多层的量化而减小每一层的边际损伤,因此当其他层都处于全精度时测得的灵敏度会被放大一个闭式因子——这是一种定性上已知的上下文依赖性的量化形式(Ancona 等,2020;McGrath 等,2023;Zhao 等,2025)——对 \(L\) 个放大的系数求和会使误差累积到 71–376%(我们对 isolate‑and‑sum(即量化损失等于每层单独量化损伤之和)以及 Hessian 迹 HAWQ‑v2 进行了测量,见第 5 节)。单个**奥曼–沙普利路径积分**可以恢复加性模型的最优系数(对应一个与层相关的有效部署密度),并精确还原层的排序,而无需任何采样配置——我们在覆盖模型下证明了这一恢复(第 6 节,附录 B)。  

由于两种模型都是预测而非排序,它们可以为配置**定价**——即在投入运行之前给出其损失预估值,这是单纯排序做不到的。在那些保护最脆弱层、量化其余层的不见配置上,定价的准确度在 4% 以内(附录 E)。与用于同一任务的基于黑箱代理模型的方法(随机森林:Jiang and Lyu, 2025;高斯过程:Zhou 等,2026;RBF 核:Lee 等,2025)相比,这些只有 \(L+1\) 个参数的模型在小测量预算下表现最优或持平——而小预算正是每个测量都需要一次前向传播时最重要的情形。其中最强的高斯过程成功的理由被我们的分析所揭示,并在理论预测的地方失败:当外推到与拟合时不同类型的量化配置时,GP 退化 22–5 倍,而加性和覆盖模型保持在 2 倍以内。这种失败的方向至关重要,因为分配器必须对不同程度量化的配置进行定价(第 7 节)。  

在匹配内存下作为分配器使用时,同样的拟合模型在混合专家语言模型上(从 0.6B 到 355B 参数)达到了所有对比分配器(灵敏度分数、结构规则、以及转化为分配器的黑箱代理模型)中最低的 KL 散度(第 7 节)。在有效位宽低于 4 比特时,由拟合模型产生的配置在 30B 和 235B 模型上,仍能在同样内存预算下使其他方法(如梯度灵敏度)的配置已无法产生有效生成的预算下,继续解决代码和推理任务(第 7.4 节)。  

#### 贡献  

1. **闭式理论**:覆盖模型的精确 Möbius 谱和 Walsh 谱(定理 3 与 4),并通过符号展开的确认分叉(图 2)加以佐证;证书恒等式(定理 1)及其精确的 \(O(L)\) 异构形式(命题 5);以及加性函数直到递增变换的序刻画(定理 2)(第 3–4 节,附录 F)。  
2. **一个带闭式解释的负面结果**:隔离测量的灵敏度(包括 HAWQ‑v2)以 71–376% 的误差误估配置损失,并给出了导致放大的闭式因子(第 5 节)。  
3. **无需拟合的估计器**:单个奥曼–沙普利路径积分恢复出加性模型在层特定有效密度下的最优系数,并精确保持层的排序——在覆盖模型下证明(第 6 节,附录 B)。  
4. **一个可解释的预测器**:在小预算下与 RF/GP/RBF/成对基线相比最优或持平;在配置外推时退化最多 2 倍,而 GP 退化 22–5 倍;在 0.6B–355B 的 LLM 以及扩散 DiT 上得到验证(第 6 节,图 4)。  
5. **一个匹配内存的分配器**:在灵敏度、规则和代理模型基分配器中达到最低 KL 散度(Qwen3‑30B 上比生产的 ModelOpt 基线低 17–21%,Qwen3‑235B 上低 13–27%,GLM‑4 上低 20–37%);并且在低于 4 比特时决定服务任务能否存活。  

## 2 相关工作  

#### 基于逐层灵敏度的混合精度分配  

AWQ(Lin 等,2024)使用激活感知缩放;HAWQ 和 HAWQ‑v2(Dong 等,2019, 2020)使用 Hessian 特征值或迹;BRECQ(Li 等,2021)和 GPTQ(Frantar 等,2022)使用二阶权重重建;NVIDIA ModelOpt 的 `auto_quantize`(NVIDIA, 2024)——我们基准测试的生产环境方法——使用结合线性规划的 Taylor/Fisher 分数,通过对隔离的逐层分数求和得出结果。所有这些都是聚合一阶或二阶的单层信号。在我们的部署场景中,最接近的方法是 FGMP(Hooper 等,2025),它通过 Fisher 加权扰动分数为权重和激活选择 FP8 与 NVFP4 块。其分数属于与我们基准测试的 ModelOpt 相同的 Taylor/Fisher 家族,但其张量内块粒度需要协同设计的核,而我们目标的服务栈均不提供,因此它与层级别分配互补而非竞争。ScaleBITS(Li 等,2026)进行硬件对齐

相似文章

Quantization Damage Is Multiplicative, Not Additive

arXiv cs.LG

This preprint challenges the common assumption that quantization damage is additive noise, showing instead that it multiplies decision margins and shrinks them with bit-width, leading to silent failures in tool-use and safety decisions. The authors propose a fitted multiplicative model that predicts flip rates well.

MixQuant:大语言模型的自适应混合精度量化

arXiv cs.LG

MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。

分数持平,失败放大:误差预算如何掩盖量化LLM智能体的损害

arXiv cs.LG

本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。