递归残差量化:一种面向大语言模型的渐进式多精度表示
摘要
提出了递归残差量化(RRQ),这是一种训练后量化框架,通过加法式残差细化,从单个LLM检查点获得多种有效精度,从而提高了灵活性和构建速度。
arXiv:2608.04048v1 公告类型:新
摘要:在多种部署约束下服务大语言模型(LLMs)需要在准确性、内存占用和吞吐量之间进行灵活的权衡。然而,传统的量化方法通常需要为每个目标位宽单独保存一个检查点。我们提出了递归残差量化(RRQ),这是一种训练后量化(PTQ)框架,将权重表示为低位量化基与一系列量化残差修正的组合,从而能够从单个检查点获得多种有效精度。从通过训练后量化(PTQ)或就近舍入(RTN)获得的2位模型开始,RRQ逐步添加由RTN生成的轻量级2位残差,以构建4位、6位和8位表示。该方法无需校准,且避免了联合多位优化。在我们的Qwen3-8B设置中,完整的全RTN 2/4/6/8位包在1,293秒内构建完成,比实测的MatGPTQ构建快3.3倍。在六个近期LLM上的实验表明,6位和8位精度具有竞争力,而4位精度则表现出与模型相关的行为。代码将在发表后公开提供。
查看缓存全文
缓存时间: 2026/08/06 07:45
# Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs
Source: https://arxiv.org/html/2608.04048
###### 摘要
在多种部署约束下服务大型语言模型(LLMs)需要在准确性、内存占用和吞吐量之间进行灵活权衡。然而,传统的量化方法通常需要为每个目标位宽单独存储一个检查点。我们提出了循环残差量化(Recurrent Residual Quantization, RRQ),一种后训练量化(Post-Training Quantization, PTQ)框架,将权重表示为低比特量化基座加上一系列量化残差校正,从而从单个检查点实现多种有效精度。从通过后训练量化(PTQ)或四舍五入到最近(Round-to-Nearest, RTN)获得的2比特模型开始,RRQ逐步添加通过RTN生成的轻量级2比特残差,以构建4比特、6比特和8比特表示。该方法无需校准,且避免了联合多比特优化。在我们的Qwen3-8B设置中,完整的全RTN 2/4/6/8比特包在1,293秒内构建完成,比实测的MatGPTQ构建快3.3×3.3\times。在六个最近的LLM上的实验表明,在6比特和8比特下具有竞争性的准确性,在4比特下表现因模型而异。代码将在发表后公开提供。
## 1 引言
大型语言模型(LLMs)[2 (https://arxiv.org/html/2608.04048#bib.bib34),21 (https://arxiv.org/html/2608.04048#bib.bib35),30 (https://arxiv.org/html/2608.04048#bib.bib1),10 (https://arxiv.org/html/2608.04048#bib.bib20)]在广泛的任务中取得了强劲的表现,但它们的内存占用和带宽需求仍然是高效服务的主要障碍。仅权重的后训练量化(PTQ)是降低这些成本的一种实用方法,近期的方法可以在低精度下保持较强的准确性[11 (https://arxiv.org/html/2608.04048#bib.bib4),20 (https://arxiv.org/html/2608.04048#bib.bib5),4 (https://arxiv.org/html/2608.04048#bib.bib32),26 (https://arxiv.org/html/2608.04048#bib.bib8),13 (https://arxiv.org/html/2608.04048#bib.bib17)]。然而,大多数PTQ流程是为单一目标精度构建的:支持4比特、6比特和8比特部署通常需要构建并存储单独的检查点。这种固定精度的工作流程与灵活服务不太匹配。在实践中,首选精度可能取决于可用内存、延迟目标、工作负载大小和准确性要求[32 (https://arxiv.org/html/2608.04048#bib.bib16),17 (https://arxiv.org/html/2608.04048#bib.bib36)]。一种能够暴露多种准确性-效率权衡的单一表示将减少检查点管理开销,并避免为不同位宽反复量化同一模型。最近的单检查点多精度方法[24 (https://arxiv.org/html/2608.04048#bib.bib2),16 (https://arxiv.org/html/2608.04048#bib.bib19)]通过使用嵌套整数位布局来实现这一目标,其中低精度模型从共享的高比特表示中派生。虽然有效,但这种设计将所有支持的精度耦合在一个位层次结构中,并且难以重用已经优化的低比特检查点作为更高精度变体的起点。
我们引入了*循环残差量化*(RRQ),一种用于单检查点多精度LLM表示的后训练框架。RRQ用加性残差精化替代嵌套位切片:权重被表示为低比特量化基座加上一系列量化残差校正。基座阶段给出最低精度模型,添加残差阶段逐步改进重建。这种表述将基座量化器与精度扩展机制分离,允许使用不同的量化器构建低比特基础和残差阶段。我们的主要实现将RTN用于2比特基座和三个轻量级2比特残差阶段,产生2比特、4比特、6比特和8比特表示。整个构建过程无需校准,不需要Hessian估计或联合多比特优化。因此,RRQ可以高效地构建多精度包,而不依赖于学习到的低比特基座量化器。我们还报告了一个更强的SignRoundV2基座变体作为消融,以分离第一阶段质量与残差表示本身的影响。在一个代表性的Qwen3-8B案例研究中,全RTN RRQ包在1,293秒内完成,比先前的多精度PTQ基线快约3.3×3.3\times。我们进一步分析了残差精化何时有望带来帮助。分析表明,当局部离群值主导量化组的动态范围时,RRQ最有利。在这种状态下,基座阶段捕获大幅值分量,使后续阶段能够量化更窄的残差信号。这种观点也解释了为什么RRQ的低比特行为因模型而异:残差精化对离群值密集的权重分布更有效,而对于更平坦的分布,直接或专用固定比特量化器可能仍然更可取。
我们在六个最近的LLM上评估了RRQ,涵盖基座检查和指令微调检查点。RRQ在更高的有效精度下接近BF16准确性,并在8比特和6比特时与现有的单检查点多精度方法保持竞争力。在4比特时,不同模型的表现差异更大,这与基于离群值的分析一致。我们的贡献总结如下:
- •我们引入了RRQ,一种将LLM权重表示为低比特量化基座加上量化残差阶段的后训练框架,实现了单检查点多精度重建,并能重用现有的低比特检查点。
- •我们通过基于离群值的视角分析了RRQ,展示了渐进式残差精化何时可能优于直接固定比特量化,并解释了其在低比特宽度下因模型而异的行为。
- •我们在最近的LLM上验证了RRQ,显示出在8比特和6比特下具有竞争性的准确性、因模型而异的4比特行为,以及在Qwen3-8B案例研究中测得的3.3×3.3\times构建时间缩减。
## 2 相关工作
### 2.1 面向LLM的固定精度权重量化
权重量化是降低LLM内存占用和推理成本的标准方法。后训练量化(PTQ)在无需重新训练的情况下压缩预训练权重。四舍五入到最近(RTN)是一个简单的基线,而GPTQ[11 (https://arxiv.org/html/2608.04048#bib.bib4)]和AWQ[20 (https://arxiv.org/html/2608.04048#bib.bib5)]利用二阶信息或激活感知缩放来减少量化损失。SqueezeLLM[15 (https://arxiv.org/html/2608.04048#bib.bib6)]对离群值密集的权重分布使用非均匀量化。LLM.int8()[6 (https://arxiv.org/html/2608.04048#bib.bib29)]系统地强调了离群值,表明一小部分激活通道可能主导量化误差;SmoothQuant[29 (https://arxiv.org/html/2608.04048#bib.bib30)]通过等效的逐通道缩放将难度从激活转移到权重来缓解这一问题。训练感知方法如LLM-QAT[22 (https://arxiv.org/html/2608.04048#bib.bib7)]将量化纳入训练,而PTQ方法如OmniQuant[26 (https://arxiv.org/html/2608.04048#bib.bib8)]通过块级重建学习辅助缩放和移位参数。这些方法虽然有效,但每个目标精度只产生*一个检查点*;因此,服务多种精度需要多个独立量化的模型。
### 2.2 多精度量化
越来越多的研究旨在获得一个可以在多种精度下运行的*单一*量化模型。MatQuant[24 (https://arxiv.org/html/2608.04048#bib.bib2)]将Matryoshka思想引入整数量化:高比特父模型可以通过最高有效位提取在推理时切分为较低比特的子模型。然而,MatQuant依赖于基于学习的量化(QAT或OmniQuant),不支持一次性PTQ或重用现有检查点。MatGPTQ[16 (https://arxiv.org/html/2608.04048#bib.bib19)]将这一方向扩展到PTQ,通过将GPTQ适应为联合多比特目标,在一次遍历中生成可切分的父检查点,并具有异构的逐层比特分配。然而,与MatQuant一样,MatGPTQ仍然局限于整数Matryoshka切片和嵌套整数位布局。混合精度方法如HAWQ[9 (https://arxiv.org/html/2608.04048#bib.bib9)]、HAWQ-V2[8 (https://arxiv.org/html/2608.04048#bib.bib14)]和OWQ[18 (https://arxiv.org/html/2608.04048#bib.bib10)]在层间分配不同的位宽,但它们针对的是单个静态精度配置文件,而不是在多个可用精度之间切换。
RRQ与MatQuant和MatGPTQ互补。它不是在一个整数字段内进行MSB切片,而是将权重分解为基座量化器和循环残差阶段。这保留了PTQ的灵活性,同时消除了所有精度都必须来自嵌套整数字段的限制。因此,RRQ可以建立在现有量化检查点之上,并重用现有量化器或低比特内核作为阶段级构建块。它还在表示上支持异构阶段格式,尽管本文仅对整数低比特阶段进行了实证评估。表1 (https://arxiv.org/html/2608.04048#S2.T1)总结了区别。
表 1:与代表性量化方法的特性比较。✓:受支持并已评估或该方法的标准特性;repr.:表示上支持但此处未实证评估;×:不支持;partial:受限支持;—:超出方法范围。
| | RRQ | GPTQ[11 (https://arxiv.org/html/2608.04048#bib.bib4)] | MatQuant[24 (https://arxiv.org/html/2608.04048#bib.bib2)] | MatGPTQ[16 (https://arxiv.org/html/2608.04048#bib.bib19)] |
|---|---|---|---|---|
| 单检查点多精度 | ✓ | × | ✓ | ✓ |
| 适用于后训练 | ✓ | ✓ | partial | ✓ |
| 非整数/FP阶段 | repr. | × | × | × |
| 基于量化检查点构建 | ✓ | × | × | × |
| 重用量化器/内核 | ✓ | — | × | × |
### 2.3 残差和多阶段量化
残差量化在信号处理和向量量化中有着悠久的历史,其中信号通过对重建误差进行连续量化和减法来近似[14 (https://arxiv.org/html/2608.04048#bib.bib11)]。在神经网络压缩中,残差向量量化(RVQ)已被用于基于码本的权重压缩[23 (https://arxiv.org/html/2608.04048#bib.bib12)]和学习式图像压缩[19 (https://arxiv.org/html/2608.04048#bib.bib13)]。最近的激活压缩工作也使用残差精化。Quant VideoGen (QVG)[28 (https://arxiv.org/html/2608.04048#bib.bib3)]对自回归视频扩散模型中的KV缓存张量应用渐进式残差量化,表明迭代残差编码可以减少激活存储。RRQ在目标和目标函数上有所不同:它量化*静态模型权重*,使用固定的逐组标量量化而不是输入相关的聚类,并使残差阶段的每个前缀都成为不同有效位宽的可使用模型。
## 3 循环残差量化
RRQ的动机来自现代LLM中观察到的重尾权重分布。先前的研究在Transformer模型的激活[6 (https://arxiv.org/html/2608.04048#bib.bib29),27 (https://arxiv.org/html/2608.04048#bib.bib33)]和权重[15 (https://arxiv.org/html/2608.04048#bib.bib6),18 (https://arxiv.org/html/2608.04048#bib.bib10),7 (https://arxiv.org/html/2608.04048#bib.bib31)]中都发现了局部离群值。为了量化局部离群值的严重程度,我们定义*峰值均值比*(Peak-to-Mean Ratio, PMR)为同一量化组内最大绝对权重除以平均绝对值(Mean Absolute Value, MAE)。取张量各组中PMR的最大值可以突出对均匀量化最具挑战性的组。例如,在组大小为128时,Qwen3-14B的逐张量最大PMR平均值为27.826。这种局部动态范围会增加均匀量化误差,表明残差校正可能是有用的。
### 3.1 问题设置
设\(x_{i}^{j}\)表示量化组\(i\)内的第\(j\)个浮点权重元素,并设\(s^{i}\)和\(z^{i}\)是该组共享的缩放因子和零点。传统量化器首先应用仿射变换来缩放和移位每个权重:
\[
q^{j}=\frac{x_{i}^{j}}{s^{i}}+z^{i},
\]
(1)
然后使用舍入算子\(\mathcal{R}(\cdot)\)获得离散整数码:
\[
Q^{j}=\mathcal{R}(q^{j}).
\]
(2)
量化器将整数码\(Q^{j}\)与元数据\(s^{i}\)和\(z^{i}\)一起存储。因此,量化误差(或残差)定义为:
\[
r^{j}=x_{i}^{j}-(Q^{j}-z^{i})s^{i}.
\]
(3)
标准固定比特量化会丢弃该残差,因此每个目标精度通常都作为独立检查点生成。RRQ在后续阶段量化残差\(r^{j}\),产生一系列加性校正。
### 3.2 方法论框架
假设基座阶段量化格式记为\(b_{0}\),它可以对应整数位宽或专门的低比特浮点格式。我们定义\(S\)为残差量化阶段的总数,其中\(b_{k}\)表示分配给第\(k\)个残差阶段的格式。如果所有阶段都使用整数格式,则经过\(t\)个残差阶段后的累积名义比特预算为:
\[
B_{t}=b_{0}+\sum_{k=1}^{t}b_{k}.
\]
RRQ从一个基座量化模型开始,递归地量化残差误差:
\[
\begin{aligned}
Q_{0}^{j} &= \mathcal{Q}_{b_{0}}(x^{j},z_{0}^{j}), \\
r_{0}^{j} &= x^{j}-\hat{x}_{0}^{j}, \\
Q_{k}^{j} &= \mathcal{Q}_{b_{k}}(r_{k-1}^{j},z_{k}^{j}), \quad \text{for } k=1,\ldots,S, \\
r_{k}^{j} &= r_{k-1}^{j}-\hat{r}_{k}^{j},
\end{aligned}
\]
(4-7)
其中\(\hat{x}_{0}^{j}\)是基座阶段的反量化近似,\(\hat{r}_{k}^{j}\)表示第\(k\)个残差阶段的反量化校正。在累积\(t\)个阶段后的有效重建权重是简单的加性求和:
\[
\tilde{x}_{(t)}^{j}=\hat{x}_{0}^{j}+\sum_{k=1}^{t}\hat{r}_{k}^{j}.
\]
(8)
算法1 (https://arxiv.org/html/2608.04048#alg1)形式化了这一构建过程。该协议需要全精度权重来计算残差目标。它也可以通过在初始基座量化步骤之前跳到已有低比特检查点来启动。
**算法 1** 循环残差量化(RRQ)
1: 全精度权重 \(W\),以及可选的现有基座检查点;基座量化器 \(\mathcal{Q}_{0}\);残差量化器 \(\{\mathcal{Q}_{k}\}_{k=1}^{S}\)。
2: **如果**提供了基座检查点**则**
3: 加载其码、缩放因子和零点;反量化为 \(\hat{W}_{0}\)。
4: **否则**
5: 用 \(\mathcal{Q}_{0}\) 量化 \(W\);存储基座码、缩放因子和零点;反量化为 \(\hat{W}_{0}\)。
6: **结束如果**
7: \(R_{0} \leftarrow W - \hat{W}_{0}\)
8: **对于** \(k=1,\ldots,S\) **执行**
9: 用 \(\mathcal{Q}_{k}\) 量化 \(R_{k-1}\);存储残差码、缩放因子和零点。
10: 将残差阶段反量化为 \(\hat{R}_{k}\)相似文章
ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization
ReQuant introduces a backpropagation-free, fixed-grid discrete refinement stage for post-training quantization (PTQ) that iteratively improves initial quantized models while preserving the quantized format, showing consistent gains across various LLMs and bit-widths.
ReRound:重建式舍入以解决无校准LLM量化中的中点模糊性
ReRound是一种训练后量化方法,使用条件扩散模型来引导接近中点的权重的舍入,在3位和4位量化下提高小型LLM的准确性,且不引入推理开销。
REAL-Q:通过动态梯度下降实现端到端大语言模型量化
本文提出REAL-Q,一种新颖的端到端对齐训练后量化方法,用于大语言模型,该方法利用动态梯度下降来减轻量化误差,在KL散度降低方面相较于最先进方法实现了显著改进。
用于大语言模型压缩的联合结构化剪枝与混合精度量化
一种新颖的端到端大语言模型压缩框架,联合优化结构化剪枝与混合精度量化,在超低位宽精度下,相比于现有最先进方法实现了显著的困惑度降低和加速效果。
MixQuant:大语言模型的自适应混合精度量化
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。