QTEA:采用稀疏残差显著权重与按列优化的三值大语言模型
摘要
QTEA是一种面向大语言模型的亚2比特训练后量化框架,通过稀疏残差显著权重与按列优化,实现了三值权重压缩,并提升了准确率与硬件效率。
arXiv:2609.00224v1 公告类型:新
摘要:仅权重量化的训练后量化可以缓解大规模部署大语言模型时的计算负担。然而,现有PTQ方法往往难以泛化到不同模型,并在低于2比特时遭受严重的精度损失。许多方法利用非结构化稀疏性来缓解这种损失,但这牺牲了规整性和对GPU友好的执行效率。我们提出了QTEA,一个亚2比特的PTQ框架,它将权重量化为三值,并使用显著权重作为残差误差补偿器。为保持硬件效率,残差被分配到在显著列内具有半结构化\(1{:}4\)稀疏性的选定列中。我们在GPTQ风格的逐列量化中进一步添加了按列缩放细化,交替更新每列的缩放因子和三值分配,以降低重建误差。我们还识别了GPTQ中与顺序相关的误差传播问题,并引入了误差衰减以减轻后期的误差累积。在Qwen3-14B上,QTEA将所有权重压缩至有效的每权重1.7比特,同时将平均精度较最强的三值PTQ基线提升了16.7\%。它在WikiText和C4上的困惑度也分别降低了1.40\(\times\)和2.61\(\times\)。这一趋势在Llama3-8B上同样成立,QTEA获得了6.6\%的精度提升,并在相同数据集上实现了1.34\(\times\)/1.95\(\times\)的更低困惑度。最后,我们开发了一个基于查找表的内核,其每令牌生成速度比FP16基线快7.2\(\times\)。代码已发布于 https://github.com/Intelligent-Microsystems-Lab/QTEA。
查看缓存全文
缓存时间: 2026/09/02 06:11
# 具有稀疏残差显著权重的三值大语言模型与列优化方法
来源: https://arxiv.org/html/2609.00224
作者: Arun M George, Jie Fu, Tareq Mahmoud, Sixue Xing, Siddharth Joshi
单位: 圣母大学
邮箱: yguo23,ageorg23,jfu23,tfathi,sxing,sjoshi2 @nd\.edu
###### 摘要
仅权重的训练后量化能够缓解大规模服务大语言模型时的计算负担。然而,现有的训练后量化方法往往无法跨模型泛化,且在低于2比特时精度损失严重。许多方法利用非结构化稀疏性来缓解这种损失,但牺牲了规律性和GPU友好型执行效率。我们提出了QTEA,一个亚2比特的训练后量化框架,它将权重量化为三值并使用显著权重作为残差误差补偿器。为了保持硬件效率,残差被分配到选定的列中,这些列在显著列内具有半结构化的1:4稀疏性。我们进一步将列级重缩放优化引入GPTQ式的逐列量化中,交替更新每列的缩放因子和三值分配以减少重构误差。我们还识别了GPTQ中的顺序依赖误差传播问题,并引入误差衰减来抑制后期误差累积。在Qwen3-14B模型上,QTEA将所有权重压缩到有效的每权重1.7比特,同时将平均精度相比最强的三值训练后量化基线提升了16.7%。它在WikiText和C4数据集上分别实现了1.40倍和2.61倍的更低困惑度。这一趋势在Llama3-8B上同样成立,QTEA在该模型上获得了6.6%的精度提升,并在同一数据集上实现了1.34倍/1.95倍的更低困惑度。最后,我们开发了一个基于查找表的计算核,相比FP16基线实现了7.2倍的单token生成加速。代码已发布于: https://github.com/Intelligent-Microsystems-Lab/QTEA
## 1 引言
大语言模型在自然语言理解、生成和推理任务上展现了强大的能力。然而,部署这些模型仍然成本高昂,因为推理过程需要反复加载和存储数十亿参数。一个700亿参数的模型仅BF16权重就需要约140GB内存,这还未考虑KV缓存和运行时开销。这种成本在低批量自回归解码中尤为显著,其中每个生成的token都由低算术强度的GEMV操作主导,这些操作需要反复从高带宽存储器将模型权重获取到计算核心,使得推理过程受内存带宽限制。因此,仅权重的训练后量化是降低内存占用和加速低批量推理的直接途径。
近期的低比特量化方法已实现了2比特大语言模型,甚至亚2比特技术,显著提升了智能密度。在此类极低精度下,对所有权重进行均匀量化通常会严重降低精度,因此有必要以更高保真度保留一小部分显著权重。然而,良好地保留显著权重本身代价高昂,现有方法主要在付出何种代价上有所不同。AWQ方法对显著通道进行重新缩放,但在三值化场景下性能下降。非结构化的显著权重保留提高了精度但引入了不规则内存访问。而列级保留虽然更规律,但通过存储和处理大量与显著权重一起的非显著权重,浪费了比特预算。因此,每种设计都在精度或硬件效率上有所舍弃。
我们观察到,在极低比特的训练后量化中,显著权重可以作为误差补偿器,而不是简单地绕过量化。我们没有将重要权重排除在低比特表示之外,而是首先将所有权重量化为紧凑的三值基础,然后为三值量化损害最大的列分配比特预算。我们进一步将列级显著性与半结构化稀疏性相结合,形成一种称为列半稀疏显著权重的方案:残差仅分配给重要列,并且在这些列内仅保留少量高影响力的条目。这在极紧的比特预算下保留了关键的权重校正,同时保持了适合高效内核的规律结构。
在此表示基础上,我们将列级重缩放优化引入GPTQ式的逐列量化。我们不是在初始参数估计后固定三值缩放因子,而是在量化过程中优化每列的重缩放因子,使得三值基础在海森感知误差传播后能更好地匹配局部权重分布。
此外,我们观察到GPTQ的误差传播引入了顺序依赖的不平衡。较早的列可以将其量化误差分散到许多后续列中,而较晚的列只能将误差传播到较短的剩余后缀中。因此,在整个块中应用相同的传播强度可能使后期的误差补偿过于激进且可靠性降低,因为每一步可用于吸收更新的列较少。为缓解这一效应,我们引入了误差衰减,它在GPTQ式量化中分配位置相关的传播强度。通过沿列顺序逐渐衰减误差传播,误差衰减减少了后期误差累积并稳定了极低比特量化。
我们整合这些观察和优化到一个统一的极低比特训练后量化框架中,称为量化三值误差适应。在Qwen3-14B上,QTEA大幅超越了当前最先进的三值训练后量化方法,将下游任务的平均精度提升了16.7%,同时在WikiText和C4上分别实现了1.40倍和2.61倍的更低困惑度。同样的趋势在Llama3-8B上也成立,QTEA将下游任务的平均精度提升了6.6%,并在WikiText上降低了1.34倍困惑度,在C4上降低了1.95倍困惑度。图1展示了QTEA在Qwen3上实现了模型大小与困惑度之间的最佳权衡。
此外,我们为QTEA开发了高效计算核,将紧凑的三值表示转化为实际的推理加速。结合CUDA Graphs,QTEA减少了运行时开销,并在使用CUDA Graphs时相比FP16基线实现了7.2倍的生成加速;相比不使用CUDA Graphs的FP16推理,加速达到了13.3倍。
我们的贡献可总结如下:
- • 我们提出了QTEA,一个三值训练后量化框架,将所有权重量化为三值基础,并使用列半稀疏显著权重作为残差补偿器,而非未量化的旁路。
- • 我们将列级重缩放优化引入GPTQ式的逐列量化,并交替优化重缩放因子和三值分配,以提高三值基础的表达能力。
- • 我们识别了GPTQ误差传播中的顺序依赖不平衡问题,并提出了误差衰减机制,以在量化顺序上平衡补偿强度。
- • 我们开发了CUDA计算核,使QTEA在使用CUDA Graphs时实现了比FP16快7.2倍的单token生成加速,不使用CUDA Graphs时加速达13.3倍。
## 2 相关工作
大语言模型的训练后量化。训练后量化无需重新训练即可压缩预训练的大语言模型,仅权重的训练后量化直接降低了推理内存占用和带宽压力。GPTQ利用近似二阶信息最小化层重构误差。AWQ通过激活感知缩放保护显著通道,而OmniQuant学习裁剪范围和等效变换。
极低比特大语言模型的量化感知训练。训练感知的极低比特方法通过微调或重训提高可量化性。QuIP#结合硬件友好旋转与微调实现2比特量化,BitNet使用二值或三值权重训练大语言模型,Sherry引入了硬件高效的1.25比特三值量化感知训练,并采用细粒度3:4稀疏性。相比之下,QTEA是一种训练后量化方法,它通过自适应三值误差补偿恢复精度,无需任何重新训练。
极低比特大语言模型的训练后量化。亚2比特训练后量化需要额外机制以避免严重精度下降。QuIP使用旋转提高可量化性,PB-LLM在部分二值化过程中保留非结构化显著权重,SliM-LLM按组分配混合精度。BiLLM探索了基于幅度分组的二值训练后量化,而PT2-LLM表明训练后三值化可提供实用的亚2比特每权重区间。然而,许多极低比特训练后量化方法依赖非结构化设计,这需要额外的掩码比特且对高效实现不太友好。
## 3 量化三值误差适应
### 3.1 三值权重量化
三值量化使用一个三值值、一个缩放因子和一个偏移量来近似每个全精度权重:
\\hat\{w\}=\\alpha t+\\beta,\quad t\\in\\\{-1,0,+1\\\}, (1)
其中α控制非零条目的幅度,β移动量化中心。遵循PT2-LLM,我们为每个量化组估计α和β,并将每个权重分配到\{β−α, β, β+α\}中最近的点。等价地,三值值由下式确定:
T_\{ij\}=\\begin\{cases\}+1,&W_\{ij\}-\\beta_\{i\}>\\Delta,\\\\-1,&W_\{ij\}-\\beta_\{i\}<-\\Delta,\\\\0,&\\text\{otherwise\},\\end\{cases\} (2)
其中Δ=α_i/2且α_i>0。因此,T提供了QTEA使用的紧凑三值基础表示。
### 3.2 列半稀疏显著权重
以更高精度保留一小部分显著权重可以缓解极低比特量化的精度损失。现有方法通常要么通过非结构化稀疏性保留它们(难以加速),要么选择显著列并在更高精度下单独量化它们(将比特预算浪费在非显著条目上)。
我们首先研究如何选择显著列。先前方法使用诸如diag(H)或mean(W^2·diag(H)^2)等指标,其中H=2/N XX^T是近似海森矩阵,N代表样本数。实验发现,通过每个权重的最大个体影响来选择列比海森对角线或平均重要性指标更有效,如表3所示。具体来说,我们通过下式为每列评分:
s_j=\\max_i(W_\{ij\}^2\\cdot\\mathrm{diag}(H)_j^2)。 (3)
直观上,W_ij^2·diag(H)_j是扰动W_ij时输出误差的标准二阶估计,而额外的diag(H)_j因子进一步偏向由高能量激活驱动的列。对行取最大值是按每个列最具破坏性的条目而非其平均重要性来排序,这与对超权重的观察一致。因为该评分仅用于排列列以分配残差,它不需要归一化,因为任何层级重缩放都保持排序。
基于此观察,QTEA使用显著权重作为稀疏残差补偿器,而非高精度旁路。我们首先将所有权重量化为三值基础,然后在选定的显著列上添加独立的稀疏残差矩阵,以校正最具破坏性的三值量化误差。这保留了每个权重的三值近似,避免了直接保留稀疏高精度权重并将其他设置为零而导致的退化。我们进一步对残差矩阵施加1:4半稀疏模式,降低开销并使结构比完全非结构化稀疏性更硬件友好。评分在量化前从原始全精度权重和校准海森矩阵中计算一次;选定的显著列在整个逐列量化过程中保持固定。
### 3.3 列级重缩放优化
在GPTQ式量化过程中的列级重缩放优化。一个简单的三值量化器对组内所有列使用组级缩放因子α。然而,在GPTQ式的逐列量化中,每列可能已被来自先前列的海森感知误差传播修改。相似文章
ExTernD: 扩展秩三值分解——精度逼近任意量化水平的LLM训练后量化
ExTernD引入了一种扩展秩三值分解用于LLM训练后量化,通过使用具有自由内秩的因子化表示,使精度接近bf16。在Gemma-4和Qwen3.5等模型上,它以每个权重5.2-5.5有效比特达到Q4_K的精度。
LC-QAT:基于线性约束向量量化的数据高效2比特LLM量化感知训练
提出LC-QAT,一种用于大语言模型的2比特仅权重量化感知训练框架,通过学习仿射映射实现端到端训练,仅使用0.1%–10%的训练数据即达到最优结果。
CAT-Q: 用于LLM的高效且准确的三值量化
CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。
2-bit QAT 模型发布
关于2位量化感知训练(QAT)在更大规模MoE模型上的潜力的讨论,比较其与4位QAT及三元LLM的性能,并探讨在消费级硬件上的可行性。
Tequila:一种面向大语言模型的无陷阱三元量化方法
本文介绍了Tequila,这是一种针对大语言模型的无陷阱量化方法,通过将陷入死区的权重重新利用为动态偏置,提高了三元量化的准确性和推理速度。