语言模型低开销量化的结构化变换
摘要
本文回顾了基于Kashin分解的大型语言模型权重量化方法,并提出一种使用结构化正交变换的改进算法,相比OPTQ和QuIP等方法,降低了计算成本并确保了数值稳定性。
arXiv:2609.11687v1 公告类型:新
摘要:我们回顾了基于Kashin分解的大型语言模型权重量化方法,并提出一种具有更强收敛性和结构化、高效正交变换的改进算法。该方法保留了每个权重分解为两个组件的核心因子化——一个具有有界无穷范数,另一个在正交变换后具有有界无穷范数——但用符号随机化的离散余弦变换(DCT)取代了密集随机正交矩阵,将每次迭代成本从 $\mathcal{O}(N^2)$ 降低到 $\mathcal{O}(N \log N)$。所提出的带有交替更新的贪婪算法保证了每个因子稳定2比特聚类所需的四峰分布,并允许聚类中心的封闭形式初始化,消除了先前工作的多重启k-means瓶颈。结合OPTQ风格的顺序误差补偿和QuIP风格的不相干预处理,由此产生的JAX流水线在OPT、Llama-2和Pythia上以每通道4比特与OPTQ、QuIP、QuIP-RG以及无需微调和向量量化的QuIP#变体相竞争,并具有有利的实时时钟扩展性。有界$\ell_\infty$因子化也显著稳健:在QuIP变体发散到四位数困惑度(Pythia-6.9B)或在LDL回代中出现NaN而中止(Mistral-7B)的压力配置下,Kashin-DCT保持数值稳定并接近FP16基线。在推理时,每个权重分解为每通道两个2比特因子代码,结构上适合原生2比特硬件。
查看缓存全文
缓存时间: 2026/09/11 08:32
# 低开销语言模型量化中的结构化变换
来源:https://arxiv.org/html/2609.11687
Alexander Rudikov所属机构:数值数学研究所 Boris Kashin所属机构:斯捷克洛夫数学研究所 Ivan Oseledets所属机构:数值数学研究所
###### 摘要
我们重新审视了基于Kashin分解的大语言模型权重量化方法,并提出了一种改进算法,该算法具有更强的收敛性和结构化、高效的正交变换。该方法保留了将每个权重分解为两个成分的核心分解方式——一个成分具有有界的无穷范数,另一个成分在经过正交变换后也具有有界的无穷范数——但用符号随机化的离散余弦变换(DCT)替代了稠密随机正交矩阵,将每次迭代的成本从 \( \mathcal{O}(N^{2}) \) 降低到 \( \mathcal{O}(N \log N) \)。所提出的交替更新贪心算法保证了每个成分稳定进行2-bit聚类所需的四峰分布,并允许聚类中心的闭式初始化,消除了先前工作中多次重启k-means的瓶颈。与OPTQ式的顺序误差补偿和QuIP式的非相干预处理相结合,所得的JAX流水线在OPT、Llama-2和Pythia模型上以每通道4-bit进行测试时,在WikiText-2和C4困惑度以及HellaSwag、PiQA和Winogrande准确率方面,与OPTQ、QuIP、QuIP-RG以及无需微调和向量量化的QuIP#变体具有竞争力,并且具有良好的墙钟时间扩展性。有界 \(\ell_{\infty}\) 分解也值得注意地稳健:在QuIP变体发散到四位数困惑度(Pythia-6.9B)或在LDL回代中因NaN中止(Mistral-7B)的压力配置下,Kashin-DCT保持数值稳定并接近FP16基线。在推理时,每个权重每通道分解为两个2-bit因子码,其结构适合原生2-bit硬件。
*关键词*训练后量化⋅大型语言模型⋅Kashin分解⋅离散余弦变换⋅贪心算法
## 1引言
现代大型语言模型(LLMs)的实现是以权重张量为代价的,这些张量在推理时主导了内存带宽和占用空间。训练后量化(PTQ)无需重新训练即可将这些权重压缩到低比特宽度,使其在训练流水线和大规模计算不可用时成为实用选择。更低的推理精度也意味着每次查询更低的能耗和相应更小的碳足迹。在部署中,主导方案仍然是简单的均匀标量量化,使用逐通道或逐组缩放(Dettmers等,2022 (https://arxiv.org/html/2609.11687#bib.bib7)),有时使用非均匀网格,如NF4(Dettmers等,2023 (https://arxiv.org/html/2609.11687#bib.bib6))。研究文献首先通过二阶误差补偿(Frantar等,2023 (https://arxiv.org/html/2609.11687#bib.bib5); Frantar和Alistarh,2022 (https://arxiv.org/html/2609.11687#bib.bib8))和非相干预处理(Chee等,2023 (https://arxiv.org/html/2609.11687#bib.bib9); Tseng等,2024a (https://arxiv.org/html/2609.11687#bib.bib10)),而最近则通过*向量量化*(VQ)来改进此基线:AQLM(Egiazarian等,2024 (https://arxiv.org/html/2609.11687#bib.bib13))、GPTVQ(van Baalen等,2024 (https://arxiv.org/html/2609.11687#bib.bib15))和QTIP(Tseng等,2024b (https://arxiv.org/html/2609.11687#bib.bib14))目前领先于低于4-bit的基准测试。然而,VQ带来三个实际成本:每层必须存储学习的码本条目和整数索引,最强结果需要基于梯度的微调,码本查找不如标量反量化那样干净地融合到标准矩阵乘内核中。
另一条互补的工作线(Merkulov等,2024 (https://arxiv.org/html/2609.11687#bib.bib11))通过*Kashin分解*来实现低比特量化:每个向量化的权重矩阵 \( w \) 被分解为 \( w = u + P^{T}\hat{v} \),其中 \( P \) 是随机正交矩阵,\( u \) 和 \( \hat{v} = P v \) 分别具有小的无穷范数。实证表明,Kashin贪心算法产生的分量形成了具有四个尖锐对称峰值的分布(Merkulov等,2024 (https://arxiv.org/html/2609.11687#bib.bib11)),这是2-bit聚类的近乎理想目标。尽管有这种吸引人的结构,先前将Kashin分解应用于LLM的工作(Merkulov等,2024 (https://arxiv.org/html/2609.11687#bib.bib11))存在三个弱点。首先,为了分摊成本,作者将算法重构为矩阵形式,这放弃了原始定理的逐向量收敛保证(Kashin,1977 (https://arxiv.org/html/2609.11687#bib.bib1));在相当一部分层上,迭代未能收敛。其次,即使在迭代确实收敛的层上,2-bit聚类所依赖的四峰结构也未持续产生:联合 \( u-\hat{v} \) 分布可能坍缩而不是分离成四个对称模式(图3 (https://arxiv.org/html/2609.11687#S4.F3)(a));第三,四个聚类中心是通过多次重启的k-means恢复的,这是一种无结构搜索,主导了量化墙钟时间。
#### 贡献。
我们从端到端重新审视基于Kashin分解的量化,解决了所有三个弱点,同时将分析保持在可以提供严格收敛证明的向量层面。
- • 一种保证峰值并具有结构化DCT变换的分区贪心算法(第4节 (https://arxiv.org/html/2609.11687#S4))。基于Kashin等人(2025 (https://arxiv.org/html/2609.11687#bib.bib2))最近对Kashin定理的加速,我们提出了一个具有交替更新的贪心算法(算法1 (https://arxiv.org/html/2609.11687#alg1)),该算法在四个一组的块中固定 \( u \) 和 \( \hat{v} \) 更新的顺序。该调度保证了两个成分中的四峰分布,我们证明了转换保证。我们进一步将稠密随机正交矩阵 \( Q \) 替换为具有 \( \mathcal{O}(N \log N) \) 成本且无存储矩阵的符号随机化离散余弦变换。
- • 闭式聚类中心(第3.1节 (https://arxiv.org/html/2609.11687#S3.SS1))。贪心更新在每个步骤中将分量改变某个值 \( \pm c_{k}(r_{k}) \),因此在两次更新后,四个峰值位置恰好是 \( \pm c_{1} \pm c_{2} \),根据残差范数 \( r_{k} \) 可以解析地知道。我们用这些中心初始化k-means,只运行少量的细化迭代,消除了多次重启搜索并减少了量化时间。
- • 自适应集成和JAX流水线(第5节 (https://arxiv.org/html/2609.11687#S5))。我们将Kashin分解与OPTQ式的顺序误差补偿和QuIP式的非相干预处理(Hadamard或Kronecker)相结合,并在对编译友好的JAX中实现了完整的流水线,支持多GPU pmap。在OPT、Pythia和Llama系列模型上以每通道4-bit进行测试时,该方法在WikiText-2和C4困惑度以及HellaSwag、PiQA和Winogrande准确率方面,与OPTQ、QuIP、QuIP-RG以及(无需微调、无需向量量化)的QuIP#相匹配或超越。
## 2相关工作
深度神经网络的量化技术可以大致分为训练后量化(PTQ)和量化感知训练(QAT)。QAT通常提供最高的精度,因为它将低精度约束直接嵌入优化循环;然而,它也需要大量的GPU时间和内存,尤其是在处理可能从降低精度推理中受益最大的非常大的模型时。相比之下,PTQ无需额外的基于梯度的微调即可将预训练模型转换为更低的比特宽度,这使其对缺乏计算资源或训练数据集的从业者具有吸引力。
最快和最容易实现的PTQ方案依赖于简单的启发式方法,例如逐层或逐行应用的均匀舍入到最近值或随机舍入(Dettmers等,2022 (https://arxiv.org/html/2609.11687#bib.bib7)),或假设特定的激活/权重分布,如NormalFloat 4-bit(NF4)量化(Dettmers等,2023 (https://arxiv.org/html/2609.11687#bib.bib6))。激活和异常值感知方法减少了标量量化必须覆盖的动态范围,方法包括平滑激活/权重幅度(Xiao等,2023 (https://arxiv.org/html/2609.11687#bib.bib16))、缩放显著通道(Lin等,2024b (https://arxiv.org/html/2609.11687#bib.bib17))、联合学习权重裁剪范围和等价变换(Shao等,2024 (https://arxiv.org/html/2609.11687#bib.bib18))或将异常值路由到稠密非均匀码本(Kim等,2024 (https://arxiv.org/html/2609.11687#bib.bib19))。
最近最先进的方法使用二阶信息来最小化层输出中由量化引起的误差。OPTQ(Frantar等,2023 (https://arxiv.org/html/2609.11687#bib.bib5))在量化层权重块的同时,通过对尚未量化参数的修正来补偿累积误差。QuIP(Chee等,2023 (https://arxiv.org/html/2609.11687#bib.bib9))表明OPTQ是LDLQ自适应量化的一个特例,本质上是QuIP中引入的方法但没有非相干处理,其中对权重矩阵尚未量化行的修正是已量化行量化误差的线性组合。作者进一步提出了非相干预处理和后处理,以使权重矩阵符合他们的定理条件,该定理确立了LDLQ量化是最近舍入和随机舍入的下界。
QuIP#(Tseng等,2024a (https://arxiv.org/html/2609.11687#bib.bib10))用随机化Hadamard变换替代了乘以随机正交矩阵的非相干处理,从而产生更好的非相干性和更快的运行时间。然而,QuIP#使用了向量量化并诉诸于微调。相同的随机旋转思想是另一条并行激活量化方法的基础:QuaRot(Ashkboos等,2024 (https://arxiv.org/html/2609.11687#bib.bib20))将Hadamard旋转融合到残差流中,以便在旋转基中同时量化权重和激活,SpinQuant(Liu等,2025 (https://arxiv.org/html/2609.11687#bib.bib21))在校准分布上学习旋转矩阵,而DuQuant(Lin等,2024a (https://arxiv.org/html/2609.11687#bib.bib22))将块旋转与置换相结合以进一步抑制异常值。
除了QuIP#之外,大量工作通过从标量切换到*向量*码本来进一步推动权重压缩。AQLM(Egiazarian等,2024 (https://arxiv.org/html/2609.11687#bib.bib13))为每组权重学习小码本的加法组合;GPTVQ(van Baalen等,2024 (https://arxiv.org/html/2609.11687#bib.bib15))将OPTQ式的误差补偿扩展到多维码本;QTIP(Tseng等,2024b (https://arxiv.org/html/2609.11687#bib.bib14))用网格编码量化替代了QuIP#的格码本,基于相同的非相干处理。这些方法实现了非常强大的低于4-bit的压缩率,但共享两个实际成本:每层必须存储学习的码本条目和整数索引,并且达到报告的质量通常需要基于梯度的微调或广泛的校准扫描。相比之下,我们在此工作中重新审视的Kashin分解保留了*标量*2-bit聚类,并且每列仅产生少量质心(第3.1节 (https://arxiv.org/html/2609.11687#S3.SS1)),无需微调步骤。
参见图注 参见图注 量化权重 未量化权重 \( (a) \) \( (b) \) \( (c) \) \( (d) \) 权重矩阵 \( W \) \( x \in \mathbb{R}^{N} \) \( u_{k} \in \mathbb{R}^{N} \) \( U_{\mathcal{E},\Phi} \, v_{k} \in \mathbb{R}^{N} \) \( \hat{V} \) 矩阵 2-bit \( U \) 矩阵 2-bit
图1:提出的量化流水线由几个阶段组成:(a) 移动到下一列进行量化;(b) 使用所提出的具有交替更新的贪心算法(算法1 (https://arxiv.org/html/2609.11687#alg1))分解为 \( u \) 和 \( \hat{v} \);(c) 通过4-peak聚类将每个因子量化为2-bit;(d) 将量化向量堆叠成输出矩阵 \( U \) 和 \( \hat{V} \);然后向未量化权重添加误差补偿并返回(a)。
## 3问题设置
Kashin(1977 (https://arxiv.org/html/2609.11687#bib.bib1))的工作引入了以下定理。
###### 定理1。
对于每个 \( N=2,3,\dots \) 和每个正交变换 \( P \in \mathbb{O}^{N} \),除了一个集合 \( V \subset \mathbb{O}^{N} \),\( \mu_{H}(V) \leqslant 2^{-N} \),以下不等式成立:
\[
\max\big\{\\|x\\|_{1},\,\\|Px\\|_{1}\big\} \geqslant c_{1} \cdot \sqrt{N}\\|x\\|_{2} \qquad \forall x \in \mathbb{R}^{N},
\]
(1)
其中 \( c_{1}>0 \) 是一个绝对常数。
利用(1),对于每个 \( P \notin V \),构造了一个贪心算法(Temlyakov,2011 (https://arxiv.org/html/2609.11687#bib.bib3)),使得对于每个 \( x \in B_{2}^{N}=\{x \in \mathbb{R}^{N}:\\|x\\|_{2} \leqslant 1\} \),在 \( k \) 步之后,它产生向量 \( u_{k} \) 和 \( v_{k} \),满足
\[
\\|u\\|_{\infty} \leqslant \dfrac{c_{2}}{\sqrt{N}},\,\,\\|Pv\\|_{\infty} \leqslant \dfrac{c_{2}}{\sqrt{N}},
\]
(2)
\[
\\big\\|x - u_{k} - v_{k}\\big\\|_{2} \leqslant \gamma^{k},
\]
其中 \( \gamma < 1 \) 和 \( c_{2} \) 是绝对常数。完整算法见附录B (https://arxiv.org/html/2609.11687#A2)。该算法需要存储矩阵 \( Q \) 的 \( N^{2} \) 个条目,每次迭代的计算复杂度为 \( \mathcal{O}(N^{2}) \) 操作。
(2) 中无穷范数的上界自然导致将此分解用于神经网络权重的量化,因为最常见的均匀量化深受异常值影响(Nagel等,2021 (https://arxiv.org/html/2609.11687#bib.bib12))。一个更有趣的现象是,\( u_{k} \) 和 \( Pv_{k} \) 的分布通常形成四个独特的对称峰值(Merkulov等,2024 (https://arxiv.org/html/2609.11687#bib.bib11)),这使得基于聚类的量化变得直接。先前的工作使用此分解来量化LLM的权重。他们的方法将Kashin定理重构为矩阵情况,但未能为该重构提供严格的收敛分析。因此,该方法在相当一部分层上遇到了收敛失败和定义不清的峰值。此外,聚类过程依赖于多次重启的k-means算法,这显著减慢了量化速度。
在本工作中,我们保留了向量形式,对于该形式有严格的证明可用,同时通过使用符号随机化的离散余弦变换(DCT)作为正交变换来缓解Merkulov等人(2024 (https://arxiv.org/html/2609.11687#bib.bib11))指出的大矩阵 \( Q \) 大小问题,利用了Kashin等人(2025 (https://arxiv.org/html/2609.11687#bib.bib2))最近对Kashin定理的加速。相似文章
[论文] 大语言模型的统计无损量化
本文提出了一种针对大语言模型的统计无损量化方法,旨在在不损失信息的情况下减小模型大小。
基于平坦度的理论最优量化
介绍了平坦度度量与双向对角量化(BDQ)用于大型语言模型的训练后量化,实现了接近无损的4比特权重和激活量化,并在极低比特设置下取得了显著改进。
通过激活值引导的补偿与正交残差理解大语言模型量化
本文提出大语言模型量化误差的分解框架,将其分离为激活值引导的权重补偿与正交残差两部分,并通过Hadamard旋转和符号选择等技术推导出改进W4A4量化的实用指南。
MixQuant:大语言模型的自适应混合精度量化
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。
LoopQ:递归Transformer的量化
LoopQ是一种针对循环语言模型的后训练量化框架,解决了分布偏移、状态复用和误差累积问题。在4位权重和激活量化下,平均准确率提升68.8%。