UniSVQ: 2-bit统一标量-向量量化

arXiv cs.CL 论文

摘要

UniSVQ提出了一种统一的2位量化框架,通过将码字参数化为整数格点的仿射变换,桥接了标量量化与向量量化,在标量方法中达到了最先进水平,并与向量方法性能相当且具有更高的吞吐量。

arXiv:2606.10520v1 公告类型:新 摘要:2位级别的训练后量化能够降低大型语言模型(LLM)的部署成本并实现推理加速。标量量化(SQ)和向量量化(VQ)是两种主要的量化方法,但前者存在显著的性能下降,后者则带来计算和存储开销。我们提出UniSVQ,一个统一的2位量化框架,通过将码字参数化为整数格点的仿射变换,桥接了标量量化与向量量化。这种结构在保留VQ大部分灵活性的同时,保持了与优化整数内核的兼容性。我们进一步引入了一种数据驱动的逐块微调策略,直接最小化量化重建误差。跨多个LLM系列和零样本基准测试的大量实验表明,UniSVQ在标量量化方法中持续优于最先进的方法,并达到了与高级向量量化方法相当的性能,同时提供了更高的推理吞吐量。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:11

# UniSVQ: 2比特统一标量-矢量量化
来源: https://arxiv.org/html/2606.10520
Haiyan Zhao†\{\}^\{\text\{\textdagger\}\}Xingyu YuZhangyang YaoXu Han†\{\}^\{\text\{\textdagger\}\}Zhiyuan LiuMaosong Sun

###### 摘要

后训练量化在2比特级别使得大型语言模型(LLMs)能够实现低成本部署和推理加速。标量量化(SQ)和矢量量化(VQ)是两种主要的量化方法,但前者面临显著的性能下降,后者则带来计算和存储开销。我们提出UniSVQ,一个统一的2比特量化框架,通过将码本参数化为整数格点的仿射变换,桥接了标量和矢量量化。这种结构保留了与优化过的整数内核的兼容性,同时继承了VQ的大部分灵活性。我们还引入了一种数据驱动的逐块微调策略,直接最小化量化重建误差。在多个LLM家族和零样本基准上的广泛实验表明,UniSVQ在性能上持续优于最先进的SQ方法,并达到与先进VQ方法相当的水平,同时提供更高的推理吞吐量。

机器学习,ICML

## 1 引言

大型语言模型(LLMs)需要大量计算资源,这对其实际应用造成了障碍。多种模型压缩技术,如量化(Frantar等人,2022(https://arxiv.org/html/2606.10520#bib.bib16);Lin等人,2024(https://arxiv.org/html/2606.10520#bib.bib6))、剪枝(Sun等人,2023(https://arxiv.org/html/2606.10520#bib.bib10);Ma等人,2023(https://arxiv.org/html/2606.10520#bib.bib8))、知识蒸馏(Gu等人,2023(https://arxiv.org/html/2606.10520#bib.bib5);Wang等人,2020(https://arxiv.org/html/2606.10520#bib.bib13))和矩阵分解(Qinsi等人,2024(https://arxiv.org/html/2606.10520#bib.bib9);Wang等人,2025(https://arxiv.org/html/2606.10520#bib.bib14))已被采用来应对这一挑战并压缩大规模模型。后训练量化(PTQ)是主要量化方法之一。由于其较低的计算成本和较小的性能下降,PTQ目前在LLM压缩中被广泛使用(Hao等人,2025(https://arxiv.org/html/2606.10520#bib.bib17))。

随着量化方法的改进,PTQ在4比特或更高比特下的性能下降已相对较小(Xing等人,2025(https://arxiv.org/html/2606.10520#bib.bib18);Liu等人,2025a(https://arxiv.org/html/2606.10520#bib.bib19))。最近,研究开始关注2比特或更低的极低位量化(Chee等人,2023(https://arxiv.org/html/2606.10520#bib.bib2);Tseng等人,2024a(https://arxiv.org/html/2606.10520#bib.bib11);Baalen等人,2024(https://arxiv.org/html/2606.10520#bib.bib1);Egiazarian等人,2024(https://arxiv.org/html/2606.10520#bib.bib3)),这些方法可分为标量量化或矢量量化。

标量量化(SQ)将每个浮点权重转换为一组有限离散值。SQ的量化/反量化过程相当简单。此外,优化过的张量核心可以显著提高SQ模型的计算速度(Frantar等人,2025(https://arxiv.org/html/2606.10520#bib.bib20))。然而,传统的2比特SQ方法通常会经历严重的性能下降。SQ的微调灵活性有限,而最小-最大投影和每个维度的独立处理使得SQ容易受到异常值的影响。因此,最先进(SOTA)的2比特标量量化模型在多种零样本任务上的性能下降可能超过30%(Liu等人,2025b(https://arxiv.org/html/2606.10520#bib.bib7))。

另一方面,矢量量化(VQ)对一组连续的权重进行联合量化。它将固定长度的浮点权重映射到一个有限的浮点向量集合中。这个向量集合称为码本,码本中的每个向量称为码字。VQ在2比特下表现出优越的性能(Egiazarian等人,2024(https://arxiv.org/html/2606.10520#bib.bib3))。然而,它需要额外的存储空间用于码本。如果码本大小超过GPU的L1缓存,频繁在GPU内存和L1缓存之间传输码本会显著减慢计算速度(Tseng等人,2024b(https://arxiv.org/html/2606.10520#bib.bib31))。因此,许多VQ研究专注于减小码本大小,但这通常会导致性能下降或解码过程更加复杂(Egiazarian等人,2024(https://arxiv.org/html/2606.10520#bib.bib3);Tseng等人,2024a(https://arxiv.org/html/2606.10520#bib.bib11))。

在这项工作中,我们表明非结构化码本实际上是VQ方法计算和存储开销的主要原因。基于这一洞察,本文提出UniSVQ,一种利用SQ和VQ优势的2比特量化方法,旨在最小化性能下降的同时减少码本存储开销和解码复杂度。关键洞察在于量化格点的空间结构,即量化后权重矩阵中所有可能值的集合。当使用线性约束的量化格点时,即所有离散值可以通过对一组整数坐标向量进行仿射变换得到,可以获得介于标量和矢量量化之间的模型结构。在量化过程中,UniSVQ等价于使用线性约束码本的VQ,并能达到类似的性能。另一方面,如图1(https://arxiv.org/html/2606.10520#S1.F1)所示,UniSVQ用仿射变换替换VQ码本,减少了额外参数数量,并保持了与SQ类似的结构。这允许重用经过充分优化的SQ矩阵乘法内核。我们的实验表明,UniSVQ实现了优于SOTA SQ方法的性能,并且与VQ方法相当或更好。此外,我们引入了一种针对仿射变换的自适应微调策略,以数据驱动的方式直接最小化量化目标函数。这进一步提高了量化模型在广泛任务中的性能。

参考图注

图1:UniSVQ方法的架构。UniSVQ在每个权重矩阵中仅引入20个额外参数(仿射矩阵4×44×4和偏置向量44),这远少于VQ。此外,逐块仿射变换可以预先应用于激活值,从而允许重用经过充分优化的标量量化Matmul内核。操作RQU=USUR^\{U\}\_\{Q\}=US\_\{U\}表示逆随机Hadamard变换,用于抑制异常值并确保更均匀的权重分布。总之,本文的贡献如下:

- •我们提出了UniSVQ,一个通过仿射格点参数化桥接标量和矢量量化的2比特量化框架,实现了类似VQ的灵活性,仅需少量辅助参数。
- •我们表明,UniSVQ在模型和零样本基准上持续优于SoTA SQ基线,并与强大的VQ方法竞争力相当。
- •我们证明,UniSVQ通过减少与码本相关的内存流量提高了推理效率,从而在实践中实现了更高的吞吐量。

## 2 背景与相关工作

本节首先回顾矢量量和标量后训练量化的代表性工作。然后介绍UniSVQ的概念并分析这些方法之间的联系。

### 2.1 仅权重的后训练量化

后训练量化直接将预训练模型的权重转换为低位表示。本文主要关注仅权重的后训练量化,其中只有权重矩阵被量化。目标是应用量化/反量化函数Φ(·)\\Phi(\\textperiodcentered)后最小化激活值的差异。对于每个线性投影,令输入激活为X∈RN×nX\\in\\mathbb\{R\}^\{N\\times n\},权重矩阵为W∈Rn×mW\\in\\mathbb\{R\}^\{n\\times m\},输出为Y=XWTY=XW^\{T\}。我们有

L(Φ)=‖XWT−XΦ(WT)‖22。\\mathcal\{L\}(\\Phi)=\\left\\\|XW^\{T\}-X\\Phi(W^\{T\})\\\right\\\|_\{2\}^\{2\}。(1)方程1(https://arxiv.org/html/2606.10520#S2.E1)对于矢量量和标量量化是相同的,主要区别在于量化格点。

### 2.2 标量量化

SQ方法单独处理每个权重,其中量化结果由权重值决定。对于本文考虑的整数量化,函数Φ(⋅)\\Phi(\\cdot)可以按点方式定义:

ΦSQ(w)=s⋅(clamp(⌈ws⌋+z,qmin,qmax)−z)。\\Phi\_\{\\text\{SQ\}\}(w)=s\\cdot(\\text\{clamp\}(\\lceil\\frac\{w\}\{s\}\\rfloor+z,q\_\{\\min\},q\_\{\\max\})-z)。(2)在方程2(https://arxiv.org/html/2606.10520#S2.E2)中,ss和zz分别表示缩放因子和零点,通常在整个权重矩阵或几个连续的列(称为一个组)中共享。qminq\_\{\\text\{min\}\}和qmaxq\_\{\\text\{max\}\}表示给定比特宽度的最小和最大可表示的整数值。

SQ是LLMs最早的PTQ方法。虽然在4比特以上性能下降很小(Shao等人,2024(https://arxiv.org/html/2606.10520#bib.bib23);Ashkboos等人,2024(https://arxiv.org/html/2606.10520#bib.bib21)),但随着比特数降低,像GPTQ这样的典型SQ方法变得困难(Kumar等人,2025(https://arxiv.org/html/2606.10520#bib.bib22))。在2比特量化中,ΦSQ(w)\\Phi\_\{\\text\{SQ\}\}(w)在一个组内只能取4个不同的量化值,因此选择这些值变得至关重要。为了解决这个问题,像OmniQuant(Shao等人,2024(https://arxiv.org/html/2606.10520#bib.bib23))和SignRound(Cheng等人,2024(https://arxiv.org/html/2606.10520#bib.bib24))这样的方法使用数据驱动的方法,通过将ss和zz作为可训练参数来确定适当的值。

其他工作关注权重矩阵中的异常值。先前的研究表明,异常值是低位量化中性能下降的主要原因(An等人,2025(https://arxiv.org/html/2606.10520#bib.bib25))。这些异常值的幅度远超其他值。当量化格点设置在概率密度高的区域时,异常值会带来显著的截断误差,大大降低模型性能。为了解决这个问题,SqueezeLLM(Kim等人,2024(https://arxiv.org/html/2606.10520#bib.bib26))和ICQuant(Li等人,2025(https://arxiv.org/html/2606.10520#bib.bib27))将异常值表示为额外的稀疏矩阵。其他研究,如PB-LLM(Yuan等人,2024(https://arxiv.org/html/2606.10520#bib.bib29))和Bi-LLM(Huang等人,2024(https://arxiv.org/html/2606.10520#bib.bib28)),已证实异常值感知量化在2比特以下也能达到合理性能。这些研究表明,当权重分布集中时,2比特量化仅用4个不同的值就能保留大量模型能力。这个断言还有来自基于正交变换的量化方法的额外证据。例如,QuIP(Chee等人,2023(https://arxiv.org/html/2606.10520#bib.bib2))通过正交变换将权重调整到高斯分布,从而消除异常值的影响。后续工作如SpinQuant(Liu等人,2025a(https://arxiv.org/html/2606.10520#bib.bib19))、FlatQuant(Sun等人,2025(https://arxiv.org/html/2606.10520#bib.bib30))和OSTQuant(Xing等人,2025(https://arxiv.org/html/2606.10520#bib.bib18))通过可学习方法优化正交矩阵,进一步减少了性能下降。

然而,尽管有这些进步,这类方法在某些具有挑战性的任务上仍可能导致超过50%的性能下降,特别是对于较小的模型。相反,矢量量化方法在2比特量化中显示出更大的潜力。

### 2.3 矢量量化

VQ量化一组连续的权重,并将它们表示为固定码本CC中的特定码字。对于应用于dd个连续权重的向量的bb比特量化,给定码本C∈Rd×2bdC\\in R^\{d\\times 2^\{bd\}\},我们有

Φ([w0,w1,...,wd],C)=Ci。\\Phi([w\_\{0\},w\_\{1\},...,w\_\{d\}],C)=C\_\{i\}。(3)在方程3(https://arxiv.org/html/2606.10520#S2.E3)中,CiC\_\{i\}是码本CC中的第ii个码字。对于VQ,量化过程不是按点进行的。此外,量化格点存储在码本中,这提供了显著更高的自由度。这些优势导致了在2比特级别上的优越性能。当前的VQ方法主要使用两种方法来选择量化格点:基于聚类的方法和基于格点的方法。基于聚类的方法使用K-means等算法来识别代表性的量化格点。而基于格点的方法则专门为高斯分布推导最优量化格点。

然而,无论采用哪种方法,VQ都不可避免地需要额外的存储和更复杂的解码过程。在基于聚类的方法中,一个常见的解决方案是采用多级码本。例如,AQLM(Egiazarian等人,2024(https://arxiv.org/html/2606.10520#bib.bib3))使用两个1比特码本代替一个2比特码本,将码本大小从Rd×2bdR^\{d\\times 2^\{bd\}\}减少到2Rd×(2b/2⋅d)2R^\{d\\times(2^\{b/2\\cdot d\}\}\。在此基础上,GPTVQ(Baalen等人,2024(https://arxiv.org/html/2606.10520#bib.bib1))加入了异常值感知量化。在基于格点的方法中,QuIP#(Tseng等人,2024a(https://arxiv.org/html/2606.10520#bib.bib11))和NestQuant(Savkin等人,2025(https://arxiv.org/html/2606.10520#bib.bib33))使用了具有高空间对称性的码本。同时,Qtip(Tseng等人,2024b(https://arxiv.org/html/2606.10520#bib.bib31))和CCQ(Zhou等人,2025(https://arxiv.org/html/2606.10520#bib.bib32))分别引入了网格码和卷积码。这些方法以各种方式压缩码字和码本,因此在推理时需要解压缩步骤。

## 3 方法

在本节中,我们将分析标量量化和矢量量化之间的差异与联系。我们还将介绍UniSVQ的基本概念及其细节。

### 3.1 标量量化与矢量量化的差异与联系

VQ和SQ在量化格点上的差异导致了模型性能和计算效率之间的权衡。在性能方面,VQ的量化格点可以放置在概率密度较高的区域,这更好地利用了权重向量的分布,导致更低的性能下降。在效率方面,SQ的量化格点通过对整数权重进行简单的缩放和平移得到。

参考图注

图2:各向同性高斯权重的2维2比特量化格点比较:标量量化、矢量量化和UniSVQ。MinMax标量量化使用高度结构化的格点,易于反量化但由于边界值而难以拟合分布。矢量量化实现了更低的误差,但缺乏结构。UniSVQ保持了结构化的格点,同时提供了更高的自由度。在本文中,我们提出UniSVQ,一种结合矢量量和标量量化的统一表示,以利用两者的优势。

相似文章

VQ-bench:可组合的向量量化框架

arXiv cs.AI

本文介绍了VQ-bench,一个用于组合和评测向量量化算法的统一框架,将25种常见量化器重新表示为原语流水线,并发布可复现的基准测试结果。

CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本

arXiv cs.LG

CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。

Channel-wise Vector Quantization

Hugging Face Daily Papers

通道级向量量化(Channel-wise Vector Quantization, CVQ)用通道级标记替换块级标记进行图像标记化,实现了一个下一通道预测框架(CAR),该框架通过逐步细化视觉细节生成图像,在重建和文本到图像生成性能上表现出色。