CAT-Q: 用于LLM的高效且准确的三值量化
摘要
CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。
arXiv:2606.26650v1 公告类型: 新
摘要: 在本文中,我们提出CAT-Q(高效且准确的三值量化),用于压缩和加速大语言模型(LLMs)。与现有依赖数据密集型且昂贵的量化感知训练来缓解严重性能下降的最先进三值量化方法不同,CAT-Q是一种简单而有效的训练后量化方案,可轻松应用于具有不同架构和模型规模的LLMs。它包含两个关键组件:可学习调制(LM)和软化三值化(ST),两者从优化角度紧密耦合。LM利用可学习因子的组合来调节预训练高精度权重的分布以及三值阈值,使其对三值化不那么敏感。ST进一步引入可微的过渡函数来引导三值化过程实现稳定收敛。我们证明,对于1.7B至8B参数的预训练LLMs,CAT-Q仅需512个校准样本即可高效地将它们量化为三值模型,同时实现优于使用1000亿token训练的BitNet 1.58-bit v1和v2系列(1.3B至7B参数)的性能,训练token减少了约100,000倍。此外,我们首次证明了CAT-Q能够在8块A100-80GB GPU上仅需8至60小时,将14B至235B参数的更大规模预训练LLMs量化为领先的三值模型。代码可在 https://github.com/IntelChina-AI/BitTern 获取。
查看缓存全文
缓存时间: 2026/06/26 05:18
# CAT-Q: 面向 LLM 的高效且准确的三值量化 来源:https://arxiv.org/html/2606.26650 ###### 摘要 本文提出 CAT‑Q(高效且准确的三值量化),用于压缩和加速大型语言模型(LLM)。与依赖大量数据和高成本量化感知训练来缓解严重性能下降的现有最先进三值量化方法不同,CAT‑Q 是一种简单且有效的训练后量化方案,可直接应用于具有不同架构和模型规模的 LLM。它包含两个关键组件:可学习调制(LM)和软化三值化(ST),两者从优化角度紧密耦合。LM 利用可学习因子的组合来调节预训练高精度权重的分布以及三值化阈值,使其对三值化不那么敏感。ST 进一步引入可微的过渡函数,引导三值化过程向稳定收敛发展。我们证明,对于参数规模为 1.7B 到 8B 的预训练 LLM,CAT‑Q 仅使用 512 个校准样本即可高效地将它们量化成三值模型,同时性能优于使用 1000 亿 token 训练的开创性 BitNet 1.58 位 v1 和 v2 系列(参数规模 1.3B 到 7B),训练 token 减少了约 100,000 倍。此外,我们首次证明,CAT‑Q 可以将参数规模为 14B 到 235B 的更大预训练 LLM 量化成领先的三值模型,在 8 张 A100-80GB GPU 上仅需 8 到 60 小时。代码已开源:https://github.com/IntelChina-AI/BitTern。 机器学习,ICML
## 1 引言
大型语言模型(LLM)(Vaswani et al., 2017;Brown et al., 2020;Achiam et al., 2023;Anil et al., 2023;Liu et al., 2024a;Hurst et al., 2024;Jaech et al., 2024;Yang et al., 2024;Guo et al., 2025;Yang et al., 2025;Singh et al., 2025;Comanici et al., 2025)在广泛的语言建模和推理任务中展现了卓越性能。然而,它们庞大的规模带来了显著的内存和计算开销,严重阻碍了其在现实应用中的部署,尤其是在资源受限的设备上。研究者提出了多种技术(Zafrir et al., 2019;Ma et al., 2023;Sun et al., 2024;Sanh et al., 2019;Hsieh et al., 2023;Zhang et al., 2021;Hsu et al., 2022)来减小模型大小并加速推理,其中量化因效果显著且易于实现而尤为引人注目。量化的最终优化目标是在保持模型性能的同时降低模型参数的数值精度,可通过训练后量化(PTQ)或量化感知训练(QAT)实现。
现有大多数方法(Shen et al., 2020;Dettmers et al., 2022;Yao et al., 2022;Frantar et al., 2023;Xiao et al., 2023;Shao et al., 2024;Lin et al., 2024b;Chee et al., 2024;Ashkboos et al., 2024b;Sun et al., 2025;Wang et al., 2026)依赖 PTQ,即使用少量校准样本量化预训练 LLM,无需 QAT 中昂贵的训练或重训练流程,因此实际使用中很方便。这些 PTQ 方法通常在 8 位量化中有效,其中一些,如 QuaRot(Ashkboos et al., 2024b)、FlatQuant(Sun et al., 2025)和 SliderQuant(Wang et al., 2026),甚至在 4 位精度下也表现良好。然而,它们在超低位设置(如 2 位量化)中仍然性能不佳。
本文聚焦于三值量化(也称为 1.58 位量化),这是一种极端的量化形式,将高精度权重映射到 {1,0,−1}。与 FP16 对应物相比,它使内存消耗降低超过 10 倍。此外,通过零状态引入稀疏性,三值量化保留了二值量化(Courbariaux et al., 2015;Rastegari et al., 2016;Xu et al., 2024;Huang et al., 2024;Shang et al., 2024;Li et al., 2025)的硬件友好算术优势,即大多数昂贵的浮点乘法运算可以替换为能效更高的整数加法和减法,同时提供更丰富的表达能力。
对于三值量化,设计一个能够仅使用 {1,0,−1} 这些值准确逼近高精度权重的有效优化方案十分具有挑战性,因为信息丢失的风险很高。为了更直接地缓解严重的精度下降,现有的最先进三值量化方法,如 BitNet 1.58 位(Ma et al., 2024;Wang et al., 2025)、TriLM(Kaushal et al., 2025)和 Tequila(Huang et al., 2026),一致采用 QAT,即在全精度训练期间模拟三值化,使模型能够将其参数适应到 1.58 位精度。尽管取得了有希望的结果,但它们需要大量训练 token(例如,数千亿),并带来巨大的计算、能源和时间成本,限制了其可扩展性和实用性。例如,BitNet 1.58 位 v2 系列(Wang et al., 2025)在 1000 亿 token 上训练,其最大模型包含 7B 参数;而 TriLM 系列(Kaushal et al., 2025)在 3000 亿 token 上训练,最大模型规模为 3.9B 参数。最近的三值量化方法 Tequila(Huang et al., 2026)仍然需要 100 亿 token 通过重训练将预训练 LLM 量化为三值模型。此外,Tequila 仅在两个小规模模型上进行了评估:Llama3 系列(Grattafiori et al., 2024)的 1B 和 3B 实例。简而言之,由于数据密集且昂贵的 QAT 流程,现有性能最优的三值量化方法仅适用于特定架构和小规模 LLM。
尽管 PTQ 在工业界更受青睐,因为它不需要访问原始训练数据,消除了数据隐私和安全顾虑以及对大规模计算资源的需求,但目前尚无基于 PTQ 的三值化方法能与上述基于 QAT 的方法性能相匹配。为填补这一空白,我们重新审视 PTQ 下的三值权重量化,从优化角度研究其主要技术挑战。给定一个小型校准集(例如,按照 PTQ 领域的常见做法,随机采样 512 个长度为 2048 token 的序列,而不是使用原始训练数据)和一个任意架构和规模的预训练 LLM,我们识别出两个主要挑战,它们与最小化三值权重量化重建误差时观察到的严重性能下降密切相关。
第一个挑战是,直接对预训练的高精度权重进行三值化往往会产生与高精度权重分布不一致的三值权重分布。这种结果三值权重与高精度权重之间的分布不匹配会导致严重的信息丢失。因此,设计适当的策略来改善分布对齐对于减少重建误差至关重要。
第二个、也是更根本的挑战是,三值化优化极难收敛,因其超低位形式和非可微性质。为解决这种极端离散化问题,现有面向 LLM 的三值量化方法沿用早期为三值化包含参数较少的卷积神经网络而设计的策略(Li et al., 2016;Zhu et al., 2017)。具体而言,它们在整个优化过程中始终使用非可微的硬三值化函数,这无法适应复杂的权重变化并确保稳定收敛,尤其是在 PTQ 体制下。
基于以上分析,我们提出高效且准确的三值量化(CAT‑Q),一种新的训练后三值化方法,适用于广泛的预训练 LLM。CAT‑Q 包含两个关键组件。第一个组件是可学习调制(LM),利用三个可学习因子的组合,基于少量校准样本优化预训练高精度权重的分布统计量以及三值化阈值。这些可学习因子实现了自适应的权重分布变换,能够抑制异常值的影响,使高精度权重对三值化不那么敏感,从而在一定程度上缓解结果三值权重与高精度权重之间的分布不匹配。第二个组件是软化三值化(ST),通过建立可微三值化和硬三值化的两阶段中继,引入一种新的过渡函数来引导三值化过程稳定收敛。将 LM 和 ST 耦合到滑动层量化流水线中,实现了 CAT‑Q 的简洁高效实现。
我们进行了全面的实验,评估 CAT‑Q 在 10 个预训练 LLM 上的有效性,这些模型涵盖不同的架构(包括密集和混合专家 MoE 模型)和模型规模(1.7B 到 235B 参数)(Yang et al., 2024, 2025;Touvron et al., 2023)。我们证明,在相似的模型规模下(1.7B 到 8B 参数),CAT‑Q 仅使用 512 个校准样本(约 100 万 token)生成的三值权重模型,性能优于使用 1000 亿 token 训练的开创性 BitNet 1.58 位 v1 和 v2 系列,训练 token 减少约 100,000 倍。此外,我们首次证明,CAT‑Q 可以轻松扩展到参数规模为 14B 到 235B 的更大预训练 LLM。在量化 1.7B 到 235B 参数的 LLM 时,CAT‑Q 在 8 张 A100-80GB GPU 上仅需 1 到 60 小时。另外,我们的三值权重加 8 位激活模型获得了与仅三值权重模型相当的性能,进一步证明了我们方法的更广泛适用性。
## 2 方法
图 1 展示了 CAT‑Q 的概览。接下来,我们描述其公式和关键组件。
图 1:CAT‑Q 学习流程概述,用于三值化任意预训练 LLM 中线性层的权重,以及用于三值模型部署的硬件友好权重重建。软化三值化过程的说明请参见图 3。
### 2.1 预备概念与动机
三值权重量化的概念最初在 TWN(Li et al., 2016)中提出,用于从头训练卷积神经网络以处理计算机视觉任务。具体而言,它通过解决逐层权重重建问题将模型权重约束为 {1,0,−1}:
argmin_{α,T} ||W - αT||_2^2 (1)
其中 W 表示线性层的高精度权重,α > 0 是一个缩放因子,用于重新缩放对应的三值权重 T,T 的元素通过硬三值化函数获得:
T_i = Q(W_i; Δ) = { 1, if W_i > Δ; 0, if |W_i| ≤ Δ; -1, if W_i < -Δ } (2)
其中 W_i 表示 W 的第 i 个元素,Δ > 0 是一个阈值。
后续面向 LLM 的三值化工作通常遵循 TWN。TernaryBERT(Zhang et al., 2020)在微调期间对小规模 BERT 语言模型(Devlin et al., 2019)的权重进行三值化,并使用了 Transformer 蒸馏(Jiao et al., 2020)来补偿严重的精度下降。而现有最先进的三值 LLM,如 BitNet 1.58 位(Ma et al., 2024;Wang et al., 2025)、TriLM(Kaushal et al., 2025)和 Tequila(Huang et al., 2026),都依赖 QAT。与这些工作不同,我们专注于在更具挑战性的 PTQ 体制下三值化 LLM 的权重,旨在实现量化成本与性能之间显著更优的平衡,并使其能够广泛适用于不同架构和模型规模的 LLM。
### 2.2 可学习调制
图 2:缩放因子 α 和阈值 Δ 分别由静态近似(蓝点)、直接学习(橙点)和我们的可学习调制(绿点)确定时的权重重建误差比较。在相同设置下,我们以 Qwen3-4B 的第 4 层为例进行说明。附录中提供了多个 LLM 不同层上的额外比较。
根据上述公式,三值权重量化的核心问题是如何为缩放因子 α 和阈值 Δ 估计合适的值。相似文章
LC-QAT:基于线性约束向量量化的数据高效2比特LLM量化感知训练
提出LC-QAT,一种用于大语言模型的2比特仅权重量化感知训练框架,通过学习仿射映射实现端到端训练,仅使用0.1%–10%的训练数据即达到最优结果。
2-bit QAT 模型发布
关于2位量化感知训练(QAT)在更大规模MoE模型上的潜力的讨论,比较其与4位QAT及三元LLM的性能,并探讨在消费级硬件上的可行性。
ExTernD: 扩展秩三值分解——精度逼近任意量化水平的LLM训练后量化
ExTernD引入了一种扩展秩三值分解用于LLM训练后量化,通过使用具有自由内秩的因子化表示,使精度接近bf16。在Gemma-4和Qwen3.5等模型上,它以每个权重5.2-5.5有效比特达到Q4_K的精度。
CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本
CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。
Qift: 移位友好的无零点W2训练后量化,用于旋转W2A4/KV4大语言模型推理
本文介绍了Qift,一种固定的无零点两位权重量化层级集,专为Hadamard旋转的大语言模型设计,通过利用旋转权重的近零中心高斯类分布,实现了改进的W2A4/KV4推理。在LLaMA-2-7B和LLaMA-3.1-8B上的实验显示,相比于标准W2量化,困惑度持续提升。