REAL-Q:通过动态梯度下降实现端到端大语言模型量化

arXiv cs.LG 论文

摘要

本文提出REAL-Q,一种新颖的端到端对齐训练后量化方法,用于大语言模型,该方法利用动态梯度下降来减轻量化误差,在KL散度降低方面相较于最先进方法实现了显著改进。

arXiv:2609.00049v1 公告类型:新 摘要:训练后量化(PTQ)对于在严格资源约束下部署大语言模型(LLMs)至关重要。最先进的PTQ方法使用单个闭式二阶求解器对每一层进行量化:为了保持解析可处理性,它们大量近似全局损失(忽略跨通道耦合,将输出行分组到组中),然后冻结整个层的结果Hessian,无法在损失景观逐列变化时刷新它——我们称之为信息错位的现象。我们提出REAL-Q(实时端到端损失对齐的大语言模型量化),这是一种新的PTQ范式,打破了这一妥协:REAL-Q不是为了解析可处理性而稀释目标,而是针对全局损失的端到端对齐替代目标,并通过在每个列块(128列)后应用细粒度的动态分块梯度下降来精炼它。通过将这种细粒度校正与用于平滑跨层过渡的滑动窗口机制相结合,REAL-Q有效减轻了网络中的误差传播。在LLaMA-3.1(8B和70B)和Qwen3(0.6B-32B)上使用W4A16,REAL-Q将端到端KL散度降低了高达约49%,相较于最先进全局引导方法。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:06

# REAL-Q:通过动态梯度下降实现端到端大语言模型量化  
来源:https://arxiv.org/html/2609.00049  
Yaoming LiZhewen TanYanshu WangHeng LuKun SuZongwei LvWenhan YuYongge MaYinjun HanRuikuang LiuTong Yang  
北京大学 东北大学 中兴通讯  
机构贡献:同等贡献  
通讯作者:[[email protected]](mailto:[email protected])  

###### 摘要  
训练后量化(PTQ)对于在严格资源约束下部署大语言模型(LLM)至关重要。当前最先进的PTQ方法使用单一的闭式二阶求解器量化每一层:为保持解析可处理性,它们对全局损失进行大幅近似(忽略跨通道耦合,将输出行分组),然后冻结整个层的海森矩阵,无法随着损失景观的逐列变化而刷新——我们将这一现象称为信息错位。我们提出REAL-Q(实时端到端损失对齐LLM量化),这是一种打破此妥协的新型PTQ范式:REAL-Q不再为了解析可处理性而削弱目标,而是针对全局损失的端到端对齐代理,并通过在每列块(128列)后应用细粒度的动态分块梯度下降来优化它。通过将这种细粒度校正与平滑跨层过渡的滑动窗口机制相结合,REAL-Q有效减轻了网络中的误差传播。在W4A16设置下,针对LLaMA-3.1(8B和70B)和Qwen3(0.6B–32B),REAL-Q相对于最先进的全局引导方法将端到端KL散度降低了高达约49%。  

## 1 引言  
大语言模型(LLM)在广泛自然语言处理任务中展现出卓越能力(Grattafiori等,2024)。然而,部署具有数十亿参数的模型会产生巨大的计算和内存成本。训练后量化(PTQ)通过将模型权重量化为低比特表示,无需昂贵重新训练,提供了一种实用解决方案(Gholami等,2021)。在PTQ方法中,GPTQ(Frantar等,2023)已成为仅权重量化压缩的基础算法。基于最优脑外科医生(OBS)框架(Hassibi等,1993),其按列求解器已被广泛集成到主流推理引擎(如vLLM、TensorRT-LLM)中,并被众多最先进的技术扩展(Dettmers等,2024;Li等,2025;Kim等,2025)。  

尽管成功,GPTQ存在根本局限:**层局部目标的不准确性**。GPTQ最小化层内重建MSE ‖**W****x**−**Ŵ****x**‖₂²,其中**x**是全精度激活。该局部目标存在双重错位。上游方面,它假设全精度输入激活**x**,忽略了来自先前量化层的扰动输入**x̂**,导致累积误差未被校正。下游方面,它均匀加权所有输出通道扰动,忽略了真实KL散度依赖于通过后续Transformer块和语言模型头的强非线性、高度耦合映射。因此,依赖未扰动输入和均匀加权平方误差的代理与真实量化损失错位。  

近期研究尝试解决这些盲点:GPTAQ(Li等,2025)重新校准输入以校正上游误差,但其每层损失仍是均匀重建MSE。相反,GuidedQuant(Kim等,2025)纳入端到端梯度以捕获下游敏感性。然而,它仍然未校正上游误差,并依赖结构近似,如忽略细粒度跨通道耦合和在输出组间共享海森矩阵。此外,由于真实的端到端海森矩阵重新计算成本极高,已近似的矩阵在每层内保持静态。当真实损失景观随权重逐列渐进量化而变化时,错位的海森矩阵导致补偿误差随列扫描过程累积。我们将此现象称为**信息错位**,其中“信息”指一阶或二阶信息如梯度和海森矩阵。  

这些方法的共同局限是结构性的:要求按列更新保持解析可解性迫使它们(i)大幅近似全局损失——忽略跨通道耦合、将输出行分组、压缩二阶信息直至适合闭式求解器;(ii)冻结所得海森矩阵在整个层内,无法随每列量化步骤中损失景观变化在更细粒度上刷新。  

REAL-Q(实时端到端损失对齐LLM量化)通过在列扫描中交错**细粒度、动态**校正来解决这两个局限,包含两个组件:  
**端到端对齐目标:聚合Fisher MSE**。REAL-Q的代理是基于当前块输出处全局KL散度的二阶泰勒展开导出的Transformer块输出Fisher MSE。使用**完整**聚合Fisher矩阵保留了分组基线必须丢弃的跨通道耦合,同时展开点选择将反向传播限制在至多两个相邻块。损失滑动窗口平滑跨块边界的目标,防止优化景观的不连续跳变。  

**细粒度、动态分块梯度下降**。REAL-Q不将整个层固定于一个静态二阶求解器,而是在GPTQ扫描中**每列块后**交错单次Adam梯度步(Kingma和Ba,2014)。这将校正粒度从先前求解器使用的每层级别提升到列块级别——约精细两个数量级——并允许每步响应最新量化状态,因为梯度针对实际部分量化权重在线重新计算。Adam的对角预条件器还动态调整每坐标尺度,在不反转海森矩阵的情况下提供隐式二阶信息。  

总之,我们的主要贡献如下:  
- **聚合Fisher MSE与损失滑动窗口**:在GPTQ系谱的顺序流水线中,我们采用端到端对齐目标替代层局部MSE。我们提出聚合Fisher MSE,在保持跨通道耦合的同时将反向传播开销限制在局部块边界。为稳定顺序量化过程,我们引入**损失滑动窗口**机制,平滑连续Transformer块间目标的过渡,防止损失景观的不连续跳变。  
- **动态分块梯度下降(Block-GD)**:我们通过用动态一阶方法替代静态解析求解器来解决先前工作的**信息错位**。通过将Adam驱动的梯度反馈直接对齐到列块更新,此机制适应移动的损失景观,并在线校正累积的上游误差。  
- **实证性能**:在LLaMA-3.1(8B和70B)和Qwen3(0.6B–32B)上的实验表明,REAL-Q在所有评估模型上实现最低KL,在W4A16设置下将KL散度在Qwen3-1.7B上降低高达约49%(图1)。  

图1:**主要结果**。在WikiText-2上的KL散度(×10⁻²,越低越好)(W4A16,按行)。REAL-Q显著优于先前最强基线GuidedQuant,每个模型的精确相对降幅已标注。完整七模型结果见附录D.2。  

## 2 相关工作  
#### 二阶训练后量化。  
最优脑损伤(OBD)(LeCun等,1989)和最优脑外科医生(OBS)(Hassibi等,1993)框架为在神经网络压缩中使用二阶海森信息奠定了基础。GPTQ(Frantar等,2023)成功将OBS扩展到十亿参数LLM。通过并发处理权重行并采用共享、静态逆海森矩阵逐列补偿量化误差,GPTQ建立了现代顺序PTQ的主导流程。  

#### GPTQ的全局感知扩展。  
近期进展尝试通过在量化过程中纳入更广模型上下文来增强标准顺序GPTQ流程。GPTAQ(Li等,2025)通过迭代重新校准输入激活来解决上游误差累积。它不完全依赖固定的全精度输入,而是使用先前量化层的输出动态计算校准激活,从而将上游量化漂移纳入层内重建目标。GuidedQuant(Kim等,2025)在局部求解器中纳入端到端下游敏感性。它在校准集上执行初始反向传播以获得每token显著性分数,随后用于加权输入协方差矩阵。为保持解析二阶更新的计算可处理性,GuidedQuant将权重矩阵行划分为组,并为每组计算共享、静态近似海森矩阵以驱动按列量化。  

#### 其他相关方向。  
关于旋转预处理(如QuaRot(Ashkboos等,2024b),我们已采用)、仅权重量化表示、量化感知训练和经典Fisher应用的详细讨论延至附录B。该附录还提供了与BRECQ(Li等,2021)的详细比较;尽管BRECQ在块级损失建模上与我们概念相似,但其整体量化流程与我们根本不同。  

## 3 预备知识  
### 3.1 问题表述  
考虑一个具有L个Transformer块的预训练LLM,其中每块ℓ包含线性模块(如注意力中的**Wq**、**Wk**、**Wv**、**Wo**和MLP中的**Wup**、**Wgate**、**Wdown**)。对于权重矩阵**W**∈ℝᵐˣⁿ的线性模块,PTQ的目标是找到量化权重**Ŵ**以最小化模型输出质量的退化。给定校准数据集𝒟={**x₁**,...,**xN**},我们通过原始与量化模型输出之间的KL散度衡量量化质量:  
ℒₖₗ=𝔼ₓ∼𝒟[𝐷ₖₗ(𝑝_**W**(⋅∣**x**)∥𝑝_**Ŵ**(⋅∣**x**))] (1)  
遵循近期研究(Kong等,2026),我们采用KL散度作为主要评估指标,因其捕获完整输出分布偏移且比困惑度更准确反映量化引起的行为退化。为与先前工作可比,我们也报告困惑度和零样本任务准确度作为次要指标。  

### 3.2 GPTQ回顾  
GPTQ(Frantar等,2023)通过按列量化权重处理线性模块。在步骤j,GPTQ将列j量化为**ŵj**,计算残差**δⱼ**=**wⱼ**−**ŵⱼ**,并最优更新剩余未量化列以补偿:  
**W**:ⱼ₊₁:ₙ←**W**:ⱼ₊₁:ₙ−1/[**H**⁻¹]ⱼⱼ **δⱼ** **H**⁻¹ⱼ,ⱼ₊₁:ₙ (2)  
其中**H**=2/𝑇∑ₜ₌₁ᵀ**xₜxₜᵀ**是局部重建MSE的海森矩阵。为加速计算,GPTQ将列分组为大小B的块。在块内应用公式(2)后,批量更新补偿所有尾随列:**W**:bₑₙ:ₙ←**W**:bₑₙ:ₙ−**E_b**·**H**⁻¹b,bₑₙ:ₙ(bₑₙ表示块b的结束),其中**E_b**是累积块误差。  

### 3.3 GuidedQuant:显著性加权海森  
标准GPTQ依赖均匀层内重建目标,而GuidedQuant(Kim等,2025)通过将海森矩阵与端到端损失对齐来改进。通过在校准集上执行初始端到端反向传播,获得每token显著性分数sₜ⁽ˡ⁾=‖∂ℒ/∂yₜ⁽ˡ⁾‖²,随后用于加权GPTQ海森矩阵计算。为管理计算开销,权重矩阵行被划分为N₉组(所有实验中使用N₉=4),并为每组维护独立海森矩阵:  
**H**₍₉₎⁽ˡ⁾=∑ₜ₌₁ᵀ sₜ,₉⁽ˡ⁾·**xₜxₜᵀ**, g=1,...,N₉ (3)  
其中sₜ,₉⁽ˡ⁾是token t限制在组g输出维度内的显著性分数。虽然计算可行,但这种分组共享策略固有地丢弃精确跨通道耦合,并降低二阶矩阵的精度。  

## 4 REAL-Q  
### 4.1 概述  
REAL-Q通过从粗到细的优化层次增强显著性加权PTQ流程。我们保留传统按列解析补偿作为初步粗更新,但通过以下方式增强优化轨迹:(1)**聚合Fisher加权MSE**提供端到端梯度指导;(2)**动态Block-GD**,一种在块后立即应用的一阶主动校正,以减少静态求解器遗漏的残差误差(如上游扰动和结构不精确性);(3)**损失滑动窗口**平滑连续Transformer块间的目标插值。这些组件共同校正静态

相似文章

KronQ: 基于Kronecker分解Hessian矩阵的大语言模型量化方法

arXiv cs.LG

KronQ是一种后训练量化框架,通过Kronecker分解的海森矩阵近似引入梯度协方差,实现了双向非相干处理和改进的混合精度分配灵敏度度量。即使在LLaMA-3-70B等大模型上进行2比特权重量化,也能实现低困惑度。

面向大语言模型的显著性感知正则化量化校准

arXiv cs.AI

本文提出了显著性感知正则化量化校准(SARQC),这是一个统一的框架,通过添加正则化项以保持权重接近度,从而改善大语言模型(LLM)的训练后量化(PTQ),提升泛化能力和性能。