激活离群值重要性:量化多模态LLMs的鲁棒恢复

arXiv cs.LG 论文

摘要

本文将激活量化识别为超低比特量化多模态LLMs中的主要瓶颈,并提出残差回退量化(RFQ)以最小开销恢复性能。

arXiv:2608.26581v1 公告类型:新 摘要:低位量化为降低多模态大语言模型(MLLMs)的计算和内存需求提供了有前景的途径。最近对低精度格式的硬件支持,从MXFP8到超低位格式如MXFP4和HiF4,加速了高效MLLM训练和部署的研究。在这项工作中,我们对代表性MLLMs中的这些量化方案进行了系统研究,涵盖视频生成和推理任务。分析显示,MXFP8实现近乎无损的性能,而激进的4位量化导致显著性能下降。通过广泛的消融实验,我们识别激活量化是性能损失的主要来源,贡献远大于权重量化。基于此观察,我们提出残差回退量化(RFQ),一个轻量级激活重建框架,通过辅助量化残差路径补充主超低位激活表示。通过显式建模和补偿量化误差,RFQ在保持超低位计算效率优势的同时提高了激活保真度。RFQ无需架构修改,计算开销可忽略不计。在Wan2.2和Qwen3-VL上的大量实验表明,RFQ在MXFP4和HiF4量化下一致恢复了大部分性能损失,显著缩小了与BF16基线在生成和推理基准上的差距。我们的发现确立了激活量化是超低位MLLMs中的主要瓶颈,并强调基于残差的激活重建是稳健4位部署的有效且实用策略。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:41

# 量化异常值至关重要:量化多模态大语言模型的鲁棒恢复方法
来源:https://arxiv.org/html/2608.26581
Mehran Taghian Jazi Yunke Peng Zhuang Ma Anandharaju Durai Raju Yao Wang Xing Huang Hei Yi Mak Shadan Golestan Hoang Le Yonghan Dong Wei Guo Yaoyuan Wang  
机构:华为  
邮箱:[\{tanzila.rahman, pengyunke\}@huawei.com](mailto:{tanzila.rahman,%20pengyunke}@huawei.com)

###### 摘要

低比特量化为降低多模态大语言模型(MLLMs)的计算和内存需求提供了有前景的途径。近年来,硬件对低精度格式的支持(从MXFP8到超低比特格式如MXFP4和HiF4)加速了高效MLLM训练与部署的研究。本工作中,我们对这些量化方案在涵盖视频生成和推理任务的代表性MLLM中进行了系统研究。分析表明,MXFP8可实现近乎无损的性能,而激进的4比特量化会导致显著性能下降。通过广泛的消融实验,我们确定激活量化是该性能损失的主要来源,其贡献远超权重量化。基于此发现,我们提出了残差回退量化(RFQ),一种轻量级激活重建框架,通过辅助量化残差路径补充主超低比特激活表示。通过显式建模和补偿量化误差,RFQ在保持超低比特计算效率优势的同时提升了激活保真度。RFQ无需架构修改且计算开销可忽略不计。在Wan2.2和Qwen3-VL上的大量实验表明,RFQ能持续恢复MXFP4和HiF4量化下损失的大部分性能,显著缩小了与BF16基线在生成和推理基准上的差距。我们的研究确立了激活量化是超低比特MLLM的主要瓶颈,并突出了基于残差的激活重建是实现稳健4比特部署的有效实用策略。

## 1 引言

基础模型(FMs),特别是多模态大语言模型(MLLMs),已成为构建能够联合处理语言、视觉及其他模态推理的通用AI系统的主导范式。这种统一建模范式推动了视觉理解[24, 7]、多模态推理[43, 22]和智能体交互[1, 44]的重大进展。尽管如此,MLLM的训练和部署成本依然极高,因其庞大的参数规模、长上下文计算和异构多模态架构对内存和计算提出了显著需求[50, 5]。为提高效率,已探索多种技术,包括稀疏注意力机制[55]、高效解码策略[19],以及最突出的低比特量化[50, 17, 29]。量化通过以降精度格式(如FP8)表示模型张量(包括权重、激活、梯度和优化器状态),减少内存占用和计算成本。

![图1:激活异常值影响及所提RFQ框架概述。激活异常值导致FP4量化下MLLM性能下降。RFQ通过残差回退校正减少异常值引起的量化误差,将生成质量恢复至接近BF16基线水平。](caption)  
近年来,硬件支持的混合精度训练进展显著扩展了低比特计算在大规模系统中的适用性。早期工作如TransformerEngine[37]展示了矩阵乘法加速线性层的有效性。FP8-LM[39]进一步将FP8量化扩展至梯度、优化器状态和通信,降低了训练期间的内存和带宽开销。最近,COAT[50]通过额外量化激活和二阶优化器状态推进了端到端FP8训练,同时引入了针对张量的策略,如为优化器统计动态范围扩展和为敏感非线性层细粒度激活量化。另有研究[6]识别了Transformer中注意力诱导的激活异常值,并引入裁剪softmax和门控注意力来抑制异常值,实现了无需额外微调的完整INT8量化。这些进展表明,有效的低精度训练需要训练栈中各组件经过精心且针对性的设计。

受这些成果启发,我们研究能否通过将多模态训练推向更激进的FP4领域来进一步提升效率。然而,FP4有限的动态范围和精度导致显著的数值不稳定性,常引起收敛性和准确性下降。为理解这一现象,我们在两个代表性MLLM上进行了系统研究:多模态生成模型Wan2.2[46]和多模态推理模型Qwen3-VL[3]。参考[20],我们同样量化了覆盖视觉编码器、文本编码器、注意力模块、前馈网络、多模态投影层和混合专家模块的关键组件。分析显示,FP4导致的性能下降在模型和模块间高度异构。在Wan2.2中,最严重的性能下降出现在视觉生成骨干(即WanDiT),而UMT5[12]文本编码器相对稳健。相比之下,Qwen3-VL的视觉编码器相对于语言模块表现出更高敏感性;尽管如此,语言骨干在超低比特约束下也经历了非平凡的架构性退化。跨两个模型,我们发现激活量化是准确性下降的主要驱动因素,某些模块呈现重尾激活分布和显著异常值,在FP4精度下严重失真,导致训练中下游误差放大。

针对异常值感知量化的先前工作为激活不稳定性提供了部分解决方案。训练后量化(PTQ)方法如SmoothQuant[51]和MASQuant[20]通过在冻结模型上的校准时变换来缓解激活异常值。量化感知训练(QAT)方法,包括OCC[48]和Outlier Fallback[57],通过裁剪、补偿或混合精度执行在训练中处理异常值。然而,这些方法并不直接适用于端到端FP4 MLLM训练:PTQ方法依赖静态校准统计,而现有QAT技术主要针对纯文本LLM或更高比特领域,并通常对模块应用统一启发式。相反,我们的发现表明MLLM中的FP4故障模式既依赖于模型也依赖于模块,激活异常值在训练中动态演变,并在不同架构的不同组件中集中分布。

这些观察表明,MLLM稳定的FP4训练需要完全可微且训练感知的激活误差建模。为此,受[57]启发,我们提出了**残差回退量化(RFQ)**,一种专为超低比特MLLM训练设计的轻量级激活感知量化策略。RFQ将激活分解为量化的主要FP4表示和显式量化残差,无需基于阈值的选择。RFQ不丢弃或选择性保留数值,而是计算完整量化误差,并通过第二条低比特量化路径重建该误差。这确保了主要激活和残差校正均与FP4计算兼容。RFQ直接解决MLLM中的FP4敏感性,同时无需架构修改或全精度回退。

我们的贡献总结如下:
- 我们对多模态大语言模型中的超低精度量化进行了首次系统研究,分析了MXFP8、MXFP4和HiF4在多模态生成和推理架构(包括Wan2.2和Qwen3-VL)中的表现。
- 我们展示了FP4敏感性在MLLM中高度依赖模块,视觉组件通常比语言组件更容易受到量化导致的退化影响。我们进一步确定激活量化是FP4退化的主要来源,揭示性能崩溃主要由重尾激活分布和激活异常值而非权重量化驱动。
- 我们提出**残差回退量化(RFQ)**,一种轻量级激活感知量化策略,通过在GEMM期间重新量化激活残差并累积其贡献来补偿FP4量化误差。RFQ在有效缓解量化引入的准确性下降同时,保持了大多数操作的FP4计算。
- 大量实验证明,RFQ显著恢复了MXFP4和HiF4量化引入的准确性下降,在保持超低精度计算效率优势的同时达到接近BF16基线的性能。

## 2 相关工作

**LLM量化**  
量化技术广泛分为训练后量化(PTQ)和量化感知训练(QAT)。PTQ使用小型校准数据集压缩预训练模型,无需进一步参数优化,因其低计算开销成为流行的部署选择。代表性方法包括RTN[23]、GPTQ[16]、AWQ[28]和SmoothQuant[51],近期扩展探索了异常值感知分配[25]、混合精度[15]和基于旋转的变换[18]。然而,PTQ在超低比特领域(如4比特)表现不佳,因其无法适应量化引起的分布偏移。

相比之下,QAT将量化集成到训练阶段,允许模型通过基于梯度的优化适应低精度噪声。近期框架如LLM-QAT[32]、BitDistiller[14]、EfficientQAT[10]和GETA[41]利用蒸馏和分阶段优化提升稳定性,而QuEST[38]、DB-LLM[8]和BitNet[35]引入了替代的三元/二元参数化。尽管如此,超低精度QAT仍因激活异常值和非均匀层敏感性而具挑战性,这些因素在反向传播期间引入巨大量化噪声并放大深层Transformer块间的误差传播。

**多模态LLM量化**  
多模态大语言模型(MLLMs)通过集成视觉编码器、语言骨干和跨模态融合模块扩展了LLMs,以实现对图像和文本等异构输入的联合推理。然而,这种多模态设计因不同模态和模型组件间激活分布的显著差异而引入额外量化挑战。因此,直接应用LLM量化技术常导致跨模态不均匀退化。为解决此问题,近期PTQ方法引入模态和层感知设计。MBQ[26]利用模态特定的令牌敏感性提升校准质量。LUQ[5]研究了MLLM的超低比特PTQ,并强调了由异构激活统计驱动的量化鲁棒性的强层间变化。MQuant[54]进一步表明跨模态分布不匹配是量化退化的关键因素。MASQuant[20]识别了跨模态的平滑不平衡,即主导激活尺度在通道级平滑下可能抑制其他尺度,并提出了模态感知补偿。其他方法包括Q-VLM[47]、VLMQ[53]和Quant Experts[21],通过敏感性感知舍入、令牌级重要性或基于重建的校正来减少视觉语言模型中的量化误差。除PTQ外,MLLM的QAT仍相对探索不足但日益重要。Attn-QAT[56]分析了FP4注意力训练,并识别了低精度反向计算中的关键稳定性约束。MF-QAT[52]提出了多格式QAT,使单一模型无需重训即可在多种精度格式下运行。

尽管有这些进展,MLLM在超低精度下的稳定优化仍是开放挑战,因其动态演变的激活分布和强跨模态交互。现有PTQ方法依赖无法适应激活偏移的静态校准,而QAT方法在极端比特约束下未能建模重建。这些限制因MLLM统计的动态、模态依赖性而被放大。为此,我们提出一种统一的模态无关量化策略,直接在激活层面操作,通过可微重建校正量化引起的扭曲。通过针对激活层面的误差,我们的方法消除了复杂的模态特定工程,同时在高度异构分布下保持鲁棒性。

## 3 预备知识

### 3.1 标准浮点与量化基础

标准浮点(FPFP)[4]数

相似文章

InfoQuant:为低比特大语言模型量化塑造激活分布

arXiv cs.LG

InfoQuant 提出了一种无需训练的方法——峰值抑制正交变换(PSOT),用于重塑低比特大语言模型量化中的激活分布,在 W4A4KV4 设置下保留了 97% 的浮点精度,并优于之前的 PTQ 方法。