突破压缩瓶颈:从理论到实践
摘要
本文首次从数学上证明,低秩分解与量化在结合用于LLM压缩时并非正交,会导致性能下降,并提出了一种新颖的对角粘合方法(DAM)来减轻这种损失。
arXiv:2607.20434v1 公告类型:新
摘要:随着语言模型参数规模的持续增长,有效的模型压缩成为减少计算和内存开销的必要手段。现有压缩方法存在瓶颈问题:当压缩率增加时,性能显著下降。低秩分解与量化是两种突出的压缩方法,已被证明能在保持模型精度的同时,大幅降低大型语言模型(LLMs)的计算和内存需求。显然,将这两种方法结合将突破现有的压缩瓶颈。然而,这两种方法在结合时如何相互作用仍是开发者面临的关键问题,因为许多人假设它们是正交的,即它们的结合不会引入超出各自方法独立引入的额外误差。本文首次从数学上证明低秩分解与量化并非正交。我们通过一系列在大语言模型上的实验验证了这些发现。实验结果表明,这两种方法是非正交的,它们的结合会导致显著的性能下降。重要的是,我们提出了一种新颖的方法——对角粘合方法(DAM),该方法能有效结合这两种方法并减轻性能损失。我们的研究为模型压缩提供了深刻见解,并为未来相关研究奠定了坚实的理论和实验基础。
查看缓存全文
缓存时间: 2026/07/24 05:15
# 突破压缩瓶颈:从理论到实践 **来源:** https://arxiv.org/html/2607.20434 Xiusheng Huang¹˒²˒³, Lu Wang⁴, Yequan Wang³†, Jun Zhao¹˒², Kang Liu¹˒²† ¹中国科学院自动化研究所复杂系统认知与决策智能重点实验室,北京,中国 ²中国科学院大学人工智能学院 ³北京人工智能研究院 ⁴Ritzz-AI [email protected], {wangluloveslezhi, tshwangyequan}@gmail.com, {jzhao, kliu}@nlpr.ia.ac.cn ###### 摘要 随着语言模型参数规模的持续增长,需要有效的模型压缩来降低其计算和内存开销。现有压缩方法存在瓶颈问题:当压缩比提高时,性能会显著下降。低秩分解和量化是两种突出的压缩方法,已被证明能显著降低大语言模型(LLM)的计算和内存需求,同时保持模型精度。显然,将这两种方法结合使用将突破现有的压缩瓶颈。然而,对于开发者来说,这两种方法在结合时如何相互作用仍是一个关键问题,因为许多人假设它们是正交的,这意味着它们的组合不会引入超出每种方法各自独立引入的额外误差。本文首次从数学上证明了低秩分解和量化是非正交的。我们通过一系列在大语言模型上的实验验证了这些发现。我们的结果表明,这些方法是非正交的,它们的组合会导致显著的性能下降。重要的是,我们提出了一种名为对角粘附方法(DAM)的新方法,该方法可以有效结合这两种方法并缓解性能损失。我们的研究为模型压缩提供了深入见解,并为未来的相关研究奠定了坚实的理论和实验基础。 ## 1 引言 近年来,大语言模型(LLM)由于参数数量不断增加,在众多自然语言处理任务中表现出色(Huang et al., 2021 (https://arxiv.org/html/2607.20434#bib.bib53), 2022 (https://arxiv.org/html/2607.20434#bib.bib54))。然而,参数规模的这种增长是以计算和存储需求显著提高为代价的(Meng et al., 2022 (https://arxiv.org/html/2607.20434#bib.bib26))。因此,LLM的高效低成本部署已成为一个关键研究领域(Gupta et al., 2023 (https://arxiv.org/html/2607.20434#bib.bib25))。该领域的先前工作大致可分为两类方法:架构修改技术和架构无关技术(Ding et al., 2023 (https://arxiv.org/html/2607.20434#bib.bib50))。架构修改技术包括蒸馏和剪枝(Hwang et al., 2021 (https://arxiv.org/html/2607.20434#bib.bib29))。蒸馏显式地从大模型中提取知识,并用其训练一个小模型(Porada et al., 2021 (https://arxiv.org/html/2607.20434#bib.bib37))。而剪枝则移除不太重要的参数以减少计算和存储开销。然而,由于蒸馏和剪枝对训练数据和计算资源有巨大需求,它们对于LLM通常不实用。架构无关技术包括量化和低秩分解(Levy et al., 2017 (https://arxiv.org/html/2607.20434#bib.bib38))。量化降低模型权重或激活的精度,通常从32位浮点数降低到较低位数的表示,如8位或4位整数,甚至二进制(Ashkboos et al., 2025 (https://arxiv.org/html/2607.20434#bib.bib23))。低秩分解用较低秩的矩阵近似权重矩阵,在保持权重为浮点格式的同时减少参数数量(Yuan et al., 2023 (https://arxiv.org/html/2607.20434#bib.bib13))。量化和低秩分解是实际部署LLM的热门选择,因为它们成本低、与架构无关且通常表现良好。 现有的量化和低秩分解方法都面临性能瓶颈(Sun et al., 2025 (https://arxiv.org/html/2607.20434#bib.bib105); Yuan et al., 2023 (https://arxiv.org/html/2607.20434#bib.bib13))。例如,量化在W4A4KV4以上的精度可以保持良好的性能,但当模型被进一步压缩到更低比特宽度时,准确率会出现显著且不可接受的下降(Hu et al., 2025 (https://arxiv.org/html/2607.20434#bib.bib108))。类似地,当压缩比超过50%时,低秩分解的性能会显著下降(Wang et al., 2024 (https://arxiv.org/html/2607.20434#bib.bib14))。大量实验表明,W4A4KV4和50%的压缩比代表了模型压缩技术当前的瓶颈,限制了进一步高保真压缩的可能性。 一个令人鼓舞的想法是有效结合这两种架构无关技术。人们自然期望直接结合量化和低秩分解能在计算和存储成本方面带来显著好处。然而,潜在的缺点尚不清楚。先前的研究假设这两种方法是正交的,这意味着它们的组合不会引入超出每种方法各自引入的额外误差(Wang et al., 2024 (https://arxiv.org/html/2607.20434#bib.bib14))。然而,这些研究主要关注仅量化权重,使得组合量化和低秩分解带来的额外误差不那么明显,并且忽略了在量化激活值时异常值的普遍存在。这些研究未能适当调查同时使用这两种方法的整体影响,也未提供有效的整合策略。这对LLM的进一步低成本部署构成了重大挑战。 为应对这些挑战,我们首先从张量和点积两个角度进行理论分析,证明量化和低秩分解是非正交的,因此会引入额外误差。此外,我们发现应用这两种方法的顺序显著影响模型性能,并推导出理论上的最优顺序——先进行低秩分解,再进行量化。最后,我们确定了激活的异常值是影响压缩模型性能的关键因素,并提出一种对角粘附方法(DAM),该方法能显著减少由量化和低秩分解组合引起的额外损失。据我们所知,我们是第一个从理论上证明量化和低秩分解是非正交的,并提供正确压缩顺序的。基于低秩分解中固有的异常值问题,我们提出了DAM方法。大量实验表明,DAM方法显著提高了压缩模型的性能。我们的研究为模型压缩提供了深入见解,并为未来的相关研究奠定了坚实的理论和实验基础。 我们的贡献总结如下: - 我们从数学上证明了量化和低秩分解是非正交操作。基于压缩误差分析,它们的组合会引入复合误差并导致性能下降。我们的发现提供了理论基础,并挑战了将量化和低秩分解组合不会显著影响性能的传统观念。 - 为了提高量化和低秩分解组合的性能,我们首次推导出最优顺序——先进行低秩分解,再进行量化。这一发现得到了大量实验结果的进一步支持。 - 我们提出了一种对角粘附方法(DAM)来解决由量化和低秩分解组合引起的性能下降问题。大量实验表明,在保持低成本和高速的同时,DAM显著提高了性能。 ## 2 相关工作 ##### 量化。 训练后量化(PTQ)因其高效性已成为大语言模型(LLM)的一项重要技术。当前的PTQ方法通常可分为仅权重量化和权重-激活量化。为最小化内存使用,一些策略专注于仅权重量化。GPTQ利用基于Hessian矩阵的误差补偿,通过减少量化误差实现显著的压缩率(Frantar et al., 2022 (https://arxiv.org/html/2607.20434#bib.bib15))。AWQ(Lin et al., 2024 (https://arxiv.org/html/2607.20434#bib.bib16))通过处理激活异常值对权重量化的影响来提升性能(Lee et al., 2023 (https://arxiv.org/html/2607.20434#bib.bib17))。QuIP(Chee et al., 2023 (https://arxiv.org/html/2607.20434#bib.bib18))和QuIP#(Tseng et al., 2024 (https://arxiv.org/html/2607.20434#bib.bib19))利用随机Hadamard矩阵进行非相干处理,并对权重应用向量量化,相比降低精度的量化获得了更好的性能。SmoothQuant(Xiao et al., 2023 (https://arxiv.org/html/2607.20434#bib.bib20))通过数学变换将量化的难度从激活转移到权重。OmniQuant(Shao et al., 2023 (https://arxiv.org/html/2607.20434#bib.bib21))通过训练量化参数和变换系数进一步提升性能。此外,I-LLM(Hu et al., 2024 (https://arxiv.org/html/2607.20434#bib.bib22))提出了一种通过全平滑块重建和全整数算子实现纯整数量化和推理的策略。最近,QuaRot(Ashkboos et al., 2025 (https://arxiv.org/html/2607.20434#bib.bib23))采用随机旋转矩阵促进权重和激活的4位量化,而SpinQuant(Liu et al., 2024 (https://arxiv.org/html/2607.20434#bib.bib24))则学习这些矩阵以优化4位量化过程。 ##### 低秩分解。 奇异值分解(SVD)是一种通过用两个较小的低秩矩阵近似矩阵来减小矩阵大小的常用技术(Golub et al., 1987 (https://arxiv.org/html/2607.20434#bib.bib11))。在LLM压缩领域,只有少数基于SVD的方法被提出。具体来说,标准SVD仅专注于压缩原始权重矩阵,而不考虑参数的重要性,这可能导致更高的压缩误差。为解决此问题,引入了FWSVD方法,该方法利用Fisher信息评估参数重要性(Hsu et al., (https://arxiv.org/html/2607.20434#bib.bib12))。然而,这种方法需要复杂的梯度计算,对LLM压缩需要大量资源。标准SVD的另一个挑战是激活的分布,它会影响压缩精度。为此,提出了ASVD方法,该方法利用对角矩阵缩放权重矩阵,以反映输入通道对权重的影响(Yuan et al., 2023 (https://arxiv.org/html/2607.20434#bib.bib13))。然而,两种方法都没有建立奇异值与压缩损失之间的明确关系。 ##### 组合量化与低秩分解。 先前的研究探索了量化和低秩分解的组合用于模型压缩。SVD-LLM仅压缩模型权重而不处理激活值,并且忽略了它们的存在(Wang et al., 2024 (https://arxiv.org/html/2607.20434#bib.bib14))。先前的研究没有为这两种方法的最优顺序提供明确结论,也没有为异常值问题提供解决方案。这些问题对进一步的高质量模型压缩构成了重大挑战。 ## 3 量化与低秩分解的非正交性 ##### 定义 3.1(量化方法)。 现有量化方法是基于块的量化方法,它将权重矩阵划分为多个块,并独立量化每个块。对于每个块,使用该块内的最大绝对值作为缩放因子。 \[ Q(W) = \text{Round}\left( \frac{W}{\max(|W|)} \cdot 2^{b-1} \right) \tag{1} \] 其中,\(Q(W)\) 表示量化后的块,\(W\) 表示原始权重块,\(\max(|W|)\) 表示块 \(W\) 中元素的最大绝对值,\(b\) 表示量化比特宽度,\(\text{Round}(\cdot)\) 表示取整操作。反量化公式为: \[ D(Q(W)) = Q(W) * \max(|W|) / (2^b - 1) \tag{2} \] ##### 定义 3.2(量化误差)。 我们将量化误差和理论误差边界形式化如下: \[ E(Wx) = \|Wx - D(Q(W))x\| \tag{3} \] \[ \|E(Wx)\| \leq \max(|W|) / (2 * (2^b - 1)) \|x\| \] 其中,\(E(Wx)\) 是量化误差,\(\|E(Wx)\|\) 是最大误差边界,\(x\) 是权重 \(W\) 的输入。详细证明过程见附录 A (https://arxiv.org/html/2607.20434#A1)。 ##### 定义 3.3(低秩分解方法)。 对于任意矩阵 \(W \in \mathbb{R}^{m \times n}\),其奇异值分解(SVD)可以表示为: \[ W = U \Sigma V^T \tag{4} \] 其中,\(U \in \mathbb{R}^{m \times m}\) 是左奇异向量矩阵(正交矩阵),\(\Sigma \in \mathbb{R}^{m \times n}\) 是奇异值对角矩阵,\(V \in \mathbb{R}^{n \times n}\) 是右奇异向量矩阵的转置(正交矩阵)。附录 B (https://arxiv.org/html/2607.20434#A2) 展示了低秩分解误差。 ### 3.1 张量级分析 ##### 定义 3.5(压缩误差)。 先前的研究没有考虑量化和低秩分解的最优应用顺序,我们为不同顺序提供了压缩误差。对于 \(l \circ q\) 的压缩误差,我们有: \[ \begin{aligned} E_l &= \|W - U_r * \Sigma_r * V_r^T\|_F, \tag{5} \\ E_q &= \|Q(U_r) * Q(\Sigma_r) * Q(V_r^T) - U_r * \Sigma_r * V_r^T\|_F, \\ E_{l \circ q} &= \|Q(U_r) * Q(\Sigma_r) * Q(V_r^T) - W\|_F \end{aligned} \] 其中,\(l \circ q\) 表示先进行低秩分解,然后使用量化方法,\(r\) 表示低秩分解的压缩比。
相似文章
用于大语言模型压缩的联合结构化剪枝与混合精度量化
一种新颖的端到端大语言模型压缩框架,联合优化结构化剪枝与混合精度量化,在超低位宽精度下,相比于现有最先进方法实现了显著的困惑度降低和加速效果。
从信号退化到计算崩溃:揭示LLM量化的两种失效模式
研究者发现激进LLM量化存在两种截然不同的失效模式——信号退化与计算崩溃,并证明无需训练的修复手段仅能缓解前者,表明超低比特模型需进行结构性重建。
通过联合优化架构与量化策略实现 LLM 压缩
来自 UiT 和奥斯陆大学的研究人员提出了一种可微分 NAS 框架,能够联合优化 LLM 压缩中的架构配置与混合精度量化策略。与先 NAS 后量化的顺序基线方法相比,该框架在七项推理任务中可实现最高 1.4 倍的推理加速,或最高 6% 的精度提升。
@asmah2107: 如果我想要小型但智能的LLM,我会研究的压缩技术。1.量化 2.蒸馏 3.低秩适应…
一条推文列出了12种压缩技术,用于在保持性能的同时减小LLM大小,包括量化、蒸馏和低秩适应。
SigmaScale:基于SVD低秩分解与学习缩放矩阵的LLM压缩方法
介绍SigmaScale,一种为基于SVD的LLM压缩学习辅助缩放矩阵的方法,在Llama 3.1 8B和Qwen3-8B基准测试上展现出具有竞争力的性能。