压缩重要部分:神经元重要性与数据感知低秩逼近相结合的语言模型压缩

arXiv cs.LG 论文

摘要

本文提出了一种通过结合神经元重要性和数据感知低秩逼近来压缩大型语言模型的方法,同时采用高效的动态压缩率分配算法,性能与之前的最先进水平相当或更优。

arXiv:2607.18284v1 公告类型:新 摘要:为了在其领域表现出色,大型语言模型由数十亿个参数组成。然而,这带来了巨大的内存需求,限制了它们在资源受限环境中的适用性。为了解决神经网络(NN)压缩问题,奇异值分解(SVD)作为通过分解实现矩阵压缩的基本组件发挥了关键作用。为了最小化压缩误差并最大化压缩模型在下游任务上的效果,之前的工作要么从参数重要性的角度,要么从每层功能等价的角度,专注于神经网络权重矩阵的低秩逼近。虽然之前的工作孤立地研究了上述视角,在这项工作中,我们研究了将这两种视角的思想结合到一个目标中的方法的有效性。与此并行的是,影响压缩质量的一个重要方面是压缩率在层和神经网络参数之间的分布。早期的工作大多考虑在层和网络权重之间均匀分配压缩率,或者依赖于计算成本高昂的启发式搜索。与它们相反,在这项工作中,我们提出了一种增强且计算高效的动态压缩率分配算法。实验结果支持了所提出方法的有效性,其性能与之前的最先进水平相当或显著更好,特别是在高压缩比下。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:18

# 压缩关键部分:神经元重要性结合数据感知低秩近似实现语言模型压缩  
来源:https://arxiv.org/html/2607.18284 \tfootnote 本研究得到欧盟项目 VOXReality(XR 空间中的语音驱动交互)资助,项目编号 101070521。 \corresp 通讯作者:Athanasios Ntovas(邮箱:[email protected])。  
ALEXANDROS DOUMANOGLOU 1, PETROS DRAKOULIS1, DIMITRIS ZARPALAS1  
信息技术研究所(ITI),研究与技术基金会(CERTH),希腊塞萨洛尼基。  
(邮箱:{atdovas, aldoum, petros.drakoulis, zarpalas}@iti.gr)  

###### 摘要  
大型语言模型为了在其领域内表现卓越,包含了数十亿的参数。然而,这带来了巨大的内存需求,限制了它们在资源受限环境中的应用。为了解决神经网络(NN)压缩问题,奇异值分解(SVD)通过分解实现矩阵压缩,一直是基础性关键方法。为了最小化压缩误差并最大化压缩模型在下游任务中的效果,以往的研究或从参数重要性的角度,或从逐层功能等价的角度,对 NN 的权重矩阵进行低秩近似。虽然以往研究孤立地探讨了上述两个角度,但在这项工作中,我们研究了一种将这两个角度的思想结合到单一目标中的方法的有效性。与此同时,影响压缩质量的另一个重要方面是压缩率在各层和 NN 参数之间的分配。早期的工作大多考虑将压缩率均匀分布在各层和网络权重上,或者依赖于计算成本高的启发式搜索。与它们不同,在这项工作中,我们提出了一种增强且计算高效的动态压缩率分配算法。实验结果支持了所提出方法的有效性,其性能与先前最先进方法相当,或在很大程度上优于它们,尤其是在高压缩比下。  

###### 索引术语:  
语言模型,神经网络压缩,神经元重要性,SVD  

## I. 引言  
过去十年人工智能(AI)的进步使得许多以前被认为使用传统编程技术无法实现的应用成为可能。如今,AI 为计算机视觉应用(能够理解我们的世界)和聊天机器人(能够用自然语言与人类交流)等提供动力。目前,AI 主要通过深度神经网络(DNN)实现,这些计算架构经过训练,能够在特定领域中以人类水平的表现完成任务。大型语言模型(LLMs)[gpt, bert, gemma2, gemma3, llama, claude] 构成了擅长自然语言理解(NLU)和自然语言处理(NLP)的 DNN,并实现了基于自然语言的流畅人机界面。然而,这些 DNN 拥有大量的参数以及巨大的内存和计算开销。随着 AI 变得无处不在,它们在资源受限环境(如边缘设备、智能手机和迷你 PC)中的高效部署成为一个硬性要求。因此,压缩 LLMs 以实现高效部署自然形成了一个独立的研究领域 [comp-survey1, comp-survey2]。  
自 2017 年以来,Transformer 架构 [transformer] 一直是 LLMs 的主要基础。在最简单的形式中,Transformer 通过将句子和单词拆分为令牌来处理自然语言,随后由一系列按层组织的 Transformer 块顺序处理。每个 Transformer 块由一个自注意力模块和一个前馈层组成,两者均由权重矩阵参数化,每个权重对应一个在网络训练期间调整的参数。压缩 Transformer 网络可以通过多种方式实现,但最终目标是一致的:减少需要存储在内存中的网络参数数量,同时将网络性能的下降降到最低。  

参见图 1:混合压缩管道(NIDA-SVD)的架构概览。我们的方法将权重重要性与数据感知低秩近似相结合,并由我们的动态秩分配方案引导。在架构表示中,层组件如 $Q_i$(查询)和 $K_i$(键)分别用于表示相应的可压缩权重矩阵 $\bm{W}_{Q_i}$ 和 $\bm{W}_{K_i}$。  

关于 LLM 压缩的一条研究路线试图通过用两个低秩矩阵的乘积来近似 Transformer 块的权重矩阵,从而减少 LLM 的参数,这种技术也称为低秩近似。由于是低秩的,这些矩阵的参数总和小于原始矩阵中的参数。奇异值分解(SVD)[svd] 是一种矩阵分解方法 [comp-survey3],在低秩近似问题中起着关键作用,因为给定目标秩,它被证明能产生具有最小矩阵重构误差的最佳可能近似。除了其简单使用之外,SVD 已被用于更复杂的方法中来压缩 DNN 矩阵。首先,使用加权低秩分解,FWSVD [fwsvd] 考虑了每个参数对 DNN 输出的重要性,从而在等效压缩比下提高了模型性能。其次,SVD-LLMv2 [svd-llmv2] 的数据感知方法旨在通过一个小型校准数据集考虑与变换矩阵相乘的层输入,从而获得 DNN 权重矩阵的功能等价近似。每种方法都相比基线展示了显著的改进,然而,目前文献中缺乏将两者思想相结合的方法。在这项工作中,我们的第一个贡献就是解决这一空白。由于数据感知低秩近似是先前 LLM 压缩的最先进方法,我们选择将其作为我们方法的基础组件,同时寻求改进它。我们的研究和分析表明,将数据感知低秩近似与 FWSVD 建议的参数重要性估计方法简单结合,会降低 LLM 在下游任务上的性能,相比单独使用数据感知低秩近似。为了克服这一点,我们提出使用神经元重要性估计,这是一种考虑功能组中参数的替代方法,在相似压缩比下,通常能带来相比先前最先进方法显著的下游模型性能提升。  

除了我们在压缩方法本身所做的贡献外,我们还考虑了权重矩阵间参数数量分配的问题。尽管在以往的工作中,均匀分配是最常见的在矩阵间分配参数的方法,但在最近的方法 SVD-LLMv2 中,提出了一种新颖的算法作为先前简单均匀策略的改进。这种先前的方法依赖于根据 Transformer 块中的功能对权重矩阵进行分组。在这项工作中,我们做出了第二个贡献,提供了实验证据表明一种基于层索引的不同分组策略更为有效。我们的分析、消融研究和实验结果支持,在压缩 BERT [bert]、DistilBERT [distilbert]、MobileBERT [mobilebert] 和 TinyBERT [tinybert](这些是自然语言理解的基础模型)时,在绝大多数情况下,与其它基于 SVD 的算法相比,所提出的方法实现了最先进的性能。此外,我们还包括了在这些压缩架构(DistilBERT、MobileBERT 和 TinyBERT)上的计算分析,详细说明了 MFLOPS/令牌和总参数数量的显著减少。  

## II. 相关工作  
已经提出了几种方法来压缩预训练 LLMs [bert, roberta, deberta, deberta v3, llama, gemma2, gemma3, gpt] 中的 Transformer 架构 [transformer]。总的来说,这些方法分为四类。剪枝方法 [prunning-1, prune-slicegpt, llm-surgeon-prune, sparse-gpt-prune] 旨在消除尽可能多的参数,实际上将模型变换矩阵中的相应权重置零。一方面,非结构化剪枝无约束地移除单个参数,但通常需要专用硬件才能高效部署。另一方面,为了提高硬件兼容性,结构化剪枝移除权重矩阵的整行或整列,这与为快速矩阵乘法优化的标准硬件架构良好对齐。基于蒸馏的方法 [distilbert, tinybert, dynabert] 利用知识蒸馏 [distillation-survey] 通过训练一个较小的模型来模仿原始模型的行为,从而减少神经网络(NN)参数的数量。虽然通常有效,但这种方法可能计算成本高昂,因为它需要从头开始重新训练一个模型。第三,与我们工作最相关的是低秩近似方法 [comp-survey4],它使用奇异值分解(SVD)近似 Transformer 权重矩阵,将其分解为两个低秩矩阵的乘积。标准 SVD 将所有条目视为同等重要以最小化重构误差。FWSVD [fwsvd] 通过根据参数对模型输出的重要性对其进行加权来改进这一点。参数重要性通过对任务损失相对于参数进行微分并取梯度的大小来确定,这一过程需要额外访问校准数据集。最近的一项研究 [features-low-rank-weights-not] 揭示,大多数 Transformer 矩阵不是低秩的,因此,当试图通过低秩近似压缩它们时,得到的压缩网络表现出显著的性能下降。然而,发现对于中间令牌表示则相反,它们似乎具有低秩结构。由于矩阵乘积的秩小于或等于参与乘法的各个矩阵的秩的最小值,DRONE [drone]、ASVD [asvd] 和 SVD-LLM [svd-llm] 从功能等价的角度进行压缩,最小化矩阵乘法结果中的误差。然而,DRONE 需要缓存中间特征激活,导致大量的内存需求。SVD-LLM 通过仅依赖它们的协方差矩阵缓解了这一限制。同时,SVD-LLM 确保基于截断奇异值对矩阵乘法误差的忠实估计,这是 ASVD 的一个局限性。然而,在其初始版本中,SVD-LLM 依赖于 Cholesky 分解,这(a)需要正定矩阵,这一要求并非总是满足,并且(b)在迭代优化过程中可能遭受数值不稳定性。这两个问题都在 SVD-LLMv2 [svd-llmv2] 中通过使用两步 SVD 算法得到了解决。低秩近似也已与知识蒸馏结合在 [matrix-decomp] 中。我们的方法结合了 SVD-LLMv2(先前讨论的最先进方法中性能最佳的方法)和受 FWSVD 启发的思想。  

在低秩近似方法中,控制压缩率与性能权衡的基本超参数是压缩矩阵的秩。由于网络本身对不同层间的不同矩阵具有变化的敏感性,为了最佳性能而跨矩阵分配压缩率通常需要进行详尽的敏感性分析,这在实践中是不可行的。一些方法 [fwsvd, svd-llm] 只是简单地将压缩率均匀分布在层间,而其他方法 [drone, asvd, svd-llmv2] 则启发式地将穷举搜索简化为更易于管理的项。我们的方法计算效率高,并建立在 SVD-LLMv2 的秩选择算法之上。  

第四,与先前用于 LLM 压缩的方法正交的是权重量化 [spin-quantization, quantization-1, actaware-quantization, bert-quantization],它通常通过在固定的二进制位数预算下量化 LLM 的参数来减少执行模型推理所需的内存。后训练量化(PTQ)[ptq] 的最新进展表明,可以在无需重训练的情况下实现高精度的 LLM 量化。同时,专为 LLM 定制的量化感知训练(QAT)技术 [qat] 通过在微调期间对量化噪声进行建模,进一步提高了鲁棒性。与其他低秩近似技术类似,我们的方法还可以从此类方案中受益。  

## III. 背景  
在本节中,我们提供了理解我们方法的基础组件。我们首先回顾 Transformer 架构 [transformer] 的核心元素,然后描述 BERT [bert](将成为我们实验基本主体的语言模型),并概述 DistilBERT、MobileBERT 和 TinyBERT 的架构,因为它们作为我们压缩方法的额外模型。然后,我们回顾 SVD [svd] 及其作为后训练压缩技术的应用。最后,我们概述两种突出的基于 SVD 的方法,FWSVD [fwsvd] 和 SVD-LLMv2 [svd-llmv2],它们既作为比较基线,也作为所提出方法开发的灵感来源。  

### III-A. Transformer 架构  
在 Transformer 架构中,令牌是模型在处理(被映射到嵌入向量后)的最小输入单元(例如单词、子词或字符)。设 $\bm{X} \in \mathbb{R}^{D \times N}$ 表示 $N$ 个令牌的矩阵,每个令牌由嵌入空间中的一个 $D$ 维向量表示。Transformer 的核心是一堆层。每个 Transformer 层或块包含两个主要组件:自注意力机制和前馈网络(FFN)。自注意力机制使用两个矩阵,即查询 $\bm{Q} = \bm{W}_Q^T \bm{X}$ 和键 $\bm{K} = \bm{W}_K^T \bm{X}$ 来衡量每个令牌相对于其他令牌的重要性,并通过线性组合值矩阵 $\bm{V} = \bm{W}_V^T \bm{X}$ 来创建上下文表示。自注意力机制的输出随后由一个带有权重矩阵 $\bm{W}_a$ 的线性层进行变换。然后,前馈网络(也称为多层感知器(MLP)块)处理先前的输出以学习更高级的特征。在自注意力机制中,涉及四个可压缩的权重矩阵,即 $\bm{W}_Q$、$\bm{W}_K$、$\bm{W}_V$ 和 $\bm{W}_a$,而前馈块引入了两个额外的矩阵,第一个执行升维投影,第二个执行降维投影。我们将这些矩阵分别称为 $\bm{W}_u$ 和 $\bm{W}_d$。Transformer 块的这两个组件包裹在残差连接中,并且每个都接有层归一化,这两者对于现代 LLM 所特有的深层架构的稳定训练和扩展都至关重要。  

### III-B. 神经元与预激活  
神经网络中的一个神经元可以被理解为

相似文章

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。

通过激活聚合的提示压缩

arXiv cs.CL

本文提出通过中间层激活的学习加权和将指令提示压缩为单个激活向量,准确率下降低于2%,并揭示了对LLM激活空间结构的洞察。

Compute Optimal Tokenization (2分钟阅读)

TLDR AI

本文通过训练近1300个模型,系统推导了压缩感知的神经缩放定律,证明了广泛使用的每参数20个词元的启发式方法是由特定分词器造成的。作者提出了基于字节的分词器无关缩放定律,为跨多样语言和模态的计算高效训练提供了新框架。