通过低秩重要性估计实现资源高效的Transformer剪枝

arXiv cs.LG 论文

摘要

本文提出REP-LIE,一种针对Transformer模型的资源高效剪枝方法,利用LoRA梯度的低秩重要性估计实现微调过程中的剪枝,并在LLaMA-7B和Mistral-7B上展现出与现有方法相当的性能。

arXiv:2608.24973v1 公告类型:新 摘要:随着基于Transformer架构的大规模预训练语言模型的快速发展,其高昂的计算和内存成本已成为部署的主要障碍,尤其是在资源受限的环境中。传统的剪枝方法通常依赖于基于全梯度的重要性估计,并且需要先对模型进行微调以达到满意的性能。这个过程往往导致不可承受的资源消耗。本文提出REP-LIE,一种在微调过程中实现资源高效剪枝的新方法。REP-LIE利用LoRA低秩矩阵的梯度来估计权重的重要性,无需进行全梯度计算。为了解决重要性估计中固有的随机性,引入了稳定性分数,作为迭代剪枝不重要模型参数的基础。剪枝后的模型通过轻量级更新进一步微调,消除了微调过程中全参数优化的需求。在中等规模的编码器模型和大规模生成模型(LLaMA-7B和Mistral-7B)上进行的广泛实验表明,REP-LIE仍然与现有方法相比具有竞争力的性能。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:29

# 通过低秩重要性估计实现Transformer的资源高效剪枝
来源:https://arxiv.org/html/2608.24973
作者:Huibing Zeng, Yiqun Zhang, Yang Yi, Jigang Wu††thanks:Peng Liu, Huibing Zeng, Yiqun Zhang和Jigang Wu隶属于中国广州510006广东工业大学计算机科学与技术学院(电子邮箱:[email protected], [email protected], [email protected], [email protected])。††thanks:Yang Yi隶属于中国扬州225000扬州大学信息与人工智能学院(电子邮箱:[email protected])。††thanks:Yiqun Zhang是通讯作者。

###### 摘要
随着基于Transformer架构的大规模预训练语言模型快速发展,其高昂的计算和内存成本已成为部署的主要障碍,尤其是在资源受限的环境中。传统的剪枝方法通常依赖于基于全梯度的重要性估计,并且需要先对模型进行微调才能达到令人满意的性能。这一过程往往导致难以承受的资源消耗。本文提出了REP-LIE,一种能够在微调过程中实现资源高效剪枝的新方法。REP-LIE利用LoRA低秩矩阵的梯度来估计权重的重要性,而无需进行全梯度计算。为了解决重要性估计中固有的随机性问题,我们引入了稳定性分数,作为迭代剪枝不重要模型参数的基础。剪枝后的模型通过轻量级更新进一步微调,消除了在微调过程中进行全参数优化的需求。在中等规模的编码器模型和大规模生成模型(LLaMA-7B和Mistral-7B)上的广泛实验表明,与现有方法相比,REP-LIE仍然具有竞争力的性能。

###### 索引术语:结构化剪枝,模型压缩,Transformer,LoRA,大语言模型,LLMs

## I 引言
基于Transformer的神经网络架构在计算机视觉、自然语言理解和多模态任务等广泛领域取得了卓越性能[1 (https://arxiv.org/html/2608.24973#bib.bib1)]。值得注意的是,像BERT [3 (https://arxiv.org/html/2608.24973#bib.bib6)]、RoBERTa [4 (https://arxiv.org/html/2608.24973#bib.bib9)]和GPT-3 [5 (https://arxiv.org/html/2608.24973#bib.bib10)]这样的大规模语言模型(LLMs) [2 (https://arxiv.org/html/2608.24973#bib.bib7)]在许多下游任务[6 (https://arxiv.org/html/2608.24973#bib.bib8)]中(包括文本分类[7 (https://arxiv.org/html/2608.24973#bib.bib4)]、阅读理解和摘要[8 (https://arxiv.org/html/2608.24973#bib.bib11)])中展现了显著的成功。然而,大型模型极其庞大的规模给实际开发带来了挑战。例如,GPT-3模型拥有1750亿个参数,需要约350GB的存储空间。海量的参数和相关的计算开销要求设备具有极高的内存和计算能力。然而,对此类先进设备的严苛要求为这些模型的广泛实际应用构成了巨大障碍。通过减少深度神经网络的参数数量,从而降低训练和推理的内存与计算成本,可以有效解决这一挑战。近期研究表明,Transformer模型内部存在一定水平的参数冗余,可以在性能损失可忽略不计的情况下被消除[9 (https://arxiv.org/html/2608.24973#bib.bib16), 10 (https://arxiv.org/html/2608.24973#bib.bib49)]。受这些发现的启发,许多工作致力于减少Transformer模型中的参数冗余和结构冗余[11 (https://arxiv.org/html/2608.24973#bib.bib37), 12 (https://arxiv.org/html/2608.24973#bib.bib38), 13 (https://arxiv.org/html/2608.24973#bib.bib46)]。作为一种高效的模型压缩技术,网络剪枝已证明其有效性。它通过移除冗余组件显著降低了模型的存储需求和计算复杂度[14 (https://arxiv.org/html/2608.24973#bib.bib15)]。根据移除组件的粒度,网络剪枝方法通常分为非结构化剪枝和结构化剪枝。在这些方法中,非结构化和结构化剪枝都旨在为微调任务估计权重的重要性,并按照系统设定的稀疏比剪枝最不重要的权重。非结构化剪枝可以产生有竞争力的结果。然而,不规则稀疏性和硬件限制限制了其加速部署[15 (https://arxiv.org/html/2608.24973#bib.bib18), 16 (https://arxiv.org/html/2608.24973#bib.bib36), 17 (https://arxiv.org/html/2608.24973#bib.bib30)]。因此,大多数现有工作专注于结构化剪枝方法,通过移除结构单元(如自注意力头、前馈网络层通道和层)来减小模型大小[18 (https://arxiv.org/html/2608.24973#bib.bib26), 19 (https://arxiv.org/html/2608.24973#bib.bib27), 20 (https://arxiv.org/html/2608.24973#bib.bib28)]。当前主流的结构化剪枝策略主要分为两类:微调前剪枝和微调后剪枝。微调前剪枝策略首先对完整模型进行剪枝,然后对剪枝后的模型进行微调。相比之下,微调后剪枝策略涉及两个阶段的微调过程:首先微调完整模型,然后微调剪枝后的模型。图1 (https://arxiv.org/html/2608.24973#S1.F1)展示了微调前剪枝和微调后剪枝策略的工作流程。两者都依赖于基于梯度的重要性估计和全模型微调。考虑到大语言模型中庞大的参数数量,参数重要性估计和全模型微调都会带来巨大的内存和计算开销。此外,结构化剪枝策略需要长时间的微调来恢复性能[21 (https://arxiv.org/html/2608.24973#bib.bib29)]。这些局限性凸显了对更有效剪枝策略的迫切需求。参数高效的微调方法,如LoRA(低秩适应)[22 (https://arxiv.org/html/2608.24973#bib.bib32)],提供了一种解决上述挑战的新途径。LoRA通过冻结原始模型权重并在模型架构的每一层注入一对可训练的低秩矩阵,可以显著降低微调成本。例如,LLM-Pruner [23 (https://arxiv.org/html/2608.24973#bib.bib34)]通过使用LoRA模块在剪枝后恢复模型性能,显著降低了微调成本。然而,这类方法仍然依赖梯度来计算权重的重要性,这会导致不可忽视的剪枝开销[24 (https://arxiv.org/html/2608.24973#bib.bib20), 25 (https://arxiv.org/html/2608.24973#bib.bib21)]。为了平衡模型性能和剪枝开销,我们提出了REP-LIE,一个针对Transformer的资源高效剪枝框架,具有低秩重要性估计和轻量级微调能力,如图1 (https://arxiv.org/html/2608.24973#S1.F1)(c)所示。REP-LIE旨在降低计算成本和模型参数量,同时最小化性能损失。与依赖基于梯度的重要性估计的传统方法不同,REP-LIE仅使用LoRA中低秩矩阵的梯度来估计重要性。这有效降低了剪枝过程中的开销。此外,与传统的微调前或微调后剪枝策略不同,REP-LIE利用了LoRA模块独特的参数高效适应机制。通过更新低秩矩阵,REP-LIE建立了一条恢复剪枝模型性能的有效途径。这种创新策略避免了更新整个模型参数集的必要性。
![图注](https://arxiv.org/html/2608.24973#S1.F1)图1:剪枝架构比较。(a) 微调前剪枝;(b) 微调后剪枝;(c) REP-LIE。

主要贡献总结如下:
1. 1.提出了一种名为REP-LIE的新模型压缩方法。REP-LIE引入了一种新颖的剪枝准则,仅使用LoRA中低秩矩阵的梯度来评估权重的重要性。这填补了现有方法依赖全模型梯度计算来评估权重重要性的空白。此外,引入了稳定性分数的概念,用于有效估计权重重要性。
2. 2.设计了一种轻量级微调策略,以减少剪枝后模型性能恢复过程中的资源消耗。与大多数现有工作采用的全模型微调不同,REP-LIE中的此策略仅更新低秩矩阵来恢复模型性能,在恢复阶段显著减少了GPU内存使用和训练时间。
3. 3.实验结果表明,REP-LIE在中等规模的编码器模型和大规模生成模型上仍能实现具有竞争力的性能。这一全面评估表明,REP-LIE在所有规模上都实现了持续的性能优势,证实了其可扩展性和鲁棒性。这种跨尺度的兼容性确立了REP-LIE作为一种可持续压缩范式的地位。它提供的资源效率增益无论未来模型规模如何演进都适用且有效。

本文其余部分组织如下。第II节[https://arxiv.org/html/2608.24973#S2]介绍了模型剪枝的背景和本工作的动机。第III节[https://arxiv.org/html/2608.24973#S3]详细描述了所提出的结构化剪枝框架,包括剪枝准则和算法。第IV节[https://arxiv.org/html/2608.24973#S4]报告了实验评估,第V节[https://arxiv.org/html/2608.24973#S5]对论文进行总结。

## II 相关工作
### II-A Transformer架构
本工作专注于BERT模型的剪枝,BERT是基于编码器的Transformer模型之一[3 (https://arxiv.org/html/2608.24973#bib.bib6)]。BERT中的每个编码器层由一个多头注意力(MHA)层和一个前馈网络(FFN)层组成。每一层的输出可以形式化表示如下:
MHA(x) = Σ_{h=1}^{H} Attn(W_q^{(l,h)}, W_k^{(l,h)}, W_v^{(l,h)}, W_o^{(l,h)}, x), (1)
X_{MHA} = LayerNorm(x + MHA(x)), (2)
FFN(x) = σ(xW^{(1)} + b^{(1)})W^{(2)} + b^{(2)}. (3)
具体而言,MHA层由H个独立参数化的注意力头组成。每个头与四个投影矩阵相关联:查询矩阵W_Q ∈ ℝ^{d×k},键矩阵W_K ∈ ℝ^{d×k},值矩阵W_V ∈ ℝ^{d×k},以及输出投影矩阵W_O ∈ ℝ^{d×k}。这里,d表示隐藏维度,k是每个自注意力头的输出维度,计算为k = d/H。FFN层通常由两个投影矩阵组成,其中σ表示激活函数。

### II-B 剪枝准则
参数重要性估计被广泛用于指导剪枝过程,通过评估单个参数对神经网络性能的影响。早期的工作利用二阶泰勒展开来估计参数对损失函数的影响[26 (https://arxiv.org/html/2608.24973#bib.bib17)]。然而,在大规模网络中计算二阶泰勒展开的开销很大。为了解决这个问题,一些研究使用权重幅度作为重要性度量,来剪枝绝对值较小的权重[27 (https://arxiv.org/html/2608.24973#bib.bib12), 28 (https://arxiv.org/html/2608.24973#bib.bib13), 29 (https://arxiv.org/html/2608.24973#bib.bib14), 30 (https://arxiv.org/html/2608.24973#bib.bib53)]。然而,由于深度神经网络固有的交互作用,小幅度权重可能对模型性能产生显著影响[21 (https://arxiv.org/html/2608.24973#bib.bib29)]。为了准确捕捉剪枝对模型性能的影响,Molchanov等人提出了一种基于一阶泰勒展开的估计方法。他们引入了梯度来评估权重的重要性,并在卷积神经网络中验证了其有效性[31 (https://arxiv.org/html/2608.24973#bib.bib19)]。受此启发,许多工作采用一阶梯度进行重要性估计[24 (https://arxiv.org/html/2608.24973#bib.bib20), 32 (https://arxiv.org/html/2608.24973#bib.bib50), 25 (https://arxiv.org/html/2608.24973#bib.bib21), 33 (https://arxiv.org/html/2608.24973#bib.bib22)]。此外,为了更有效地近似二阶信息,一些研究利用Fisher信息矩阵作为Hessian矩阵的代理[34 (https://arxiv.org/html/2608.24973#bib.bib23), 35 (https://arxiv.org/html/2608.24973#bib.bib24), 36 (https://arxiv.org/html/2608.24973#bib.bib52)],而其他研究则通过聚类分析简化梯度计算[37 (https://arxiv.org/html/2608.24973#bib.bib25)]。尽管这些改进降低了权重重要性估计的开销,但它们仍然无法克服由梯度计算和内存存储引起的高开销。

### II-C 结构化剪枝
作为一种高效的模型压缩方法,结构化剪枝近年来在Transformer模型中得到了广泛应用。为了增强结构化缩减的灵活性和任务适应性,EBERT使用输入感知机制对注意力头和前馈网络通道进行样本级动态剪枝[38 (https://arxiv.org/html/2608.24973#bib.bib41)]。CoFi通过将粗粒度和细粒度剪枝与逐层蒸馏相结合来加速推理[39 (https://arxiv.org/html/2608.24973#bib.bib40)]。ARC通过结合细粒度自注意力蒸馏和逐层随机替换训练来增强模型压缩[40 (https://arxiv.org/html/2608.24973#bib.bib51)]。FLOP利用低秩分解结合L₀正则化和增强拉格朗日优化,自适应地移除权重矩阵中的冗余元素[41 (https://arxiv.org/html/2608.24973#bib.bib48)]。BMP创新性地采用半结构化块级剪枝,压缩注意力模块和前馈网络模块内的子矩阵[42 (https://arxiv.org/html/2608.24973#bib.bib47)]。
![图注](https://arxiv.org/html/2608.24973#S1.F1)图2:LoRA在单层上的示意图。
然而,这些方法仍然需要全模型微调,并依赖蒸馏等额外技术来恢复模型性能。为了进一步降低剪枝成本,RECAP使用基于二阶泰勒展开的权重重要性估计,然后根据Fisher信息准则更新完整模型的较小子网络[43 (https://arxiv.org/html/2608.24973#bib.bib44)]。这种方法节省了内存开销。

相似文章

基于可学习秩的参数高效微调

arXiv cs.CL

来自阿德莱德大学的研究人员提出了 LR-LoRA(可学习秩 LoRA),这是一种参数高效微调方法,在训练过程中动态学习每个 Transformer 层的适配器秩,而非使用固定的全局秩。LR-LoRA 在语言理解和常识推理基准测试上达到了最先进的性能,超越了固定秩 LoRA 基线。

DLR: 零推理成本的隐式残差用于低秩预训练

arXiv cs.LG

引入重复隐式残差(DLR),这是一种仅训练、无参数的插件,用于低秩预训练,可提升从60M到7B参数的LLaMA模型的困惑度,并且训练后可折叠到模型中,推理成本为零。

Super-Tuning: 从激活感知剪枝到稀疏微调

arXiv cs.CL

本文介绍了 Super 和 Supra 两种稀疏参数高效微调方法,它们重用来自剪枝的显著性信号(如 Wanda 分数)来选择可训练的支持集,并与 LoRA 结合,以更少的内存和计算在算术任务上取得了高准确率。

Aletheia:基于梯度引导的层选择方法,实现跨架构的高效LoRA微调

arXiv cs.CL

Aletheia 提出了一种基于梯度引导的层选择方法,用于高效的 LoRA 微调。该方法通过轻量级梯度探针识别与任务相关的 Transformer 层,并选择性地应用适配器,在 14 个模型上实现了 15%-28% 的训练加速,同时保持了在 MMLU、GSM8K 和 HumanEval 基准测试中的下游性能。