面向延迟和模型大小优化的LLM多目标结构化剪枝
摘要
提出了一种面向LLM的两阶段结构化剪枝框架,通过多目标深度剪枝和并行贝叶斯优化联合优化延迟与模型大小,在边缘部署中实现有利的权衡。
arXiv:2607.22583v1 公告类型:新
摘要:大型语言模型(LLMs)因其强大的推理和查询响应能力而得到广泛采用。然而,由于严格的延迟、内存和能耗限制,将它们部署在嵌入式及边缘计算环境中仍然具有挑战性。其庞大的参数数量和计算需求阻碍了在资源受限平台上的高效执行。尽管模型剪枝已成为一种在保持性能的同时缩减规模的可行方案,但联合优化层数、注意力头数及多层感知器(MLP)维度仍然非常复杂。穷尽探索这一组合设计空间计算成本高昂,且往往导致局部最优或不稳定配置。为解决这些局限,我们提出了一种硬件感知的多目标结构化剪枝框架。所提出的两阶段方法明确以延迟和模型大小为优化目标,以实现在边缘设备上的高效部署。在粗粒度阶段,多目标深度剪枝移除整个注意力块和MLP块,以减少计算负载和内存占用。在后续细粒度阶段,并行贝叶斯优化(PBO)搜索在延迟约束下的最佳逐层剪枝比例,同时基于重要性的策略对每层分配预算内要剪枝的具体组件进行排序。实验结果表明,我们的方法在最小化对常识推理任务和零样本性能影响的前提下降低了模型复杂度。我们的方法在准确率、延迟和模型大小之间实现了有利的权衡,使其适用于边缘部署。在多个LLM上以37.5%和50%的剪枝比例,所提出的方法在常识推理任务上取得了比现有方法更好的性能,同时显著降低了推理成本。
查看缓存全文
缓存时间: 2026/07/28 06:25
# 面向延迟与模型大小优化的多目标结构化剪枝框架 来源:https://arxiv.org/html/2607.22583 ###### 摘要 大型语言模型由于其强大的推理和查询响应能力而得到广泛采用。然而,由于严格的延迟、内存和能量限制,将它们部署在嵌入式系统和边缘计算环境中仍然具有挑战性。其庞大的参数数量和计算需求阻碍了在资源受限平台上的高效执行。尽管模型剪枝已成为一种在保持性能的同时缩小规模的可行方案,但联合优化层、注意力头和多层感知机(MLP)维度仍然非常复杂。穷举探索这一组合设计空间计算成本高昂,且常常导致局部最优或不稳定配置。为了解决这些局限性,我们提出了一个硬件感知的多目标结构化剪枝框架。所提出的两阶段方法明确针对延迟和模型大小,以实现边缘设备上的高效部署。在粗粒度阶段,多目标深度剪枝移除整个注意力和MLP块,以减少计算负载和内存使用。在随后的细粒度阶段,并行贝叶斯优化搜索在延迟约束下进行剪枝的最佳逐层剪枝比率,而基于重要性的策略则用于在每个层分配预算内排序要剪枝的特定组件。实验结果表明,我们的方法在最小化对常识推理任务和零样本性能影响的前提下降低了模型复杂度。我们的方法在准确性、延迟和模型大小之间取得了有利的平衡,使其适合边缘部署。在多个LLM上,以37.5%和50%的剪枝比率,所提出的方法在常识推理任务上取得了比现有方法更好的性能,同时将100个token推理的A100延迟降低到73.8512秒,Jetson Nano延迟降低到843秒。这些结果凸显了结构化多目标优化技术在弥合大规模LLM与资源受限嵌入式平台之间差距的潜力。 ## I. 引言 语言模型并非新鲜事物,但Transformer架构的引入加速了大量大型语言模型的发展。LLM是旨在理解、生成和预测人类语言的AI系统。它们被广泛用于语音识别、机器翻译、自然语言生成和光学字符识别等任务。一个著名的LLM家族——生成式预训练Transformer(GPT),为许多流行的聊天机器人提供动力,如ChatGPT、Claude和Gemini。然而,这些模型的一个主要挑战是其庞大的规模,使得它们难以部署在小型边缘设备上,或在内存和延迟限制下本地运行。 获得小型语言模型主要有两种策略。第一种是从头开始训练紧凑的架构。然而,这种方法需要大量的数据集和大量的计算资源。这些需求消耗大量能量,在移动和边缘系统中通常不切实际[2](https://arxiv.org/html/2607.22583#bib.bib2)。或者,研究人员可以压缩现有的大型模型,以在较小规模下保持性能。 现有研究表明,LLM在不同结构层面存在大量冗余。在基于Transformer的LLM中,每个块主要由多头注意力模块和前馈多层感知机模块组成。MHA通过多个注意力头捕获token间的交互,而MLP则应用位置独立的非线性变换,扩展和投影隐藏表示。由于这些模块对准确性、参数数量和延迟的贡献不同,可以在多种粒度上进行剪枝,范围从整个Transformer块到单个注意力头或MLP神经元。 剪枝方法通常分为结构化、半结构化和非结构化三类。非结构化剪枝移除单个权重,可以实现高稀疏度,但由此产生的不规则稀疏矩阵通常需要专门的硬件或稀疏核心才能实现实际的速度提升。相比之下,结构化剪枝移除完整的架构单元,如层、注意力头、通道或MLP神经元,产生易于在标准边缘设备上加速的密集子网络。 结构化剪枝方法可进一步分为深度方向和方法和宽度方向方法。深度方法移除完整的Transformer块或子块,减少模型深度和内存占用。诸如[14](https://arxiv.org/html/2607.22583#bib.bib14)和[9](https://arxiv.org/html/2607.22583#bib.bib9)的方法通过在粗粒度级别剪枝Transformer块来遵循这一方向。然而,仅靠粗粒度剪枝可能忽略保留层内MHA和MLP组件的异质性贡献。宽度方法则剪枝块内结构,如注意力头、神经元或通道。诸如[5](https://arxiv.org/html/2607.22583#bib.bib5)、[1](https://arxiv.org/html/2607.22583#bib.bib1)、[18](https://arxiv.org/html/2607.22583#bib.bib18)的方法使用基于梯度、基于激活或基于敏感度的分数来识别不重要的组件。这些方法提供了更精细的控制,但常常统一考虑候选组件,并不总是考虑部署约束,如延迟和活跃参数数量。 最近的方法联合或顺序地结合了深度和宽度剪枝。诸如[8](https://arxiv.org/html/2607.22583#bib.bib8)和[7](https://arxiv.org/html/2607.22583#bib.bib7)的方法剪枝了块级和组件级结构,但它们通常不显式优化逐层剪枝比率的分配,以识别更低延迟的配置。这一点很重要,因为相同的稀疏预算根据剪枝如何分布在层、MHA头和MLP神经元之间,可能导致非常不同的推理行为。 在计算资源有限的边缘设备(如NVIDIA Jetson Nano或树莓派)上部署LLM,需要剪枝策略保持与密集线性代数单元的兼容性。结构化剪枝移除整个结构组件,产生架构上连贯的模型,可以在此类硬件上实现延迟降低。相比之下,非结构化剪枝产生不规则稀疏性,需要专门支持(例如稀疏张量核心)才能带来性能提升,这限制了其在主流边缘加速器上的实用性。 尽管现有结构化剪枝方法有效,但仍存在两个挑战。首先,深度剪枝必须在保持准确性与面向部署的目标(如延迟和模型大小)之间取得平衡。其次,在选择粗粒度架构后,剩余的剪枝预算必须在层和组件之间分配,以确定能降低延迟的配置。在这项工作中,我们通过一个两阶段框架来解决这些问题: 1. 一个多目标深度剪枝阶段,通过联合评估输出分布损失和效率目标,搜索帕累托最优的层剪枝架构。 2. 一个并行贝叶斯优化阶段,用于确定产生更低硬件延迟的逐层剪枝比率。 本文的贡献如下: - •我们将LLM结构化剪枝表述为一个多目标的两阶段问题,该问题联合考虑性能和硬件指标(延迟和吞吐量),同时在受限边缘设备上对模型进行基准测试。 - •我们引入了一种并行贝叶斯优化方法,用于分配逐层剪枝比率,以找到延迟更低的配置,从而在多目标阶段之后实现稀疏分布的高效探索。 - •我们在相同的分配框架下,对多种第二阶段子组件剪枝的重要性策略进行了基准测试,并对其准确性、困惑度和延迟的权衡进行了实证分析。 ## II. 相关工作 深度学习的最新进展导致LLM(如GPT、LLaMA[19](https://arxiv.org/html/2607.22583#bib.bib19)、Qwen[24](https://arxiv.org/html/2607.22583#bib.bib24)、Phi[25](https://arxiv.org/html/2607.22583#bib.bib25)和Mistral[20](https://arxiv.org/html/2607.22583#bib.bib20))在各种应用中被广泛采用。然而,这些模型庞大的规模和计算需求引发了关于内存和延迟的重大担忧。为了在资源受限的边缘设备上实现实时性能,研究人员探索了量化、知识蒸馏和剪枝等模型压缩技术[3](https://arxiv.org/html/2607.22583#bib.bib3)。其中,剪枝是在保持预测性能的同时减小模型大小和提高能效的关键方法。 剪枝的概念早已确立,LeCun等人[4](https://arxiv.org/html/2607.22583#bib.bib4)的开创性工作“最优脑损伤”便是一个例子,它使用二阶导数来识别和移除对目标函数影响最小的权重。我们将我们的方法与三种主要剪枝类型进行比较:结构化、半结构化和非结构化。 早期的结构化剪枝方法包括LLM Pruner[5](https://arxiv.org/html/2607.22583#bib.bib5),这是一种任务无关的方法,基于梯度信息移除非必需的耦合结构(依赖组),并通过低秩适配微调恢复性能。类似地,Block Pruner在Transformer块内执行细粒度结构化剪枝,基于组件级别重要性剪枝MLP和MHA子组件[9](https://arxiv.org/html/2607.22583#bib.bib9)。其他方法侧重于剪枝模型宽度和单个列[5](https://arxiv.org/html/2607.22583#bib.bib5),[7](https://arxiv.org/html/2607.22583#bib.bib7)。 SliceGPT利用主成分分析移除矩阵中的行和列[8](https://arxiv.org/html/2607.22583#bib.bib8)。然而,此类方法通常需要额外的参数或僵化的结构调整来维持兼容性。2SSP框架[7](https://arxiv.org/html/2607.22583#bib.bib7)提出了一种两阶段方法:首先,基于输出幅度从前馈网络中移除神经元;其次,迭代地移除注意力子模块。然而,这种顺序过程可能错过两个阶段之间的全局最优解。在一个类似的方法中,Blockpruner[9](https://arxiv.org/html/2607.22583#bib.bib9)使用组件级重要性评分来定位注意力头和MLP。与2SSP不同,Blockpruner应用块级重要性来剪枝MLP和MHA组件,但未能考虑子组件级剪枝的重要性[9](https://arxiv.org/html/2607.22583#bib.bib9)。最近,粗到细结构化剪枝(CFSP)[23](https://arxiv.org/html/2607.22583#bib.bib23)引入了一个粗到细的结构化剪枝框架,该框架利用块间和块内的激活信息来指导剪枝过程。相比之下,我们的方法明确将剪枝表述为一个以部署导向标准(如延迟和模型大小)为中心的多目标优化问题。我们的方法不仅仅是依赖基于激活的重要性,而是识别并优化多个帕累托最优的粗粒度配置。这允许沿着帕累托前沿探索更多样化的解空间。然后,这些候选解通过第二阶段的重要性计算进一步优化,确保为边缘部署量身定制更优的准确性与效率权衡。 非结构化剪枝方法使用激活感知标准剪枝单个权重,在高稀疏度下保持准确性。然而,在实践中,它们引发的不规则稀疏性并未被标准GPU核心高效支持,因此在通用硬件上的推理加速通常有限[6](https://arxiv.org/html/2607.22583#bib.bib6),[16](https://arxiv.org/html/2607.22583#bib.bib16)。  图1: 提出的多目标结构化剪枝框架概览,结合了LLM压缩的完整工作流程以及用于延迟和模型大小感知优化的两阶段粗到细剪枝过程。 尽管上述方法有效,但它们没有明确考虑性能-效率的权衡,并且通常以单阶段而非分层方式处理剪枝问题。因此,当联合优化模型大小、延迟和准确性时,这些方法可能会忽略全局最优配置。为了克服这些限制,我们提出了一种多目标优化策略,该策略识别帕累托最优解,并随后应用基于重要性的剪枝来优化子组件。这种对性能-效率权衡的显式处理,引导第二阶段选择更具部署导向性的模型,这些模型具有有利的参数数量和更低的延迟。通过将全局架构搜索与局部组件优化分离,两阶段设计实现了比单阶段剪枝更平衡的优化过程和更硬件高效的压缩流程。 ## III. 提出的方法论 我们提出的方法论采用了一个从全局到局部的剪枝框架,该框架将宏观的架构搜索与更细粒度的结构优化分开,从而简化了优化过程。图1(https://arxiv.org/html/2607.22583#S2.F1)提供了方法论概览,并给出了一个4块LLM在50%剪枝率下的数值示例。在此示例中,第一阶段剪枝模型参数的50%,并生成多个具有不同参数数量的帕累托最优解。第二阶段通过利用并行贝叶斯优化分配剩余逐层剪枝比率并找到延迟更低的配置来优化这些解。接下来,它执行对子组件的针对性剪枝。为便于解释,我们考虑这些层内MHA头和MLP神经元的示例,两者都使用定义的重要性度量(即50%减去第一阶段已执行的剪枝)进行评估,以通过延迟感知配置选择进一步降低模型复杂度,同时保持性能。算法1(https://arxiv.org/html/2607.22583#alg1)总结了整体流程。两个阶段的细节如下: 在第一阶段,通过在层级别剪枝完整的MHA和MLP子块来生成候选架构。此阶段捕获全局架构级别的权衡,并返回一组帕累托最优候选解,而非单一解。在第二阶段,使用贝叶斯优化将剩余的稀疏预算分配到各个层。每个贝叶斯优化候选解指定特定层的逐层剪枝比率,候选解被并行评估以减少搜索时间。然后,将选定的分配方案与重要性评分度量一起应用,以移除排名最低的子组件。 由于MHA和MLP是LLM中两个主要且重要的组件,我们为这些模块形式化了符号。这些符号为后续内容提供了数学基础。
相似文章
用于大语言模型压缩的联合结构化剪枝与混合精度量化
一种新颖的端到端大语言模型压缩框架,联合优化结构化剪枝与混合精度量化,在超低位宽精度下,相比于现有最先进方法实现了显著的困惑度降低和加速效果。
通过幂变换和保号分数聚合实现自适应特征保留的大语言模型结构化剪枝
本文提出了一种针对大语言模型的结构化剪枝方法,解决了在将非结构化剪枝技术适配到结构化剪枝时出现的分布不匹配、符号信息丢失和异常值影响等问题,在Llama-3-8B和Vicuna-v1.5-13B等模型上实现了相当精度,并获得了1.56-1.57倍的加速。
小型LLM:剪枝与从头训练
本文实证比较了剪枝与从头训练小型语言模型的差异,发现在有限token预算下剪枝具有明显优势,但随着训练规模扩大,优势逐渐减小,尤其是在粗粒度剪枝情况下。
修剪不安全票:一种资源高效的框架,用于更安全、更鲁棒的大型语言模型
本文介绍了一种资源高效的修剪框架,该框架能够识别并移除大型语言模型中与不安全行为相关的参数,同时保持模型的实用性。该方法利用无梯度归因和彩票假说视角,在最小化性能损失的前提下,显著减少了不安全内容的生成,并增强了对越狱攻击的鲁棒性。
TriSP: 三信号结构化剪枝用于大语言模型
TriSP 提出了一种三信号重要性度量,结合权重幅度、激活范数和梯度敏感性,用于大语言模型的结构化剪枝,在 LLaMA-7B 上实现了最低困惑度和高吞吐量提升。