超越逐层稀疏性中的层重要性:一种层间扰动吸收视角
摘要
本文提出了一种用于大语言模型逐层稀疏性的层间扰动吸收视角,表明不同层对剪枝扰动表现出异质性响应,并引入了一种吸收感知校正方法,通过降低困惑度和提升准确率来改进现有剪枝方法。
查看缓存全文
缓存时间: 2026/06/16 11:46
# 超越逐层稀疏性中的层重要性:一种层间扰动吸收视角
来源:https://arxiv.org/html/2606.15161
###### 摘要
大型语言模型(LLMs)中显著的逐层冗余性,使得跨层的非均匀稀疏分配已成为高效压缩的标准剪枝方法。现有的逐层分配方法通常基于诸如激活异常值或权重谱等局部信号来估计分配策略,这些方法主要源于局部层重要性,而剪枝后的最终性能还受网络后续补偿能力的制约。在本文中,我们通过受控扰动实验直接刻画了这一特性。我们得到以下实证发现。首先,各层对剪枝尺度扰动的响应表现出高度异质性。在大多数情况下,早期层会放大扰动,而中间层和后期层则主动吸收扰动,相对 L2 漂移随深度单调递减,并且方向会重新调整为未受扰动的隐藏状态轨迹。其次,吸收是一种大扰动现象。在小扰动下,网络在所有层上都表现出放大效应,而当扰动幅度增大到剪枝尺度时,网络平滑地过渡到吸收状态。这一转变是连续的,排除了数值伪影的可能性。这些发现丰富了相关工作中线性化累积理论的内涵。基于这些发现,我们为每一层定义了一个吸收系数,并提出了吸收感知校正方法——一种正交增强手段,通过降低困惑度 7.13% 并将零样本准确率提升 1.02%(在 70% 稀疏度下,涵盖多个模型族),改进了 OWL 和 AlphaPruning。
## 1 引言
大型语言模型(LLMs)在各种自然语言处理任务中展现出卓越的能力 (Liu et al., 2024 (https://arxiv.org/html/2606.15161#bib.bib10); Touvron et al., 2023a (https://arxiv.org/html/2606.15161#bib.bib11); Achiam et al., 2023 (https://arxiv.org/html/2606.15161#bib.bib12))。扩大模型参数规模持续带来性能提升 (Wei et al., 2022 (https://arxiv.org/html/2606.15161#bib.bib13)),然而其巨大的计算和内存开销给模型部署带来了重大障碍,抑制了更广泛的应用 (Wang et al., 2024 (https://arxiv.org/html/2606.15161#bib.bib14))。
剪枝已成为无需重新训练即可压缩大型语言模型的关键方法,典型方法包括 SparseGPT (Frantar and Alistarh, 2023 (https://arxiv.org/html/2606.15161#bib.bib1)) 和 Wanda (Sun et al., 2024 (https://arxiv.org/html/2606.15161#bib.bib2))。训练后剪枝的一个核心设计选择是逐层稀疏性分配:如何将全局稀疏预算分配到网络的各层。均匀分配忽略了各层对剪枝敏感度不同的事实,因此越来越多的工作提出了非均匀分配策略。
现有方法可分为三个类别。基于度量的方法根据手工设计的信号估计每层的重要性得分,并按照与重要性成反比的方式分配稀疏度。OWL (Yin et al., 2024 (https://arxiv.org/html/2606.15161#bib.bib4)) 使用激活异常值比率,AlphaPruning (Lu et al., 2024 (https://arxiv.org/html/2606.15161#bib.bib5)) 使用基于权重谱的重尾自正则化理论,而 ALS (Li et al., 2024b (https://arxiv.org/html/2606.15161#bib.bib15)) 使用层间激活的互信息。基于搜索的方法则将分配视为优化问题,其中 DSA (Li et al., 2024a (https://arxiv.org/html/2606.15161#bib.bib6)) 和 EvoPress (Sieberling et al., (https://arxiv.org/html/2606.15161#bib.bib16)) 都使用进化搜索来搜索分配表达式。第三类方法则显式考虑层间耦合。ATP (Huang et al., 2025 (https://arxiv.org/html/2606.15161#bib.bib3)) 基于重建误差如何通过网络向前传播的理论分析推导出逐层分配,证明增加早期层的稀疏度会提高所有后续层重建误差的下界,并提出一个单调递增的等差数列作为解决方案。
基于度量的方法主要依赖层内信号,因此忽略了层间耦合。ATP 通过建模剪枝某一层如何通过重建误差的线性传播影响下游行为来纳入这种耦合。然而,这种表述忽略了网络对剪枝诱导扰动的实际响应。由于剪枝一层会引入扰动,这些扰动通过下游层传播并可能被放大或吸收,因此逐层剪枝应考虑下游网络如何处理每个被剪枝层引起的扰动。
在本文中,我们通过使用受控的逐层扰动注入直接研究这种下游响应,追踪扰动在 Transformer 中随深度演化的方式,从而得到启发,引发对逐层分配的新看法。
**与层相关的响应。** 在剪枝尺度的扰动下,各层表现出高度异质的响应。通常,注入到早期层的扰动会被后续层放大;注入到中间层和后期层的扰动则会被主动吸收,其方向重新调整为未受扰动的隐藏状态轨迹。吸收强度在各层之间差异很大,且无法仅通过深度很好地预测。
**与尺度相关的响应。** 吸收是一种大扰动现象。在小扰动下,所有层都表现出累积效应:无论注入点在哪,相对漂移均随深度单调递增。当扰动幅度增大到实际剪枝产生的尺度时,中间层和后期层平滑过渡到吸收状态。这一转变是连续的,排除了数值伪影的可能性。
综合来看,这些发现并不与先前工作中关于重建误差累积的观察相矛盾。总误差沿深度的增长是许多局部扰动的累积叠加,而每个局部扰动所引起的误差在通过网络其余部分传播时可能被吸收或放大。我们的结果将此下游响应识别为层重要性的一个缺失维度。
为了验证这一维度是否具有实际用途,我们提出了一个简单的操作性方案。我们定义了一个逐层漂移比率,并将其用作基于度量分配方法之上的加性校正,在保持全局预算固定的同时重新分配少量稀疏预算。我们的目的并非声称一种新的最先进方法,而是证明吸收维度能够带来可衡量的收益。实验结果表明,该校正方法在大多数设置下改进了 OWL 和 AlphaPruning。
本文的核心贡献可总结如下:
- • 我们证实剪枝诱导的扰动会被网络的其余部分部分吸收。我们进一步表明吸收是层依赖和尺度依赖的。
- • 我们为我们的发现与线性累积理论提供了精确的关系。全模型剪枝下总误差沿深度的增长是许多部分吸收局部扰动的累积效应,而非每个单次扰动的放大。
- • 我们定义了一个逐层漂移比率,并将其用作基于度量分配方法之上的校正,在多个模型上展示了改进效果,正如我们的分析所预测。
## 2 相关工作
**LLM 剪枝。** 剪枝长期以来被用于压缩神经网络,可追溯到基于幅度和二阶准则的方法,如 OBD (LeCun et al., 1989 (https://arxiv.org/html/2606.15161#bib.bib17)) 和 OBS (Hassibi and Stork, 1992 (https://arxiv.org/html/2606.15161#bib.bib18))。对于 LLMs,重新训练的高昂成本推动了训练后非结构化剪枝的发展,即仅使用少量校准集单次移除权重。SparseGPT (Frantar and Alistarh, 2023 (https://arxiv.org/html/2606.15161#bib.bib1)) 利用逆 Hessian 信息选择掩码并更新权重;Wanda (Sun et al., 2024 (https://arxiv.org/html/2606.15161#bib.bib2)) 剪除权重幅度与输入激活范数乘积最小的权重;进一步的改进包括 ALPS (Meng et al., 2024a (https://arxiv.org/html/2606.15161#bib.bib7))。这些方法决定每一层内移除哪些权重,但通常对各层应用统一的稀疏率,未触及跨层稀疏分配问题。我们的工作聚焦于这一逐层分配问题,并且与上述任何基础剪枝方法兼容。
**非均匀稀疏性。** 最近的工作非均匀地跨层分配稀疏度,其动机是观察到不同层对模型性能的贡献不均等 (Frankle and Carbin, 2018 (https://arxiv.org/html/2606.15161#bib.bib8))。这些方法分为三个类别。基于度量的方法根据手工设计的信号为每层分配重要性分数。OWL (Yin et al., 2024 (https://arxiv.org/html/2606.15161#bib.bib4)) 和 MRP (Gao et al., 2025 (https://arxiv.org/html/2606.15161#bib.bib37)) 使用激活异常值,AlphaPruning (Lu et al., 2024 (https://arxiv.org/html/2606.15161#bib.bib5)) 使用重尾权重谱,LSA (Yang et al., 2026 (https://arxiv.org/html/2606.15161#bib.bib9)) 使用每层的最小线性重建误差。基于搜索的方法如 DSA (Li et al., 2024a (https://arxiv.org/html/2606.15161#bib.bib6)) 直接优化分配,但代价是重复尝试剪枝。考虑层间耦合的方法:ATP (Huang et al., 2025 (https://arxiv.org/html/2606.15161#bib.bib3)) 是一种先验方法,它显式建模了在一层剪枝如何影响其他层,并从重建误差传播的线性化分析中推导出单调递增的等差数列。上述方法均未直接刻画剪枝诱导的扰动在剪枝实际发生的条件下如何通过下游层传播,而我们在第 3 节中识别出这一维度是关键缺失因素。
**剪枝中的重建误差。** 重建误差长期以来既是 LLMs 压缩的目标也是信号,较低的重建误差通常表明压缩网络更忠实地保留了原网络的性能 (Yun and Wong, 2021 (https://arxiv.org/html/2606.15161#bib.bib19); Luo et al., 2017 (https://arxiv.org/html/2606.15161#bib.bib20); He et al., 2017 (https://arxiv.org/html/2606.15161#bib.bib21); Zhuang et al., 2018 (https://arxiv.org/html/2606.15161#bib.bib22); Meng et al., 2024b (https://arxiv.org/html/2606.15161#bib.bib23))。SparseGPT (Frantar and Alistarh, 2023 (https://arxiv.org/html/2606.15161#bib.bib1)) 选择掩码并更新权重以最小化逐层重建误差;LSA (Yang et al., 2026 (https://arxiv.org/html/2606.15161#bib.bib9)) 将每层的最小线性重建误差用作重要性信号;ATP (Huang et al., 2025 (https://arxiv.org/html/2606.15161#bib.bib3)) 基于重建误差随深度传播构建其分配理论。在本文中,我们探索了 LLMs 中的重建误差补偿现象。具体而言,重建误差在通过后续层传播过程中不断被修复,且不同层表现出不同的扰动恢复能力。模型非均匀剪枝应考虑这种差异并相应调整各层的稀疏率分配。因此,我们提出了一个重建误差补偿因子来量化不同层的扰动恢复能力。
参见图注图 1:层间扰动吸收及其所启用的吸收感知校正。(a) 注入到层 ℓ 的扰动 δ_ℓ 通过下游层传播,在剪枝尺度下其大小 ‖Δh_k‖ 沿深度衰减。这是我们在第 3.3 节中识别的层间吸收现象。端到端漂移比率 r_ℓ = E_x [R_L / R_ℓ] 总结了这种逐层行为。(b) 在 LLaMA-2-7B 上,经过 AlphaPruning 在 70% 稀疏度下(高斯探针 η=10^{-2},5 个种子)测量得到逐层漂移比率。(c) 算法 1 将 r_ℓ 转换为 AlphaPruning 基础分配之上的加性校正,严格保持全局稀疏预算。稀疏度从 r_ℓ > 1(放大,剪枝危险)的层转移到 r_ℓ < 1(吸收,剪枝更安全)的层。
## 3 与层相关的重建误差补偿
在本节中,我们设计了一个受控的扰动注入方案,该方案隔离了单层扰动如何通过网络的其余部分传播,然后利用它得出关于下游 Transformer 层如何响应扰动的发现。
### 3.1 预备知识
我们将大型语言模型(LLM)的每一层视为研究的基元单元。给定一个具有 L 层的 LLM,第 ℓ 层(ℓ=1,2,…,L)的重建误差定义为
R_ℓ^abs = ‖W_ℓ X_ℓ^T - (M ⊙ W_ℓ) X_ℓ^T‖_F^2 (1)
其中 W_ℓ ∈ R^{c_out × c_in} 和 X_ℓ ∈ R^{N × c_in} 分别表示第 ℓ 层的权重矩阵和校准输入。这里 N 是校准 token 的数量,M ∈ {0,1}^{c_out × c_in} 是剪枝掩码,M ⊙ W_ℓ 表示剪枝后的权重矩阵,而 ‖·‖_F 表示 Frobenius 范数。
现有的训练后稀疏方法(例如 SparseGPT)和非均匀剪枝策略(例如 LSA)通常旨在最小化剪枝后 LLM 的重建误差。尽管该度量被广泛使用,但它存在一个固有的局限性:它对尺度敏感。R_ℓ^abs 的大小直接受隐藏状态范数的影响,而隐藏状态范数在已训练的 Transformer 中随深度显著增长。先前的诊断研究已提供了这一问题的间接证据,观察到深度可分离卷积网络中的层表现出了剧烈波动的动态范围 (Yun and Wong, 2021 (https://arxiv.org/html/2606.15161#bib.bib19))。
为了缓解这个问题,本文采用了一种尺度不变的替代方案。令 h_ℓ ∈ R^{d×n} 表示第 ℓ 层在 n 个 token 批次上的原始输出,而 \tilde{h}_ℓ 为相应干预下的输出。我们将第 ℓ 层的相对重建误差定义为:
R_ℓ = (‖\tilde{h}_ℓ - h_ℓ‖_F) / (‖h_ℓ‖_F) (2)相似文章
PALS:面向大语言模型剪枝的百分位感知层稀疏度方法
PALS根据激活幅度的99百分位数调整大语言模型剪枝中的每层稀疏比,在LLaMA-2-7B上相比均匀稀疏实现了显著困惑度改进,且附加成本可忽略不计。
超越余弦相似度:重新思考大语言模型中的层相关性
本文证明,余弦相似度作为评估大语言模型中层重要性的指标效果不佳,并提出使用层移除后实际准确率下降作为更稳健的度量标准。
别让我的LLM崩溃:注意力层剪枝对解释忠实性与置信度校准的影响
本文研究了在大型语言模型(LLM)中剪枝注意力层对解释忠实性和置信度校准的影响,发现准确率通常保持较高,但可解释性和可靠性下降,凸显了模型置信度、可解释性与准确率之间的失调。
When Compression Scores Cannot Decide: Information Boundaries for Group-Robust LLM Pruning
This paper analyzes why compression statistics for LLM pruning can be reproducible yet select suboptimal endpoints, introducing information boundaries and observation fibers to model the gap. It proposes group-resolved and model-specific mask selection methods that improve worst-group perplexity across dense LLMs and OLMoE.
跳过一层还是循环它?学习LLM中的Program-of-Layers
本文介绍了一种名为Program-of-Layers(PoLar)的方法,它允许大语言模型根据每个输入动态地跳过或循环预训练层,从而在固定深度推理的基础上提高准确性和效率。