通过马尔钦科-帕斯图尔分布剪枝深度神经网络

arXiv cs.LG 论文

摘要

本文提出了一种基于马尔钦科-帕斯图尔随机矩阵的深度神经网络剪枝方法,提供了理论保证,并在 ImageNet 上对 ViT 和 CNN 架构实现了高精度保持,仅需极少的微调。

arXiv:2606.02608v1 公告类型:新 摘要:我们研究了一种基于马尔钦科-帕斯图尔(MP)随机矩阵的深度神经网络剪枝方法,该方法在剪枝后仅需极少的微调预算。主要的实际贡献在于能够在较短的校准和微调周期内保持精度,而非依赖冗长的剪枝后重优化流程。理论提供了确定性的数据通路保证:如果被移除的组件 $R$ 的传播 logit 效应 $L_s \| R \psi_1(s) \|_\infty$ 很小,那么剪枝会降低弹性网络目标函数,并保留那些密集边缘超过两倍扰动的样本。零预算情况可实现完美剪枝;剪枝-恢复扩展模型在固定稀疏执行模式内模拟权重恢复;而加性 $L_2$ 正则化模型表明,可容许的类随机组件在训练极限处消失,持久尖峰随 MP 体部坍缩而稳定。在 iid 高斯充分条件下,拟合的 MP 边缘 $\sigma_+$ 提供了高概率的逐层预算信号。 在 ImageNet-1k 上,仅经过三个蒸馏周期后,ViT-B/16 $2{:}4{+}$ToMe 达到了 $83.41\%$ 的 top-1 准确率(相对于密集模型下降 $-1.70$ 个百分点),稀疏执行 MAC 降低 $59.81\%$,对于相同的检查点和 ToMe 图,在 A40 原生 $2{:}4$ 后端的加速比达到 $1.388\times$(最佳观测值);另一个无 ToMe 的 A100 端点达到 $2.705\times$。在结构化稀疏方面,ViT-B/16 $6{:}12$ 达到 $83.74\%$,ViT-L/16 $8{:}16$ 密集+置换达到 $85.33\%$(下降 $-0.51$ 个百分点),ConvNeXtV2-Base $12{:}16$ 达到 $86.35\%$(下降 $-0.37$ 个百分点)。对于 CNN,ResNet50 $8{:}16$ 密集+置换达到 $75.87\%$(下降 $-0.26$ 个百分点),ResNet152d CAST-conv+置换达到 $81.33\%$(下降 $-1.53$ 个百分点),MAC 占比约 ${\sim}50\%$,A40 im2col$+2{:}4$ 稀疏-GEMM 审计加速比为 $1.62\times$。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:39

# 通过马尔琴科–帕斯图尔分布对深度神经网络进行剪枝
来源: https://arxiv.org/html/2606.02608
Leonid Berlyand 数学系 宾夕法尼亚州立大学 大学城, PA 16802, 美国  
Theo Bourdais 计算与数学科学系 加州理工学院 帕萨迪纳, CA 91125, 美国  
Houman Owhadi 计算与数学科学系 加州理工学院 帕萨迪纳, CA 91125, 美国  
Yitzchak Shmalo 数学系 宾夕法尼亚州立大学 大学城, PA 16802, 美国  

###### 摘要

我们研究了一种基于马尔琴科–帕斯图尔 (MP) 随机矩阵的方法,用于在极小的剪枝后微调预算下对深度神经网络进行剪枝。主要的实际贡献在于,能在较短的校准和微调周期内保持精度,而无需漫长的剪枝后重新优化流程。理论给出了确定性的数据路径保证:如果被移除的组件 \(R\) 具有较小的传播对数几率效应 \(L_s \|R\psi_1(s)\|_\infty\),则剪枝会降低弹性网目标函数,并保留任何密集边缘超过两倍扰动的训练样本。零预算情况对应完美剪枝;一种“剪枝-恢复”扩展模型描述了在固定稀疏执行模式内部恢复权重的情况;一个加性 \(L_2\) 正则化模型表明,可接受的类随机分量会在训练极限处消失,而持续的特征峰值会在 MP 本体坍缩时趋于稳定。在独立同分布高斯充分条件下,拟合的 MP 上边缘 \(\sigma_+\) 提供了一个高概率的逐层预算信号。

在 ImageNet-1k 上,仅经过三个蒸馏周期后,ViT-B/16 采用 2:4 + ToMe 方法达到了 83.41% 的 top-1 准确率(比密集模型低 1.70 个百分点),稀疏执行 MAC 降低了 59.81%,在相同检查点和 ToMe 图上,最佳观测到的 A40 原生 2:4 后端加速比为 1.388 倍;一个独立的、不使用 ToMe 的 A100 端点加速比为 2.705 倍。在结构化稀疏性方面,ViT-B/16 6:12 达到 83.74%,ViT-L/16 8:16 密集+置换达到 85.33%(低 0.51 个百分点),ConvNeXtV2-Base 12:16 达到 86.35%(低 0.37 个百分点)。对于 CNN 而言,ResNet50 8:16 密集+置换达到 75.87%(低 0.26 个百分点),ResNet152d CAST-conv+置换达到 81.33%(低 1.53 个百分点),在约 50% MAC 计算量下,A40 im2col + 2:4 稀疏 GEMM 审计加速比为 1.62 倍。

关键词: DNNs, ViTs, 随机矩阵理论, 马尔琴科–帕斯图尔分布, 剪枝, 正则化

补充信息。完整的证明、高斯/随机矩阵特化和数学推论见在线资源 1。完整的方法论、运行配方、检查点账本、时序审计细节以及完整的比较表格见在线资源 2。稿件源文件和 PDF 的镜像副本保存在 https://github.com/yspennstate/RMT_based_pruning_in_deep_learning。

范数约定。全文使用 \(\|x\|_\infty\) 表示向量最大范数,而 \(\|A\|_\infty\) 表示诱导矩阵范数
\[
\|A\|_\infty := \max_i \sum_j |A_{ij}|.
\]

## 1 引言

DNN 压缩的动机来自过拟合、正则化和部署约束。随机矩阵理论 (RMT) 已被用于研究训练后的谱、隐式自正则化、泛化诊断、雅可比矩阵和初始化 [17, 14, 19, 31, 28, 22, 23, 21, 18, 16]。对于固定的剪枝超参数,本文使用 MP 谱诊断来分配掩码,在掩码构建阶段无需访问验证集或测试集。

一个主要贡献在于,所报告的精度下降是在很少的剪枝后微调下获得的:每个非结构化剪枝周期仅需一个 epoch,CAST/CAST-conv 仅需三个蒸馏周期,而非长时间的重训练计划。实证目标是在 Vision Transformers 及相关的 ImageNet 模型 [5, 29] 的密集仿射映射内部实现稀疏性。训练后的谱是异质的:该方法将类似 MP 的层视为更大剪枝预算的候选层,同时保护非 MP 层或重尾层。主要的数值结果被有意地前置呈现。在 ImageNet-1k 上,混合幅度–SER 方法在 50% 非结构化稀疏度下使 ViT-B/16 保持了 83.37% 的 top-1 准确率,而可部署的 CAST 2:4 + ToMe 行在仅三个蒸馏周期后,于 59.81% 稀疏执行 MAC 降低下达到了 83.41% 的 top-1 准确率。同一检查点和 ToMe 图在固定批量 A40 原生 2:4 加速比下测得 1.36 倍(最佳批量扫描值为 1.388 倍);一个独立的、不使用 ToMe 的 ViT-B/16 密集到 2:4 的 A100 端点加速比为 2.705 倍。更宽的结构化投影提高了精度方面:ViT-B/16 6:12 达到 83.74%,ViT-L/16 8:16 密集+置换达到 85.33%(低 0.51 个百分点),ConvNeXtV2-Base 12:16 达到 86.35%(低 0.37 个百分点)。对于 CNN 而言,ResNet50 8:16 密集+置换达到 75.87%,仅比密集模型低 0.26 个百分点,ResNet152d CAST-conv+置换达到 81.33%,比密集模型低 1.53 个百分点,A40 im2col + 2:4 稀疏 GEMM 审计加速比为 1.62 倍。更宽的 6:12、8:16 和 12:16 行是精度/MAC 计算量统计行,而非原生稀疏张量核心通量声明。

我们还提出了三个主要理论结果。首先,确定性数据路径保证指出,如果被移除的组件 \(R\) 具有较小的传播对数几率效应 \(L_s \|R\psi_1(s)\|_\infty\),那么剪枝会降低弹性网目标函数,并保留每一个密集边缘大于该扰动两倍的训练样本(引理 5.1,推论 5.2,定理 5.4)。在零预算或“完美剪枝”情况下,边缘界保证了训练集上无精度损失。其次,“剪枝-恢复”保证建模了结构化 \(k:n\) 稀疏性:在已经付出的稀疏执行组内部恢复条目可以在改善保证的同时,保持最终的稀疏执行模式不变(定理 5.5)。第三,加性 \(L_2\) 正则化理论表明,在单侧平稳性和局部路径收敛条件下,可接受的类随机分量会在训练极限处消失;相关的 MP 本体坍缩,而持续的信号特征峰值趋于稳定(定理 4.8,推论 4.9–4.12,以及推广的定理 4.7)。MP 边缘作为数据路径预算的充分随机矩阵条件,以及 SER/CAST 所使用的经验层分配信号而被引入。表 1、2、3 和 4 报告了主要的非结构化、结构化、MAC 降低和可部署性结果;表 5 提供了文献背景。先前的剪枝分类学和 ViT/CNN 压缩引用收集于在线资源 2。

第 2 节给出了 DNN 和 MP 预备知识。第 3 节报告了数值证据。第 4 节和第 5 节阐述了加性和确定性保证。完整的证明和数学细节见在线资源 1;完整的协议、算法、来源注释和补充数值材料见在线资源 2。

## 2 深度神经网络中的随机性

### 2.1 深度神经网络简介

在分类任务中,目标是将集合 \(S\) 中的每个元素分配给 \(K\) 个类别之一。设 \(C(s) \in \{1,\dots,K\}\) 表示 \(s \in S\) 的正确类别。给定一个带标签的训练集 \(T \subset S\),我们寻求一个能从 \(T\) 泛化到未见数据的分类器。我们考虑如下形式的 DNN:
\[
\varphi(\cdot,\alpha) = \rho \circ X(\cdot,\alpha),
\]
其中 \(\rho\) 是 softmax 映射,\(X(\cdot,\alpha)\) 是仿射映射和非线性的复合:
\[
X(\cdot,\alpha) = \lambda \circ M_L(\cdot,\alpha) \circ \cdots \circ \lambda \circ M_1(\cdot,\alpha).
\]
这里:
- \(M_k(\cdot,\alpha)\) 是一个从 \(\mathbb{R}^{N_{k-1}}\) 到 \(\mathbb{R}^{N_k}\) 的仿射映射,具有权重矩阵 \(W_k \in \mathbb{R}^{N_k \times N_{k-1}}\) 和偏置向量 \(\beta_k \in \mathbb{R}^{N_k}\),因此 \(M_k(x) = W_k x + \beta_k\)。
- \(\lambda: \mathbb{R}^m \to \mathbb{R}^m\) 是一个非线性激活函数。在下面的简化理论中,我们取 \(\lambda\) 为逐分量的绝对值或 ReLU。
- softmax 映射 \(\rho: \mathbb{R}^K \to \mathbb{R}^K\) 由下式给出:
\[
\rho(v)_i = \frac{e^{v_i}}{\sum_{j=1}^K e^{v_j}}, \quad v \in \mathbb{R}^K. \tag{1}
\]

标准的交叉熵损失为:
\[
L_{\mathrm{CE}}(\alpha) = -\frac{1}{|T|} \sum_{s \in T} \log\big( \varphi_{C(s)}(s,\alpha) \big). \tag{2}
\]

### 2.2 机器学习背景下的 MP 分布

马尔琴科–帕斯图尔分布是 RMT [15] 中的一个基本对象;更广泛的 高维随机矩阵方法在信号处理、统计学、无线通信和机器学习中有应用 [30, 9, 26, 3]。我们首先定义相关的经验谱分布。

###### 定义 2.1(特征值和奇异值经验谱分布)。

设 \(G \in \mathbb{R}^{N \times M}\),并设 \(s_1(G), \dots, s_{\min\{N,M\}}(G)\) 为其奇异值,按重数计数并包含可能的零。\(G\) 的奇异值经验谱分布 (ESD) 为:
\[
\nu_G := \frac{1}{\min\{N,M\}} \sum_{i=1}^{\min\{N,M\}} \delta_{s_i(G)}.
\]
如果 \(A \in \mathbb{R}^{M \times M}\) 是对称半正定矩阵,具有特征值 \(\lambda_1(A), \dots, \lambda_M(A)\),则其特征值 ESD 为:
\[
\mu_A := \frac{1}{M} \sum_{i=1}^{M} \delta_{\lambda_i(A)}.
\]

###### 定理 2.2(马尔琴科–帕斯图尔定律)。

设 \(W_N\) 是一个 \(N \times M_N\) 的随机矩阵,其元素独立同分布,均值为 0,方差为 \(\sigma^2\),且具有有限四阶矩。定义:
\[
X_N := \frac{1}{N} W_N^\top W_N, \qquad c_N := \frac{M_N}{N} \to c \in (0,\infty).
\]
则特征值 ESD \(\mu_{X_N}\) 几乎必然收敛于马尔琴科–帕斯图尔定律:
\[
\mu_{\mathrm{MP}}^{c,\sigma^2} = \left(1 - \frac{1}{c}\right)_+ \delta_0 + \frac{\sqrt{(\lambda_+ - x)(x - \lambda_-)}}{2\pi c \sigma^2 x} \mathbf{1}_{[\lambda_-, \lambda_+]}(x) \, \mathrm{d}x, \tag{3}
\]
其中
\[
\lambda_\pm = \sigma^2 (1 \pm \sqrt{c})^2. \tag{4}
\]

*证明。* 这是经典引用的随机矩阵输入,而非本文的新定理;来源说明见在线资源 1。

###### 注 2.3。

如果对于所有 \(N\) 有 \(M_N \le N\),则 \(c \in (0,1]\),并且 (3) 中在零点的原子消失。当讨论 \(W_N\) 的奇异值尺度时,我们记 \(\sigma_+ := \sqrt{N \lambda_+}\) 为相应的 MP 上边缘。

### 2.3 通过 MP 诊断减少 DNN 权重中的随机性

在常见的初始化尺度下,\(W_{ij}\) 具有方差 \(g/N\),因此上述注记在矩形纵横比极限 \(M/N \to c\) 下给出 \(\sigma_+ = \sqrt{g} (1 + \sqrt{c})\)。奇异值和 \(W^\top W\) 的非零特征值于是为 \(O(1)\),而 \(X_\ell = W_\ell^\top W_\ell / N\) 的特征值为 \(O(1/N)\);学习后的谱后来会偏离初始随机定律 [17, 27]。训练引入了结构,这激发了以下信号加随机性的假设。

#### 假设 1。

经过 \(t\) 步训练后,第 \(\ell\) 层的权重矩阵可以分解为:
\[
W_\ell(t) = R_\ell(t) + S_\ell(t),
\]
其中 \(R_\ell(t)\) 是一个独立的随机扰动,而 \(S_\ell(t)\) 是一个结构化的信号分量。

#### 假设 2。

对于谱特征峰值解释,\(S_\ell(t)\) 相对于宽度是低秩或近似低秩的。

这些假设是 MP 预算论证的建模工具,并非断言训练后的 ViT 整体上是独立同分布噪声加低秩信号。图 1 给出了两个有代表性的层诊断结果;在预算中使用 MP 拟合背后的假设在第 4 节和第 5 节中说明。

参见标题 (a) ViT-B/16 层的示例,MP 拟合误差 0.74,本体分数 73%。
参见标题 (b) ViT-B/16 层的示例,MP 拟合误差 0.01,本体分数 99.73%。

图 1: 来自同一训练后 ViT-B/16 的两个投影矩阵的逐层 MP 诊断。

## 3 数值证据:RMT 引导的 ViT 剪枝

本节报告实证剪枝证据,并提供读取表格所需的最小算法上下文。完整的运行配方、脚本、检查点账本、校准细节以及迁移的数值附录见在线资源 2。本节中所有 ImageNet-1k top-1 值均在所述剪枝和微调配方之后,于相应密集检查点上测量得到;验证标签不用于构建掩码。因此,一行中的密集基线是该行协议的一部分,与外部工作的比较应通过报告的下降值、压缩轴、训练预算和部署说明来解读,而非仅通过原始 top-1 值。

最简单的基线是幅度剪枝。对于目标稀疏度 \(s\),它移除可修剪张量中绝对值最小的条目,可以是全局的,也可以是在实验指定的层集内。幅度剪枝之所以有用,是因为它是确定性的、廉价的且难以忽视:如果

相似文章

二值化神经网络的剪枝:专用框架与全局加权算法

arXiv cs.LG

本文介绍了一个基于PyTorch的框架,用于剪枝二值化神经网络,并提出了一种新颖的全局加权剪枝方法,该方法在准确率和剪枝率方面表现优异,使得在像FPGA这样的边缘硬件上进行高效部署成为可能。