Prox:通过近似中间通道显著性在LLM中实现免训练FFN激活稀疏性
摘要
Prox是一个用于LLM中稀疏SwiGLU FFN的免训练框架,利用近似中间通道显著性来构建通道掩码,无需密集计算。在十个LLM上,Prox优于免训练基线,在70%稀疏度下实现了高达1.99倍的端到端解码加速。
arXiv:2607.27591v1 Announce Type: new
摘要:前馈网络(FFN)在大语言模型(LLM)推理中主导内存流量和计算,使其成为激活稀疏化的主要目标。然而,现有的免训练方法在高稀疏度下会因通道选择策略的局限性而出现显著的模型质量下降。我们观察到,SwiGLU中间状态提供了非常有效的通道选择信号,但获取该状态需要代价高昂的密集计算。为了解决这个问题,我们提出了\emph{Prox},一个用于稀疏SwiGLU FFN的两阶段免训练框架。Prox的关键洞见在于:稀疏执行只需要由中间状态产生的通道掩码,而该掩码可以通过其条目的幅度排序而非精确值来构建。具体来说,第一阶段利用输入稀疏性和量化代理权重来构建共享掩码;第二阶段精确计算选中的通道,从而实现所有三个投影的稀疏执行。在来自六个模型家族的十个LLM上,Prox在所有稀疏度水平上均优于免训练基线,在70\% FFN稀疏度下实现了高达$1.99\times$的端到端解码加速,并且与量化和稀疏注意力兼容。
查看缓存全文
缓存时间: 2026/07/31 10:04
# Prox: 通过近似中间通道显著性实现 LLM 中免训练的 FFN 激活稀疏化
来源: https://arxiv.org/html/2607.27591
Jinyi Liu1,2, Wei Chen1,2\通讯作者, Pengyu Chen1,2, Xinyi Yuan1,2, Minghe Bai3, Guoquan Wu1,2, Jun Wei1,2
###### 摘要
前馈网络 \(FFNs\) 在大型语言模型 \(LLM\) 推理中主导了内存流量和计算量,使其成为激活稀疏化的主要目标。然而,现有的免训练方法在高稀疏度下由于通道选择策略的局限性,会导致模型质量显著下降。我们观察到,SwiGLU 中间状态提供了一种非常有效的通道选择信号,但获取它需要代价高昂的密集计算。为了解决这个问题,我们提出了*Prox*,一个用于稀疏 SwiGLU FFN 的两阶段免训练框架。Prox 的关键洞察在于:稀疏执行仅需要由中间状态诱导出的通道掩码,而该掩码可以通过其条目的幅度排序而非精确值来构建。具体来说,阶段 1 使用输入稀疏性和量化代理权重来构建共享掩码;阶段 2 精确计算所选通道,从而实现对全部三个投影的稀疏执行。在来自六个模型家族的十个 LLM 上,Prox 在所有稀疏度水平上都优于免训练基线,在 70% FFN 稀疏度下实现了高达 1.99× 的端到端解码加速,并且与量化和稀疏注意力兼容。
## 1 引言
高效推理对于部署大型语言模型 \(LLMs\) 至关重要,尤其是在资源受限和延迟敏感的场景中。在小型批次的自回归解码中,从片外高带宽内存 \(HBM\) 到片上存储的参数传输主导了延迟。现代 LLM 普遍采用 SwiGLU 前馈网络 \(FFNs\),其三个投影矩阵占据模型参数、内存流量和计算量的大部分 \(图1 (https://arxiv.org/html/2607.27591#S1.F1)\),使其成为加速的高杠杆目标。
现有方法通过权重量化 \(Dettmers等人 2022 (https://arxiv.org/html/2607.27591#bib.bib13); Frantar等人 2022 (https://arxiv.org/html/2607.27591#bib.bib14); Lin等人 2024 (https://arxiv.org/html/2607.27591#bib.bib2)\) 和模型剪枝 \(Ma等人 2023 (https://arxiv.org/html/2607.27591#bib.bib22); Frantar 和 Alistarh 2023 (https://arxiv.org/html/2607.27591#bib.bib38); Ashkboos等人 2024 (https://arxiv.org/html/2607.27591#bib.bib36); Men等人 2025 (https://arxiv.org/html/2607.27591#bib.bib35); Qiao等人 2025 (https://arxiv.org/html/2607.27591#bib.bib16); Sun等人 2024 (https://arxiv.org/html/2607.27591#bib.bib40)\) 来加速 LLM 推理,这些方法通过改变模型精度或结构来降低内存占用或计算成本。与这些静态修改正交,激活稀疏化 \(Liu等人 2023 (https://arxiv.org/html/2607.27591#bib.bib9); Lee等人 2024 (https://arxiv.org/html/2607.27591#bib.bib4); Cheon 和 Kang 2025 (https://arxiv.org/html/2607.27591#bib.bib7); Liu等人 2025 (https://arxiv.org/html/2607.27591#bib.bib41); Chen等人 2023 (https://arxiv.org/html/2607.27591#bib.bib39); Raihan 和 Aamodt 2020 (https://arxiv.org/html/2607.27591#bib.bib29); Kurtz等人 2020 (https://arxiv.org/html/2607.27591#bib.bib18); Szatkowski等人 2026 (https://arxiv.org/html/2607.27591#bib.bib45)\) 通过动态跳过低显著性通道及相关的乘加运算来缓解内存和计算瓶颈。先前的工作利用基于训练的预测器或免训练的启发式方法来实现依赖于输入的激活稀疏化。然而,这些预测器必须针对每个模型单独训练,而现有的免训练方案随着稀疏度增加,由于通道选择策略的局限性,经常遭受显著的精度下降。
参照图注图 1:在 4K 上下文长度下,Qwen3 Transformer 块中 FFN 在不同模型规模下占据参数和乘加运算 \(MACs\) 的大部分。我们的分析揭示了两个发现:\(1\) SwiGLU 中间状态提供了一种非常有效的通道选择信号,但需要代价高昂的密集计算。我们的 oracle 实验表明,在大多数模型上,使用这一精确状态进行选择在 70% 稀疏度下的相对困惑度增加小于 3%。\(2\) 稀疏执行仅需要通道掩码,而通道掩码仅取决于状态条目的幅度排序而非其精确值。我们的实验表明,低成本的输入稀疏代理能够保持这一排序,并紧密匹配 oracle 掩码。
基于这两个关键发现,我们提出了*Prox*,一种用于稀疏 SwiGLU 推理的两阶段免训练方法。阶段 1 \(*轻量级代理构建*\) 结合基于幅度的输入稀疏性和量化代理权重来估计 SwiGLU 的两个分支,并构建共享的中间通道掩码。阶段 2 \(*精确稀疏计算*\) 使用原始的 up 和 gate 权重计算所选通道,并将相同的掩码应用于 down 投影。Prox 还在目标稀疏度预算下在阶段 1 和阶段 2 之间分配计算,并使用定制的 CUDA 和 Triton \(Tillet等人 2019 (https://arxiv.org/html/2607.27591#bib.bib43)\) 内核来减少全部三个投影的权重访问和计算。
我们在来自六个模型家族的十个代表性 LLM 上评估了 Prox。结果表明,Prox 持续优于最先进的免训练基线,尤其是在 60-70% FFN 稀疏度下,以最小的精度损失实现了高达 1.99× 的端到端解码加速。至关重要的是,Prox 与量化和稀疏注意力完全正交,能够实现协同的效率提升。
我们的主要贡献总结如下:
- • 洞察。我们确定 FFN 中间状态是一种有效的通道选择信号,并表明低成本代理能够保持恢复精确状态所诱导掩码所需的幅度排序。这激发了基于代理的通道选择,随后对保留通道进行精确计算。
- • Prox 框架。我们提出了 Prox,一个免训练的两阶段框架,使用量化代理进行通道选择,并精确计算保留值,从而稀疏化全部三个 SwiGLU 投影,同时防止错误累积。
- • 全面评估。我们的大量实验表明,Prox 在各种模型和稀疏度水平下提供了优越的精度-效率权衡,同时保持与量化和稀疏注意力的完全兼容性。
## 2 背景与相关工作
### 2\.1 SwiGLU 前馈网络
LLM 通常由堆叠的 Transformer 层构建,每层包含一个注意力块和一个 FFN。虽然早期的 Transformer FFN 使用 ReLU 或 GELU 激活函数,但门控线性单元 \(GLUs\) \(Dauphin等人 2017 (https://arxiv.org/html/2607.27591#bib.bib8); Shazeer 2020 (https://arxiv.org/html/2607.27591#bib.bib34)\) 已在很大程度上取代了它们。如今,SwiGLU \(Shazeer 2020 (https://arxiv.org/html/2607.27591#bib.bib34)\) 仍然是现代 LLM 中采用最广泛的 GLU 变体,代表性模型包括 Qwen3 \(Team 2025b (https://arxiv.org/html/2607.27591#bib.bib28)\)、Llama\-3 \(AI@Meta 2024 (https://arxiv.org/html/2607.27591#bib.bib20)\) 和 Mistral \(Jiang等人 2023 (https://arxiv.org/html/2607.27591#bib.bib17)\)。
一个 SwiGLU FFN 包含三个投影矩阵:up 投影 \(W_up ∈ R^{d_model × d_ff}\)、gate 投影 \(W_gate ∈ R^{d_model × d_ff}\) 和 down 投影 \(W_down ∈ R^{d_ff × d_model}\)。给定输入表示 \(x ∈ R^{d_model}\),其前向计算定义为
FFN\(x\) = \(x W_up ⊙ SiLU\(x W_gate\)\) W_down。
为了便于后续讨论,我们定义三个变量:
u = x W_up, h = SiLU\(x W_gate\), s = u ⊙ h,
分别表示 up 分支激活、门控非线性激活和中间 SwiGLU 状态。
### 2\.2 激活稀疏化
激活稀疏化既减轻了 HBM 到寄存器的内存带宽开销,也减少了低显著性通道上的冗余计算。对于线性投影 \(y = x W\),其中 \(x ∈ R^{d_in}\) 且 \(W ∈ R^{d_in × d_out}\),可以沿着输入维度或输出维度强制执行稀疏性。令 \(I\(m\) = \{i | m_i = 1\}\) 表示二进制掩码 \(m\) 沿目标维度保留的索引集合。
输入稀疏性将掩码 \(m ∈ \{0,1\}^{d_in}\) 应用于输入维度。具体来说,\(m_i = 0\) 掩盖第 \(i\) 个输入通道,消除了 \(x_i\) 与 \(W\) 对应行的乘法。
Π^in\(x, W, m\) = x_{[I\(m\)]} W_{[I\(m\), :]}。
输出稀疏性将掩码 \(m ∈ \{0,1\}^{d_out}\) 应用于输出维度,并且仅计算选定的输出坐标:
Π^out\(x, W, m\) = x W_{[:, I\(m\)]},
其中 \(W\) 的选定列产生保留的输出通道。
参照图注图 2:SwiGLU FFN 的具有代表性的稀疏化方法的计算模式。激活稀疏化的演变紧密跟随 Transformer FFN 从基于 ReLU 的设计到现代 SwiGLU 变体的架构转变。
早期的激活稀疏化方法主要针对基于 ReLU 的 FFN,跳过依赖于输入的非激活或低幅度神经元,以减少计算和内存流量 \(Li等人 2022 (https://arxiv.org/html/2607.27591#bib.bib19); Liu等人 2023 (https://arxiv.org/html/2607.27591#bib.bib9); Alizadeh等人 2024 (https://arxiv.org/html/2607.27591#bib.bib21)\)。虽然这些方法在 ReLU 诱导的精确或近似精确零值上表现出色,但它们无法直接适应基于 SiLU 的 SwiGLU FFN。
第二条工作路线,ReLUfication,通过激活替换和训练后适配将非 ReLU FFN 转换为 ReLU 风格变体 \(Mirzadeh等人 2024 (https://arxiv.org/html/2607.27591#bib.bib30); Zhang等人 2024 (https://arxiv.org/html/2607.27591#bib.bib31); Song等人 2025 (https://arxiv.org/html/2607.27591#bib.bib26), 2024 (https://arxiv.org/html/2607.27591#bib.bib44)\)。然而,这些方法通常需要明确的架构修改或资源密集的重新训练,例如持续训练或知识蒸馏。
对于原生 SwiGLU FFN,基于预测器的方法在执行完整 FFN 之前估计显著的中间通道。例如,Cheon 和 Kang \(2025 (https://arxiv.org/html/2607.27591#bib.bib7)\) 需要针对 FFN 输入训练模型特定的、逐层的低秩预测器,以从中间状态 \(s\) 中选择通道。然而,有限的预测精度会降低下游模型质量。
相比之下,免训练方法使用激活幅度对原生 SwiGLU FFN 进行稀疏化。它们主要在两个方面有所不同:哪些激活信号指导通道选择,以及生成的掩码如何诱导稀疏执行。图 2 (https://arxiv.org/html/2607.27591#S2.F2) 沿着这两个维度比较了三种代表性方法。CATS \(Lee等人 2024 (https://arxiv.org/html/2607.27591#bib.bib4)\) 基于密集计算的 gate 激活 \(h\) 的幅度选择中间通道,从而在 up 投影中诱导输出稀疏性,在 down 投影中诱导输入稀疏性 \(图 2 (https://arxiv.org/html/2607.27591#S2.F2)\(a\)\)。COUNTDOWN \(Cheon 和 Kang 2025 (https://arxiv.org/html/2607.27591#bib.bib7)\) 则使用密集计算的 up 分支激活 \(u\) 的幅度进行通道选择,在 gate 投影中产生输出稀疏性,在 down 投影中产生输入稀疏性 \(图 2 (https://arxiv.org/html/2607.27591#S2.F2)\(b\)\)。¹ 与这些单分支方法不同,TEAL \(Liu等人 2025 (https://arxiv.org/html/2607.27591#bib.bib41)\) 同时对 up 和 gate 投影中的 \(x\) 以及 down 投影中的 \(s\) 应用输入稀疏性 \(图 2 (https://arxiv.org/html/2607.27591#S2.F2)\(c\)\)。R\-Sparse 遵循类似的输入稀疏模式,同时在线性层中结合低秩补偿 \(Zhang等人 2025 (https://arxiv.org/html/2607.27591#bib.bib48)\)。
在图 2 (https://arxiv.org/html/2607.27591#S2.F2) 的三种代表性方法中,随着稀疏度增加,模型质量大幅下降,暴露了其通道选择策略的关键局限性。CATS 和 COUNTDOWN 分别仅从 \(h\) 和 \(u\) 估计中间通道显著性;每种方法都依赖于仅捕获联合中间状态 \(s = u ⊙ h\) 部分信息的单分支信号,导致显著通道排序错误。TEAL 则在两个连续点应用输入稀疏性:首先应用于 \(x\),即 up 和 gate 投影的共享输入,然后应用于生成的中间状态 \(s\),即 down 投影的输入。因此,后者操作的已经是近似后的中间状态,使得两个稀疏化步骤的错误通过 FFN 复合累积。
这些局限性促使我们需要一种更有效的、专为免训练 SwiGLU 稀疏化设计的通道选择机制。
参照图注图 3:\(a\) oracle \(s\) 通道选择下困惑度增加与稀疏度的关系。\(b\) Qwen3\-8B 第 8 层中 \(s\) 的经验分布以及拟合的高斯和拉普拉斯密度;\(c\) 在 70% 有效稀疏度下,Qwen3\-8B 第 3 层一个代表性 token 的精确与代理中间状态幅度;颜色表示每个通道是被两种 top\-ranking 选择都保留、仅一种选择保留、还是均未保留。两种选择达到 82\.77% 的重叠率。\(d\) 在 512 个 token 上精确/代理 top\-ranking 的重叠率;虚线表示 82\.04% 的平均重叠率。
## 3 动机
### 3\.1 使用中间状态 \(s\) 进行通道选择
遵循 SwiGLU FFN 的加权和视角 \(Cheon 和 Kang 2025 (https://arxiv.org/html/2607.27591#bib.bib7)\),FFN 输出是 down 投影行的加权和:
FFN\(x\) = s W_down = ∑_{i=1}^{d_ff} s_i W_down[i, :]。
分析。依赖于输入的系数 \(s_i\) 控制每行的输出,使得 \(|s_i|\) 成为通道选择的自然度量。除了衡量输出贡献之外,中间状态 \(s\) 天然地与所有三相似文章
持续LLM升级循环:一种用于从稠密到稀疏LLM的预测器门控按组稀疏训练方案
本文提出了一种用于大语言模型的从稠密到稀疏的持续训练方法,采用预测器门控的按组稀疏性实现4倍FFN稀疏度,并在Qwen2.5-8B上通过长上下文训练进行了验证。
整体之稀疏一瞥:无需训练的自推测解码
本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。
SharQ:连接激活稀疏性与FP4量化以优化大语言模型推理
SharQ提出了一种无需训练的方法,将激活稀疏性与FP4量化相结合用于大语言模型推理,采用稀疏-密集分解和统一的FP4权重负载。与仅使用FP4的基线相比,它显著降低了延迟并恢复了精度。
PALS:面向大语言模型剪枝的百分位感知层稀疏度方法
PALS根据激活幅度的99百分位数调整大语言模型剪枝中的每层稀疏比,在LLaMA-2-7B上相比均匀稀疏实现了显著困惑度改进,且附加成本可忽略不计。
全注意力回归:在百步训练内将全注意力转化为稀疏注意力
RTPurbo 仅需数百步训练即可将全注意力大语言模型转化为稀疏模型,实现接近无损的准确率,并在预填充阶段最高提速 9.36 倍,解码阶段最高提速 2.01 倍。