面向大语言模型激活稀疏化的敏感性感知阈值化与令牌路由

arXiv cs.LG 论文

摘要

本文提出了SATS(面向稀疏性的敏感性感知阈值化)及令牌路由框架,通过动态稀疏化MLP激活,提升LLM推理效率。与基于百分位数的基线方法相比,这些方法实现了更优的质量-吞吐量权衡。

arXiv:2607.08991v1 公告类型:新 摘要:大型语言模型(LLM)的高效推理需要在保持模型质量的同时,确定哪些计算可以缩减。我们通过多层感知机(MLP)激活稀疏化及令牌级条件路由来研究此问题。我们首先提出SATS(面向稀疏性的敏感性感知阈值化),一种阈值校准方法,使用局部MLP输出敏感性代理来选择逐层门控阈值,而非直接从激活百分位数校准阈值。SATS保留了通过门控激活阈值化来稀疏化MLP激活的现有机制,但将基于百分位数的校准替换为敏感性感知选择规则。接着,我们引入一个轻量级令牌路由框架,该框架在每个令牌的基础上动态选择基础路径或修改路径,而非将修改后的计算统一应用于所有令牌。我们在多个近期开权重的LLM上评估了这两种方法。结果表明,在匹配实际稀疏度的情况下,SATS优于基于阈值稀疏化的基线,并且令牌路由比静态激活修改基线实现了更有利的质量-吞吐量权衡。总体而言,我们的结果表明,改进的阈值校准和令牌路由可以改善LLM中的质量-吞吐量权衡。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:57

# 敏感性感知阈值调整与令牌路由:面向大型语言模型的激活稀疏化研究
来源:https://arxiv.org/html/2607.08991
Youngmin Yi  西江大学  ymyi@sogang\.ac\.kr  
Hoeseok Yang  圣克拉拉大学  hoeseok\.yang@scu\.edu

######  摘要

大型语言模型(LLM)的高效推理需要在保持模型质量的前提下决定何处可以减少计算量。本文通过多层感知器(MLP)激活稀疏化和令牌级条件路由来研究该问题。我们首先提出**敏感性感知稀疏化阈值调整(SATS)**,一种阈值校准方法,利用局部MLP输出敏感性代理来选择逐层门控阈值,而非直接根据激活百分位数校准阈值。SATS保留了通过对门控激活进行阈值化来稀疏化MLP激活的现有机制,但用敏感性感知选择规则取代了基于百分位数的校准。随后,我们引入了一个轻量级令牌路由框架,该框架在逐令牌基础上动态选择基础路径或修改路径,而不是将修改后的计算统一应用于所有令牌。我们在多个近期开源权重的LLM上评估了这两种方法。结果表明,在匹配实际稀疏度的情况下,SATS优于基于阈值的稀疏化基线;并且与静态激活修改基线相比,令牌路由带来了更有利的质量-吞吐量权衡。总体而言,我们的结果表明,改进的阈值校准和令牌路由能够改善LLM的质量-吞吐量权衡。

## 1  引言

大型语言模型(LLM)被广泛应用于多种任务,但其推理成本仍是主要瓶颈。这一成本的很大一部分来自每个Transformer层内的多层感知器(MLP)模块。因此,优化MLP模块可以加速设备端LLM推理。近期研究(Lee等,2024(https://arxiv.org/html/2607.08991#bib.bib2);Zhang等,2024(https://arxiv.org/html/2607.08991#bib.bib3))表明,这些激活值包含显著稀疏性,可以通过对MLP门控激活进行阈值化来利用,从而在不修改整体Transformer架构的情况下加速LLM推理。然而,如何决定移除哪些激活以及何时应用修改后的计算仍是一个挑战。

应对这一挑战的常见策略是从校准数据集的激活统计量中为每一层校准一个激活阈值。CATS(Lee等,2024(https://arxiv.org/html/2607.08991#bib.bib2))使用基于百分位数的方法选择这些逐层阈值。但基于百分位数的校准主要关注移除多少个激活,而非考察给定阈值对最终MLP输出造成的损害程度。激活层中两个相邻的阈值可能在最终输出中导致截然不同的信息损失。更广泛地看,激活修改被统一应用于生成提示中的所有令牌,尽管修改的影响在不同令牌之间并不统一。

在本工作中,我们从两个层面研究LLM中MLP层的稀疏化。首先,我们提出**敏感性感知稀疏化阈值调整(SATS)**,一种阈值校准方法,用基于逐层MLP输出失真的敏感性感知方法取代基于百分位数的阈值选择。SATS根据局部层敏感性预算选择阈值,并通过全局目标稀疏度确定逐层最终工作点。其次,我们引入了一种轻量级**令牌路由**方法,为每个令牌决定是使用密集MLP路径还是稀疏路径(后者使用激活阈值化)。该路由方法仅需令牌标识,因此可以简化为一个查找表,对推理速度的影响可以忽略不计。

我们在Llama 3.1 8B(Grattafiori等,2024(https://arxiv.org/html/2607.08991#bib.bib4))和Qwen 3 8B(Yang等,2025(https://arxiv.org/html/2607.08991#bib.bib5))上评估了这两种方法。在这两个模型家族中,在匹配实际稀疏度的情况下,SATS相比基于百分位数的阈值化提供了更好的质量。接着,我们展示了与静态稀疏或密集模型执行相比,令牌路由进一步改善了质量-吞吐量权衡。我们的主要贡献如下:

- • 我们提出了SATS,一种用于激活稀疏化的敏感性感知阈值校准方法,保留了现有的运行时激活阈值屏蔽方法。
- • 我们展示了在匹配实际稀疏度的情况下,SATS在两个近期开源权重LLM家族上优于基于百分位数的阈值校准。
- • 我们引入了一种基于令牌标识的路由方法,在推理时以最小的路由开销在密集计算路径和稀疏计算路径之间进行选择。
- • 我们展示了令牌路由相对于静态稀疏执行改善了质量-吞吐量权衡,同时保持了比密集推理更快的速度。

## 2  背景

我们主要关注使用门控MLP模块的基于Transformer的LLM,如Llama(Touvron等,2023(https://arxiv.org/html/2607.08991#bib.bib16))和Qwen(Bai等,2023(https://arxiv.org/html/2607.08991#bib.bib17))家族。给定输入向量 xx,门控MLP模块可以表示为以下公式:

门控-MLP\(x\):=\(激活函数\(xW_{gate}\)∗\(xW_{up}\)\)W_{down} \标签{1}

其中 W_{gate}、W_{up} 和 W_{down} 代表MLP层中的权重。虽然MLP层中的激活函数可以变化,但SiLU(Elfwing等,2018(https://arxiv.org/html/2607.08991#bib.bib18))是一种广泛采用的激活函数,可以表示为:

SiLU:=x∗sigmoid\(x\)=x1+e−x \标签{2}

CATS(Lee等,2024(https://arxiv.org/html/2607.08991#bib.bib2))旨在通过应用特定阈值来稀疏化MLP层中的激活值,从而利用激活稀疏性。给定稀疏度水平 kk(例如50%)作为输入,计算训练数据随机子集(限于500个数据点)上的激活值。这用于计算作为结果值的第k个百分位数的截断阈值。

t:=min⁡{t′:F\(t′\)≥k} \标签{3}

计算阈值后,CATS在MLP层现有激活函数之上应用以下激活函数。

CATS_t\(x_j\):={x_j,if\|x_j\|≥t;0,if\|x_j\|<t} \标签{4}

对于输入 SiLU\(xW_{gate}\),变为:

CATS_t\(SiLU\(xW_{gate}\)\):={SiLU\(xW_{gate}\),if\|SiLU\(xW_{gate}\)\|≥t;0,if\|SiLU\(xW_{gate}\)\|<t} \标签{5}

我们扩展了CATS框架以实现更具损害意识的阈值调整。CATS控制全局稀疏度水平,但并未明确考虑移除特定神经元所导致的损害。我们提出的敏感性感知稀疏化阈值调整(SATS)框架在保留硬件高效的CATS运行时屏蔽形式的同时,用敏感性感知阈值选择取代了基于百分位数的稀疏度校准。

## 3  方法

### 3.1  SATS:敏感性感知稀疏化阈值调整

为了量化在特定阈值下将神经元置零的影响,我们定义了一个局部MLP失真度量,其灵感来源于ReLU²(Zhang等,2024(https://arxiv.org/html/2607.08991#bib.bib3))中引入的尾端截断累计误差(CETT)。他们的工作表明,较大的MLP截断误差与较差的模型性能相关,这启发了我们使用局部失真作为校准信号的方法。与ReLU²(直接通过对MLP输出进行阈值化来研究稀疏化)不同,我们仅使用该信号来校准CATS式激活屏蔽的逐层门控阈值。

参见图注:图1:(a) Llama 3.2 1B中不同门控阈值化下的逐层失真。对于代表性的MLP层,我们扫描候选门控阈值,并在校准子集上测量层稀疏度和局部MLP输出失真。相似的稀疏度水平可能在不同层之间引起不同的局部失真。(b) Llama 3.2 1B上SATS预算扫描的平均局部失真与下游平均准确率。每个点对应一个共享的逐层预算bb(其实际稀疏度水平已标注在点上)。

CATS方法从门控后激活的经验分布中选择阈值,这直接建模了稀疏度,但未建模阈值化引起的失真。在门控层上应用相邻的阈值可能因上投影值和下投影权重的不同而对最终MLP输出产生不同的贡献。如图1(a)所示,相似的层稀疏度可能在不同层之间引入显著不同的局部失真。由于各层对阈值化引起的失真的敏感性(失真使用公式6测量)可能差异很大,我们保留了CATS的运行时屏蔽方法,但用敏感性感知校准方法取代了基于百分位数的阈值校准。

对于候选阈值 tt,令 y_ℓ\(x\) 表示层ℓ处的密集MLP输出,令 ỹ_ℓ,t\(x\) 表示在移除门控后激活幅度低于 tt 的值后获得的阈值化MLP输出。我们将局部阈值化误差定义为:

Err_ℓ\(t\)=E_x[‖y_ℓ\(x\)−ỹ_ℓ,t\(x\)‖_2 / (‖y_ℓ\(x\)‖_2+ε)] \标签{6}

其中 ε 是一个用于数值稳定性的小常数。该分数衡量了在特定 tt 处进行阈值化对层ℓ的MLP输出造成的失真程度。

与CATS类似,我们首先使用校准数据集,根据门控后激活幅度构建候选阈值集合 T。这保持了CATS的推理时门控屏蔽方法,但修改了阈值选择方法。对于每个候选阈值,我们在校准数据集上估计其局部误差分数 Err_ℓ\(t\)。然后,我们引入一个逐层误差预算 b,并为每个层ℓ选择局部误差不超过该预算的最大阈值 t_ℓ。

t_ℓ^⋆\(b\)=max⁡{t∈T_ℓ : Err_ℓ\(t\)≤b} \标签{7}

对于任何固定预算 b,将该规则独立应用于所有层会得到一个模型范围内的阈值分配。

T^⋆\(b\)=[t_1^⋆\(b\),...,t_L^⋆\(b\)] \标签{8}

这为每个 bb 的选择定义了一个稀疏模型。较大的预算允许更激进的阈值化,通常会导致更高的稀疏度。因此,bb 的选择在此尤为重要。虽然 bb 被选择用于建模局部MLP失真,但它仍然是建模端到端LLM性能的有用信号。图1(b)表明局部MLP失真与端到端模型性能之间存在一致的相关性,这表明该信号足以指导阈值校准。

我们将 bb 视为一个校准参数,用于达到所需的稀疏度水平。具体地,对于目标稀疏度 s_tar,每个候选预算 b 生成一个阈值分配 T^⋆\(b\),从而产生一个实际平均稀疏度 S\(b\),定义为:

S\(b\)=1/L ∑_{ℓ=1}^L sp_ℓ\(t_ℓ^⋆\(b\)\) \标签{9}

其中 sp_ℓ\(t\) 表示在给定阈值 t 下层ℓ的预期稀疏度。然后我们选择实际稀疏度最接近目标值的预算:

b^⋆=arg⁡min_b |S\(b\)−s_tar| \标签{10}

这使得 b 和 s_tar 的角色不同。预算 b 控制哪些阈值在局部误差准则下是可接受的,而目标稀疏度 s_tar 仅在外部校准循环中用于在生成的稀疏模型中进行选择。

在实践中,我们使用粗到细搜索实现这种校准。我们首先扫描一组粗略的预算值,并确定其实际稀疏度最接近目标稀疏度的区域。然后,我们在该区域附近进行局部细化,对每一层附近的候选阈值进行更密集的搜索。从概念上讲,这种方法将阈值校准重新定义为对受敏感性约束的阈值选择进行目标稀疏度搜索。

### 3.2  令牌路由

参见图注:图2:所提出的令牌路由方法概述。对于每个令牌,d_i 在校准语料库上计算,其平均值存储在一个查找表中。在推理过程中,路由器使用此查找表根据 τ 将令牌传递到基础路径或稀疏路径。基础路径和稀疏路径使用相同的模型权重,仅调整MLP层激活。

到目前为止讨论的激活阈值化方法产生一个单一的修改后的稀疏模型,该模型在每次使用稀疏配置时被统一应用。虽然这种静态设计很简单,但它为每个令牌使用相同的稀疏计算路径。令牌路由提出了这样一个问题:是否可以有选择性地做出这个决定?我们不统一应用稀疏路径,而是允许每个令牌在保留原始模型性能的基础模型路径和为了更快推理而应用激活阈值化的稀疏路径之间进行选择。

考虑到实际模型部署场景,我们仅使用当前令牌标识来进行路由决策。这使得路由开销最小化,因为部署仅需查询一个预计算表。在此约束下,主要目标是为每个令牌分配一个分数,反映其在平均情况下使用稀疏路径的安全性。

为了构建这个分数,我们使用一个由 tokenized 序列组成的校准语料库。对于该语料库中的每个令牌出现 ii,我们在同一令牌上同时运行基础路径和稀疏路径,并记录该位置的下一个令牌交叉熵损失。需要注意的是,这些损失并非令牌类型的内在属性。相反,它们是从校准语料库中实际出现的情况中测量的,并且取决于周围的序列上下文。因此,路由校准构建了对给定令牌使用稀疏路径风险程度的统计估计。

令 x_i 表示当前令牌出现的标识,令 ℓ_base 和 ℓ_sparse 分别表示基础路径和稀疏路径的每令牌交叉熵损失。作为主要的路由目标,我们使用稀疏路径相对于基础路径的额外损害:

相似文章

基于自监督早期退出机制加速大语言模型推理

arXiv cs.CL

本文介绍了一种针对大语言模型的自监督早期退出方法,允许在置信度较高时在中间层提前停止计算,从而降低推理成本。此外,还提出了动态自推测解码(DSSD),相比现有基线实现了更高的令牌接受率。

降低LLM延迟

Reddit r/AI_Agents

用于降低大语言模型延迟、提高推理速度的技术和方法。

面向高效全模态LLM的阶段自适应Token选择方法

Hugging Face Daily Papers

SEATS是一种无需训练的阶段自适应Token选择方法,通过逐步剪枝冗余的视觉和音频Token来降低全模态LLM的计算开销,实现了9.3倍FLOPs减少和4.8倍预填充加速,同时保持96.3%的性能。