稀疏性低语者
摘要
本文介绍了几种差异感知剪枝方法(Wisp、Wisp+、Whisper),用于大型语言模型,表明在Llama 2和3.1系列模型(最高405B参数)中,保留输出差异能够提升稀疏化效果。
arXiv:2608.06630v1 公告类型:新
摘要:剪枝可以降低大型语言模型的推理成本,但现有标准主要保留大的激活值或重建层输出。我们认为这忽略了一个关键计算,该计算由MLP中上投影和门控投影里对稀疏性特别敏感的神经元执行:将相似输入分离为不相似输出。这表明有效的剪枝不仅应保留激活值,还更广泛地保留输出之间的差异。我们基于这一原理引入了一系列差异感知剪枝方法。Wisp是一种一阶、无需更新的方法,使用输入差异范数对权重进行评分;Wisp+则利用每个神经元最能区分的输入对,以神经元为单位细化该评分。最后,Whisper是一种二阶方法,使用轻度正则化的差异海森矩阵作为其重建目标。在Llama 2和3.1系列模型(从7B到405B参数)中,我们的二阶变体持续优于强重建基线,而我们的无需更新变体则优于激活感知基线,尤其是在受限设置下。与Wanda和SparseGPT相比,改进也扩展到结构化稀疏、下游评估和其他模型家族。将RIA和ALPS等更强技术与我们的差异感知标准相结合,可获得进一步改进,以可忽略的额外成本将整体精度-运行时边界向外推移。这些结果表明,保留输出差异是训练后LLM稀疏化中一种广泛有用且可组合的信号。
查看缓存全文
缓存时间: 2026/08/10 08:02
# 稀疏性低语者 来源:https://arxiv.org/abs/2608.06630 查看 PDF(https://arxiv.org/pdf/2608.06630) > 摘要:剪枝可降低大语言模型的推理成本,但现有标准主要保留较大的激活值或重建层输出。我们认为,这忽略了 MLP 上投影与门控投影中对稀疏性尤为敏感的神经元所执行的一项关键计算:将相似输入分离为不同输出。这表明,有效的剪枝不仅应保留激活值,还应更广泛地保留输出之间的差异。我们基于这一原理提出了一系列差异感知(difference-informed)剪枝方法。Wisp 是一种一阶、无需更新的方法,使用输入差异范数对权重进行打分;Wisp+ 则利用每个神经元分离最强的输入对,按神经元进一步细化该分数。最后,Whisper 是一种二阶方法,将轻度正则化的差异 Hessian 作为其重建目标。在参数量从 7B 到 405B 的 Llama 2 和 3.1 模型上,我们的二阶变体持续优于强重建类基线,而无更新变体则优于激活感知基线,尤其在受限场景中。与 Wanda 和 SparseGPT 相比,其改进可扩展到结构化稀疏性、下游评估以及其他模型家族。将 RIA、ALPS 等更强技术与我们的差异感知标准相结合,可带来进一步改进,以可忽略的额外成本将整体精度-运行时间前沿向外推移。这些结果表明,保留输出差异是训练后 LLM 稀疏化中一种广泛适用且可组合的信号。 ## 提交历史 来自:Linghao Kong [查看电子邮件(https://arxiv.org/show-email/65a34912/2608.06630)] **\[v1\]** 2026 年 8 月 6 日星期四 22:37:26 UTC(2,853 KB)
相似文章
权重剪枝放大偏见:压缩大语言模型在边缘人工智能中多方法研究
本研究揭示了一个“智能剪枝悖论”:诸如 Wanda 等激活感知剪枝方法虽然保持了困惑度,但在边缘设备上部署的大语言模型中显著放大了偏见。
超越单维压缩:大语言模型的复合稀疏前沿
本文提出了一种针对LLM的复合稀疏框架,结合了静态参数剪枝与动态令牌级计算,表明混合这两种机制优于单维压缩,并能延迟性能退化。
通过幂变换和保号分数聚合实现自适应特征保留的大语言模型结构化剪枝
本文提出了一种针对大语言模型的结构化剪枝方法,解决了在将非结构化剪枝技术适配到结构化剪枝时出现的分布不匹配、符号信息丢失和异常值影响等问题,在Llama-3-8B和Vicuna-v1.5-13B等模型上实现了相当精度,并获得了1.56-1.57倍的加速。
TriSP: 三信号结构化剪枝用于大语言模型
TriSP 提出了一种三信号重要性度量,结合权重幅度、激活范数和梯度敏感性,用于大语言模型的结构化剪枝,在 LLaMA-7B 上实现了最低困惑度和高吞吐量提升。
小型LLM:剪枝与从头训练
本文实证比较了剪枝与从头训练小型语言模型的差异,发现在有限token预算下剪枝具有明显优势,但随着训练规模扩大,优势逐渐减小,尤其是在粗粒度剪枝情况下。