利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

arXiv cs.LG 论文

摘要

本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。

arXiv:2607.08786v1 公告类型:新 摘要:随着大语言模型(LLM)部署的日益增长,LLM推理成本已成为一个关键挑战。引入稀疏性的剪枝技术可以加速推理。然而,保持模型质量通常将剪枝限制在适度非结构化稀疏性(约50%)。在这些稀疏级别下,现有的稀疏矩阵乘法(SpMM)GPU内核均无法超越其密集对应物。本文提出了一种针对具有适度稀疏性的LLM的高效GPU推理方法。我们提出了一种三层矩阵存储格式,包括:(i) 稀疏张量核心层(Sparse-TC),使稀疏张量核心能够加速SpMM;(ii) 槽填充层(Slot-Filling),利用并行差分距离进行矩阵压缩,同时支持低成本的片上解码;(iii) 轻量级残差层(Residual Layer),确保正确的SpMM计算。基于该格式,我们设计了一个联合利用稀疏张量核心和CUDA核心的SpMM内核。该设计实现了高效的执行流水线,并使片上计算与内存访问重叠。评估表明,我们的工作是首个在现代配备高带宽内存(HBM)的GPU上超越密集矩阵乘法的工作。相比SpInfer(EuroSys'25,最佳论文)实现了最高1.64倍的内核级加速,相比FlashLLM(VLDB'24)实现了最高1.41倍的端到端加速。我们的源代码:https://github.com/moui0/cudac.
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:55

# 加速具有适度非结构化稀疏权重矩阵的大型语言模型GPU推理
来源:https://arxiv.org/html/2607.08786
Tao Lu§,\*, Haoyu Wang¶,\*, Zonghui Wang¶,†, Keshen Xiang¶, Jiaheng Zhang§,†, Wenzhi Chen¶§新加坡国立大学,¶浙江大学新加坡,中国lutao, jhzhang@nus\.edu\.sg, whaoyu, zhwang, keshen, chenwz@zju\.edu\.cn (https://arxiv.org/html/2607.08786v1/mailto:lutao,%[email protected],%20whaoyu,%20zhwang,%20keshen,%[email protected])

\(2026\)

###### 摘要

随着大型语言模型(LLM)的广泛部署,LLM推理成本已成为一个关键挑战。通过向权重矩阵引入稀疏性的剪枝技术可以加速推理。然而,保持模型质量通常会将剪枝限制在适度的非结构化稀疏性(约50%)。在这些稀疏性水平下,现有的用于稀疏矩阵乘法(SpMM)的GPU内核都无法超越其稠密对应物。本文提出了一种针对具有适度稀疏性的LLM的高效GPU推理方法。我们提出了一种三层矩阵存储格式,包括:(i) 稀疏张量核心层,使稀疏张量核心能够加速SpMM;(ii) 槽填充层,使用并行差分距离进行矩阵压缩,同时支持低开销的片上解码;(iii) 轻量级残差层,确保正确的SpMM计算。基于此格式,我们设计了一个联合利用稀疏张量核心和CUDA核心的SpMM内核。该设计实现了高效的执行流水线,并使片上计算与内存访问重叠。评估表明,我们的工作是第一个在现代配备高带宽内存(HBM)的GPU上超越稠密矩阵乘法的工作。它在内核级别上实现了高达1.64×的加速比(相较于SpInfer,EuroSys’25最佳论文),并在端到端推理中实现了高达1.41×的加速比(相较于FlashLLM,VLDB’24)。我们的源代码:https://github.com/moui0/cudac。

††期刊年份:2026††版权:cc††会议:第63届ACM/IEEE设计自动化会议;2026年7月26-29日;美国加利福尼亚州长滩††书籍标题:第63届ACM/IEEE设计自动化会议(DAC ’26),2026年7月26-29日,美国加利福尼亚州长滩††doi:10.1145/3770743.3804227††isbn:979-8-4007-2254-7/2026/07## 1. 引言

随着大型语言模型(LLM)(Radford等人,2019 (https://arxiv.org/html/2607.08786#bib.bib45);Vaswani等人,2017 (https://arxiv.org/html/2607.08786#bib.bib8);Zhang等人,2022 (https://arxiv.org/html/2607.08786#bib.bib39);Guo等人,2025 (https://arxiv.org/html/2607.08786#bib.bib40))在自然语言理解、文本生成和代码补全等应用中的日益普及,LLM推理的高昂计算成本已成为一个关键问题。为了缓解这一问题,最近的工作,如SparseGPT(Frantar和Alistarh,2023 (https://arxiv.org/html/2607.08786#bib.bib2))、Wanda(Sun等人,2023 (https://arxiv.org/html/2607.08786#bib.bib1))和RIA(Zhang等人,2024 (https://arxiv.org/html/2607.08786#bib.bib23)),提出了有效的剪枝策略,从权重矩阵中移除不太重要的值。这些方法旨在加速推理,同时保持模型质量。

然而,与可以引入高稀疏性而对模型质量影响较小的小规模模型不同(Child等人,2019 (https://arxiv.org/html/2607.08786#bib.bib5);Narang等人,2017 (https://arxiv.org/html/2607.08786#bib.bib3)),LLM对高稀疏性水平更为敏感,这会严重降低推理质量。如表1 (https://arxiv.org/html/2607.08786#S1.T1)所示,最先进的剪枝方案(Zhang等人,2024 (https://arxiv.org/html/2607.08786#bib.bib23);Sun等人,2023 (https://arxiv.org/html/2607.08786#bib.bib1))仅在权重矩阵具有适度非结构化稀疏性(通常约为50%)时才能在LLM中取得良好性能。当稀疏性水平超过70%时,模型的困惑度得分(评估语言模型输出质量的关键指标)急剧上升,这表明模型生成连贯且上下文适当响应的能力显著下降。

尽管适度非结构化稀疏性在保持模型质量方面非常有效,但一个主要瓶颈在于,现有的用于稀疏矩阵乘法(SpMM)的GPU内核(Zheng等人,2022 (https://arxiv.org/html/2607.08786#bib.bib10);Gale等人,2020 (https://arxiv.org/html/2607.08786#bib.bib12);Okanovic等人,2024 (https://arxiv.org/html/2607.08786#bib.bib18);Xue等人,2023 (https://arxiv.org/html/2607.08786#bib.bib21);Fan等人,2024 (https://arxiv.org/html/2607.08786#bib.bib16);Li等人,2022 (https://arxiv.org/html/2607.08786#bib.bib14);Wang等人,2022 (https://arxiv.org/html/2607.08786#bib.bib15);Narang等人,2017 (https://arxiv.org/html/2607.08786#bib.bib3);Ye等人,2023 (https://arxiv.org/html/2607.08786#bib.bib19);Wang等人,2023 (https://arxiv.org/html/2607.08786#bib.bib20);Fan等人,2025 (https://arxiv.org/html/2607.08786#bib.bib26))都无法超越其稠密对应物,如cuBLAS(Nvidia,2025b (https://arxiv.org/html/2607.08786#bib.bib25)),即用于稠密矩阵乘法的标准库。这一性能差距表明,尽管剪枝减少了非零权重的数量,但使用当前稀疏GPU内核获得的加速是负的。

表1. 不同稀疏性水平和拓扑结构下,Wanda(Sun等人,2023 (https://arxiv.org/html/2607.08786#bib.bib1))和RIA(Zhang等人,2024 (https://arxiv.org/html/2607.08786#bib.bib23))等著名LLM剪枝方案在WikiText-2数据集上的困惑度得分,得分越低表示性能越好。稀疏性 | 拓扑结构 | 方案 | Llama | Llama | Opt
7B | 13B | 1.3B
稠密 | - | - | 5.47 | 4.88 | 14.6
0% | 非结构化 | Wanda | 7.79 | 6.28 | 18.5
| | RIA | 6.88 | 5.95 | 18.9
2:4 | Wanda | 11.6 | 9.69 | 28.3
| | RIA | 11.3 | 8.44 | 27.4
60% | 非结构化 | Wanda | 15.3 | 9.63 | 38.8
| | RIA | 10.4 | 7.84 | 26.2
70% | 非结构化 | Wanda | 214.9 | 105.0 | 231.2
| | RIA | 68.8 | 52.0 | 98.5

与针对高度稀疏矩阵的SpMM内核不同,加速适度非结构化稀疏性下的SpMM要困难得多。**挑战1:张量核心不兼容。** 现代GPU上的高效张量核心仅支持结构化的2:4稀疏性,使得它们与非零元素不规则分布的非结构化剪枝不兼容。因此,它们无法直接加速此类设置中的SpMM。**挑战2:元数据开销比例高。** 传统的存储格式,如压缩稀疏行(CSR)(Saad,2003 (https://arxiv.org/html/2607.08786#bib.bib50)),需要为每个非零元素存储完整的位置元数据。在适度的稀疏性水平下,特别是约50%时,位置元数据可能占据与非零元素本身一样大的空间。**挑战3:矩阵压缩中的高片上解码开销。** 尽管像基于位图的编码(Fan等人,2025 (https://arxiv.org/html/2607.08786#bib.bib26))这样的矩阵压缩技术有效地减少了元数据存储开销,但它们引入了额外的片上解码工作量。由于大量元数据必须在CUDA核心(而不是更快的张量核心)上解码,在现代配备高带宽内存(HBM)的GPU上,解码过程无法跟上,因为片上计算无法被全局内存访问完全重叠。

参见图注 图1. 配备HBM的NVIDIA H100 GPU上非结构化SpMM实现与cuBLAS的执行时间对比。(M/K/N = 66K/16K/32,这是LLM推理中的典型值)本文中,我们加速了具有适度非结构化稀疏权重矩阵的LLM的GPU推理。我们的方法旨在解决上述三个基本挑战。一方面,我们提出了一种三层矩阵存储格式,包括:(i) 稀疏张量核心层,使稀疏张量核心能够加速SpMM;(ii) 槽填充层,使用并行差分距离进行矩阵压缩,同时支持低开销的片上解码;(iii) 轻量级残差层,确保正确的SpMM计算。基于此格式,我们设计了一个协同优化的SpMM内核,联合利用稀疏张量核心和CUDA核心,利用前者加速结构化矩阵运算,利用后者灵活管理我们存储格式的不规则解码。该设计实现了高效的执行流水线,并使片上计算与内存访问重叠。

以下是我们的贡献总结:

- •我们提出了一种针对适度非结构化稀疏性定制的稀疏矩阵存储格式,解决了GPU上稀疏LLM推理的三个挑战:实现与稀疏张量核心的兼容性、减少元数据开销、以及最小化片上解码成本。
- •我们设计了一个用于适度非结构化稀疏矩阵的SpMM GPU内核,高效地协同利用稀疏张量核心和CUDA核心。其流水线执行将计算与内存访问重叠,从而最大化HBM带宽利用率。
- •我们在SpMM内核和端到端LLM推理中实现了我们的方法。在现代配备HBM的GPU上,我们的方法是第一个超越稠密矩阵乘法的方法。它在内核级别上实现了高达1.64×的加速比(相较于SpInfer,EuroSys’25最佳论文),并在端到端推理中实现了高达1.41×的加速比(相较于FlashLLM,VLDB’24)。

## 2. 背景

### 2.1. 大型语言模型与模型剪枝

大型语言模型(LLM)的推理包含两个阶段:预填充和解码。如图2 (https://arxiv.org/html/2607.08786#S2.F2)所示,预填充阶段处理完整的输入序列以生成第一个输出token,输入形状为\[BL, H\]\[\\mathit{B}\\mathit{L},\\mathit{H}\]。然后解码阶段迭代地以前一个生成的token作为输入,每一步处理一个更薄的矩阵\[B, H\]\[\\mathit{B},\\mathit{H}\]。在这两个阶段中,矩阵乘法主导了计算,构成了LLM推理的核心工作负载。

模型剪枝通过系统地移除权重矩阵中不重要的元素,直接减少了矩阵大小和计算成本。由于剪枝直接针对权重矩阵,稀疏模式可以预先计算并以专用格式存储,从而消除了在模型推理期间进行额外处理的需要。这允许更快的推理执行。

在这项工作中,我们关注使用模型剪枝引入的稀疏模式的LLM,这与量化、混合专家和稀疏注意力方法正交。

参见图注 图2. 具有模型剪枝引入稀疏性的LLM推理工作流程。参见图注 图3. 50%稀疏性水平下不同稀疏矩阵格式的存储成本比较。参见图注 图4. 具有适度非结构化稀疏性的稀疏矩阵的多层存储格式。参见图注 图5. 不同稀疏性下全局内存访问与片上解码延迟的比较。
### 2.2. 现代GPU架构

现代GPU设计用于大规模并行计算,使其在深度学习和大型语言模型(LLM)推理中非常有效。GPU集成了数千个CUDA核心,能够并发执行线程。为了进一步加速AI工作负载,现代GPU整合了张量核心,即针对矩阵运算优化的专用硬件单元。稠密张量核心处理标准矩阵乘法,而稀疏张量核心利用2:4结构化稀疏性将吞吐量几乎翻倍。

内存带宽是另一个关键决定因素。现代GPU采用分层内存架构,包括全局内存、L2缓存和快速的片上共享内存。为了进一步提高数据传输效率,最近的架构将高带宽内存(HBM)集成作为全局内存,提供比传统GDDR内存更高的吞吐量。这种设计使得现代AI工作负载所需的模型权重能够被快速访问。

### 2.3. 现有工作的不足

大量的研究工作(Zheng等人,2022 (https://arxiv.org/html/2607.08786#bib.bib10);Gale等人,2020 (https://arxiv.org/html/2607.08786#bib.bib12);Okanovic等人,2024 (https://arxiv.org/html/2607.08786#bib.bib18);Xue等人,2023 (https://arxiv.org/html/2607.08786#bib.bib21);Wang等人,2022 (https://arxiv.org/html/2607.08786#bib.bib15);Narang等人,2017 (https://arxiv.org/html/2607.08786#bib.bib3);Ye等人,2023 (https://arxiv.org/html/2607.08786#bib.bib19);Wang等人,2023 (https://arxiv.org/html/2607.08786#bib.bib20);Fan等人,2025 (https://arxiv.org/html/2607.08786#bib.bib26))聚焦于加速GPU上的稀疏矩阵乘法。然而,许多GPU内核主要针对科学应用(Dai等人,2022 (https://arxiv.org/html/2607.08786#bib.bib31);Fan等人,2024 (https://arxiv.org/html/2607.08786#bib.bib16),2023 (https://arxiv.org/html/2607.08786#bib.bib32);Hong等人,2019 (https://arxiv.org/html/2607.08786#bib.bib33);Pang等人,2024 (https://arxiv.org/html/2607.08786#bib.bib17))设计,这些应用中的矩阵极其稀疏(超过99%)。为AI工作负载设计的最先进的解决方案包括SparTA(Zheng等人,2022 (https://arxiv.org/html/2607.08786#bib.bib10))、FlashLLM(Xia等人,2023 (https://arxiv.org/html/2607.08786#bib.bib11))和SpInfer(Fan等人,2025 (https://arxiv.org/html/2607.08786#bib.bib26)),每个都提出了一种新颖的稀疏矩阵存储格式及GPU执行方案。

SparTA(Zheng等人,2022 (https://arxiv.org/html/2607.08786#bib.bib10))将非结构化矩阵划分为2:4结构化部分和残差非结构化部分,分别使用cuSPARSELt(Nvidia,2025a (https://arxiv.org/html/2607.08786#bib.bib27))在稀疏张量核心上以及Sputnik(Gale等人,2020 (https://arxiv.org/html/2607.08786#bib.bib12))在CUDA核心上进行加速。然而,在适度稀疏性下,许多不满足2:4模式的非零元素会移动到非结构化部分,导致CUDA核心执行过载。FlashLLM(Xia等人,2023 (https://arxiv.org/html/2607.08786#bib.bib11))稀疏地加载矩阵,但将其转换为稠密形式以在张量核心上执行。虽然这减少了全局内存流量,但其CSL存储在适度稀疏性下引入了大量元数据开销,此时存储大小接近稠密矩阵(图3 (https://arxiv.org/html/2607.08786#S2.F3))。SpInfer(Fan等人,2025 (https://arxiv.org/html/2607.08786#bib.bib26))采用位图编码,用单比特非零指示符替换显式索引,提高了内存访问效率,但引入了显著的片上解码开销,特别是在配备HBM的GPU上,片上计算无法被全局内存访问完全重叠(图5 (https://arxiv.org/html/2607.08786#S2.F5))。

## 3. 存储格式设计

### 3.1. 设计目标

该设计针对三个要求。首先,它旨在减少位置元数据的开销,这些元数据编码了稀疏矩阵中非零元素的位置。其次,该格式必须与稀疏张量核心兼容,后者为GPU上结构化稀疏矩阵运算提供高效的硬件加速。第三,它旨在减少片上解码开销。由于元数据解码由较慢的CUDA核心处理,过度的解码复杂度可能成为主要瓶颈。

### 3.2. 矩阵的多层存储格式

为了实现我们的设计目标,我们为稀疏矩阵开发了一种多层存储格式,如图4 (https:/

相似文章

降低LLM延迟

Reddit r/AI_Agents

用于降低大语言模型延迟、提高推理速度的技术和方法。

推理时上下文稀疏性:幻象还是机遇?

arXiv cs.AI

本文认为,极端的上下文稀疏性是LLM推理的一个有原则且可行的基础,展示了当前模型能够容忍高达100倍的稀疏性而无质量损失,并且稀疏解码内核可以在现有硬件上将处理速度提升10倍。