@_akhaliq: SpenseGPT 实用的一次性剪枝方法,支持大语言模型推理中的稀疏和密集 GEMM

X AI KOLs Following 论文

摘要

SpenseGPT 提出了一种实用的一次性剪枝方法,用于大语言模型,可在推理过程中同时支持稀疏和密集的 GEMM,提升效率。

SpenseGPT 实用的一次性剪枝方法,支持大语言模型推理中的稀疏和密集 GEMM https://t.co/0R0wPqMqpT
查看原文
查看缓存全文

缓存时间: 2026/06/14 00:18

SpenseGPT

实用的一次性剪枝,实现LLM推理中的稀疏与密集GEMM https://t.co/0R0wPqMqpT

相似文章

利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

arXiv cs.LG

本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。

TriSP: 三信号结构化剪枝用于大语言模型

arXiv cs.AI

TriSP 提出了一种三信号重要性度量,结合权重幅度、激活范数和梯度敏感性,用于大语言模型的结构化剪枝,在 LLaMA-7B 上实现了最低困惑度和高吞吐量提升。