@_akhaliq: SpenseGPT 实用的一次性剪枝方法,支持大语言模型推理中的稀疏和密集 GEMM
摘要
SpenseGPT 提出了一种实用的一次性剪枝方法,用于大语言模型,可在推理过程中同时支持稀疏和密集的 GEMM,提升效率。
SpenseGPT
实用的一次性剪枝方法,支持大语言模型推理中的稀疏和密集 GEMM https://t.co/0R0wPqMqpT
查看缓存全文
缓存时间: 2026/06/14 00:18
SpenseGPT
实用的一次性剪枝,实现LLM推理中的稀疏与密集GEMM https://t.co/0R0wPqMqpT
相似文章
持续LLM升级循环:一种用于从稠密到稀疏LLM的预测器门控按组稀疏训练方案
本文提出了一种用于大语言模型的从稠密到稀疏的持续训练方法,采用预测器门控的按组稀疏性实现4倍FFN稀疏度,并在Qwen2.5-8B上通过长上下文训练进行了验证。
PALS:面向大语言模型剪枝的百分位感知层稀疏度方法
PALS根据激活幅度的99百分位数调整大语言模型剪枝中的每层稀疏比,在LLaMA-2-7B上相比均匀稀疏实现了显著困惑度改进,且附加成本可忽略不计。
SHAPE: 面向稀疏混合专家大语言模型的联盟感知专家剪枝
SHAPE提出了一种面向稀疏MoE大语言模型的联盟感知专家剪枝框架,该框架利用路由轨迹上的Shapley式归因来识别关键专家,在20-40%剪枝率下实现了有竞争力的准确率,并降低了GPU内存占用。
利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理
本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。
TriSP: 三信号结构化剪枝用于大语言模型
TriSP 提出了一种三信号重要性度量,结合权重幅度、激活范数和梯度敏感性,用于大语言模型的结构化剪枝,在 LLaMA-7B 上实现了最低困惑度和高吞吐量提升。