降低LLM延迟

Reddit r/AI_Agents 工具

摘要

用于降低大语言模型延迟、提高推理速度的技术和方法。

暂无内容
查看原文

相似文章

利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

arXiv cs.LG

本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。