量化是否会影响MTP的草案率?

Reddit r/LocalLLaMA 论文

摘要

本文探讨了量化是否会影响多token预测模型中的草案率,并分析了模型压缩与推理效率之间的潜在权衡。

暂无内容
查看原文

相似文章

量化MTP KV缓存 = 免费午餐?

Reddit r/LocalLLaMA

在llama.cpp中将Qwen模型的多令牌预测(MTP)KV缓存量化为q8_0,可以减少VRAM使用,同时不影响推理速度或接受率,实际上为内存受限的配置提供了'免费午餐'。

研究机器翻译高效推理部署中的量化权衡

arXiv cs.CL

本文研究了在单块GPU上部署EuroLLM和Hy-MT2等翻译模型时的量化权衡,表明将文档分块策略与W4A8/W8A8量化相结合能够改善延迟-吞吐量权衡,同时引入文档级评估来考察长上下文动态。

K-Quantization 及其对输出性能的影响

arXiv cs.CL

本文研究了不同量化级别(2位到8位)对八个大型语言模型在推理、代码理解和阅读理解任务上的性能影响,发现虽然更高精度通常带来更好的性能,但激进量化通常能保持可接受的准确率,且更大的模型展现出更强的韧性。