面向突发性LLM推理的预测性投机KV复制

Hacker News Top 论文

摘要

本文介绍了一种用于处理突发性LLM推理工作负载的预测性投机KV复制方法,代码可在GitHub上获取。

<a href="https:&#x2F;&#x2F;github.com&#x2F;jwlaboratory&#x2F;bite-the-bullet" rel="nofollow">https:&#x2F;&#x2F;github.com&#x2F;jwlaboratory&#x2F;bite-the-bullet</a>
查看原文

相似文章

整体之稀疏一瞥:无需训练的自推测解码

arXiv cs.CL

本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。