@songhan_mit:探索我们在KV缓存压缩方面的持续努力:
摘要
来自Song Han的一条推文强调了在KV缓存压缩方面的持续工作,其中介绍了Weian Mao的一篇博客,讨论了论文中常常被忽视的系统级方面。
探索我们在KV缓存压缩方面的持续努力:
查看缓存全文
缓存时间: 2026/06/15 19:06
探索我们在 KV 缓存压缩方面的持续努力:
Weian Mao (@WeianMaoX): 🔗 我们的新博客深入探讨了论文通常忽略的 KV 缓存效率的一个方面:https://t.co/GXo228eJtf 这里的大多数工作都是关于算法的:例如,驱逐论文的重点是哪些条目值得保留。但算法只有在底层系统能够
相似文章
@yukangchen_: 我们很高兴分享一篇新的技术文章《KV缓存压缩及其基础设施问题》。https://research.nvidia.…
NVIDIA Research发布了一篇技术博客,探讨KV缓存压缩技术及其基础设施问题,包括FlashAttention和paged attention如何为长上下文LLM的生产部署带来实际障碍,并提出了一个使用RoPE的几何解决方案。
@che_shr_cat: 1/ 多年来我们一直通过头部共享(GQA/MQA)来优化KV缓存,但我们忽略了一个基本假设:为什么……
这条推文挑战了关于Transformer需要独立的Q、K和V投影的基本假设,提出合并它们可以为KV缓存带来巨大的内存节省。
面向长上下文服务的KV-Cache优化:任务质量与系统性能的基准测试
本文提出了一个负载感知的基准测试,在长上下文LLM服务任务上比较了KV-cache压缩技术(量化、剪枝、合并),发现仅压缩比不足以预测性能,并倡导负载感知的选择。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2074502882812952666
一份关于KV缓存管理的实践指南,介绍开源LMCache架构,该架构通过消除代理工作流中的冗余上下文处理,将输入令牌成本降低90%,并将LLM推理速度提升高达14倍。
DKV: 用于本地LLM推理的开源KV-cache压缩框架(CLI + 技术报告)
DKV是一个开源框架,用于在本地LLM推理过程中压缩KV-cache,提供CLI和技术报告。