@JunchenJiang: 我很高兴最近做了三场主题演讲,一场在ISCA'26第三届HotInfra研讨会(由Jian Huang教授主办)……
摘要
Junchen Jiang发表了三次主旨演讲,认为KV缓存是LLM推理中被低估的资产,能够节省成本、降低延迟并提升质量,应被视为未来推理基础设施中的核心数据层。
查看缓存全文
缓存时间: 2026/06/30 23:48
最近我有幸做了三场主旨报告:一场是在ISCA’26第三届HotInfra研讨会(由黄建教授主持),一场是在UIUC系统组静修会(由@tianyin_xu主持),还有一场是CMU客座讲座(由李磊教授主持)。
核心信息很简单:KV缓存远不止是可缓存中间状态。
它是让推理系统变得智能的关键。
- 如果缓存了,能节省成本、降低延迟。
- 如果分析了,能揭示模型如何关注和理解上下文。
- 如果优化了,不仅能提升性能,还能改善输出质量。
它不是负担,而是资产——(几乎)总是越多越好。
这正是业界大多数人仍低估的地方,尽管技术已经就绪:KV缓存压缩、混合、语义复用、跨模型共享、注意力引导、基于KV缓存的检索等等。
差距不在于想象力,而在于产品化。
KV缓存将成为未来推理基础设施中核心的AI原生数据层——不仅仅是存储的对象,更是我们管理、分析和优化的对象。
#KVCache #LMCache #LLMInference #Tensormesh #vLLM #SGLang #MLSys #HotInfra
相似文章
@JunchenJiang:这会终止关于压缩KV缓存可能会搞砸LLM推理的争论吗?
这条推文质疑一项新发现是否能够解决关于压缩KV缓存是否损害LLM推理性能的争论。
KV缓存正成为推理的内存层级结构
文章讨论了KV缓存如何演变为LLM推理的内存层级结构,优化解码过程中的内存管理。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2074502882812952666
一份关于KV缓存管理的实践指南,介绍开源LMCache架构,该架构通过消除代理工作流中的冗余上下文处理,将输入令牌成本降低90%,并将LLM推理速度提升高达14倍。
@yukangchen_: 我们很高兴分享一篇新的技术文章《KV缓存压缩及其基础设施问题》。https://research.nvidia.…
NVIDIA Research发布了一篇技术博客,探讨KV缓存压缩技术及其基础设施问题,包括FlashAttention和paged attention如何为长上下文LLM的生产部署带来实际障碍,并提出了一个使用RoPE的几何解决方案。
@songhan_mit:探索我们在KV缓存压缩方面的持续努力:
来自Song Han的一条推文强调了在KV缓存压缩方面的持续工作,其中介绍了Weian Mao的一篇博客,讨论了论文中常常被忽视的系统级方面。