@techNmak: 你的LLM推理正在消耗50%的计算资源在已经完成的工作上。如果你正在运行RAG或多轮对话,……
摘要
LMCache是一个开源库,它使KV缓存持久化并可在请求之间共享,消除了RAG和多轮对话工作负载中的重复计算,实现了高达15倍的吞吐量提升和3-10倍的首令牌时间减少。
你的LLM推理正在浪费50%的计算资源在已经完成的工作上。
如果你正在运行RAG或多轮对话,你正在一遍又一遍地重复计算相同文档的KV缓存。
我找到了一个在基础设施层面解决这个问题的开源库。它叫LMCache。
它将KV缓存从临时状态转变为可复用的AI原生知识——持久化、可共享、且与存储无关。
AI基础设施的“作弊码”
LMCache没有在请求结束时让缓存失效,而是将其卸载到共享层——CPU、磁盘、Redis、Cloud Bigtable,或VAST、DDN等企业存储。
这解锁了以前不可能实现的架构模式:
1/ 即时RAG
一次性处理100页的PDF。存储KV缓存。之后针对该文档的每次查询都以接近零的TTFT开始。
2/ 分离式服务
在H100上运行繁重的预填充。将缓存流式传输到更便宜的L4进行解码。只在必要的地方支付H100的价格。
3/ 上下文共享
1000个用户询问同一个文档?只计算一次。从缓存服务所有人。
4/ 多引擎自由
兼容vLLM、SGLang等,并且可以在它们之间切换而不会丢失存储的缓存。完全供应商中立。
多轮问答工作负载中实现15倍的吞吐量提升
首令牌时间减少3-10倍
谁已经在押注这项技术?
Netflix、Samsung、Google Cloud、AWS、腾讯、Hugging Face、NVIDIA、Intel、Cohere。
别再让你的GPU做两次相同的作业了。
这是GitHub仓库:https://github.com/LMCache/LMCache
查看缓存全文
缓存时间: 2026/06/24 16:27
可扩展LLM推理的KV缓存管理层
博客 | 文档 | 加入Slack | 社区会议 | 路线图
相似文章
LMCache/LMCache
LMCache 是一个开源的KV缓存管理层,用于LLM推理,通过支持跨推理引擎持久化存储和复用KV缓存,减少首Token延迟并提升吞吐量。
@h100envy: 前vLLM核心贡献者用34分钟解释如何将LLM推理成本降低10倍——比$3000的推理优化训练营更有效
一位前vLLM核心贡献者解释了如何通过LMCache将KV缓存卸载到CPU/SSD/远程存储,从而使LLM推理成本降低10倍,这一技术已被彭博等生产环境采用。
@Alacritic_Super: 如果你在构建生产级 LLM 应用,学习 LLM 缓存。缓存可降低延迟、GPU 利用率和 AP…
本文强调了在生产系统中使用 LLM 缓存的重要性,以减少延迟、GPU 利用率和成本,并介绍了 LMCache,这是一个用于可扩展 LLM 推理的开源 KV 缓存管理层。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2074502882812952666
一份关于KV缓存管理的实践指南,介绍开源LMCache架构,该架构通过消除代理工作流中的冗余上下文处理,将输入令牌成本降低90%,并将LLM推理速度提升高达14倍。
@akshay_pachaar:每个推理引擎都犯了同样的错误。像 vLLM 或 SGLang 这样的推理引擎,是位于你的请求与模型权重之间的软件……
LMCache 是一个开源的 KV 缓存管理层,它将缓存 I/O 与计算分离,可插入 vLLM、SGLang 和 TensorRT-LLM,通过并行化缓存查找和共享 GPU 内存,实现高达 14 倍的首 token 延迟降低和 4 倍的解码加速。