@techNmak: 你的LLM推理正在消耗50%的计算资源在已经完成的工作上。如果你正在运行RAG或多轮对话,……

X AI KOLs Timeline 工具

摘要

LMCache是一个开源库,它使KV缓存持久化并可在请求之间共享,消除了RAG和多轮对话工作负载中的重复计算,实现了高达15倍的吞吐量提升和3-10倍的首令牌时间减少。

你的LLM推理正在浪费50%的计算资源在已经完成的工作上。 如果你正在运行RAG或多轮对话,你正在一遍又一遍地重复计算相同文档的KV缓存。 我找到了一个在基础设施层面解决这个问题的开源库。它叫LMCache。 它将KV缓存从临时状态转变为可复用的AI原生知识——持久化、可共享、且与存储无关。 AI基础设施的“作弊码” LMCache没有在请求结束时让缓存失效,而是将其卸载到共享层——CPU、磁盘、Redis、Cloud Bigtable,或VAST、DDN等企业存储。 这解锁了以前不可能实现的架构模式: 1/ 即时RAG 一次性处理100页的PDF。存储KV缓存。之后针对该文档的每次查询都以接近零的TTFT开始。 2/ 分离式服务 在H100上运行繁重的预填充。将缓存流式传输到更便宜的L4进行解码。只在必要的地方支付H100的价格。 3/ 上下文共享 1000个用户询问同一个文档?只计算一次。从缓存服务所有人。 4/ 多引擎自由 兼容vLLM、SGLang等,并且可以在它们之间切换而不会丢失存储的缓存。完全供应商中立。 多轮问答工作负载中实现15倍的吞吐量提升 首令牌时间减少3-10倍 谁已经在押注这项技术? Netflix、Samsung、Google Cloud、AWS、腾讯、Hugging Face、NVIDIA、Intel、Cohere。 别再让你的GPU做两次相同的作业了。 这是GitHub仓库:https://github.com/LMCache/LMCache
查看原文
查看缓存全文

缓存时间: 2026/06/24 16:27

可扩展LLM推理的KV缓存管理层

博客 | 文档 | 加入Slack | 社区会议 | 路线图

相似文章

LMCache/LMCache

GitHub Trending (daily)

LMCache 是一个开源的KV缓存管理层,用于LLM推理,通过支持跨推理引擎持久化存储和复用KV缓存,减少首Token延迟并提升吞吐量。