@m_sirovatka: KV Cache 重用是代理工作负载推广中最重要的部分。我们已经将 Mooncake Store 集成到 prime-rl 中,与 vL…
摘要
vLLM 集成了 Mooncake Store 用于分布式 KV 缓存重用,支持跨节点前缀缓存,高效服务具有高令牌重用的代理工作负载。
查看缓存全文
缓存时间: 2026/06/03 21:55
KV 缓存复用是代理型部署中最关键的部分。我们已经将 Mooncake Store 集成到 prime-rl 与 vLLM 中,现在你可以将其作为原生 CPU/磁盘卸载的即插即用替代方案,实现跨节点前缀缓存复用,让你的代理飞速运行 🚀
vLLM (@vllm_project): 🚀 @vllm_project 博客新文章:使用 vLLM × Mooncake 大规模服务代理型工作负载。
代理型追踪会增长到 80K+ token,其中 94%+ 是可复用前缀,但本地 KV 缓存会将其驱逐,跨实例路由也无法命中。
通过将 Mooncake Store 集成为分布式 KV
相似文章
@KVCache_AI: Mooncake现在支持KV缓存的SSD卸载。随着智能体工作负载成为常态,KV缓存的生存时间正在…
Mooncake宣布支持KV缓存的SSD卸载,能够经济高效地将KV缓存容量扩展到DRAM之外,适用于长时间运行的智能体工作负载。分析显示,双峰复用模式使得分层存储更加高效。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2074502882812952666
一份关于KV缓存管理的实践指南,介绍开源LMCache架构,该架构通过消除代理工作流中的冗余上下文处理,将输入令牌成本降低90%,并将LLM推理速度提升高达14倍。
ReCache:面向工具增强LLM代理的高效KV缓存重用与压缩
ReCache是一个用于工具增强LLM代理中高效KV缓存重用与压缩的框架,在保持性能的同时实现显著的加速和内存减少。
@Alacritic_Super: 想要掌握LLM缓存管理?从这些资源开始。KV缓存:https://huggingface.co/docs/transformers/mai…
精心整理的资源列表,用于掌握LLM缓存管理,包括关于KV缓存、前缀缓存及相关技术的解释、教程和研究论文。
KV Packet: 免重计算的上下文无关KV缓存用于大语言模型
KV Packet 提出了一种免重计算的缓存复用框架,用于大语言模型。该框架使用可训练的软标记适配器来弥合上下文不连续性,消除了开销,同时在 Llama-3.1 和 Qwen2.5 上的性能与完全重计算基线相当。