@lmcache: 𝐋𝐌𝐂𝐚𝐜𝐡𝐞 𝐯𝟎.𝟓.𝟏 𝐢𝐬 𝐡𝐞𝐫𝐞!

X AI KOLs Timeline 工具

摘要

LMCache v0.5.1 已发布,新增对 MiniMax M3 的模型支持,新后端包括 AMD hipFile 和 XPU Docker,支持跨层级预取、Device-DAX L1 拆分、隐藏状态缓存,以及用于 vLLM 集成的算子自动化。

𝐋𝐌𝐂𝐚𝐜𝐡𝐞 𝐯𝟎.𝟓.𝟏 𝐢𝐬 𝐡𝐞𝐫𝐞! 发布亮点: 模型支持——MiniMax M3 通过 EngineKVFormat 实现层级分组,所有分组查询现已整合至此格式。 新后端——AMD hipFile 用于 GDS L1 层级(MP 模式)、带保护的 MUSA MP 句柄包装器,以及 XPU Docker 镜像。 跨层级预取——MP 协调器现在可在需要之前将 KV 从 L2 预取到 L1。 Device-DAX L1 拆分——Device-DAX L1 已与 CPU L1 管理器完全分离,以实现更好的混合层级控制。 隐藏状态缓存——新的 HiddenStateStore 缓存隐藏状态,而不仅仅是 KV。 算子自动化——通过 webhook 自动将 LMCacheEngine 连接注入到 vLLM 的 Pod 中。 衷心感谢所有贡献者!了解更多:
查看原文
查看缓存全文

缓存时间: 2026/07/07 01:22

一个面向可扩展大语言模型推理的KV缓存管理层

博客 | 文档 | 加入Slack | 社区会议 | 开发路线图

相似文章

LMCache/LMCache

GitHub Trending (daily)

LMCache 是一个开源的KV缓存管理层,用于LLM推理,通过支持跨推理引擎持久化存储和复用KV缓存,减少首Token延迟并提升吞吐量。