@lmcache: 𝐋𝐌𝐂𝐚𝐜𝐡𝐞 𝐯𝟎.𝟓.𝟏 𝐢𝐬 𝐡𝐞𝐫𝐞!
摘要
LMCache v0.5.1 已发布,新增对 MiniMax M3 的模型支持,新后端包括 AMD hipFile 和 XPU Docker,支持跨层级预取、Device-DAX L1 拆分、隐藏状态缓存,以及用于 vLLM 集成的算子自动化。
𝐋𝐌𝐂𝐚𝐜𝐡𝐞 𝐯𝟎.𝟓.𝟏 𝐢𝐬 𝐡𝐞𝐫𝐞!
发布亮点:
模型支持——MiniMax M3 通过 EngineKVFormat 实现层级分组,所有分组查询现已整合至此格式。
新后端——AMD hipFile 用于 GDS L1 层级(MP 模式)、带保护的 MUSA MP 句柄包装器,以及 XPU Docker 镜像。
跨层级预取——MP 协调器现在可在需要之前将 KV 从 L2 预取到 L1。
Device-DAX L1 拆分——Device-DAX L1 已与 CPU L1 管理器完全分离,以实现更好的混合层级控制。
隐藏状态缓存——新的 HiddenStateStore 缓存隐藏状态,而不仅仅是 KV。
算子自动化——通过 webhook 自动将 LMCacheEngine 连接注入到 vLLM 的 Pod 中。
衷心感谢所有贡献者!了解更多:
查看缓存全文
缓存时间: 2026/07/07 01:22
一个面向可扩展大语言模型推理的KV缓存管理层
博客 | 文档 | 加入Slack | 社区会议 | 开发路线图
相似文章
@lmstudio: 视觉模型的批处理功能在我们的最新MLX引擎更新中现已进入Beta测试阶段。此更新还带来了主要……
LM Studio 宣布其 MLX 引擎的 Beta 更新,引入了视觉模型的批处理功能和改进的缓存,以加速推理。
@Raullen:Rapid-MLX 0.11.0 发布!让 Apple Silicon 上的本地模型可靠到足以运行你的代理工作流程,而不仅仅是演示…
Rapid-MLX 0.11.0 带来了显著的性能提升,包括前缀缓存和响应缓存,支持新的模型家族,如 HY3 295B MoE 和 Qwen3-Coder-Next 80B,引入了结构化输出,确保有效的工具调用,并添加了与 MCP 服务器的无缝集成,用于自主代理工作流程。
@Prince_Canuma: mlx-vlm v0.6.4 来了!今天开始使用:> uv pip install -U mlx-vlm 5个新模型系列 — MiniMax M3、Kimi K2.5、Un…
mlx-vlm v0.6.4 已发布,支持5个新模型系列、TTS/STT端点,以及包括 TurboQuant 和连续批处理在内的重大性能改进。
LMCache/LMCache
LMCache 是一个开源的KV缓存管理层,用于LLM推理,通过支持跨推理引擎持久化存储和复用KV缓存,减少首Token延迟并提升吞吐量。
@no_stp_on_snek: MiniMax-M3 的 Config-I 量化版本已发布在 MLX 上。2-bit 专家、4-bit 注意力、8-bit 边界与嵌入、f16 路由器。约…
发布了 MiniMax-M3 的 Config-I 量化版本,在 MLX 上使用 2-bit 专家和 4-bit 注意力,将 427B MoE 模型从 869GB 减少到约 167GB,但该量化版本未经测试且需要为 mlx_lm 打补丁。