@venkat_systems: 推理不仅仅是GPU/加速器的问题。热路径中未经优化的CPU工作会极大影响性能。v0.…
摘要
Venkat 解释道,热路径中未经优化的CPU工作会严重影响推理性能,并介绍了他在 mooncake 中提交的PR,该PR添加了一个内存池,用于实现无锁、无分配的操作,使 vLLM 和 SGL 项目受益。
查看缓存全文
缓存时间: 2026/06/20 14:38
推理不仅仅是GPU/加速器的问题。热路径中未优化的CPU工作会显著影响性能。@Kimi_Moonshot 的 mooncake v0.3.11 包含了我对该仓库的第一个 PR。
在性能至关重要的地方,无锁编程模式不断被重复采用。LMAX 率先实现了这一点:预分配的环形缓冲区、无锁CAS序列、热路径中无内存分配。@TigerBeetleDB 也严格遵循这一原则,启动后不再有 malloc 或 free。
我的 PR 1820 引入了一个内存区域(memory arena)。mooncake 在启动时预分配一大块内存,并在每次缓存操作中复用该内存,热路径中不再有内核调用。在 @vllm_project 和 @sgl_project 中启用它,即可免费获得有效吞吐量提升!
每一代 GPU 都会让相同的 CPU 工作占据请求总时间的更大比例。阿姆达尔定律最终会揭示热路径中所有你未曾优化的固定成本。值得提前应对。
相似文章
@akshay_pachaar:每个推理引擎都犯了同样的错误。像 vLLM 或 SGLang 这样的推理引擎,是位于你的请求与模型权重之间的软件……
LMCache 是一个开源的 KV 缓存管理层,它将缓存 I/O 与计算分离,可插入 vLLM、SGLang 和 TensorRT-LLM,通过并行化缓存查找和共享 GPU 内存,实现高达 14 倍的首 token 延迟降低和 4 倍的解码加速。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2087928032904523980
一条科普帖,讲解GPU的工作原理,重点在于主导LLM服务性能的内存-计算不对称性,并说明量化、投机解码和连续批处理等技术如何从这一根本约束出发。
@Alacritic_Super: 如果你在构建生产级 LLM 应用,学习 LLM 缓存。缓存可降低延迟、GPU 利用率和 AP…
本文强调了在生产系统中使用 LLM 缓存的重要性,以减少延迟、GPU 利用率和成本,并介绍了 LMCache,这是一个用于可扩展 LLM 推理的开源 KV 缓存管理层。
@Alacritic_Super: LLM推理的最大瓶颈不是算术运算,而是数据移动。一次乘加运算仅需…
一条科普线程,解释LLM推理的主要瓶颈是数据移动而非计算,并强调了量化、KV缓存优化和FlashAttention等减少内存流量技术的要点。
@_avichawla: LLM推理中的预填充与解码。你是否注意到,LLM的第一个令牌总是需要片刻才出现…
解释LLM推理的两个阶段——预填充和解码,详细说明GPU瓶颈如何从预填充时的计算受限转变为解码时的内存受限,以及KV缓存的重要性。