@kazukifujii: 加州大学圣地亚哥分校Hao AI实验室的博客非常清晰地解释了DistServe的Prefill Decode分离的实用性…
摘要
加州大学圣地亚哥分校Hao AI实验室的博客清晰解释了DistServe的Prefill Decode分离技术,追溯了该技术从2024年到2025年的被接受过程,并关联了NVIDIA Dynamo、llm-d、Ray Serve LLM、LMCache和MoonCake等相关技术,是学习LLM推理的绝佳起点。
查看缓存全文
缓存时间: 2026/06/28 06:01
UC San Diego Hao AI Lab 的博客对 DistServe 的预填充-解码分离(Prefill Decode Disaggregation)的实用性进行了非常清晰的解释,同时回顾了从 2024 年 DistServe 提出到 2025 年底,PD 分离是如何被逐渐接受的,这使得文章非常有趣。
它还提到了与 2025 年备受关注的技术之间的联系,例如 NVIDIA Dynamo、llm-d、Ray Serve LLM、LMCache 和 MoonCake,因此对于刚开始研究 LLM 推理的人来说,这似乎是一个不错的起点。
博客:
相似文章
@kazukifujii: 樱花互联网的Michishita-san的文章全面总结了LLM推理,强烈推荐。它涵…
本文总结了Junda Chen关于LLM分解推理的演讲,解释了为什么goodput(满足延迟SLO的吞吐量)比原始吞吐量更重要,以及分离预填充和解码阶段如何提升性能。文章还强调了其对NVIDIA Dynamo的影响。
@robertnishihara: 关于PD分离的一些直觉——PD不会加速预填充,实际上可能损害TTFT——PD的真正…
这篇来自Anyscale的博客文章解释了LLM服务中Prefill-Decode(PD)分离的直觉,展示了如何将预填充和解码阶段分配到专用GPU上,在使用Ray和vLLM的AMD MI325X上实现高达2.7倍的有效吞吐量提升和67%的成本节省,同时也讨论了PD分离何时没有帮助。
@_avichawla: LLM推理中的预填充与解码。你是否注意到,LLM的第一个令牌总是需要片刻才出现…
解释LLM推理的两个阶段——预填充和解码,详细说明GPU瓶颈如何从预填充时的计算受限转变为解码时的内存受限,以及KV缓存的重要性。
@CyrusHakha:我们在大规模服务LLM的客户中反复看到一种模式:预填充-解码分离常被当作一根魔杖……
基于客户模式,讨论大规模LLM服务中预填充-解码分离的微妙现实,并在AMD + vLLM上进行了验证。
[开源] dlmserve —— 首个扩散语言模型服务引擎
dlmserve 是首个面向扩散语言模型的开源服务引擎,提供兼容 OpenAI 的 API、持续批处理功能,在 12GB VRAM 内即可运行,吞吐量是 Hugging Face 的 2.5 倍。