标签
加州大学圣地亚哥分校Hao AI实验室的博客清晰解释了DistServe的Prefill Decode分离技术,追溯了该技术从2024年到2025年的被接受过程,并关联了NVIDIA Dynamo、llm-d、Ray Serve LLM、LMCache和MoonCake等相关技术,是学习LLM推理的绝佳起点。