prefill-decode-disaggregation

标签

Cards List
#prefill-decode-disaggregation

ELDR: 专家局部性感知的解码路由用于PD分离的MoE服务

Hugging Face Daily Papers · 2026-07-01 缓存

ELDR是一种专家局部性感知的解码路由器,用于预填充-解码分离的混合专家(MoE)服务。它通过预填充签名预测专家激活,并路由请求以最小化延迟。该路由器已在vLLM中实现,在多达40个GPU上实现了中位数TPOT降低5.9%至13.9%。

0 人收藏 0 人点赞
#prefill-decode-disaggregation

@kazukifujii: 加州大学圣地亚哥分校Hao AI实验室的博客非常清晰地解释了DistServe的Prefill Decode分离的实用性…

X AI KOLs Timeline · 2026-06-27 缓存

加州大学圣地亚哥分校Hao AI实验室的博客清晰解释了DistServe的Prefill Decode分离技术,追溯了该技术从2024年到2025年的被接受过程,并关联了NVIDIA Dynamo、llm-d、Ray Serve LLM、LMCache和MoonCake等相关技术,是学习LLM推理的绝佳起点。

0 人收藏 0 人点赞
#prefill-decode-disaggregation

@robertnishihara: 关于PD分离的一些直觉——PD不会加速预填充,实际上可能损害TTFT——PD的真正…

X AI KOLs Following · 2026-06-17 缓存

这篇来自Anyscale的博客文章解释了LLM服务中Prefill-Decode(PD)分离的直觉,展示了如何将预填充和解码阶段分配到专用GPU上,在使用Ray和vLLM的AMD MI325X上实现高达2.7倍的有效吞吐量提升和67%的成本节省,同时也讨论了PD分离何时没有帮助。

0 人收藏 0 人点赞
#prefill-decode-disaggregation

@Zai_org: https://x.com/Zai_org/status/2057216685040443743

X AI KOLs Timeline · 2026-05-20 缓存

本文介绍了ZCube,一种由Z.ai、Harnets.AI和清华大学提出的新型网络架构,用于解决Prefill-Decode分离式LLM推理集群中由拓扑引起的拥塞问题。在GLM-5.1编码工作负载的生产部署中,网络CapEx降低了33%,吞吐量提升了15%,TTFT P99延迟降低了40.6%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈