@raydistributed: Ray Serve LLM 现在在预填充密集型工作负载上提供4.4倍的更高请求吞吐量,以及在解码密集型工作负载上提供24.8倍的更高请求吞吐量…
摘要
Ray Serve LLM 通过直接流式传输、新的 vLLM V2 执行器后端和 HAProxy 入口,在预填充和解码密集型工作负载上实现了4.4倍和24.8倍的吞吐量提升,现已在 Ray 2.56 中推出,与 Google Cloud 和 vLLM 合作。
查看缓存全文
缓存时间: 2026/06/18 22:11
Ray Serve LLM 现在针对预填充密集型工作负载可将请求吞吐量提升 4.4 倍,针对解码密集型工作负载可将请求吞吐量提升 24.8 倍!
三大核心优化:
- 直接流式传输,通过新增的纯控制平面端点选择器,绕过响应路径上的中间 Ray Serve 部署
- vLLM 中新增的 Ray V2 执行器后端,支持异步调度等优化
- HAProxy 入口,实现 C 语言级别的入口请求路由速度
以上功能均在 Ray 2.56 版本中提供。这是与 @googlecloud 和 @vllm_project 合作的卓越成果!
Seiji Eicher (@seiji_________): 今天,我们很高兴地宣布,与 Google Cloud 的 GKE 团队 (@googlecloud) 合作,Ray Serve LLM 在生产服务能力上达到了一个重大里程碑。Ray Serve LLM 现在已能匹敌基于 Rust 的高性能路由框架(如 vllm-router @vllm_project)的表现。
相似文章
@seiji_________: 今天,我们激动地宣布,与 Google Cloud 的 GKE 团队(@googlecloud)合作,一项重大里程碑……
Ray Serve LLM 在 Ray 2.56 中,对预填充密集型工作负载实现了高达 4 倍的吞吐量提升,对解码密集型工作负载实现了 24 倍的提升,在生产基准测试中与基于 Rust 的路由框架(如 vllm-router)性能相当,这是与 Google Cloud GKE 团队合作宣布的。
@robertnishihara:试试Ray 2.56!
Ray 2.56已发布,包含Ray Data的稳定性改进以及Ray Serve的重构,以提升LLM服务的性能。
@raydistributed: 我们刚刚发布了 Ray 2.56!这包括 - Ray Data 稳定性改进:减少对象存储溢出,自动 ba…
Ray 2.56 已发布,改进了 Ray Data、面向 LLM 的 Ray Serve、GPU 域感知放置组以及 Kubernetes 集成。
@Mayhem4Markets: https://x.com/Mayhem4Markets/status/2069090022117019928
两大主流LLM服务框架SGLang和vLLM的详细技术对比,涵盖KV缓存管理(RadixAttention vs PagedAttention)的架构差异、吞吐量、延迟以及自托管环境的部署考量。
BlockServe: 块粒度连续批处理实现高吞吐扩散大语言模型服务
BlockServe 引入了块粒度连续批处理来解决扩散大语言模型中的收敛异质性,相比 Fast-dLLM 实现了 1.9–10.6 倍的吞吐量提升,同时保持生成质量。