@raydistributed: 我们刚刚发布了 Ray 2.56!这包括 - Ray Data 稳定性改进:减少对象存储溢出,自动 ba…
摘要
Ray 2.56 已发布,改进了 Ray Data、面向 LLM 的 Ray Serve、GPU 域感知放置组以及 Kubernetes 集成。
我们刚刚发布了 Ray 2.56!这包括 - Ray Data 稳定性改进:减少对象存储溢出,自动批次大小选择 - Ray Serve LLM 重新架构:将请求处理与令牌流式响应路径解耦,LLM 服务性能改进,新的路由策略如通过一致性哈希实现会话粘性路由 - Ray Core GPU 域感知放置组:使放置组能够将捆绑包打包到共享 http://ray.io/gpu-domain 标签的节点上,而不是仅在单节点级别打包 - Kubernetes 集成:为 Autoscaler v2 提供初始的 Kubernetes 原地调整 Pod 大小支持
相似文章
@robertnishihara:试试Ray 2.56!
Ray 2.56已发布,包含Ray Data的稳定性改进以及Ray Serve的重构,以提升LLM服务的性能。
@raydistributed: Ray Serve LLM 现在在预填充密集型工作负载上提供4.4倍的更高请求吞吐量,以及在解码密集型工作负载上提供24.8倍的更高请求吞吐量…
Ray Serve LLM 通过直接流式传输、新的 vLLM V2 执行器后端和 HAProxy 入口,在预填充和解码密集型工作负载上实现了4.4倍和24.8倍的吞吐量提升,现已在 Ray 2.56 中推出,与 Google Cloud 和 vLLM 合作。
@seiji_________: 今天,我们激动地宣布,与 Google Cloud 的 GKE 团队(@googlecloud)合作,一项重大里程碑……
Ray Serve LLM 在 Ray 2.56 中,对预填充密集型工作负载实现了高达 4 倍的吞吐量提升,对解码密集型工作负载实现了 24 倍的提升,在生产基准测试中与基于 Rust 的路由框架(如 vllm-router)性能相当,这是与 Google Cloud GKE 团队合作宣布的。
@raydistributed: 在Snowflake上试用基于Ray的批量推理
Snowflake现在支持基于Ray的作业级批量推理,通过单一API调用即可在数百万非结构化数据点上执行分布式GPU,从而扩展模型推理。
@anyscalecompute:在本节课中,您将学到:- 使用Ray构建和扩展数据管道 - 什么是视频数据筛选 - 大规模流式传输…
Anyscale正在举办一场动手虚拟实验室课程,教授开发者如何使用Ray构建和扩展数据管道,涵盖视频数据筛选、分布式GPU推理以及CPU/GPU流式管道。