@googledevs: 重大消息:@Google 和 @RadixArk 合作,将 @sgl_project 引入 Google Cloud TPU!今天即可在 TPU 上运行 SGLang,通过…
摘要
Google Cloud 和 RadixArk 合作,将开源推理框架 SGLang 引入 Google Cloud TPU,初期通过 SGL-JAX,后续推出 SGL-torchtpu 提供原生 PyTorch 支持,让开发者能够无缝在 GPU 和 TPU 上运行生产工作负载。
查看缓存全文
缓存时间: 2026/07/30 17:56
重磅消息:@Google与@RadixArk达成合作,将@SGL项目(sgl_project)引入Google Cloud TPU!
即日起可通过SGL-JAX在TPU上运行SGLang
即将推出:面向PyTorch原生体验的SGL-torchtpu
无需再承担迁移成本——为开发者提供极致灵活性
了解更多:https://goo.gle/3U2JVOC
#GoogleCloud #TPU #SGLang #AI #开发者关系
RadixArk携谷歌将SGLang完整功能部署至TPU
来源:https://www.lmsys.org/blog/2026-07-30-sglang-google-tpu RadixArk与Google Cloud合作,将SGLang(https://github.com/sgl-project/sglang)引入TPU,为开发者提供在自选硬件上运行工作负载的极致灵活性。
SGLang是一个专为高吞吐量和低延迟生产环境设计的开源推理框架。其GitHub星标超3万,贡献者逾1700人,每日在全球数十万GPU上运行,并生成数万亿Token。RadixArk(https://www.radixark.com/)是SGLang项目的维护方。
目前,开发者可通过SGL-JAX(https://github.com/sgl-project/sglang-jax)在最新TPU型号上运行SGLang,支持主流大语言模型和多模态模型系列(包括Gemma、Qwen、DeepSeek、GLM、Mimo、Kimi、Ling、MiniMax、Grok),以及视频与图像生成扩散模型(如Wan、Flux)。今年晚些时候,RadixArk将推出SGL-torchtpu作为额外的PyTorch原生TPU后端,具备即时执行、PyTorch生态系统兼容性及MPMD支持。它使任何AI研究人员或工程师都能使用标准PyTorch工具,在谷歌TPU上以高性能、可扩展性和尖端特性运行LLM SGLang。包括在多主机TPU上运行完整规模的领先开源模型(质量与已发布基线一致),支持数据、张量、专家、上下文和流水线并行、Radix缓存、HiCache、量化及投机性解码——这些均由RadixArk、谷歌和SGLang社区基于TPU Pallas内核构建。
未来,SGLang将实现新开源模型在TPU上运行的“GPU同日支持”,并将这种Day 0支持扩展到每一代新TPU。
上述举措使TPU成为前沿推理的即插即用、高性价比路径。团队可使用与GPU相同的SGLang API和功能,根据工作负载需求和性价比自由选择硬件。
“RadixArk的使命是让前沿AI基础设施对每位开发者开放且可及。SGLang正是这一理念的体现,我们很高兴能与Google Cloud合作,将其性能与灵活性带入TPU生态系统。”——RadixArk首席执行官应晟(Ying Sheng)表示。
“要真正加速前沿AI创新,开发者必须能够自由选择和使用性能、可靠性、可扩展性及成本更优的AI训练与服务平台。”谷歌核心ML/AI工程副总裁Bill Jia表示,“我们与RadixArk的合作是实现可编程异构愿景的关键一步——软件作为开放桥梁而非锁定机制。通过将SGLang的高吞吐服务框架引入谷歌TPU,我们有效消除了开发者的‘迁移成本’,使他们能无缝在自选硬件(如GPU、TPU)和AI框架(如PyTorch、JAX)之间,使用完全相同的SGLang推理API运行生产工作负载。”
SGL-JAX由RadixArk与SGLang社区联合开发,现已上线github.com/sgl-project/sglang-jax(https://github.com/sgl-project/sglang-jax)。
SGL家族始终欢迎新贡献者共同构建开放、高性能的服务引擎!
相似文章
@googledevs:构建、训练、推理。全新 TPU 开发者中心现已上线。一站式获取文档和框架指南,用于构建…
谷歌推出了 TPU 开发者中心,这是一个集中式资源,包含在 Google Cloud TPU 上构建、训练和提供 AI 服务的文档和框架指南,支持 JAX、PyTorch 和 vLLM。
@yifandotqiao: 是的,TPU。因为它在那里。
Google Cloud 与 Inferact 宣布合作优化 vLLM for TPU,使其成为开放模型生态系统中代理生产服务的一流选择。
@googledevs:Tunix 重大更新,助力规模化 Agentic RL 训练。新的异步解耦式回滚引擎解决了多轮交互瓶颈……
谷歌宣布其训练后优化库 Tunix 迎来重大更新,推出了异步解耦式回滚引擎,用于在 JAX/TPU 上规模化实施基于智能体的强化学习,消除空闲时间,提升吞吐量。
@sgl_project:SGLang很荣幸能成为Miles的原生rollout引擎。我们致力于让token持续流转,让GPU保持忙碌状态...
SGLang正式宣布成为Miles v0.1的原生rollout引擎。Miles是一个针对大语言模型与多模态模型的开源强化学习框架,旨在提升大规模强化学习训练中的吞吐量、缓存效率与稳定性。
从 RTX 到 Spark:NVIDIA 加速 Gemma 4 赋能本地智能体 AI
NVIDIA 与谷歌合作优化 Gemma 4 模型,以实现在 RTX GPU、DGX Spark 和 Jetson 设备上的本地部署,从而支持高效的端侧智能体 AI,具备推理、编程、多模态能力以及 35 多种语言的支持。