@h100envy: Ying Sheng 共同撰写了 SGLang,该推理引擎现在在 xAI 上为 Grok 服务,运行在十万个 GPU 上。她还构建了 Fle…
摘要
Ying Sheng 共同撰写了 SGLang,该推理引擎现在在 xAI 上用十万个 GPU 为 Grok 服务,相比 DeepSeek 的 API 实现了 5 倍的成本削减;她还构建了 FlexGen,并参与构建了 Chatbot Arena。
查看缓存全文
缓存时间: 2026/06/20 14:38
盛英是SGLang的合著者,该推理引擎如今在xAI的十万块GPU上为Grok提供支持。
她还构建了FlexGen,让一个1750亿参数的模型能在单块消费级GPU上运行,并协助搭建了Chatbot Arena。
整个领域使用的三件工具,出自同一位研究者之手。SGLang将成本压到DeepSeek自身API的五分之一,已有十余个团队复现了它。
所有人都在争论模型。而她构建的引擎,让这些模型真正能以足够低廉的成本部署并存活下来。
相似文章
@h100envy: 前伯克利博士,在 xAI 领导 SGLang 团队,解释了如何在 23 分钟内用 10 万块 GPU 为 Grok 提供服务——比价值 2000 美元的……更好
一位在 xAI 领导 SGLang 团队的前伯克利博士,解释了如何使用分离预填充/解码、专家分片以及通信/计算重叠,在 10 万块 GPU 上为 Grok 提供服务,以实现碾压 DeepSeek API 的价格。
@zodchiii: xAI 与 Grok 工程师:"在 xAI,95% 的开发者正在使用 AI 代理循环,这使他们的发布速度提升了 10 倍,现在每一次..."
一位 xAI 工程师透露,95% 的开发者使用 AI 代理循环来加速产品发布 10 倍,每位工程师运行 10-20 个 GrokBot 代理以自动化日常任务。
@PyTorch: SGLang 为 DeepSeek-V4 提供了首日支持,而 @lmsysorg 与 @NVIDIAAI 工程团队的合作…
SGLang 为 DeepSeek-V4 提供了首日支持,LMSys 与 NVIDIA 工程团队的合作在生产环境中实现了高达 5 倍的吞吐量提升,相关改进已在 SemiAnalysis InferenceX 仪表盘上展示。
@JiaZhihao: 我认为这归结为一个经典的系统权衡:通用性与专业化。vLLM/SGLang 覆盖了巨大的…空间
这篇文章讨论了AI推理引擎中通用性与专业化的权衡,以vLLM和SGLang为例,并指出编码代理正在降低创建专用引擎的工程成本。
@sgl_project: 我们刚刚为 DeepSeek-V4-Flash-Vision 和 DeepSeek-V4-Flash-0731 在 2x DGX Spark 上添加了指南。 https://docs.sglang.io/coo…
SGLang 已经为 DeepSeek-V4-Flash-Vision 和 DeepSeek-V4-Flash-0731 模型在 2x DGX Spark 硬件上添加了部署指南,支持多种配置和优化。