@h100envy: 前伯克利博士,在 xAI 领导 SGLang 团队,解释了如何在 23 分钟内用 10 万块 GPU 为 Grok 提供服务——比价值 2000 美元的……更好
摘要
一位在 xAI 领导 SGLang 团队的前伯克利博士,解释了如何使用分离预填充/解码、专家分片以及通信/计算重叠,在 10 万块 GPU 上为 Grok 提供服务,以实现碾压 DeepSeek API 的价格。
查看缓存全文
缓存时间: 2026/07/06 20:20
原伯克利博士、现xAI负责SGLang的负责人,用23分钟在10万张GPU上解释了如何为Grok提供服务——比价值2000美元的规模化推理课程还要好。
分离预填充和解码 -> 将专家分片到各GPU -> 按专家路由token -> 重叠通信与计算 -> 以击穿DeepSeek API的价格提供服务。
正是这一套逻辑,让xAI用SGLang运行Grok,也让第三方服务在成本上比DeepSeek自有API低5倍。
SGLang + 预填充-解耦分离 + 专家并行 + AMD MI300 —— 这就是整个技术栈。
观看并收藏,然后阅读下面的文章。
相似文章
@h100envy: Ying Sheng 共同撰写了 SGLang,该推理引擎现在在 xAI 上为 Grok 服务,运行在十万个 GPU 上。她还构建了 Fle…
Ying Sheng 共同撰写了 SGLang,该推理引擎现在在 xAI 上用十万个 GPU 为 Grok 服务,相比 DeepSeek 的 API 实现了 5 倍的成本削减;她还构建了 FlexGen,并参与构建了 Chatbot Arena。
@VraserX: xAI团队在Grok 4.5上真是做绝了。性价比真的有点疯狂。获得前沿级…
这条推文称赞xAI的Grok 4.5性价比令人印象深刻,使前沿级别的AI推理更易于获取。
@Mahaximus_: 中国开发者:"单一代理总失败。Grok Bot 有效是因为它运行循环和图。" 在20分钟内…
一位中国开发者解析了 Grok Bot 的架构,解释了为什么它使用循环和图而不是单一代理来实现更好的性能。
@elonmusk: Grok
Elon Musk 强调,xAI 的 Grok 4.6 在罕见病诊断的 RareBench 中登顶,以约三分之一的成本击败了 Claude Opus 5,而 DeepSeek 的新模型则表现不佳。
@PyTorch: SGLang 为 DeepSeek-V4 提供了首日支持,而 @lmsysorg 与 @NVIDIAAI 工程团队的合作…
SGLang 为 DeepSeek-V4 提供了首日支持,LMSys 与 NVIDIA 工程团队的合作在生产环境中实现了高达 5 倍的吞吐量提升,相关改进已在 SemiAnalysis InferenceX 仪表盘上展示。