@PyTorch: SGLang 为 DeepSeek-V4 提供了首日支持,而 @lmsysorg 与 @NVIDIAAI 工程团队的合作…
摘要
SGLang 为 DeepSeek-V4 提供了首日支持,LMSys 与 NVIDIA 工程团队的合作在生产环境中实现了高达 5 倍的吞吐量提升,相关改进已在 SemiAnalysis InferenceX 仪表盘上展示。
查看缓存全文
缓存时间: 2026/06/24 03:57
虽然 SGLang 在首发日即提供了对 DeepSeek-V4 的支持,但 @lmsysorg 与 @NVIDIAAI 工程团队的协作将其实战性能提升到了新高度。
根据公开的 SemiAnalysis InferenceX 仪表盘数据,GB300 解耦通道(DeepSeek-V4 Pro、FP4、8K/1K)在相同交互水平下,吞吐量实现了 5 倍提升——从约 2,200 tok/s/GPU 跃升至约 11,200 tok/s/GPU。这些更新使得在多数部署目标所关注的交互延迟区间内,系统能够持续保持高吞吐能力,同时在 Blackwell Ultra 聚合通道上也带来了 2.9 倍的提升。
完整技术细节见下方评论区:
相似文章
@TheAhmadOsman:DeepSeek V4 Flash 的体量比 GLM 5.2 小约 70%,并且还击败了大约一个月前还是 SoTA 模型的 GLM 5.2…
DeepSeek V4 Flash 的体量比 GLM 5.2 小约 70%,但性能却更胜一筹,这意味着达到最先进水平的 AI 可能比预期更早地在 RTX 5090 等消费级硬件上运行。
@Ex0byt: 更新:通往GLM-5.2之路:我们快到了,各位!未量化、未剪枝的DeepSeek-v4-Flash。单台……上11 tok/s
关于在单台DGX Spark上使用sglang推理和自定义mega-kernel以11 tok/s运行未量化的DeepSeek-v4-Flash模型的更新,正在向GLM-5.2迈进。
针对双GH200优化的DSv4-Flash:SGLang上PP达10,000 tok/s,TG超过300 tok/s
DeepSeek V4 Flash在双GH200工作站上的详细基准测试,比较了SGLang和vLLM在1M上下文长度下使用DSpark投机解码的表现,发现SGLang更快,约为317 tok/s对比276 tok/s。
@PyTorch: LightSeek (@lightseekorg) TokenSpeed 为 Thinking Machines Lab 的 Inkling 模型提供 Day-0 优化的 FP4 推理支持…
LightSeek 的 TokenSpeed 为 Thinking Machines Lab 的 Inkling 模型提供 Day-0 优化的 FP4 推理支持,支持 NVIDIA 和 AMD 加速器,基于 PyTorch 并与 vLLM 合作。
DeepSeek开源DSpark,一个可将LLM推理速度提升高达85%的新框架(阅读时间18分钟)
DeepSeek开源了DSpark,这是一个采用MIT许可证的框架,利用推测解码技术将LLM推理速度提升高达85%,支持包括自家DeepSeek-V4、阿里巴巴Qwen和谷歌Gemma在内的多个模型系列。