@charles_irl: 许多人迟来地意识到智能必须开放。开放智能要成功,开发者必须携手合…
摘要
Modal、SGLang 和 Z Lab 之间的合作将 DFlash 推测方案集成到 SGLang 中,为阿里巴巴的 Qwen 397B-A17B 模型实现了高达 4.3 倍的吞吐量提升,推动了开放智能的发展。
查看缓存全文
缓存时间: 2026/06/16 11:40
很多人现在才意识到,智能必须是开放的。
开放智能要取得成功,开发者必须跨越机构界限共同合作。
这正是我对 @modal、@sgl_project 和 Z Lab 之间这项合作如此期待的原因:
Modal (@modal): 我们与 @lmsysorg 及 https://t.co/Cg0JsVomui 合作,
- 将 DFlash 规范集成到 @sgl_project 中
- 通过重叠处理让它更快
- 为 @Alibaba_Qwen 397B-A17B 训练了一个 DFlash 草稿模型
结果:相比基线,吞吐量提升高达 4.3 倍,相比原生 MTP 提升 1.5 倍。
相似文章
@modal: 我们与 @lmsysorg 和 http://z-lab.ai 合作,将 DFlash 规范集成到 @sgl_project,并通过重叠加速……
Modal 与 LMSys 和 Z Lab 合作,将 DFlash 推测解码集成到 SGLang,在大型语言模型上实现了相比基准最高 4.3 倍的吞吐量提升,比原生多 token 预测提升 1.5 倍。
@charles_irl:推测就是一切。在这篇博客中,我们宣布与Z Lab共同发布六款最新的DFla…
Modal和Z Lab发布了六款新的DFlash推测解码草稿模型,用于Qwen 3.x,在B200上实现了每秒超过1000个token,并认为推测解码是最有影响力的推理优化。
@lmsysorg: 新博客: 推测解码的下一代: DFlash 和 Spec V2。DFlash + Spec V2 实现 >4.3倍基准吞吐量…
关于 DFlash 和 Spec V2 推测解码方法的新研究实现了 LLM 推理的 >4.3倍基准吞吐量,现已成为 SGLang 的默认推测解码引擎。
@charles_irl: dflash 高速运转
NVIDIA 宣布推出 DFlash,一种用于推测解码的开源块扩散模型,在 Blackwell GPU 上可实现高达 15 倍的推理吞吐量提升,同时保持交互性。
@charles_irl: 推测就是一切
Yong Quan 强调,更好的推测解码器可以在 LLM 推理中实现近乎线性的吞吐量提升,该观点由 Charles 在 Modal 研讨会上提出。