@modal: 我们与 @lmsysorg 和 http://z-lab.ai 合作,将 DFlash 规范集成到 @sgl_project,并通过重叠加速……
摘要
Modal 与 LMSys 和 Z Lab 合作,将 DFlash 推测解码集成到 SGLang,在大型语言模型上实现了相比基准最高 4.3 倍的吞吐量提升,比原生多 token 预测提升 1.5 倍。
查看缓存全文
缓存时间: 2026/06/15 19:06
我们与 @lmsysorg 及 https://t.co/Cg0JsVomui 合作,完成了以下工作:
- 将 DFlash 规范集成到 @sgl_project 中
- 通过重叠(overlap)技术使其更快
- 为 @Alibaba_Qwen 397B-A17B 训练了一个 DFlash 草稿模型
结果:相比基线实现了最高 4.3 倍的吞吐量提升,相比原生 MTP 实现了 1.5 倍提升。https://t.co/tIypW8vc7E
Z Lab
来源:https://z-lab.ai/
我们专注于通过全栈创新让 AI 变得更小、更快、更高效:
- 🧠算法:设计高效的模型架构与近似方法(例如稀疏化、压缩)。
- ⚙️系统:构建硬件感知的系统支持,加速新兴 AI 工作负载。
- 🚀应用:处理生成式 AI、机器人学和科学发现中的实际用例。
我们是 UCSD 机器学习系统研究组(https://mlsys-ucsd.org/)和 UCSD 视觉计算中心(https://viscomp.ucsd.edu/)的一部分。
新闻动态
- 2026 年 1 月 ParoQuant(https://z-lab.ai/projects/paroquant/)被 ICLR 2026 接收!ParoQuant 通过成对旋转量化实现高效的推理大语言模型推理。
- 2026 年 1 月 DFlash(https://z-lab.ai/projects/dflash/)发布!DFlash 利用块扩散进行推测解码,实现高效且高质量的并行草稿生成。
- 2025 年 6 月 SparseVILA(https://z-lab.ai/projects/sparsevila/)被 ICCV 2025 接收!SparseVILA 解耦视觉 token 稀疏性,实现高效的视觉语言模型推理。
- 2025 年 6 月 SparseLoRA(https://z-lab.ai/projects/sparselora/)被 ICML 2025 接收!SparseLoRA 应用上下文稀疏性,在微调过程中跳过不必要的计算,实现高达 2.2 倍的计算量减少。
相似文章
@lmsysorg: 新博客: 推测解码的下一代: DFlash 和 Spec V2。DFlash + Spec V2 实现 >4.3倍基准吞吐量…
关于 DFlash 和 Spec V2 推测解码方法的新研究实现了 LLM 推理的 >4.3倍基准吞吐量,现已成为 SGLang 的默认推测解码引擎。
@charles_irl:推测就是一切。在这篇博客中,我们宣布与Z Lab共同发布六款最新的DFla…
Modal和Z Lab发布了六款新的DFlash推测解码草稿模型,用于Qwen 3.x,在B200上实现了每秒超过1000个token,并认为推测解码是最有影响力的推理优化。
@_avichawla: 研究人员发现了一种让大语言模型(LLM)提速 8.5 倍的方法!(且不影响准确度)投机解码相当有效……
研究人员提出了 DFlash 技术,这是一种利用块扩散模型(block diffusion models)进行投机解码的方法,可在不损失准确度的情况下,将大语言模型推理速度提升高达 8.5 倍。该技术已集成到 vLLM 和 SGLang 等主要框架中。
@charles_irl: 许多人迟来地意识到智能必须开放。开放智能要成功,开发者必须携手合…
Modal、SGLang 和 Z Lab 之间的合作将 DFlash 推测方案集成到 SGLang 中,为阿里巴巴的 Qwen 397B-A17B 模型实现了高达 4.3 倍的吞吐量提升,推动了开放智能的发展。
z-lab/dflash
DFlash 引入了一种用于 Flash 投机解码的块扩散方法,以提高大语言模型的推理速度。