@modal: 我们与 @lmsysorg 和 http://z-lab.ai 合作,将 DFlash 规范集成到 @sgl_project,并通过重叠加速……

X AI KOLs Following 模型

摘要

Modal 与 LMSys 和 Z Lab 合作,将 DFlash 推测解码集成到 SGLang,在大型语言模型上实现了相比基准最高 4.3 倍的吞吐量提升,比原生多 token 预测提升 1.5 倍。

我们与 @lmsysorg 和 https://t.co/Cg0JsVomui 合作, - 将 DFlash 规范集成到 @sgl_project - 通过重叠加速 - 为 @Alibaba_Qwen 397B-A17B 训练 DFlash 起草模型 结果:相比基准最高可实现 4.3 倍的吞吐量提升,相比原生 MTP 提升 1.5 倍。https://t.co/tIypW8vc7E
查看原文
查看缓存全文

缓存时间: 2026/06/15 19:06

我们与 @lmsysorg 及 https://t.co/Cg0JsVomui 合作,完成了以下工作:

  • 将 DFlash 规范集成到 @sgl_project 中
  • 通过重叠(overlap)技术使其更快
  • 为 @Alibaba_Qwen 397B-A17B 训练了一个 DFlash 草稿模型

结果:相比基线实现了最高 4.3 倍的吞吐量提升,相比原生 MTP 实现了 1.5 倍提升。https://t.co/tIypW8vc7E


Z Lab

来源:https://z-lab.ai/

我们专注于通过全栈创新让 AI 变得更小、更快、更高效:

  • 🧠算法:设计高效的模型架构与近似方法(例如稀疏化、压缩)。
  • ⚙️系统:构建硬件感知的系统支持,加速新兴 AI 工作负载。
  • 🚀应用:处理生成式 AI、机器人学和科学发现中的实际用例。

我们是 UCSD 机器学习系统研究组(https://mlsys-ucsd.org/)和 UCSD 视觉计算中心(https://viscomp.ucsd.edu/)的一部分。

新闻动态

  • 2026 年 1 月 ParoQuant(https://z-lab.ai/projects/paroquant/)被 ICLR 2026 接收!ParoQuant 通过成对旋转量化实现高效的推理大语言模型推理。
  • 2026 年 1 月 DFlash(https://z-lab.ai/projects/dflash/)发布!DFlash 利用块扩散进行推测解码,实现高效且高质量的并行草稿生成。
  • 2025 年 6 月 SparseVILA(https://z-lab.ai/projects/sparsevila/)被 ICCV 2025 接收!SparseVILA 解耦视觉 token 稀疏性,实现高效的视觉语言模型推理。
  • 2025 年 6 月 SparseLoRA(https://z-lab.ai/projects/sparselora/)被 ICML 2025 接收!SparseLoRA 应用上下文稀疏性,在微调过程中跳过不必要的计算,实现高达 2.2 倍的计算量减少。

相似文章

z-lab/dflash

GitHub Trending (daily)

DFlash 引入了一种用于 Flash 投机解码的块扩散方法,以提高大语言模型的推理速度。