z-lab/Qwen3.8-27B-DFlash2

Hugging Face Models Trending 模型

摘要

介绍了 DFlash 2,一种用于与 Qwen3.8-27B 模型进行投机解码的块扩散草稿器,在基准测试中展示了改进的接受长度和吞吐量。

任务:文本生成 标签:transformers, safetensors, qwen3, dflash2, 投机解码, 块扩散, 草稿模型, sglang, vllm, 文本生成, 基础模型:Qwen/Qwen3.8-27B, 基础模型:微调:Qwen/Qwen3.8-27B, 许可证:apache-2.0, 文本生成推理, 区域:美国
查看原文
查看缓存全文

缓存时间: 2026/08/21 09:52

z-lab/Qwen3.8-27B-DFlash2 · Hugging Face

来源:https://huggingface.co/z-lab/Qwen3.8-27B-DFlash2 博客 (https://inco.ai/blog/dflash2/) | GitHub (https://github.com/z-lab/dflash)

本仓库包含用于 Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) 的 DFlash 2 草稿模型。它不是一个独立的语言模型:它运行于推测性解码服务器内部,为目标模型生成待验证的词元草稿。本仓库是 incoai/Qwen3.8-27B-DFlash2 (https://huggingface.co/incoai/Qwen3.8-27B-DFlash2) 的镜像。

DFlash 2 是一种用于推测性解码的块扩散草稿模型。它在单次前向传播中预测整个词元块,并在每个位置保留最佳候选。一个轻量级选择器随后从中追踪出一条连贯的路径。骨干网络中的双抽头动态卷积可防止草稿在块末尾质量下降。解码是无损的:贪心输出与目标模型完全一致,采样则保留其分布。

DFlash 2:采用候选路径选择器的并行块草稿模型

快速开始

使用 SGLang (https://github.com/sgl-project/sglang) 部署:

pip install "sglang[all] @ git+https://github.com/sgl-project/sglang.git#subdirectory=python"

python -m sglang.launch_server \
  --model-path Qwen/Qwen3.8-27B \
  --speculative-algorithm DFLASH \
  --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \
  --speculative-num-draft-tokens 8

或使用 vLLM (https://github.com/vllm-project/vllm):

pip install -U "vllm @ git+https://github.com/vllm-project/vllm.git@refs/pull/52816/head"

vllm serve Qwen/Qwen3.8-27B \
  --speculative-config '{
    "method": "dflash",
    "model": "incoai/Qwen3.8-27B-DFlash2",
    "num_speculative_tokens": 7
  }'

更多引擎及详情请参阅博客文章 (https://inco.ai/blog/dflash2/)。

评估

  • 运行时:单卡 NVIDIA H200 上的 SGLang,目标和草稿注意力均使用 FlashAttention 3
  • 推测块大小:8(每个验证步骤生成 7 个草稿词元)
  • 采样参数:Qwen3.8 官方推荐参数(temperature 1.0,top-p 0.95,top-k 20),推理强度设为 xhigh
  • 最大新词元数:4096
  • 提示词:采用 z-lab/dflash (https://github.com/z-lab/dflash) 的基准测试格式

我们对比了自回归解码、Qwen3.8 内置的七词元 MTP、社区 DSpark 草稿模型 (RadixArk/Qwen3.8-27B-DSpark (https://huggingface.co/RadixArk/Qwen3.8-27B-DSpark)) 以及 DFlash 2。所有推测方法每个验证步骤均提出 7 个草稿词元。

接受长度

接受长度是指每个请求的平均完成词元数除以验证步数。数值越高越好。

任务MTPDSparkDFlash 2
GSM8K5.024.365.46
MATH-5004.723.925.28
HumanEval3.913.304.39
MBPP3.993.514.79
MT-Bench3.743.014.10

吞吐量

吞吐量是总输出词元数除以端到端挂钟时间。每个单元格显示 输出词元/秒(相对于自回归解码的加速比)

并发数 1

任务自回归MTPDSparkDFlash 2
GSM8K68.978.5 (2.59×)185.3 (2.69×)236.1 (3.43×)
MATH-50069.072.8 (2.51×)174.5 (2.53×)230.7 (3.34×)
HumanEval69.051.9 (2.20×)159.9 (2.32×)214.6 (3.11×)
MBPP69.053.1 (2.22×)163.3 (2.37×)226.9 (3.29×)
MT-Bench68.934.9 (1.96×)37.6 (2.00×)184.0 (2.67×)

并发数 8

任务自回归MTPDSparkDFlash 2
GSM8K467.21,022.1 (2.19×)1,040.8 (2.23×)1,328.7 (2.84×)
MATH-500480.01,023.5 (2.13×)1,025.8 (2.14×)1,368.3 (2.85×)
HumanEval483.4934.2 (1.93×)956.5 (1.98×)1,291.5 (2.67×)
MBPP478.0938.1 (1.96×)974.1 (2.04×)1,328.0 (2.78×)
MT-Bench480.5835.2 (1.74×)802.3 (1.67×)1,090.2 (2.27×)

并发数 32

任务自回归MTPDSparkDFlash 2
GSM8K1,329.81,381.1 (1.04×)1,506.5 (1.13×)1,922.5 (1.45×)
MATH-5001,505.81,415.6 (0.94×)1,429.0 (0.95×)1,951.8 (1.30×)
HumanEval1,546.51,296.8 (0.84×)1,330.1 (0.86×)1,799.0 (1.16×)
MBPP1,507.71,314.9 (0.87×)1,361.3 (0.90×)1,886.8 (1.25×)
MT-Bench1,507.41,159.7 (0.77×)1,115.5 (0.74×)1,525.3 (1.01×)

引用

如果您觉得 DFlash 2 有用,请引用:

@misc{inco2026dflash2,
  title  = {{DFlash 2: Keep Drafting Parallel}},
  author = {{Inco AI}},
  year   = {2026},
  month  = {August},
  url    = {https://inco.ai/blog/dflash2/}
}

也请引用原始 DFlash 论文:

@inproceedings{chen2026dflash,
  title     = {{DFlash: Block Diffusion for Flash Speculative Decoding}},
  author    = {Chen, Jian and Liang, Yesheng and Liu, Zhijian},
  booktitle = {International Conference on Machine Learning (ICML)},
  year      = {2026}
}

相似文章

z-lab/Qwen3.6-27B-DFlash

Hugging Face Models Trending

本文介绍 Qwen3.6-27B-DFlash,这是专为 DFlash 设计的草稿模型。DFlash 是一种新型推测解码方法,利用块扩散技术加速推理速度。文章提供了 vLLM 和 SGLang 的安装说明,以便与目标模型 Qwen3.6-27B 实现并行草稿生成。

z-lab/Qwen3.6-35B-A3B-DFlash

Hugging Face Models Trending

z-lab 发布 DFlash,一种基于轻量级块扩散模型的投机解码草稿器,可并行生成 15–16 个 token,为 Qwen3.6-35B-A3B 推理带来最高 2.9× 加速。

incoai/Qwen3.8-27B-DFlash2

Hugging Face Models Trending

DFlash 2 是一个用于投机解码的块扩散草稿模型,可提升 Qwen3.8-27B 语言模型的推理速度,在基准测试中提供更高的接受长度和吞吐量。

DFlash与Spec V2解码(14分钟阅读)

TLDR AI

Z Lab、SGLang和Modal发布DFlash,这是一种针对Qwen 3.5 397B-A17B的新型投机解码模型,采用块扩散和KV注入技术,相较于基线实现超过4倍吞吐量提升,相较于原生MTP实现1.5倍提升。