incoai/Qwen3.8-27B-DFlash2

Hugging Face Models Trending 模型

摘要

DFlash 2 是一个用于投机解码的块扩散草稿模型,可提升 Qwen3.8-27B 语言模型的推理速度,在基准测试中提供更高的接受长度和吞吐量。

任务:文本生成 标签:transformers, safetensors, qwen3, dflash2, 投机解码, 块扩散, 草稿模型, sglang, vllm, 文本生成, 基础模型:Qwen/Qwen3.8-27B, 基础模型:微调:Qwen/Qwen3.8-27B, 许可证:apache-2.0, 文本生成推理, 地区:美国
查看原文
查看缓存全文

缓存时间: 2026/08/23 10:00

incoai/Qwen3.8-27B-DFlash2 · Hugging Face

来源: https://huggingface.co/incoai/Qwen3.8-27B-DFlash2 博客 (https://inco.ai/blog/dflash2/) | GitHub (https://github.com/z-lab/dflash)

此仓库包含 Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) 的 DFlash 2 草稿模型。它不是一个独立的语言模型:它运行在推测解码服务器内部,为目标模型草拟 token 供其验证。该检查点也镜像在 z-lab/Qwen3.8-27B-DFlash2 (https://huggingface.co/z-lab/Qwen3.8-27B-DFlash2)。

DFlash 2 是一种用于推测解码的块扩散草拟器。它单次预测一整个 token 块,并在每个位置保留最高候选项。然后一个轻量级选择器从中追溯一条连贯路径。骨干网络中的双路动态卷积可以防止草拟在块末尾时质量衰减。解码是无损的:贪心输出与目标模型完全一致,而采样保留了其分布。

DFlash 2:并行块草拟与候选路径选择器

快速开始

使用 SGLang (https://github.com/sgl-project/sglang) 部署:

pip install "sglang[all] @ git+https://github.com/sgl-project/sglang.git#subdirectory=python"

python -m sglang.launch_server \
  --model-path Qwen/Qwen3.8-27B \
  --speculative-algorithm DFLASH \
  --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \
  --speculative-num-draft-tokens 8

或使用 vLLM (https://github.com/vllm-project/vllm):

pip install -U "vllm @ git+https://github.com/vllm-project/vllm.git@refs/pull/52816/head"

vllm serve Qwen/Qwen3.8-27B \
  --speculative-config '{
    "method": "dflash",
    "model": "incoai/Qwen3.8-27B-DFlash2",
    "num_speculative_tokens": 7
  }'

详情及其他引擎支持,请参阅博客文章

评估

  • 运行环境:SGLang,单张 NVIDIA H200 GPU,目标和草拟注意力均使用 FlashAttention 3
  • 推测块大小:8(每个验证步骤 7 个草拟 token)
  • 采样参数:Qwen3.8 官方推荐参数(温度 1.0,top-p 0.95,top-k 20),使用 xhigh 推理强度
  • 最大新 token 数:4096
  • 提示:采用 z-lab/dflash (https://github.com/z-lab/dflash) 的基准测试格式

我们将自回归解码、Qwen3.8 内置的七 token MTP、社区 DSpark 草拟器 (RadixArk/Qwen3.8-27B-DSpark (https://huggingface.co/RadixArk/Qwen3.8-27B-DSpark)) 和 DFlash 2 进行了比较。所有推测方法在每个验证步骤均提议 7 个草拟 token。

接受长度

接受长度是每个请求的完成 token 数除以验证步骤数的平均值。数值越高越好。

任务MTPDSparkDFlash 2
GSM8K5.024.365.46
MATH-5004.723.925.28
HumanEval3.913.304.39
MBPP3.993.514.79
MT-Bench3.743.014.10

吞吐量

吞吐量是总输出 token 数除以端到端壁钟时间。每个单元格显示为 输出 tok/s(相比自回归的加速比)

并发数 1

任务自回归MTPDSparkDFlash 2
GSM8K68.9178.5 (2.59×)185.3 (2.69×)236.1 (3.43×)
MATH-50069.0172.8 (2.51×)174.5 (2.53×)230.7 (3.34×)
HumanEval69.0151.9 (2.20×)159.9 (2.32×)214.6 (3.11×)
MBPP69.0153.1 (2.22×)163.3 (2.37×)226.9 (3.29×)
MT-Bench68.9134.9 (1.96×)137.6 (2.00×)184.0 (2.67×)

并发数 8

任务自回归MTPDSparkDFlash 2
GSM8K467.21,022.1 (2.19×)1,040.8 (2.23×)1,328.7 (2.84×)
MATH-500480.01,023.5 (2.13×)1,025.8 (2.14×)1,368.3 (2.85×)
HumanEval483.4934.2 (1.93×)956.5 (1.98×)1,291.5 (2.67×)
MBPP478.0938.1 (1.96×)974.1 (2.04×)1,328.0 (2.78×)
MT-Bench480.5835.2 (1.74×)802.3 (1.67×)1,090.2 (2.27×)

并发数 32

任务自回归MTPDSparkDFlash 2
GSM8K1,329.81,381.1 (1.04×)1,506.5 (1.13×)1,922.5 (1.45×)
MATH-5001,505.81,415.6 (0.94×)1,429.0 (0.95×)1,951.8 (1.30×)
HumanEval1,546.51,296.8 (0.84×)1,330.1 (0.86×)1,799.0 (1.16×)
MBPP1,507.71,314.9 (0.87×)1,361.3 (0.90×)1,886.8 (1.25×)
MT-Bench1,507.41,159.7 (0.77×)1,115.5 (0.74×)1,525.3 (1.01×)

引用

如果您觉得 DFlash 2 有用,请引用:

@misc{inco2026dflash2,
  title  = {{DFlash 2: Keep Drafting Parallel}},
  author = {{Inco AI}},
  year   = {2026},
  month  = {August},
  url    = {https://inco.ai/blog/dflash2/}
}

同时,请引用原始的 DFlash 论文:

@inproceedings{chen2026dflash,
  title     = {{DFlash: Block Diffusion for Flash Speculative Decoding}},
  author    = {Chen, Jian and Liang, Yesheng and Liu, Zhijian},
  booktitle = {International Conference on Machine Learning (ICML)},
  year      = {2026}
}

相似文章

z-lab/Qwen3.8-27B-DFlash2

Hugging Face Models Trending

介绍了 DFlash 2,一种用于与 Qwen3.8-27B 模型进行投机解码的块扩散草稿器,在基准测试中展示了改进的接受长度和吞吐量。

z-lab/Qwen3.6-35B-A3B-DFlash

Hugging Face Models Trending

z-lab 发布 DFlash,一种基于轻量级块扩散模型的投机解码草稿器,可并行生成 15–16 个 token,为 Qwen3.6-35B-A3B 推理带来最高 2.9× 加速。

z-lab/Qwen3.6-27B-DFlash

Hugging Face Models Trending

本文介绍 Qwen3.6-27B-DFlash,这是专为 DFlash 设计的草稿模型。DFlash 是一种新型推测解码方法,利用块扩散技术加速推理速度。文章提供了 vLLM 和 SGLang 的安装说明,以便与目标模型 Qwen3.6-27B 实现并行草稿生成。