针对 Qwen 的最快推测解码

Reddit r/LocalLLaMA 工具

摘要

一种针对 Qwen 模型的最快推测解码的新实现已可用,通过 Hugging Face 分支在 sglang 中得到支持,后续将在 uzu 引擎中获得支持。

嘿,各位,我们至少为 Qwen 构建了最快的推测解码。要在 sglang 中运行,你可以使用我们的 Hugging Face 分支链接。欢迎提供反馈和测试。请告诉我们如何能改善你的体验。我们的 uzu 引擎稍后也会提供支持。
查看原文

相似文章

z-lab/Qwen3.6-35B-A3B-DFlash

Hugging Face Models Trending

z-lab 发布 DFlash,一种基于轻量级块扩散模型的投机解码草稿器,可并行生成 15–16 个 token,为 Qwen3.6-35B-A3B 推理带来最高 2.9× 加速。

z-lab/Qwen3.6-27B-DFlash

Hugging Face Models Trending

本文介绍 Qwen3.6-27B-DFlash,这是专为 DFlash 设计的草稿模型。DFlash 是一种新型推测解码方法,利用块扩散技术加速推理速度。文章提供了 vLLM 和 SGLang 的安装说明,以便与目标模型 Qwen3.6-27B 实现并行草稿生成。