在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南
摘要
本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。
我发现Q2效果非常好,能产出优质结果,也看到dflash2如何让模型在120k上下文长度下生成速度超过60 tokens/秒。我很喜欢它的表现!以下是如何设置(由AI撰写)
在16GB显存上使用DFlash2推测解码 — 1.72倍加速(设置指南)
DFlash2将一个小型草稿模型与你的大模型配对。草稿模型并行猜测一批tokens,目标模型一次性验证它们。无损——输出质量完全相同,只是更快。
在RTX 4080 16GB上使用Qwen3.8-27B的结果:50.6 → 86.7 tok/s(1.72倍),占用561MB显存。
---
从PR分支构建llama.cpp
DFlash2不在主分支中(只有DFlash 1)。它位于未合并的PR #27342中。如果你使用发布版本,会得到错误的tensor数量;预期81个,每个草稿量化版本都得到58个。
git clone --depth 1 https://github.com/ggml-org/llama.cpp.git llama.cpp_new
cd llama.cpp_new
git remote add zlab https://github.com/z-lab/llama.cpp-fork.git
git fetch --depth 1 zlab dflash2
git checkout FETCH_HEAD
构建前验证:
grep -c "LLM_KV_DFLASH_SELECTOR_RANK" src/llama-arch.cpp # 必须打印1
构建到与现有llama.cpp不同的目录中。
获取模型
- 目标:你的Qwen3.8-27B GGUF(我的:Q2_K_P,9.94GB)
- 草稿模型:HermiHg/Qwen3.8-27B-DFlash2-Q2_K_S-MIX-GGUF(561MB)
草稿模型是针对特定模型配对的——为特定目标训练。
运行它
llama-server.exe \
-m Qwen3.8-27B-Q2_K_P.gguf \
--model-draft Qwen3.8-27B-DFlash2-Q2_K_S-MIX.gguf \
--spec-type draft-dflash \
--spec-draft-n-max 3 \
-ngl 99 -c 122880 -fa on \
--cache-type-k q4_0 --cache-type-v q4_0 \
--host 0.0.0.0 --port 8080 --jinja
--spec-type draft-dflash 是必需的——没有它草稿模型加载但不会启用。注意是 --model-draft(不是 --draft-model)和 -ngl(不是 --ngl)。
---
吞吐量
使用 n_max=3 的 Q2_K_S-MIX。它比官方的 Q4_K_M 更快,且体积只有一半。n_max=5 在各方面都更差——接受率下降快于并行性增益。
上下文长度与速度对比
4k • KV: q4_0 • tok/s: 86.7 • 加速比: 1.72x
120k • KV: q4_0 • tok/s: 66.1 • 加速比: 1.31x
草稿模型下最大稳定上下文长度为122880。超过此值会遇到PR bug(非内存溢出):
- 131072 不使用草稿模型 → 正常工作
- 131072 使用草稿模型 → 无效向量下标
- 126976 → 不稳定(使用 --no-warmup 加载,预热时崩溃)
相似文章
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
我在llama.cpp中测试了最新合并的DFlash在Qwen 3.6 27B本地AI上的表现。36K上下文速度提升4.44倍。以下是我的发现(RTX 6000 PRO)。
一位用户在llama.cpp中测试了新合并的DFlash推测解码方法(Qwen 3.6 27B),在36K上下文下相比基准实现速度提升高达4.44倍,并附有详细的排行榜和质量测试。
[基准测试] RTX 5090上的DFlash推测解码与KV缓存压缩 — 3.26倍加速
在 RTX 5090 上对 DFlash 推测解码结合 KV 缓存压缩进行的基准测试显示,针对 Qwen3.6-27B 模型最高可实现 3.26 倍加速,且困惑度下降极小,其中 q4_0/turbo4 提供了最佳平衡。
在搭载RTX 4060(8GB)的笔记本电脑上运行Qwen3.6-35B-A3B——哪些有效、哪些无效以及一个令人意外的推测解码结果
详细记录了在8GB笔记本GPU上运行Qwen3.6-35B-A3B MoE模型的经历,涵盖有效优化(如--no-mmap和VRAM余量)、意料之外的发现(推测解码相比基准测试提升26%的速度)以及Windows和CPU瓶颈的陷阱。
48GB VRAM + Qwen 3.6 27B 的最佳设置
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。