在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南

Reddit r/LocalLLaMA 工具

摘要

本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。

我发现Q2效果非常好,能产出优质结果,也看到dflash2如何让模型在120k上下文长度下生成速度超过60 tokens/秒。我很喜欢它的表现!以下是如何设置(由AI撰写) 在16GB显存上使用DFlash2推测解码 — 1.72倍加速(设置指南) DFlash2将一个小型草稿模型与你的大模型配对。草稿模型并行猜测一批tokens,目标模型一次性验证它们。无损——输出质量完全相同,只是更快。 在RTX 4080 16GB上使用Qwen3.8-27B的结果:50.6 → 86.7 tok/s(1.72倍),占用561MB显存。 --- 从PR分支构建llama.cpp DFlash2不在主分支中(只有DFlash 1)。它位于未合并的PR #27342中。如果你使用发布版本,会得到错误的tensor数量;预期81个,每个草稿量化版本都得到58个。 git clone --depth 1 https://github.com/ggml-org/llama.cpp.git llama.cpp_new cd llama.cpp_new git remote add zlab https://github.com/z-lab/llama.cpp-fork.git git fetch --depth 1 zlab dflash2 git checkout FETCH_HEAD 构建前验证: grep -c "LLM_KV_DFLASH_SELECTOR_RANK" src/llama-arch.cpp # 必须打印1 构建到与现有llama.cpp不同的目录中。 获取模型 - 目标:你的Qwen3.8-27B GGUF(我的:Q2_K_P,9.94GB) - 草稿模型:HermiHg/Qwen3.8-27B-DFlash2-Q2_K_S-MIX-GGUF(561MB) 草稿模型是针对特定模型配对的——为特定目标训练。 运行它 llama-server.exe \ -m Qwen3.8-27B-Q2_K_P.gguf \ --model-draft Qwen3.8-27B-DFlash2-Q2_K_S-MIX.gguf \ --spec-type draft-dflash \ --spec-draft-n-max 3 \ -ngl 99 -c 122880 -fa on \ --cache-type-k q4_0 --cache-type-v q4_0 \ --host 0.0.0.0 --port 8080 --jinja --spec-type draft-dflash 是必需的——没有它草稿模型加载但不会启用。注意是 --model-draft(不是 --draft-model)和 -ngl(不是 --ngl)。 --- 吞吐量 使用 n_max=3 的 Q2_K_S-MIX。它比官方的 Q4_K_M 更快,且体积只有一半。n_max=5 在各方面都更差——接受率下降快于并行性增益。 上下文长度与速度对比 4k • KV: q4_0 • tok/s: 86.7 • 加速比: 1.72x 120k • KV: q4_0 • tok/s: 66.1 • 加速比: 1.31x 草稿模型下最大稳定上下文长度为122880。超过此值会遇到PR bug(非内存溢出): - 131072 不使用草稿模型 → 正常工作 - 131072 使用草稿模型 → 无效向量下标 - 126976 → 不稳定(使用 --no-warmup 加载,预热时崩溃)
查看原文

相似文章

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。