BeeLlama v0.2.0 – DFlash 重大更新。单张 RTX 3090:Qwen 3.6 27B 最高 164 tps(4.40 倍),Gemma 4 31B 最高 177.8 tps(4.93 倍)。提示处理速度接近基线。
摘要
BeeLlama v0.2.0 引入了 DFlash 投机解码的重大改进,在单张 RTX 3090 上,Gemma 4 31B 加速最高达 4.93 倍,Qwen 3.6 27B 加速最高达 4.40 倍,且提示处理速度接近基线。
**BeeLlama v0.2.0 来了!** >虽不是天马,但也相差无几。 [**GitHub**](https://github.com/Anbeeld/beellama.cpp) **|** [**Qwen 3.6 27B 快速入门**](https://github.com/Anbeeld/beellama.cpp/blob/main/docs/quickstart-qwen36-dflash.md) **|** [**Gemma 4 31B 快速入门**](https://github.com/Anbeeld/beellama.cpp/blob/main/docs/quickstart-gemma-4-31b-dflash.md)
* 完全支持 Gemma 4 31B,配备高效的 DFlash 实现与视觉功能。
* Qwen 3.6 27B 性能大幅提升,得益于更低的 DFlash 开销、更干净的预填充处理、草稿者 K/V 投影缓存以及更安全的 CUDA 执行。
* 现已支持带有上游架构的 DFlash GGUFs。
* 修复了围绕基线探测的自适应收益行为。
* 简化验证路径更严格,当语法、采样器状态或推理需要时,可安全回退至完整 logits。
* 推理和工具调用边界更加严谨。
* 更严格的草稿/目标验证和更好的草稿模型发现。
* ……以及更多改进!
**基准测试**
* 环境:Windows 11,AMD Ryzen 7 5700X3D,32 GB DDR4 内存,RTX 3090 24 GB
* 配置:与快速入门文档相同,但非对话提示关闭推理
* 对比的基线和 MTP 服务器:llama.cpp [b9275](https://github.com/ggml-org/llama.cpp/releases/tag/b9275) CUDA 13.1 Windows 预编译版
* 基准测试提示的完整文本见 [GitHub 上的 README.md](https://github.com/Anbeeld/beellama.cpp/blob/main/README.md#dflash-speedup)
**Qwen 3.6 27B**
目标模型:[Qwen 3.6 27B Q5\_K\_S](https://huggingface.co/unsloth/Qwen3.6-27B-GGUF) 或 [Qwen 3.6 27B MTP Q5\_K\_S](https://huggingface.co/unsloth/Qwen3.6-27B-MTP-GGUF)。DFlash 模型:[Q4\_K\_M](https://huggingface.co/Anbeeld/Qwen3.6-27B-DFlash-GGUF)。
|提示|服务端|输出|中位数|最佳|加速比|接受率|
|:-|:-|:-|:-|:-|:-|:-|
|Task store module|Baseline|~1K tok|37.2 tok/s|37.2 tok/s|1.00x|N/A|
|Task store module|DFlash|~1K tok|**163.9 tok/s**|181.9 tok/s|**4.40x**|67.7% / 89.2%|
|Task store module|MTP|~1K tok|69.3 tok/s|69.6 tok/s|1.86x|92.0% / 73.3%|
|KV report module|Baseline|~1K tok|34.6 tok/s|36.5 tok/s|1.00x|N/A|
|KV report module|DFlash|~1K tok|**157.7 tok/s**|162.5 tok/s|**4.56x**|58.8% / 88.9%|
|KV report module|MTP|~1K tok|67.3 tok/s|68.1 tok/s|1.94x|89.3% / 73.0%|
|Doubly-linked list|Baseline|~4K tok|36.8 tok/s|36.9 tok/s|1.00x|N/A|
|Doubly-linked list|DFlash|~4K tok|**130.8 tok/s**|154.1 tok/s|**3.56x**|50.4% / 86.8%|
|Doubly-linked list|MTP|~4K tok|66.3 tok/s|68.0 tok/s|1.80x|87.8% / 72.5%|
|Prompt processing|Baseline|~20K tok|1229.5 tok/s|1229.5 tok/s|1.00x|N/A|
|Prompt processing|DFlash|~20K tok|**1214.4 tok/s**|1221.7 tok/s|**0.99x**|N/A|
|Prompt processing|MTP|~20K tok|1162.6 tok/s|1164.7 tok/s|0.95x|N/A|
|Multi-turn coding|Baseline|~28K tok|33.3 tok/s|33.3 tok/s|1.00x|N/A|
|Multi-turn coding|DFlash|~30K tok|**64.6 tok/s**|65.4 tok/s|**1.94x**|24.9% / 72.9%|
|Multi-turn coding|MTP|~34K tok|56.5 tok/s|56.5 tok/s|1.70x|71.9% / 68.3%|
*接受率:被接受的提议草稿令牌 / 接受的草稿令牌到最终生成的令牌*
**Gemma 4 31B**
目标模型:[Gemma 4 31B Q4\_K\_S](https://huggingface.co/unsloth/gemma-4-31b-it-GGUF)。DFlash 模型:[Q5\_K\_M](https://huggingface.co/Anbeeld/gemma-4-31B-it-DFlash-GGUF)。
|提示|服务端|输出|中位数|最佳|加速比|接受率|
|:-|:-|:-|:-|:-|:-|:-|
|Task store module|Baseline|~1K tok|36.1 tok/s|36.1 tok/s|1.00x|N/A|
|Task store module|DFlash|~1K tok|**177.8 tok/s**|182.0 tok/s|**4.93x**|65.7% / 90.0%|
|KV report module|Baseline|~1K tok|35.9 tok/s|36.0 tok/s|1.00x|N/A|
|KV report module|DFlash|~1K tok|**154.3 tok/s**|162.8 tok/s|**4.29x**|55.7% / 88.6%|
|Doubly-linked list|Baseline|~1.9K tok|36.0 tok/s|36.0 tok/s|1.00x|N/A|
|Doubly-linked list|DFlash|~1.9K tok|**116.6 tok/s**|127.3 tok/s|**3.24x**|44.5% / 84.9%|
|Prompt processing|Baseline|~24K tok|1021.3 tok/s|1021.3 tok/s|1.00x|N/A|
|Prompt processing|DFlash|~24K tok|**954.5 tok/s**|954.9 tok/s|**0.93x**|N/A|
|Multi-turn coding|Baseline|~12K tok|34.8 tok/s|34.8 tok/s|1.00x|N/A|
|Multi-turn coding|DFlash|~12K tok|**60.6 tok/s**|64.1 tok/s|**1.74x**|24.4% / 72.3%|
*接受率:被接受的提议草稿令牌 / 接受的草稿令牌到最终生成的令牌*
相似文章
BeeLlama.cpp:支持推理和视觉的先进 DFlash 与 TurboQuant。在 RTX 3090 上以 200k 上下文运行 Qwen 3.6 27B Q5,速度比基线快 2-3 倍(峰值 135 tps!)
BeeLlama.cpp 是一个专注于性能的 llama.cpp 分支,引入了 DFlash 投机解码和 TurboQuant KV 缓存压缩技术,使得在消费级硬件上也能高速本地运行像 Qwen 3.6 27B 这样的大型模型。
Gemma 4 26B 在单块 RTX 5090 上达到 600 Tok/s
一项基准测试显示,使用 vLLM 搭配 DFlash 投机解码,在单块 RTX 5090 上将 Gemma 4 26B 的推理速度提升至约 578 tokens/s,相比基线实现了 2.56 倍的加速。
我在llama.cpp中测试了最新合并的DFlash在Qwen 3.6 27B本地AI上的表现。36K上下文速度提升4.44倍。以下是我的发现(RTX 6000 PRO)。
一位用户在llama.cpp中测试了新合并的DFlash推测解码方法(Qwen 3.6 27B),在36K上下文下相比基准实现速度提升高达4.44倍,并附有详细的排行榜和质量测试。
在24GB显存环境中运行Qwen 3.6 27B的配置:后端对比、量化选择与设置(llama.cpp, ik_llama.cpp, BeeLlama, vllm)
本文对比了在RTX 3090 24GB上运行Qwen 3.6 27B使用的llama.cpp后端,发现搭配IQ4_KS量化的ik_llama.cpp性能最佳(预填充1261 tok/s,解码72.9 tok/s)。
我测试了 llama.cpp 在 Qwen 3.6 27B 上的所有推测性解码方法:MTP ~2.7x, DFlash ~3.7x, n-gram 堆叠在真实编码中达到 ~6x。本地 AI 获胜。我在 RTX 6000 PRO 上的发现。
llama.cpp 在 Qwen 3.6 27B 上的推测性解码方法的全面基准测试表明,在 DFlash 上叠加 n-gram 堆叠在迭代编码任务中实现了高达 6 倍的加速,其中 ngram-mod 贡献了大部分增益且零 VRAM 成本。