BeeLlama v0.2.0 – DFlash 重大更新。单张 RTX 3090:Qwen 3.6 27B 最高 164 tps(4.40 倍),Gemma 4 31B 最高 177.8 tps(4.93 倍)。提示处理速度接近基线。

Reddit r/LocalLLaMA 工具

摘要

BeeLlama v0.2.0 引入了 DFlash 投机解码的重大改进,在单张 RTX 3090 上,Gemma 4 31B 加速最高达 4.93 倍,Qwen 3.6 27B 加速最高达 4.40 倍,且提示处理速度接近基线。

**BeeLlama v0.2.0 来了!** >虽不是天马,但也相差无几。 [**GitHub**](https://github.com/Anbeeld/beellama.cpp) **|** [**Qwen 3.6 27B 快速入门**](https://github.com/Anbeeld/beellama.cpp/blob/main/docs/quickstart-qwen36-dflash.md) **|** [**Gemma 4 31B 快速入门**](https://github.com/Anbeeld/beellama.cpp/blob/main/docs/quickstart-gemma-4-31b-dflash.md) * 完全支持 Gemma 4 31B,配备高效的 DFlash 实现与视觉功能。 * Qwen 3.6 27B 性能大幅提升,得益于更低的 DFlash 开销、更干净的预填充处理、草稿者 K/V 投影缓存以及更安全的 CUDA 执行。 * 现已支持带有上游架构的 DFlash GGUFs。 * 修复了围绕基线探测的自适应收益行为。 * 简化验证路径更严格,当语法、采样器状态或推理需要时,可安全回退至完整 logits。 * 推理和工具调用边界更加严谨。 * 更严格的草稿/目标验证和更好的草稿模型发现。 * ……以及更多改进! **基准测试** * 环境:Windows 11,AMD Ryzen 7 5700X3D,32 GB DDR4 内存,RTX 3090 24 GB * 配置:与快速入门文档相同,但非对话提示关闭推理 * 对比的基线和 MTP 服务器:llama.cpp [b9275](https://github.com/ggml-org/llama.cpp/releases/tag/b9275) CUDA 13.1 Windows 预编译版 * 基准测试提示的完整文本见 [GitHub 上的 README.md](https://github.com/Anbeeld/beellama.cpp/blob/main/README.md#dflash-speedup) **Qwen 3.6 27B** 目标模型:[Qwen 3.6 27B Q5\_K\_S](https://huggingface.co/unsloth/Qwen3.6-27B-GGUF) 或 [Qwen 3.6 27B MTP Q5\_K\_S](https://huggingface.co/unsloth/Qwen3.6-27B-MTP-GGUF)。DFlash 模型:[Q4\_K\_M](https://huggingface.co/Anbeeld/Qwen3.6-27B-DFlash-GGUF)。 |提示|服务端|输出|中位数|最佳|加速比|接受率| |:-|:-|:-|:-|:-|:-|:-| |Task store module|Baseline|~1K tok|37.2 tok/s|37.2 tok/s|1.00x|N/A| |Task store module|DFlash|~1K tok|**163.9 tok/s**|181.9 tok/s|**4.40x**|67.7% / 89.2%| |Task store module|MTP|~1K tok|69.3 tok/s|69.6 tok/s|1.86x|92.0% / 73.3%| |KV report module|Baseline|~1K tok|34.6 tok/s|36.5 tok/s|1.00x|N/A| |KV report module|DFlash|~1K tok|**157.7 tok/s**|162.5 tok/s|**4.56x**|58.8% / 88.9%| |KV report module|MTP|~1K tok|67.3 tok/s|68.1 tok/s|1.94x|89.3% / 73.0%| |Doubly-linked list|Baseline|~4K tok|36.8 tok/s|36.9 tok/s|1.00x|N/A| |Doubly-linked list|DFlash|~4K tok|**130.8 tok/s**|154.1 tok/s|**3.56x**|50.4% / 86.8%| |Doubly-linked list|MTP|~4K tok|66.3 tok/s|68.0 tok/s|1.80x|87.8% / 72.5%| |Prompt processing|Baseline|~20K tok|1229.5 tok/s|1229.5 tok/s|1.00x|N/A| |Prompt processing|DFlash|~20K tok|**1214.4 tok/s**|1221.7 tok/s|**0.99x**|N/A| |Prompt processing|MTP|~20K tok|1162.6 tok/s|1164.7 tok/s|0.95x|N/A| |Multi-turn coding|Baseline|~28K tok|33.3 tok/s|33.3 tok/s|1.00x|N/A| |Multi-turn coding|DFlash|~30K tok|**64.6 tok/s**|65.4 tok/s|**1.94x**|24.9% / 72.9%| |Multi-turn coding|MTP|~34K tok|56.5 tok/s|56.5 tok/s|1.70x|71.9% / 68.3%| *接受率:被接受的提议草稿令牌 / 接受的草稿令牌到最终生成的令牌* **Gemma 4 31B** 目标模型:[Gemma 4 31B Q4\_K\_S](https://huggingface.co/unsloth/gemma-4-31b-it-GGUF)。DFlash 模型:[Q5\_K\_M](https://huggingface.co/Anbeeld/gemma-4-31B-it-DFlash-GGUF)。 |提示|服务端|输出|中位数|最佳|加速比|接受率| |:-|:-|:-|:-|:-|:-|:-| |Task store module|Baseline|~1K tok|36.1 tok/s|36.1 tok/s|1.00x|N/A| |Task store module|DFlash|~1K tok|**177.8 tok/s**|182.0 tok/s|**4.93x**|65.7% / 90.0%| |KV report module|Baseline|~1K tok|35.9 tok/s|36.0 tok/s|1.00x|N/A| |KV report module|DFlash|~1K tok|**154.3 tok/s**|162.8 tok/s|**4.29x**|55.7% / 88.6%| |Doubly-linked list|Baseline|~1.9K tok|36.0 tok/s|36.0 tok/s|1.00x|N/A| |Doubly-linked list|DFlash|~1.9K tok|**116.6 tok/s**|127.3 tok/s|**3.24x**|44.5% / 84.9%| |Prompt processing|Baseline|~24K tok|1021.3 tok/s|1021.3 tok/s|1.00x|N/A| |Prompt processing|DFlash|~24K tok|**954.5 tok/s**|954.9 tok/s|**0.93x**|N/A| |Multi-turn coding|Baseline|~12K tok|34.8 tok/s|34.8 tok/s|1.00x|N/A| |Multi-turn coding|DFlash|~12K tok|**60.6 tok/s**|64.1 tok/s|**1.74x**|24.4% / 72.3%| *接受率:被接受的提议草稿令牌 / 接受的草稿令牌到最终生成的令牌*
查看原文

相似文章

Gemma 4 26B 在单块 RTX 5090 上达到 600 Tok/s

Reddit r/LocalLLaMA

一项基准测试显示,使用 vLLM 搭配 DFlash 投机解码,在单块 RTX 5090 上将 Gemma 4 26B 的推理速度提升至约 578 tokens/s,相比基线实现了 2.56 倍的加速。