@populartourist: llama.cpp 发布版本 b9235 添加了一些用于提升推理性能的新工具。使用 llama.c 对 RTX 5090 上的 Qwen3.6 27B 进行了基准测试…
摘要
llama.cpp 发布版本 b9235 引入了推测性 n-gram 调优,在 RTX 5090 上的 Qwen3.6 27B 上实现了高达约 7 倍的吞吐量提升,其中 k4v96 配置在 10k 和 70k token 测试中表现出最佳的持续性能。
查看缓存全文
缓存时间: 2026/05/20 16:33
llama.cpp 版本 b9235 增加了一些用于加速推理的新工具。
在 RTX 5090 上使用 llama.cpp 对 Qwen3.6 27B 进行了基准测试,采用了投机性 n-gram 调优,在 10k 生成 token 的测试中。
增加 --spec-ngram-map-k4v-size-m 的值,使得解码吞吐量(predicted_per_second)提高,接受的输出 token 生成速度最高提升约 7 倍。
随后针对 k4v64 和 k4v96 样本进行的 7x50k token 生成测试,确认了 10k-token 性能的持续性,使得 k4v96 成为赢家。
k4v128 也经过了测试,但在 7x50k token 运行中相比 k4v96 稳定性较差,因此已从图表中移除。
实际结果仍属轶事性,尽管 k4v96 的接受率远低于传统的 --spec-draft-n-max 3,但仍然实现了更快的评估速度——因此这种权衡似乎值得。
下方评论中给出了 k4v96 测试样本的标记。
-
--spec-type-draft-mtp,ngram-mod,ngram-map-k4v- `--spec-draft-n-max` - `"3"` - `--spec-draft-p-min` - `"0.0"` - `--spec-ngram-mod-n-match` - `"24"` - `--spec-ngram-mod-n-min` - `"48"` - `--spec-ngram-mod-n-max` - `"64"` - `--spec-ngram-map-k4v-size-n` - `"16"` - `--spec-ngram-map-k4v-size-m` - `"96"` - `--spec-ngram-map-k4v-min-hits` - `"1"`
我更倾向于 1M。
据我所知,如果你能使用 MTP 运行 Qwen3.6 27B 或 35B-A3B,这仅仅是对 MTP 的预测进行调优——因此从技术上讲应该会加快速度。
要知道结果,唯一的方法就是自己测试。
相似文章
Llama.cpp PR 带来 8% 速度提升
一个 llama.cpp PR 将采样从 CPU 移至 GPU,在 RTX 5090 上为 Qwen3.6-35B 推理带来 8% 的 token 速度提升,在 Tesla P40 上约为 4%。
我测试了 llama.cpp 在 Qwen 3.6 27B 上的所有推测性解码方法:MTP ~2.7x, DFlash ~3.7x, n-gram 堆叠在真实编码中达到 ~6x。本地 AI 获胜。我在 RTX 6000 PRO 上的发现。
llama.cpp 在 Qwen 3.6 27B 上的推测性解码方法的全面基准测试表明,在 DFlash 上叠加 n-gram 堆叠在迭代编码任务中实现了高达 6 倍的加速,其中 ngram-mod 贡献了大部分增益且零 VRAM 成本。
在24GB显存环境中运行Qwen 3.6 27B的配置:后端对比、量化选择与设置(llama.cpp, ik_llama.cpp, BeeLlama, vllm)
本文对比了在RTX 3090 24GB上运行Qwen 3.6 27B使用的llama.cpp后端,发现搭配IQ4_KS量化的ik_llama.cpp性能最佳(预填充1261 tok/s,解码72.9 tok/s)。
BeeLlama.cpp:支持推理和视觉的先进 DFlash 与 TurboQuant。在 RTX 3090 上以 200k 上下文运行 Qwen 3.6 27B Q5,速度比基线快 2-3 倍(峰值 135 tps!)
BeeLlama.cpp 是一个专注于性能的 llama.cpp 分支,引入了 DFlash 投机解码和 TurboQuant KV 缓存压缩技术,使得在消费级硬件上也能高速本地运行像 Qwen 3.6 27B 这样的大型模型。
一个 llama.cpp PR 让 Q2_0 在 x86 CPU 上提速 3.0–3.6 倍,8B 解码从 2.39 升至 8.20 tok/s
一个 llama.cpp 拉取请求为 Q2_0 × Q8_0 点积添加了 x86 VNNI 实现,在 Bonsai 模型上实现了 3.0–3.6 倍的纯 CPU 加速,内核级逐位精确,且 token 一致性达 99.2%。