Qwen-3.6-27B + llamacpp 投机解码效果惊艳
摘要
Reddit 用户展示了 llamacpp 的投机解码功能将 Qwen-3.6-27B 的生成速度从 13.6 提升至 136.75 t/s,并分享了完整的命令参数和硬件配置。
首先简单说明一下图片中发生了什么。我做了一个小实验,目的是测试投机解码(speculative decoding)能为新版 Qwen 带来多大的速度提升(简言之:非常大!)。第一张图展示了我在会话开始时使用的简单提示词。第二张图显示了生成第一版程序所用的时间和 token 生成速度(13.60 t/s),以及我请求新增功能的提示词。第三张图显示了第二版程序的生成时间和速度(25.53 t/s——可以看到有所提升)。图中还可以看到存在一个 bug,我向 Qwen 展示了浏览器控制台打开的截图,Qwen 准确识别出了 bug 类型并进行了修复。第四张图显示了修复后版本的生成时间和速度(68.35 t/s——大幅提升),以及我请求对程序进行小修改的提示词。第五张图显示了最终版本在小修改后的生成时间和速度(136.75 t/s!!!)。最后一张图展示了完成后的精美水族馆效果。与同等规模的旧模型以及许多更大规模的模型相比,其美学效果和功能性都达到了另一个层次。因此,整个会话期间的速度变化为:13.60 > 25.53 > 68.35 > 136.75 t/s。每次 Qwen 都输出了完整代码。我经常使用类似的工作流。而这一切都要归功于 llama-server 命令中的这一行参数:'`--spec-type ngram-mod --spec-ngram-size-n 24 --draft-min 12 --draft-max 48`'。我不确定这是最佳设置,但对我来说效果很好,我会继续尝试调整。
我的 llama-swap 命令:
${llama-server} -m ${models}/Qwen3.6-27B/Qwen3.6-27B-Q8_0.gguf --mmproj ${models}/Qwen3.6-27B/mmproj-BF16Qwen3.6-27B.gguf --no-mmproj-offload --spec-type ngram-mod --spec-ngram-size-n 24 --draft-min 12 --draft-max 48 --ctx-size 128000 --temp 1.0 --top-p 0.95 --top-k 20 --presence_penalty 1.5 --chat-template-kwargs '{"preserve_thinking": true}'
我的 Linux PC 配置为 40GB VRAM(rtx3090 和 rtx4060ti)以及 128GB DDR5 RAM。
非常感谢所有为 llamacpp 做出贡献的聪明人们、这个 Reddit 社区以及 Qwen 团队。免费午餐,快来试试吧……
编辑:我忘了提到 llama.cpp 两天前的一些更新,记得更新一下。
相似文章
Qwen 27B
一位用户报告称,在q6kxl量化与多token预测下,Qwen 27B在4090+3090系统上使用LCPP实现了50-90 token/s的解码速度和1500-2200 token/s的预填充速度,并指出它在各种编码任务中表现稳定、快速且连贯。
Qwen 3.6 27B 投机解码基准测试:单张 RTX 3090 上实现 ~100 TPS
一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。
Qwen 3.6 27B 在 llama.cpp 中的标志/设置
一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。
Qwen 3.8 27B 比预期更快
一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。
在 12GB 显存下,使用 Qwen3.6 35B A3B 与 llama.cpp MTP 实现 80 tok/sec 的速度和 128K 上下文
一名用户分享了一份配置方案,该方案在使用 llama.cpp 和多令牌预测(MTP)的情况下,能在 12GB 显存的 GPU 上让 Qwen3.6 35B A3B 模型实现超过每秒 80 个令牌的生成速度。帖子中包含了基准测试结果以及用于优化性能的具体命令行参数。