Qwen3.8-Flash-Next MTP 集成至 ik_llama.cpp(集成头或单独 -md 文件)... 在 5090 + 128GB 上 45 → 90 tok/s,甚至可在 12GB 4070 上运行

Reddit r/LocalLLaMA 工具

摘要

文章详细描述了将 Multi-Token Prediction (MTP) 支持合并至 ik_llama.cpp 的过程,这显著提升了 Qwen3.8-Flash-Next 模型的令牌生成速度,基准测试显示在高端硬件上速度最高可提升一倍。

ik_llama.cpp 昨日合并了 qwen4exp MTP 支持(PR #2369,我的提交,经四人分别在各自硬件上审查和测试)。现已在主分支上,无需 fork 或补丁。发布此消息是因为最近几个线程有人声称该模型的 MTP 仅存在于 unsloth fork PR 中……还有其他途径。Flash-Next 附带一个 2.6B MTP 头,但公共转换器曾忽略它。加载后,模型自行草拟下一个令牌并进行验证,因此输出与未加载时相同。在代码任务中,草拟接受率可达 93-99%,散文任务约为 60-65%。数据,解码 tok/s,无 MTP → 有 MTP。我的 5090 + 128GB DDR5,专家在 CPU 上:编码流量下,使用 ngram-mod 前置,45 → 90 tok/s。treo 在 RTX Pro 6000 上:代码 85 → 113 tok/s,但散文从 83 → 59 tok/s,因此散文任务尚未免费提升。joelfarthing 在 12GB 4070 上:代码在 n_max=1 时从 9.5 → 12.5 tok/s。注意:目前仅支持单槽位(-np 1),且 --jinja 会降低接受率,因为模板默认开启思考,推理文本草拟类似散文。标准 CUDA 构建后,运行:llama-server -m Qwen3.8-Flash-Next-MXFP4-ngramQ8-NextN.gguf -ngl 999 -ncmoe 38 -fa 1 -c 196608 -ub 512 -ctk q8_0 -ctv q8_0 -np 1 -t 24 -tb 32 --jinja --spec-type ngram-mod:n_min=4 --spec-type mtp:n_max=4 --spec-ckpt-mode gpu-fallback -rtr -muge 已有 unsloth 或其他量化版本?单独头路径适用于相同代码,无需重新拉取:-md <head>.gguf --spec-type mtp:n_max=4。dzannotti 和 ji-farthing 的头文件均在审查期间经过测试。尚未尝试 unsloth 的“共享”分片,布局不同。PR: https://github.com/ikawrakow/ik_llama.cpp/pull/2369 我的集成头 MXFP4 文件:https://huggingface.co/jamesrogers/Qwen3.8-Flash-Next-MTP-MXFP4-GGUF ji-farthing 的 ik_llama KT 量化 + 头文件:https://huggingface.co/ji-farthing/Qwen3.8-Flash-Next-ik-llama-GGUF 好奇您测量到的结果,尤其是 AMD 相关数据!
查看原文

相似文章

@Snixtp: https://x.com/Snixtp/status/2055734339346768225

X AI KOLs Timeline

某用户使用llama.cpp在单张RTX 3090上对Qwen3.6 27B的MTP变体与普通版本进行了基准测试,发现MTP在长上下文(32k-64k)下生成速度最高可提升2.37倍,但预填充较慢且暂不支持并发。

在6GB显存笔记本上使用Qwen3.6-35B-A3B的MTP:不值得

Reddit r/LocalLLaMA

在6GB显存笔记本上对llama.cpp中Qwen3.6-35B-A3B模型的多Token预测(MTP)支持进行的基准测试显示,MTP不值得使用,因为提示处理速度显著变慢,抵消了微小的生成速度提升。作者发现,对草稿KV缓存使用q4_0量化可以节省显存而不影响质量。