Qwen3.8-Flash-Next MTP 集成至 ik_llama.cpp(集成头或单独 -md 文件)... 在 5090 + 128GB 上 45 → 90 tok/s,甚至可在 12GB 4070 上运行
摘要
文章详细描述了将 Multi-Token Prediction (MTP) 支持合并至 ik_llama.cpp 的过程,这显著提升了 Qwen3.8-Flash-Next 模型的令牌生成速度,基准测试显示在高端硬件上速度最高可提升一倍。
ik_llama.cpp 昨日合并了 qwen4exp MTP 支持(PR #2369,我的提交,经四人分别在各自硬件上审查和测试)。现已在主分支上,无需 fork 或补丁。发布此消息是因为最近几个线程有人声称该模型的 MTP 仅存在于 unsloth fork PR 中……还有其他途径。Flash-Next 附带一个 2.6B MTP 头,但公共转换器曾忽略它。加载后,模型自行草拟下一个令牌并进行验证,因此输出与未加载时相同。在代码任务中,草拟接受率可达 93-99%,散文任务约为 60-65%。数据,解码 tok/s,无 MTP → 有 MTP。我的 5090 + 128GB DDR5,专家在 CPU 上:编码流量下,使用 ngram-mod 前置,45 → 90 tok/s。treo 在 RTX Pro 6000 上:代码 85 → 113 tok/s,但散文从 83 → 59 tok/s,因此散文任务尚未免费提升。joelfarthing 在 12GB 4070 上:代码在 n_max=1 时从 9.5 → 12.5 tok/s。注意:目前仅支持单槽位(-np 1),且 --jinja 会降低接受率,因为模板默认开启思考,推理文本草拟类似散文。标准 CUDA 构建后,运行:llama-server -m Qwen3.8-Flash-Next-MXFP4-ngramQ8-NextN.gguf -ngl 999 -ncmoe 38 -fa 1 -c 196608 -ub 512 -ctk q8_0 -ctv q8_0 -np 1 -t 24 -tb 32 --jinja --spec-type ngram-mod:n_min=4 --spec-type mtp:n_max=4 --spec-ckpt-mode gpu-fallback -rtr -muge 已有 unsloth 或其他量化版本?单独头路径适用于相同代码,无需重新拉取:-md <head>.gguf --spec-type mtp:n_max=4。dzannotti 和 ji-farthing 的头文件均在审查期间经过测试。尚未尝试 unsloth 的“共享”分片,布局不同。PR: https://github.com/ikawrakow/ik_llama.cpp/pull/2369 我的集成头 MXFP4 文件:https://huggingface.co/jamesrogers/Qwen3.8-Flash-Next-MTP-MXFP4-GGUF ji-farthing 的 ik_llama KT 量化 + 头文件:https://huggingface.co/ji-farthing/Qwen3.8-Flash-Next-ik-llama-GGUF 好奇您测量到的结果,尤其是 AMD 相关数据!
相似文章
[基准测试] DFlash2 与 MTP 比较。5090RTX, Qwen 3.8 27B, Dynamic v3 GGUF, llama.cpp。令牌生成、延迟和可用上下文。
该基准测试对 llama.cpp 中的 DFlash2 与 MTP 技术进行了比较,结果表明 DFlash2 的令牌生成速度提高了约 20%,但可用上下文减少了 38%。
@Snixtp: https://x.com/Snixtp/status/2055734339346768225
某用户使用llama.cpp在单张RTX 3090上对Qwen3.6 27B的MTP变体与普通版本进行了基准测试,发现MTP在长上下文(32k-64k)下生成速度最高可提升2.37倍,但预填充较慢且暂不支持并发。
在 12GB 显存下,使用 Qwen3.6 35B A3B 与 llama.cpp MTP 实现 80 tok/sec 的速度和 128K 上下文
一名用户分享了一份配置方案,该方案在使用 llama.cpp 和多令牌预测(MTP)的情况下,能在 12GB 显存的 GPU 上让 Qwen3.6 35B A3B 模型实现超过每秒 80 个令牌的生成速度。帖子中包含了基准测试结果以及用于优化性能的具体命令行参数。
Qwen3.8-Flash-Next 在单张96 GB显卡上支持170K上下文窗口,速度约110 tokens/秒。
本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。
在6GB显存笔记本上使用Qwen3.6-35B-A3B的MTP:不值得
在6GB显存笔记本上对llama.cpp中Qwen3.6-35B-A3B模型的多Token预测(MTP)支持进行的基准测试显示,MTP不值得使用,因为提示处理速度显著变慢,抵消了微小的生成速度提升。作者发现,对草稿KV缓存使用q4_0量化可以节省显存而不影响质量。