Llama.cpp B9406 MTP mmproj 修复
摘要
Llama.cpp 版本 B9406 修复了在使用 MTP 和 MoE 视觉模型(例如 Qwen3.6-35B-A3B)时出现的崩溃问题 (GGML_ASSERT)。
[B9406](https://github.com/ggml-org/llama.cpp/releases/tag/b9406) 等了很久了。正在编译。如果测试了请汇报结果!>GGML\\_ASSERT(i01 >= 0 && i01 < ne01) 崩溃发生在 get\\_rows / mtmd\\_helper\\_decode\\_image\\_chunk 中,当使用 MTP + MoE 模型 + 视觉 (Qwen3.6-35B-A3B) 时。
相似文章
MTP 已发布 Qwen3.8-Flash-Next-GGUF
Qwen3.8-Flash-Next-GGUF 模型的 MTP 已发布,并提供了与 llama.cpp、vLLM 和 Ollama 等推理工具集成的详细部署说明。
@victormustar: 支持MTP的llama.cpp使本地模型足够快,可作为日常驱动 Qwen3.6-27B密集生成(在A10G上…
llama.cpp为Qwen3.6模型添加MTP支持,在A10G硬件上将生成速度提升78%,使本地模型可作为日常驱动使用。
qwen4exp 在 llama.cpp 中的修复
本文报道了 llama.cpp 中针对 Qwen Flash Next 模型的最近错误修复和更新,建议用户频繁更新其构建版本。
llama.cpp MTP推测解码简化:2026年7月在密集模型上大获成功,MoE上表现平平
对llama.cpp中原生MTP推测解码的分析表明,像Qwen3.6-27B这样的密集模型获得了显著的加速(1.4倍至2.2倍),但在MoE架构上结果不尽人意,由于每步开销已经很低,收益微乎其微。
PSA:llama.cpp 现在默认加载任何 draft-mtp 架构的 MTP 张量,即使 MTP 被禁用
最新版本的 llama.cpp 现在会自动为 draft-mtp 架构加载 MTP 张量,即使未启用推测解码,这可能会增加其 GGUF 文件中捆绑了 MTP 块的用户的显存使用量。