Llama.cpp B9406 MTP mmproj 修复
摘要
Llama.cpp 版本 B9406 修复了在使用 MTP 和 MoE 视觉模型(例如 Qwen3.6-35B-A3B)时出现的崩溃问题 (GGML_ASSERT)。
[B9406](https://github.com/ggml-org/llama.cpp/releases/tag/b9406) 等了很久了。正在编译。如果测试了请汇报结果!>GGML\\_ASSERT(i01 >= 0 && i01 < ne01) 崩溃发生在 get\\_rows / mtmd\\_helper\\_decode\\_image\\_chunk 中,当使用 MTP + MoE 模型 + 视觉 (Qwen3.6-35B-A3B) 时。
相似文章
@victormustar: 支持MTP的llama.cpp使本地模型足够快,可作为日常驱动 Qwen3.6-27B密集生成(在A10G上…
llama.cpp为Qwen3.6模型添加MTP支持,在A10G硬件上将生成速度提升78%,使本地模型可作为日常驱动使用。
llama.cpp MTP推测解码简化:2026年7月在密集模型上大获成功,MoE上表现平平
对llama.cpp中原生MTP推测解码的分析表明,像Qwen3.6-27B这样的密集模型获得了显著的加速(1.4倍至2.2倍),但在MoE架构上结果不尽人意,由于每步开销已经很低,收益微乎其微。
llama.cpp - Qwen3.6/3.5-MTP - 分享你的基准测试(t/s)
llama.cpp 发布 b9495 版本,针对 Qwen3.6/3.5-MTP(多令牌预测)进行了优化,并请用户分享他们的基准测试结果及完整的命令详情。
b9180 llama.cpp MTP 已落地
llama.cpp 版本 b9180 已发布,支持多令牌预测 (MTP)。此次发布标志着构建成功,开发者们如释重负。
StepFun 3.5 MTP 由 pwilkin 提交 · 拉取请求 #23274 · ggml-org/llama.cpp
为 llama.cpp 添加 StepFun 3.5 MTP 模型支持的拉取请求。