PSA:llama.cpp 现在默认加载任何 draft-mtp 架构的 MTP 张量,即使 MTP 被禁用
摘要
最新版本的 llama.cpp 现在会自动为 draft-mtp 架构加载 MTP 张量,即使未启用推测解码,这可能会增加其 GGUF 文件中捆绑了 MTP 块的用户的显存使用量。
如果你的 GGUF 嵌入了 MTP/NextN 张量(如 GLM-5.2、hy_v3、qwen35moe、step35 等),最新的 llama.cpp 构建会默认加载它们——即使你从未传递 --spec-type draft-mtp。以前,除非你实际启用推测解码,否则它们会被跳过。大多数社区 GGUF 默认捆绑了 MTP 块,因此这意味着每次加载时都会增加额外的显存/内存使用(大约多一个 MoE 层),无论你是否使用 MTP。详见 https://github.com/ggml-org/llama.cpp/pull/25980
相似文章
PSA:如果您几天未更新Llama.cpp,发现MTP性能不佳,请更新Llama.cpp。
更新Llama.cpp可获得显著的token生成速度提升,最高达1.5-1.8倍,并改善提示处理。
MTP 支持已合并至 llama.cpp
为 llama.cpp 添加 MTP(多令牌预测)支持的拉取请求已合并至 master 分支。
移除MTP中的填充和多重D2D拷贝 - 由gaugarg-nv提交 · 拉取请求#24086 · ggml-org/llama.cpp
一个针对 llama.cpp 的拉取请求,移除了多令牌预测 (MTP) 中的填充和多重设备到设备拷贝,提高了 GPU 上的性能。
llama.cpp MTP推测解码简化:2026年7月在密集模型上大获成功,MoE上表现平平
对llama.cpp中原生MTP推测解码的分析表明,像Qwen3.6-27B这样的密集模型获得了显著的加速(1.4倍至2.2倍),但在MoE架构上结果不尽人意,由于每步开销已经很低,收益微乎其微。
llama + spec: 由 am17an 提交的 MTP 支持 · Pull Request #22673 · ggml-org/llama.cpp
拉取请求为 llama.cpp 添加多令牌预测(MTP)支持,启用推测解码以加速推理。