PSA:llama.cpp 现在默认加载任何 draft-mtp 架构的 MTP 张量,即使 MTP 被禁用

Reddit r/LocalLLaMA 工具

摘要

最新版本的 llama.cpp 现在会自动为 draft-mtp 架构加载 MTP 张量,即使未启用推测解码,这可能会增加其 GGUF 文件中捆绑了 MTP 块的用户的显存使用量。

如果你的 GGUF 嵌入了 MTP/NextN 张量(如 GLM-5.2、hy_v3、qwen35moe、step35 等),最新的 llama.cpp 构建会默认加载它们——即使你从未传递 --spec-type draft-mtp。以前,除非你实际启用推测解码,否则它们会被跳过。大多数社区 GGUF 默认捆绑了 MTP 块,因此这意味着每次加载时都会增加额外的显存/内存使用(大约多一个 MoE 层),无论你是否使用 MTP。详见 https://github.com/ggml-org/llama.cpp/pull/25980
查看原文

相似文章