@julien_c: 我注意到网上有些困惑,关于如何以最简单的方式运行带MTP(多令牌预测)的llama.cpp……
摘要
Julien C 解释了如何运行带有MTP(多令牌预测)的llama.cpp,以实现约2倍的生成速度,可以使用Dense 27B或MoE 35B模型,并提供了安装和配置说明。
查看缓存全文
缓存时间: 2026/05/19 14:48
我在网上看到一些关于如何用最简单的方式运行带 MTP(多 token 预测)功能的 llama.cpp 的困惑。
简而言之(ICYMI),MTP 是一种内置于模型本身的新型推测性解码技术,在大多数使用场景下能让你的每秒 token 数大约翻倍。
2 倍生成速度 = 真正的重大突破。
如何运行?
brew upgrade llama.cpp
# 或者你可能需要从源码安装,直到 build 9200 进入你的包管理器:
brew install llama.cpp --HEAD
然后选择 Dense 27B 或 35B A3B MoE 模型。
我个人倾向于使用 Dense 模型,在我的机器上能达到约 30 tok/sec。MoE 则更快,在我的机器上能达到惊人的约 100 tok/sec。确实非常快。
两种情况下,你可能需要 48GB 或更好的 64GB RAM 或 VRAM,不过 36GB 配合更大量化版本也或许可行。
Dense:
llama-server -hf ggml-org/Qwen3.6-27B-MTP-GGUF --spec-type draft-mtp --spec-draft-n-max 2
MoE:
llama-server -hf ggml-org/Qwen3.6-35B-A3B-MTP-GGUF --spec-type draft-mtp --spec-draft-n-max 3
尽情享受!
相似文章
LLaMA.cpp的多令牌预测(MTP)——Gemma 4速度提升40%
llama.cpp中新的多令牌预测(MTP)实现为Gemma 4模型带来了40%的速度提升,已在MacBook Pro M5Max上测试。文章提供了量化GGUF模型和补丁源代码的链接。
这是个好消息...
多令牌预测(MTP)已获批准集成到llama.cpp中,表明本地LLM推理工具即将更新。
MTP+GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 - llama.cpp
一位用户在 llama.cpp 上使用 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 标志对令牌生成速度进行基准测试,比较启用和未启用 MTP(多令牌预测)时的性能。结果显示,在 RTX5090 上使用 Qwen3.6-27B 模型时,启用 MTP 后速度从 49 tok/s 显著提升至 64 tok/s。
llama + spec: 由 am17an 提交的 MTP 支持 · Pull Request #22673 · ggml-org/llama.cpp
拉取请求为 llama.cpp 添加多令牌预测(MTP)支持,启用推测解码以加速推理。
llama.cpp MTP推测解码简化:2026年7月在密集模型上大获成功,MoE上表现平平
对llama.cpp中原生MTP推测解码的分析表明,像Qwen3.6-27B这样的密集模型获得了显著的加速(1.4倍至2.2倍),但在MoE架构上结果不尽人意,由于每步开销已经很低,收益微乎其微。