@julien_c: 我注意到网上有些困惑,关于如何以最简单的方式运行带MTP(多令牌预测)的llama.cpp……

X AI KOLs Following 工具

摘要

Julien C 解释了如何运行带有MTP(多令牌预测)的llama.cpp,以实现约2倍的生成速度,可以使用Dense 27B或MoE 35B模型,并提供了安装和配置说明。

我注意到网上有些困惑,关于如何以最简单的方式运行带MTP(多令牌预测)的llama.cpp。 ICYMI, MTP 是一种内置于模型本身的新型推测解码方式,对于大多数用例,它能使令牌每秒约翻倍。 2倍的生成速度 = 真正的游戏规则改变者。 如何运行? brew upgrade llama.cpp # 或者你可能需要从源码安装,直到你的包管理器中包含 build 9200: brew install llama.cpp --HEAD 然后选择 Dense 27B 或 35B A3B MoE 模型。 我个人倾向于使用 Dense 模型,在我的机器上能达到约30 tok/s。MoE 当然更快,在我的机器上达到惊人的约100 tok/s。真快。 两种情况下,你可能需要48GB或更好的64GB RAM或VRAM,虽然36GB配合更强量化的版本也可能可行。 # Dense: llama-server -hf ggml-org/Qwen3.6-27B-MTP-GGUF --spec-type draft-mtp --spec-draft-n-max 2 # MoE: llama-server -hf ggml-org/Qwen3.6-35B-A3B-MTP-GGUF --spec-type draft-mtp --spec-draft-n-max 3 祝使用愉快!
查看原文
查看缓存全文

缓存时间: 2026/05/19 14:48

我在网上看到一些关于如何用最简单的方式运行带 MTP(多 token 预测)功能的 llama.cpp 的困惑。

简而言之(ICYMI),MTP 是一种内置于模型本身的新型推测性解码技术,在大多数使用场景下能让你的每秒 token 数大约翻倍。

2 倍生成速度 = 真正的重大突破。

如何运行?

brew upgrade llama.cpp
# 或者你可能需要从源码安装,直到 build 9200 进入你的包管理器:
brew install llama.cpp --HEAD

然后选择 Dense 27B 或 35B A3B MoE 模型。

我个人倾向于使用 Dense 模型,在我的机器上能达到约 30 tok/sec。MoE 则更快,在我的机器上能达到惊人的约 100 tok/sec。确实非常快。

两种情况下,你可能需要 48GB 或更好的 64GB RAM 或 VRAM,不过 36GB 配合更大量化版本也或许可行。

Dense:

llama-server -hf ggml-org/Qwen3.6-27B-MTP-GGUF --spec-type draft-mtp --spec-draft-n-max 2

MoE:

llama-server -hf ggml-org/Qwen3.6-35B-A3B-MTP-GGUF --spec-type draft-mtp --spec-draft-n-max 3

尽情享受!

相似文章

这是个好消息...

Reddit r/LocalLLaMA

多令牌预测(MTP)已获批准集成到llama.cpp中,表明本地LLM推理工具即将更新。

MTP+GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 - llama.cpp

Reddit r/LocalLLaMA

一位用户在 llama.cpp 上使用 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 标志对令牌生成速度进行基准测试,比较启用和未启用 MTP(多令牌预测)时的性能。结果显示,在 RTX5090 上使用 Qwen3.6-27B 模型时,启用 MTP 后速度从 49 tok/s 显著提升至 64 tok/s。