LLaMA.cpp的多令牌预测(MTP)——Gemma 4速度提升40%

Reddit r/LocalLLaMA 工具

摘要

llama.cpp中新的多令牌预测(MTP)实现为Gemma 4模型带来了40%的速度提升,已在MacBook Pro M5Max上测试。文章提供了量化GGUF模型和补丁源代码的链接。

为LLaMA.cpp实现了多令牌预测。将Gemma 4助手模型量化为GGUF格式。在MacBook Pro M5Max上运行测试。Gemma 26B使用MTP生成令牌速度提升40%。提示:用递归编写一个Python程序查找第n个斐波那契数。输出:LLaMA.cpp: 97 tokens/s; LLaMA.cpp + MTP: 138 tokens/s。Gemma4-assistant GGUF量化模型:[https://huggingface.co/collections/AtomicChat/gemma-4-assistant-gguf](https://huggingface.co/collections/AtomicChat/gemma-4-assistant-gguf) 本地AI模型应用:[http://atomic.chat](http://atomic.chat) 修补后的llama.cpp:[https://github.com/AtomicBot-ai/atomic-llama-cpp-turboquant](https://github.com/AtomicBot-ai/atomic-llama-cpp-turboquant)
查看原文

相似文章

[WIP] Gemma 4 MTP

Reddit r/LocalLLaMA

llama.cpp 是一个开源 C/C++ 库,用于在各种硬件上高效进行 LLM 推理,支持多种量化格式和 GPU 后端。本篇 README 详细介绍了其功能、安装方法以及近期更新,包括 Hugging Face 缓存迁移和多模态支持。

MTP+GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 - llama.cpp

Reddit r/LocalLLaMA

一位用户在 llama.cpp 上使用 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 标志对令牌生成速度进行基准测试,比较启用和未启用 MTP(多令牌预测)时的性能。结果显示,在 RTX5090 上使用 Qwen3.6-27B 模型时,启用 MTP 后速度从 49 tok/s 显著提升至 64 tok/s。