充分发挥MTP的性能
摘要
一份通过调整n_max参数来优化MTP(多令牌预测)性能的指南,附带了多种模型(如Gemma-31b和Qwen)在P100和V100 GPU上的基准测试结果。
如果你想充分发挥MTP的性能,就必须进行一些测试或基准测试。使用默认设置打开它虽然能带来改进,但对于许多模型和显卡组合来说,如果不调整n_max,会浪费大量性能。在某些模型上,可能会轻易损失50-100%的潜在性能。我针对自己在硬件(p100 + 2xV100)上使用的各种模型进行了一些基准测试,发现不同模型家族之间存在相当大的差异。以下是我得到的一些结果。完整细节、其他一些模型(包括对显存的影响)以及运行基准测试的脚本都在GitHub上:https://github.com/bradrlaw/ai-server/blob/main/docs/benchmarking.md
Gemma-31b 随着n-max的增加而表现良好
Qwen 从中等设置中获益最多
大家最爱的模型扩展得很好
较小的Gemma模型行为与较大的相反
相似文章
MTP 关键在于接受率
一位用户在 M4 Max Studio 上使用 mlx-vlm 对 Gemma 4 进行了 MTP(多令牌预测)基准测试,发现它在代码生成方面表现出色(速度快 1.53 倍,接受率 66%),但对 JSON 输出不利(速度慢 50%,接受率仅 8%),对长篇散文则影响中性,表明当令牌接受率低于 50% 时,MTP 的优势便荡然无存。
我在 vLLM 和 llama.cpp 上对 Gemma 4 和 Qwen 3.6 测试了 MTP —— 推理速度提升 3.34 倍,这是我的发现(RTX 6000 PRO)。
使用 vLLM 和 llama.cpp 对 Gemma 4 31B 和 Qwen 3.6 27B 进行的多令牌预测(MTP)基准测试显示,推理速度最高提升 3.34 倍,最优推测令牌数量因模型和引擎而异。
更多 Qwen3.6-27B MTP 的成功案例,但这次是在双路 Mi50 上
本文在双路 Mi50 GPU 上,使用多令牌预测(MTP)和张量并行技术对 Qwen3.6-27B 模型进行了基准测试,展示了通过 llama.cpp 实现的显著加速效果。
LLaMA.cpp的多令牌预测(MTP)——Gemma 4速度提升40%
llama.cpp中新的多令牌预测(MTP)实现为Gemma 4模型带来了40%的速度提升,已在MacBook Pro M5Max上测试。文章提供了量化GGUF模型和补丁源代码的链接。
MTP(多令牌预测):在AMD Strix Halo和Radeon 9700 AI Pro上实现2倍令牌生成加速
MTP(多令牌预测)可以将LLM推理速度提高2倍,尤其适用于编码代理。本视频展示了Qwen 3.6在AMD Strix Halo和双Radeon 9700上的性能提升。