@jakevin7: 最近在看 GLM 5.2 相关的文档,发现一些有趣的内容分享一下。 GLM-5.2 用了 MTP(Multi-Token Prediction)来加速推理:用一个轻量的"草稿模型"先快速预测多个 token,再用大模型一次性验证,接受则跳…
摘要
GLM-5.2采用了MTP(Multi-Token Prediction)技术加速推理,并修复了GLM-5.1中MTP训练推理不一致导致的KV cache混用问题。
查看缓存全文
缓存时间: 2026/06/20 20:22
最近在看 GLM 5.2 相关的文档,发现一些有趣的内容分享一下。
GLM-5.2 用了 MTP(Multi-Token Prediction)来加速推理:用一个轻量的“草稿模型“先快速预测多个 token,再用大模型一次性验证,接受则跳过解码步骤。
文档里有一个有趣的 bug 修复:GLM-5.1 的 MTP 在第 2+ 步有一个“训练推理不一致“(training-inference discrepancy),导致 KV cache 混用了目标模型和 MTP 模型的结果,acceptance rate 偏低。GLM-5.2 通过 IndexShare + KVShare 解决了这个问题。
相似文章
@karminski3: 本地用vLLM部署GLM-5.2的速度终于上来了! 好消息终于轮到本地部署 GLM-5.2 了! 大家都知道 GLM-5.2 这次是自带了MTP头的, 可以进行推测性解码. 但是, 这个只适用于bf16原始精度的GLM-5.2, 而这玩意…
Community efforts, including a hybrid quantization approach by dnhkng, have enabled vLLM and SGLang to support GLM-5.2 with MTP heads, boosting local inference speed from 2 token/s to over 43 token/s on dual GH200 hardware. The challenge involved managing DSA-based MTP and quantization compatibility.
LLaMA.cpp的多令牌预测(MTP)——Gemma 4速度提升40%
llama.cpp中新的多令牌预测(MTP)实现为Gemma 4模型带来了40%的速度提升,已在MacBook Pro M5Max上测试。文章提供了量化GGUF模型和补丁源代码的链接。
@_yucheng_lu: MTP 使自回归 LLM 变快。同样的技巧能否用于扩散语言模型?与 @modal 进行了一次有趣的合作,探索……
介绍了多令牌残差预测(MRP)技术,该技术通过预测相邻去噪步骤之间的残差来加速扩散语言模型推理,在 SGLang 中实现了最高 1.56 倍的速度提升,并在激进解码设置中恢复了最高 +16 的准确率点数。
我在 vLLM 和 llama.cpp 上对 Gemma 4 和 Qwen 3.6 测试了 MTP —— 推理速度提升 3.34 倍,这是我的发现(RTX 6000 PRO)。
使用 vLLM 和 llama.cpp 对 Gemma 4 31B 和 Qwen 3.6 27B 进行的多令牌预测(MTP)基准测试显示,推理速度最高提升 3.34 倍,最优推测令牌数量因模型和引擎而异。
我进行了一些模型优化技巧,将GH200系统上的GLM5.2从约2.5 tok/s提升至超过50 tok/s。
一篇详细博客文章,描述了如何通过停止模型跨模块通信,并将FP8 MTP头部嫁接至INT4基础模型上,将双Grace Hopper系统上的GLM-5.2推理速度从2.5 tok/s显著提升到超过50 tok/s。