@jakevin7: 最近在看 GLM 5.2 相关的文档,发现一些有趣的内容分享一下。 GLM-5.2 用了 MTP(Multi-Token Prediction)来加速推理:用一个轻量的"草稿模型"先快速预测多个 token,再用大模型一次性验证,接受则跳…

X AI KOLs Following 模型

摘要

GLM-5.2采用了MTP(Multi-Token Prediction)技术加速推理,并修复了GLM-5.1中MTP训练推理不一致导致的KV cache混用问题。

最近在看 GLM 5.2 相关的文档,发现一些有趣的内容分享一下。 GLM-5.2 用了 MTP(Multi-Token Prediction)来加速推理:用一个轻量的"草稿模型"先快速预测多个 token,再用大模型一次性验证,接受则跳过解码步骤。 文档里有一个有趣的 bug 修复:GLM-5.1 的 MTP 在第 2+ 步有一个"训练推理不一致"(training-inference discrepancy),导致 KV cache 混用了目标模型和 MTP 模型的结果,acceptance rate 偏低。GLM-5.2 通过 IndexShare + KVShare 解决了这个问题。
查看原文
查看缓存全文

缓存时间: 2026/06/20 20:22

最近在看 GLM 5.2 相关的文档,发现一些有趣的内容分享一下。

GLM-5.2 用了 MTP(Multi-Token Prediction)来加速推理:用一个轻量的“草稿模型“先快速预测多个 token,再用大模型一次性验证,接受则跳过解码步骤。

文档里有一个有趣的 bug 修复:GLM-5.1 的 MTP 在第 2+ 步有一个“训练推理不一致“(training-inference discrepancy),导致 KV cache 混用了目标模型和 MTP 模型的结果,acceptance rate 偏低。GLM-5.2 通过 IndexShare + KVShare 解决了这个问题。

相似文章

@karminski3: 本地用vLLM部署GLM-5.2的速度终于上来了! 好消息终于轮到本地部署 GLM-5.2 了! 大家都知道 GLM-5.2 这次是自带了MTP头的, 可以进行推测性解码. 但是, 这个只适用于bf16原始精度的GLM-5.2, 而这玩意…

X AI KOLs Timeline

Community efforts, including a hybrid quantization approach by dnhkng, have enabled vLLM and SGLang to support GLM-5.2 with MTP heads, boosting local inference speed from 2 token/s to over 43 token/s on dual GH200 hardware. The challenge involved managing DSA-based MTP and quantization compatibility.