MTP 和 QTA 有什么关系?

Reddit r/LocalLLaMA 工具

摘要

一位用户寻求澄清 llama.cpp 中 MTP(多 token 预测)与 QAT(量化感知训练)之间的关系,特别是关于 Gemma4 模型的 GGUF 兼容性以及文件名中新增的 QAT 字符串。

我是个老家伙,讨厌变化太快,周围全是噪音和爆炸性新闻!MTP,我知道它的缩写含义以及它擅长的地方。Gemma4 31b dense 是我的目标。Unsloth、Google、GGUF、张量……信息重叠太多。我讨厌看到没有清晰路径的情况。请帮帮我…… 事实 1 = MTP 已合并到 llama.cpp 中 事实 2 = 旧的 GGUF 不兼容 事实 3 = 我需要第二个文件与 GGUF 一起加载 这些事实检查正确吗?哪个 GGUF 可以?为什么 Unsloth 在其文件名中添加了“QTA”魔法字符串,却没有明确说明与使用场景的关系?不要让我去 hf/SomeRandomUsername/gemma4-31b-it-SomeRandomShit,因为我不想测试某个随机的 GGUF。**我想测试基线/官方资源来形成自己的看法。**我不是坏人,但现在互联网、博客和论坛就像伊斯坦布尔的大巴扎,每走一步都要避开骗局/广告/垃圾。和平。 --- 编辑 --- 是 QAT,不是 QTA。这证明我不是机器人,哈哈……
查看原文

相似文章

你对Gemma4 QAT的体验如何?

Reddit r/LocalLLaMA

用户分享了使用Gemma4 QAT模型的积极体验,提到质量提升和MTP带来的速度增益,并询问其他人的体验。

更多QAT内容以及毛茸茸的tick

Reddit r/LocalLLaMA

作者发布了Gemma 4模型(12B和31B)改进后的GGUF量化版本,采用了更精确的量化感知训练过程,相比原版量化实现了更低的KLD和更高的同top百分比。