使用MTP时,Gemma 4 12B QAT模型的速度反而比未使用时更慢...
摘要
用户报告在使用Vulkan后端时,Gemma 4 12B QAT模型开启MTP后的推理速度变慢,但发现切换到ROCm后性能显著提升,MTP下达到60t/s。
嘿,想看看有没有其他人遇到过这个问题?我在Proxmox LXC上使用16GB的9060XT,通过Docker运行llama-server,使用Vulkan后端,它一直运行得很棒——大多数模型开启MTP时速度为40-50t/s,甚至IQ2或IQ3的3.8 27B在约100k上下文时也能达到25t/s!但我一直在尝试Gemma 4 12B QAT,发现了一些奇怪的现象:尽管VRAM使用量仅约12GB,上下文为262k且启用了视觉功能,速度只有约33t/s,考虑到其大小,我认为应该更高。更奇怪的是,如果我添加MTP——VRAM使用量增加到约12.5GB,但速度却下降了。在draft n max = 1时,速度为32t/s,draft n max = 4时降至23t/s。我尝试过减少上下文、禁用视觉功能——甚至还尝试了多个QAT仓库,包括Unsloths和HuahuaCS。有什么想法吗?如果有所帮助,这是我的docker stack启动命令:command: > --models-preset /models/models.ini --models-max 1 --timeout 28800 --port 8080 --host 0.0.0.0 --no-mmap --metrics --kv-unified --jinja --sleep-idle-seconds 900 以及来自我的models.ini的内容:#version = 1 [*] flash-attn = on ngl = 99 t = 6 tb = 12 b = 2048 ub = 512 #cache-ram = 2048 reasoning = on reasoning-budget = 4000 reasoning-budget-message = "\n\n[SYSTEM: STOP REASONING. TIME TO RESPOND.]" reasoning-preserve = on [Gemma-4-12B] hf-repo = HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced:Q4_K_M temp = 0.6 top-p = 0.9 min-p = 0.05 top-k = 64 c = 262144 np = 1 repeat-penalty = 1.1 #b = 512 #spec-type = draft-mtp #spec-draft-n-max = 4 #spec-draft-p-min = 0.8 编辑:感谢那些评论的人。我尝试了你们建议的事情(如我在回复中所述),但遗憾的是没有看到任何改善。然而,我一时兴起尝试了ROCm而不是Vulkan,没有其他设置更改,突然:MTP下达到60t/s,无MTP时30t/s。所以,当前的server-vulkan镜像在Gemma 4上运行MTP时出了问题。我会检查我使用的其他模型,确保ROCm不会因为更快的Gemma-4-12B而影响它们,但至少我现在可以使用这个模型及其MTP头了!再次感谢 <3
相似文章
[3090] Gemma4 QAT + MTP 快速TPS数据 [TLDR 提升1.2-1.8倍]
基准测试结果显示,在24GB RTX 3090 GPU上使用QAT和MTP,Gemma 4模型(12B和26B)的每秒token速度提升了1.2-1.8倍。
在12GB显存上使用Gemma 4 12B QAT MTP实现120 tok/s
Google的Gemma 4 12B QAT模型通过llama.cpp的多令牌预测(MTP)在12GB GPU上达到120 tok/s。本文提供分步指南以及无MTP的基准对比,显示速度提升2倍。
使用 Q4_K MTP 草稿模型与 Gemma 4 31b 解码速度提升 10%
有用户报告,对于 Gemma 4 31b,将 f16 MTP 草稿模型量化到 Q4_K(而不是默认的 Q4_0)在双 3090 上解码速度大约提升 10%(从 65 TPS 到 72 TPS),而 Q2_K 表现更差。
你对Gemma4 QAT的体验如何?
用户分享了使用Gemma4 QAT模型的积极体验,提到质量提升和MTP带来的速度增益,并询问其他人的体验。
@osanseviero: Gemma 4 MTP 现已正式合并到 llama.cpp,这意味着你可以使用 Gemma 4 QAT + MTP 来实现轻量级且超快的…
Gemma 4 MTP 已合并到 llama.cpp,通过 Gemma 4 QAT 和 MTP 实现轻量且快速的推理。