Gemma 4 QAT 基准测试结果(AMD 7900 XTX):速度更快,显存占用更少,质量无损
摘要
一位用户在 AMD 7900 XTX 上对 Google 的 Gemma 4 QAT 模型进行了基准测试,报告显示生成速度提升高达 45%,吞吐量提高 83%,显存占用大幅减少(例如 12B QAT 模型节省 5.7GB),且与标准权重相比质量无损。
我一直在用这张 7900 XTX 反复进行大量测试。我之前的所有工作负载都依赖 qwen3.6 模型,这些模型本身非常出色,但我希望获得更多样化的思路。特别是针对 Honcho 工作负载层级和不同的定时任务。并非所有工作负载都能从智能体调优模型中受益,因此我最近更多地测试了 Gemma 4 模型。此外,他们还发布了 Gemma 4 系列的量化感知训练版本,据称这些版本在 Q4 权重下能保持 BF16 权重的保真度。我对这两套模型进行了 A/B 对比测试,以观察它们之间的差异以及是否存在显著不同。更小的模型,更快的速度,高保真度?谁不喜欢免费的午餐呢!以下是包含配置版本、标志等信息的详细报告。我的智能体没有抓取实际的 tok/s 测量值(当然),但你可以通过整体的挂钟时间得到一个粗略的概念。包含数据的完整文章:https://kmarble.dev/posts/gemma-4-qat-benchmark-same-quality-faster-less-vram/
各模型摘要:
• 12B QAT 对比 Q8_0 — 这是最值得替换的。总生成时间从 323 秒降至 176 秒(快了 45%),吞吐量提升 83%,节省 5.7GB 显存。所有提示的质量均相同。在约束遵循方面,普通 Q8_0 花费 124 秒迭代草稿,而 QAT 仅用 24 秒就完成。
• 26B QAT 对比 UD-Q4 — 显存占用确实更少。持续的中等提升(1.0 倍到 1.38 倍加速),节省 2GB 显存。在温度=1.0 时,任何提示类型均未观察到质量下降。
• 31B QAT 对比 Q4_K_M — 尽管显存节省不多,但仍然值得。速度快 1.3 到 1.5 倍,实际总输出量增加了 8%。在创意续写方面:普通版本生成了 710 个字符后停止,QAT 则生成了 1256 个字符。
• E4B — 暂且跳过。结果受到位宽差异的影响(普通版本为 q8_0,QAT 为 q4 级别)。需要在相同精度下进行比较。
测试环境:单张 AMD 7900 XTX / ROCm,通过 llama-swap 运行,温度=1.0,无 token 上限。
[完整原始输出(约 170KB markdown)](https://kmarble.dev/artifacts/gemma-4-qat-benchmark-same-quality-faster-less-vram/raw-outputs.md) 供有兴趣深入查看实际生成内容的读者参考。
相似文章
在12GB显存上使用Gemma 4 12B QAT MTP实现120 tok/s
Google的Gemma 4 12B QAT模型通过llama.cpp的多令牌预测(MTP)在12GB GPU上达到120 tok/s。本文提供分步指南以及无MTP的基准对比,显示速度提升2倍。
Qwen3.6-35B 与 Gemma4-26B 在 7900 XTX 上的对比
一项详细的基准测试对比了 Radeon 7900 XTX 上的 Qwen3.6-35B 和 Gemma4-26B,结果显示尽管 Gemma 的 token 生成速度较慢,但端到端快了约 20%,原因是 Qwen 因内部推理生成了约两倍的 token。文章建议:在吞吐量受限的批量任务中使用 Qwen,在延迟敏感的单次请求中使用 Gemma。
Gemma 4 QAT模型:为移动和笔记本电脑效率优化压缩
谷歌发布采用量化感知训练(QAT)优化的Gemma 4模型,旨在提升移动和笔记本电脑部署的效率,将E2B模型的内存占用降至1GB,同时保持质量。
[3090] Gemma4 QAT + MTP 快速TPS数据 [TLDR 提升1.2-1.8倍]
基准测试结果显示,在24GB RTX 3090 GPU上使用QAT和MTP,Gemma 4模型(12B和26B)的每秒token速度提升了1.2-1.8倍。
@analogalok: Gemma 4 12B QAT(密集)在8GB显存和120k上下文下实现超过1000 tokens/秒的预填充速度 Gemma 4 12B QAT(密集),TurboQ…
Gemma 4 12B QAT(密集)使用TurboQuant在8GB RTX 4060上实现超过1000 tokens/秒的预填充速度,支持120k上下文,实现完整的GPU层卸载。相比之前的方法,预填充速度提升了42%。