Gemma 4 QAT 基准测试结果(AMD 7900 XTX):速度更快,显存占用更少,质量无损

Reddit r/LocalLLaMA 模型

摘要

一位用户在 AMD 7900 XTX 上对 Google 的 Gemma 4 QAT 模型进行了基准测试,报告显示生成速度提升高达 45%,吞吐量提高 83%,显存占用大幅减少(例如 12B QAT 模型节省 5.7GB),且与标准权重相比质量无损。

我一直在用这张 7900 XTX 反复进行大量测试。我之前的所有工作负载都依赖 qwen3.6 模型,这些模型本身非常出色,但我希望获得更多样化的思路。特别是针对 Honcho 工作负载层级和不同的定时任务。并非所有工作负载都能从智能体调优模型中受益,因此我最近更多地测试了 Gemma 4 模型。此外,他们还发布了 Gemma 4 系列的量化感知训练版本,据称这些版本在 Q4 权重下能保持 BF16 权重的保真度。我对这两套模型进行了 A/B 对比测试,以观察它们之间的差异以及是否存在显著不同。更小的模型,更快的速度,高保真度?谁不喜欢免费的午餐呢!以下是包含配置版本、标志等信息的详细报告。我的智能体没有抓取实际的 tok/s 测量值(当然),但你可以通过整体的挂钟时间得到一个粗略的概念。包含数据的完整文章:https://kmarble.dev/posts/gemma-4-qat-benchmark-same-quality-faster-less-vram/ 各模型摘要: • 12B QAT 对比 Q8_0 — 这是最值得替换的。总生成时间从 323 秒降至 176 秒(快了 45%),吞吐量提升 83%,节省 5.7GB 显存。所有提示的质量均相同。在约束遵循方面,普通 Q8_0 花费 124 秒迭代草稿,而 QAT 仅用 24 秒就完成。 • 26B QAT 对比 UD-Q4 — 显存占用确实更少。持续的中等提升(1.0 倍到 1.38 倍加速),节省 2GB 显存。在温度=1.0 时,任何提示类型均未观察到质量下降。 • 31B QAT 对比 Q4_K_M — 尽管显存节省不多,但仍然值得。速度快 1.3 到 1.5 倍,实际总输出量增加了 8%。在创意续写方面:普通版本生成了 710 个字符后停止,QAT 则生成了 1256 个字符。 • E4B — 暂且跳过。结果受到位宽差异的影响(普通版本为 q8_0,QAT 为 q4 级别)。需要在相同精度下进行比较。 测试环境:单张 AMD 7900 XTX / ROCm,通过 llama-swap 运行,温度=1.0,无 token 上限。 [完整原始输出(约 170KB markdown)](https://kmarble.dev/artifacts/gemma-4-qat-benchmark-same-quality-faster-less-vram/raw-outputs.md) 供有兴趣深入查看实际生成内容的读者参考。
查看原文

相似文章

Qwen3.6-35B 与 Gemma4-26B 在 7900 XTX 上的对比

Reddit r/LocalLLaMA

一项详细的基准测试对比了 Radeon 7900 XTX 上的 Qwen3.6-35B 和 Gemma4-26B,结果显示尽管 Gemma 的 token 生成速度较慢,但端到端快了约 20%,原因是 Qwen 因内部推理生成了约两倍的 token。文章建议:在吞吐量受限的批量任务中使用 Qwen,在延迟敏感的单次请求中使用 Gemma。