@_philschmid: 更多 Gemma 4!新的 QAT Gemma 4 检查点,性能相似,内存使用减少约 4 倍!它附带了一种新的移动…

X AI KOLs Following 模型

摘要

新的 QAT Gemma 4 检查点提供相似的性能,内存使用减少约 4 倍,通过一种新的移动端量化格式,使 Gemma 4 E2B 的内存占用仅需 1GB。

更多 Gemma 4!新的 QAT Gemma 4 检查点,性能相似,内存使用减少约 4 倍! 它附带了一种新的移动端量化格式,将 Gemma 4 E2B 的内存占用降至仅 1GB。 量化感知训练(QAT)在训练过程中模拟低精度运算,从而实现后续的无损量化,生成更小、更快的模型,同时保持准确性。 可在 @huggingface 上获取,并能直接运行。
查看原文
查看缓存全文

缓存时间: 2026/06/08 15:22

更多Gemma 4!全新QAT Gemma 4检查点,性能相近,内存占用减少约4倍!

它采用了新型移动量化格式,将Gemma 4 E2B的内存占用降至仅1GB。

量化感知训练(QAT)在训练过程中模拟低精度运算,从而在后续实现无损量化,得到更小、更快的模型,同时保持准确性。

已在@huggingface上线,可直接运行。

相似文章

Gemma 4 26B A4B IT QAT 对比

Reddit r/LocalLLaMA

一位用户在MMLU_PRO和HumanEval上对Gemma 4 26B IT的三个量化版本(4位、6位和8位QAT)进行了基准测试,发现QAT 8位模型在HumanEval上的表现不如6位量化版本,且并未明显优于4位版本,从而质疑QAT对此模型的优越性。