Gemma 4 12B Q3:通过张量级量化分配实现 +8.55% 编码性能提升
摘要
一位开发者创建了一个任务感知的 GGUF 量化流水线,利用张量级比特分配,在手调 imatrix 基础上将 Gemma 4 12B Q3 的编码性能提升了 8.55%,而模型大小仅增加了 0.119%。
几个月来我一直在实验任务感知的 GGUF 量化,从 TASA 和 TAQO 中获得灵感,但将分配粒度进一步下探到张量级别。基本思路是:从特定类别的语料库生成自定义 imatrix,测量量化造成损失的位置,然后将固定的比特预算重新分配给那些在该类别中增加精度最能恢复性能的张量。今天我取得了首个真正的成功。这条流水线已经上线。
在 Gemma 4 12b 上,手调 imatrix 的 q3_k_s 得分 45.974。经过张量级分配后,同一 q3_k_s 基准的得分达到 49.905。这是在 imatrix 基础上通过分配获得的 +3.931 分,即 8.55% 的相对提升。两个模型的大小几乎相同:对照模型为 5,528,230,848 字节,分配后的模型为 5,534,804,928 字节,差异仅为 +0.119%。
我特意选择 q3。它在量化悬崖之上,同时拥有最大的可恢复余量。这个模型是有意针对特定类别进行专门化的。未选中类别中的性能下降是可以预期的。为了最大化这些结果,还有很多调整工作要做,但考虑到运行所需的空间,这个 imatrix + 分配在 q3 上的表现与无 imatrix 和原始模型相比,确实相当惊人。
如果大家感兴趣,我非常希望得到社区的测试和反馈。https://huggingface.co/ByteOtter/Gemma-4-12B-it-CADA-Q3_K_S
我的最终目标是创建一条流水线,接收全精度 .gguf 文件,并自动输出所选类别内以恢复效果最佳大小优化的模型。这是一个扎实的开端。图表由 ChatGPT 根据我的数据提供。
TL;DR:我构建了一条任务感知的 GGUF 量化流水线,将特定类别的 imatrix 与张量级损伤测量和比特分配相结合。在 Gemma 4 12B Q3_K_S 上,分配将编码性能从 45.974 提升到 49.905,相对于手调 imatrix 有 8.55% 的相对提升,而模型大小仅增加了 0.119%。该模型有意进行专门化,因此一些类别外的回归是预期内的。这是分配阶段本身产生明确优势的第一个结果。
相似文章
Gemma 4 QAT 31B 对 KV 缓存量化的响应也更好
Gemma 4 QAT 31B 模型在 KV 缓存量化时表现出更好的行为,表明推理效率得到提升。
Gemma 4 QAT模型:为移动和笔记本电脑效率优化压缩
谷歌发布采用量化感知训练(QAT)优化的Gemma 4模型,旨在提升移动和笔记本电脑部署的效率,将E2B模型的内存占用降至1GB,同时保持质量。
google/gemma-4-12B-it-qat-q4_0-gguf
Google DeepMind 发布了 Gemma 4 模型,这些模型通过量化感知训练(QAT)进行了优化,并提供包括 GGUF 在内的多种格式,在降低内存需求的同时实现了高质量。
自托管 Gemma 2 9B 与前沿 API 基准测试:NVIDIA L4 上的 FP8 量化预填充代价与显存现实 [P]
该基准测试将未量化的 Gemma 2 9B 模型与 FP8 量化变体在 NVIDIA L4 GPU 上进行比较,揭示了 FP8 量化引入了预填充代价(更高的 TTFT),但改善了解码延迟和显存使用,且在狭窄任务中语义漂移极小。
Gemma 4 26B-A4B GGUF 基准测试
嘿,r/LocalLLaMA 社区,我们为不同提供方的 Gemma 4 26B-A4B GGUF 进行了 KL 散度(KL Divergence)基准测试,以帮助大家挑选最佳的量化版本。* 平均 KL 散度结果使几乎所有 **Unsloth GGUF 都位于帕累托前沿** * KLD 用于衡量量化模型与原始 BF16 输出分布的匹配程度,从而反映模型保留的精度。* 这使得 Unsloth 在 21/22 种尺寸中**表现最佳。**99.9% KLD 及其他指标也呈现相似趋势。* 我们还更新了我们的 Q6_K 量化版本以提高动态性。此前,它们...