我的 GGUF 上传的新张量类型布局
摘要
作者分享了一篇关于 GGUF 上传的新张量类型布局的博客文章,详细描述了显示改进的模型量化性能的研究。
大家好,好久没发帖了。我想出来露个面,指向一篇我刚发布的博客文章,关于我进行的研究和我在发布的模型形状上所做的更改,你可以在这里阅读:https://huggingface.co/blog/bartowski/per-tensor-layout-maps-for-gguf-quantization 我不会试图声称“帕累托前沿”或“世界上最好的模型”,但从测试来看,新的形状看起来总体上比我之前发布的要好,所以我对结果非常满意,我希望这还不是结束 :) https://cdn-uploads.huggingface.co/production/uploads/6435718aaaef013d1aec3b8b/Ufz9TXQlKFxVHdocVoZIw.png 如果任何人有任何问题,请告诉我!
相似文章
Gemma 4 12B Q3:通过张量级量化分配实现 +8.55% 编码性能提升
一位开发者创建了一个任务感知的 GGUF 量化流水线,利用张量级比特分配,在手调 imatrix 基础上将 Gemma 4 12B Q3 的编码性能提升了 8.55%,而模型大小仅增加了 0.119%。
@aisearchio: GLM 5.2 GGUF 已经来了!8位版本大小约为完整模型的一半。更小版本即将推出 https://huggingfa…
GLM 5.2 GGUF 量化模型已发布,8位版本大小约为完整模型的一半;更小版本即将推出。
更多QAT内容以及毛茸茸的tick
作者发布了Gemma 4模型(12B和31B)改进后的GGUF量化版本,采用了更精确的量化感知训练过程,相比原版量化实现了更低的KLD和更高的同top百分比。
@antirez:上传新的 2-bit HF imatrix GGUF:名称相同但内容不同,已修复共享专家的 down layer(原存在…
修复 imatrix 计算 bug 后,已将修正后的 2-bit GGUF 模型文件上传至 Hugging Face,从而提升了 logits 召回率并降低了误差。
google/gemma-4-12B-it-qat-q4_0-gguf
Google DeepMind 发布了 Gemma 4 模型,这些模型通过量化感知训练(QAT)进行了优化,并提供包括 GGUF 在内的多种格式,在降低内存需求的同时实现了高质量。