@Tono_Ken3: 为gemma-4-12B-coder-fable5-composer2.5-GGUF添加了Q3系列。你可能可以在编码中尝试Fable5(作为教师角色)的精髓……

X AI KOLs Timeline 模型

摘要

新的Q3量化版本已添加到gemma-4-12B-coder-fable5-composer2.5 GGUF模型中,通过重要性矩阵量化版本,使得这一专注于编码的微调模型能够在大约6GB显存的GPU上运行。

为gemma-4-12B-coder-fable5-composer2.5-GGUF添加了Q3系列。即使在大约6GB显存的GPU上,你也可以在编码中尝试Fable5(作为教师角色)的精髓。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:49

已将 Q3 系列添加到 gemma-4-12B-coder-fable5-composer2.5-GGUF 中。你或许可以在约 6GB VRAM 的 GPU 上体验 Fable5(作为导师角色)在编码方面的精髓。


sakamakismile/gemma-4-12B-coder-fable5-composer2.5-GGUF · Hugging Face

来源:https://huggingface.co/sakamakismile/gemma-4-12B-coder-fable5-composer2.5-GGUF

💻 Gemma-4-12B-Coder (fable5 × composer2.5) — imatrix GGUF

只要 llama.cpp 能跑的地方就能跑 — AMD/Vulkan、CPU、Apple、NVIDIA。没有 Blackwell,没有 MTP,只是 GGUF。 🐧🍎🪟

重要性矩阵(imatrix)量化版本,基于 yuxinlu1 的编码模型(https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF),并使用真实 Python 编码数据进行校准,因此低位版本依然保持编码能力。纯文本(编码模型,无视觉包袱)。 💚


🙏 致谢

量化版本来自 yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1 (https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF) — 感谢 @yuxinlu1(https://huggingface.co/yuxinlu1) 提供该模型。请为原项目点星并关注 v2!作者的配方:在 执行验证 的 Python 编码思维链(Composer 2.5 真实 CoT + 针对难题的 Fable 5 “二次尝试”集)上微调 google/gemma-4-12B-it。它以 Gemma 的原生通道进行思考,然后编写干净可运行的代码。已去除拒绝机制;以 Python/算法为重点;面向英语。

本仓库的目的: 原始版本是静态 GGUF。这些版本添加了重要性矩阵(经过代码校准),使得 IQ4_XS / Q4_K 在低 VRAM 下保持更高质量 — 这些版本适合 AMD/Vulkan 和 CPU 用户。


📦 选择你的量化等级(全部为 imatrix)

量化等级大小描述
🟢 Q3_K_S5.53 GB最小可工作版本 — 适用于 8 GB / 6 GB 显卡(为上下文留出空间)。~91.7% HumanEval[:12]
🟢 Q3_K_M6.09 GB小巧锐利 — 100% HumanEval[:15]
🔵 IQ4_XS6.64 GBimatrix 4-bit 甜点 — 100% HumanEval[:15]
🔵 Q4_K_M7.38 GB均衡(嵌入/输出为 Q6_K)
Q5_K_M8.55 GB如果你有足够的 RAM/VRAM,质量优先

💡 8 GB VRAM(或 6 GB): 选择 Q3_K_S(5.5 GB) — 它为上下文留出空间且编码表现良好。在 Vulkan 后端(AMD)上所有这些版本都飞快运行。 ⚠️ 对此模型避免使用 IQ3(i-quant 3-bit)IQ3_XXS / IQ3_S 在这里会崩溃成乱码(gemma-4 的特殊注意力层无法在 3-bit i-quant 下存活)。同样大小的 Q3_K_* K-quant 保持连贯 — 这就是小规模版本提供 Q3_K 而非 IQ3 的原因。


🚀 运行它(llama.cpp — 任意后端)

# 用你的后端构建 llama.cpp(AMD 使用 Vulkan): cmake -B build -DGGML_VULKAN=ON && cmake --build build
# 下载一个量化版本:
hf download sakamakismile/gemma-4-12B-coder-fable5-composer2.5-GGUF gemma-4-12B-coder-fable5-composer2.5-IQ4_XS.gguf --local-dir .

# 聊天服务器(OpenAI 兼容,位于 http://localhost:8080)
./llama-server -m gemma-4-12B-coder-fable5-composer2.5-IQ4_XS.gguf \
  -ngl 99 --ctx-size 16384 -fa on --jinja \
  --temp 1.0 --top-p 0.95 --top-k 64 --host 0.0.0.0 --port 8080

⚠️ 需要较新的 llama.cpp — 这是 gemma4 架构(旧版本无法加载)。 🧠 思考默认开启,通过聊天模板(--jinja)。模型会推理边缘情况,然后编写代码。如需确定性编码,请使用 --temp 0

🦙 Ollama(一行命令,直接使用本仓库)

ollama run hf.co/sakamakismile/gemma-4-12B-coder-fable5-composer2.5-GGUF:Q4_K_M

选择任意标签:Q3_K_S Q3_K_M IQ4_XS Q4_K_M Q5_K_M

“manifest not found”? 你必须同时包含 hf.co/ 前缀一个明确的量化标签。如果没有标签,Ollama 会查找 :latest(此处不存在);没有 hf.co/,它会搜索 Ollama 自己的注册表而非本仓库。解决方法是使用 ...-GGUF:Q4_K_M 格式。

也可在 LM Studio / Jan / KoboldCpp 中使用 — 导入 GGUF,选择量化版本,即可运行。 🐾


📊 性能如何?(贪婪 pass@1)

基准测试分数
HumanEval90.2% (148/164)
MBPP85.7% (366/427)

在困难算法、错误修复与重构以及忠实的开放式推理方面表现出色。日语提示对 Python 质量无明显下降。

⚠️ 一个诚实的注意事项:时间序列 / 量化金融代码上,它可能会引入前瞻偏差(并且其推理可能陈述了正确的规则,但代码却做了相反的事情)。作为算法/调试助手很棒 — 但在信任其 pandas/numpy 回测代码之前,请仔细审查


🔧 量化细节

  • imatrix 基于代码密集型校准集(HumanEval + MBPP 问题与解决方案)计算,因此重要性矩阵反映了真实的编码激活模式。
  • 来源:作者的 Q8_0 GGUF(≈无损)。纯文本 gemma4(无视觉/音频)。
  • 较高等级将令牌嵌入和输出张量保持在 Q6_K(K-quant 默认值),以在最关键的地方保证保真度;Q3_K 等级在这方面略作牺牲以换取体积。
  • 此处使用 K-quant 而非 i-quant: gemma-4 的异质注意力(head_dim 256 / 512 层)能在 Q3_K_* 下存活,但会在 IQ3_*崩溃 — 已验证,因此小规模版本以 Q3_K 形式提供。

📚 许可与使用

Gemma 使用条款(https://ai.google.dev/gemma/terms)(衍生作品必须遵守)。已去除拒绝机制 / 未进行安全对齐 — 请自行添加防护措施。最适合 Python/算法任务;对于一般性事实和时间序列代码请再次核对。按原样提供。量化与评估由 Lna-Lab(https://huggingface.co/sakamakismile)完成;感谢 @yuxinlu1。 🐾✨

相似文章

yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF

Hugging Face Models Trending

针对代码任务的 Gemma 4 12B 专注微调版本,从思维链数据(Composer 2.5 和 Fable 5)中蒸馏而来,并量化为 GGUF 格式,以在本地离线使用,仅需极低 VRAM 要求

通俗版对比:Qwen3.6 35b-a3b 与 Gemma4-26b-a4b-it

Reddit r/LocalLLaMA

Gemma 4-26b-a4b-it 基本是个基础扎实、能稳妥完成任务的 B 等生。Qwen3.6-35b-a3b 则是考出 A+ 的优等生,做完任务后还有余力搞点锦上添花的发挥。在我的 16GB 显存显卡上,两款模型运行速度相当。测试环境为 Windows 下的 LM Studio,采用推荐推理设置。使用的模型:unsloth/gemma-4-26B-A4B-it-UD-Q4_K_S 与 AesSedai/Qwen3.6-35B-A3B IQ4_XS。大家有不同意见吗?**更新:** 看来我之前用 Gemma 4 的方式不太对。[Sadman782 的评论](https://www.redd