@Tono_Ken3: 为gemma-4-12B-coder-fable5-composer2.5-GGUF添加了Q3系列。你可能可以在编码中尝试Fable5(作为教师角色)的精髓……
摘要
新的Q3量化版本已添加到gemma-4-12B-coder-fable5-composer2.5 GGUF模型中,通过重要性矩阵量化版本,使得这一专注于编码的微调模型能够在大约6GB显存的GPU上运行。
查看缓存全文
缓存时间: 2026/06/16 11:49
已将 Q3 系列添加到 gemma-4-12B-coder-fable5-composer2.5-GGUF 中。你或许可以在约 6GB VRAM 的 GPU 上体验 Fable5(作为导师角色)在编码方面的精髓。
sakamakismile/gemma-4-12B-coder-fable5-composer2.5-GGUF · Hugging Face
来源:https://huggingface.co/sakamakismile/gemma-4-12B-coder-fable5-composer2.5-GGUF
💻 Gemma-4-12B-Coder (fable5 × composer2.5) — imatrix GGUF ✨
只要 llama.cpp 能跑的地方就能跑 — AMD/Vulkan、CPU、Apple、NVIDIA。没有 Blackwell,没有 MTP,只是 GGUF。 🐧🍎🪟
重要性矩阵(imatrix)量化版本,基于 yuxinlu1 的编码模型(https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF),并使用真实 Python 编码数据进行校准,因此低位版本依然保持编码能力。纯文本(编码模型,无视觉包袱)。 💚
🙏 致谢
量化版本来自 yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1 (https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF) — 感谢 @yuxinlu1(https://huggingface.co/yuxinlu1) 提供该模型。请为原项目点星并关注 v2!作者的配方:在 执行验证 的 Python 编码思维链(Composer 2.5 真实 CoT + 针对难题的 Fable 5 “二次尝试”集)上微调 google/gemma-4-12B-it。它以 Gemma 的原生通道进行思考,然后编写干净可运行的代码。已去除拒绝机制;以 Python/算法为重点;面向英语。
本仓库的目的: 原始版本是静态 GGUF。这些版本添加了重要性矩阵(经过代码校准),使得 IQ4_XS / Q4_K 在低 VRAM 下保持更高质量 — 这些版本适合 AMD/Vulkan 和 CPU 用户。
📦 选择你的量化等级(全部为 imatrix)
| 量化等级 | 大小 | 描述 |
|---|---|---|
| 🟢 Q3_K_S | 5.53 GB | 最小可工作版本 — 适用于 8 GB / 6 GB 显卡(为上下文留出空间)。~91.7% HumanEval[:12] |
| 🟢 Q3_K_M | 6.09 GB | 小巧且锐利 — 100% HumanEval[:15] |
| 🔵 IQ4_XS | 6.64 GB | imatrix 4-bit 甜点 — 100% HumanEval[:15] |
| 🔵 Q4_K_M | 7.38 GB | 均衡(嵌入/输出为 Q6_K) |
| ⚪ Q5_K_M | 8.55 GB | 如果你有足够的 RAM/VRAM,质量优先 |
💡 8 GB VRAM(或 6 GB): 选择 Q3_K_S(5.5 GB) — 它为上下文留出空间且编码表现良好。在 Vulkan 后端(AMD)上所有这些版本都飞快运行。 ⚠️ 对此模型避免使用 IQ3(i-quant 3-bit) —
IQ3_XXS/IQ3_S在这里会崩溃成乱码(gemma-4 的特殊注意力层无法在 3-bit i-quant 下存活)。同样大小的Q3_K_*K-quant 保持连贯 — 这就是小规模版本提供 Q3_K 而非 IQ3 的原因。
🚀 运行它(llama.cpp — 任意后端)
# 用你的后端构建 llama.cpp(AMD 使用 Vulkan): cmake -B build -DGGML_VULKAN=ON && cmake --build build
# 下载一个量化版本:
hf download sakamakismile/gemma-4-12B-coder-fable5-composer2.5-GGUF gemma-4-12B-coder-fable5-composer2.5-IQ4_XS.gguf --local-dir .
# 聊天服务器(OpenAI 兼容,位于 http://localhost:8080)
./llama-server -m gemma-4-12B-coder-fable5-composer2.5-IQ4_XS.gguf \
-ngl 99 --ctx-size 16384 -fa on --jinja \
--temp 1.0 --top-p 0.95 --top-k 64 --host 0.0.0.0 --port 8080
⚠️ 需要较新的 llama.cpp — 这是
gemma4架构(旧版本无法加载)。 🧠 思考默认开启,通过聊天模板(--jinja)。模型会推理边缘情况,然后编写代码。如需确定性编码,请使用--temp 0。
🦙 Ollama(一行命令,直接使用本仓库)
ollama run hf.co/sakamakismile/gemma-4-12B-coder-fable5-composer2.5-GGUF:Q4_K_M
选择任意标签:Q3_K_S Q3_K_M IQ4_XS Q4_K_M Q5_K_M。
❗ “manifest not found”? 你必须同时包含
hf.co/前缀和一个明确的量化标签。如果没有标签,Ollama 会查找:latest(此处不存在);没有hf.co/,它会搜索 Ollama 自己的注册表而非本仓库。解决方法是使用...-GGUF:Q4_K_M格式。
也可在 LM Studio / Jan / KoboldCpp 中使用 — 导入 GGUF,选择量化版本,即可运行。 🐾
📊 性能如何?(贪婪 pass@1)
| 基准测试 | 分数 |
|---|---|
| HumanEval | 90.2% (148/164) |
| MBPP | 85.7% (366/427) |
在困难算法、错误修复与重构以及忠实的开放式推理方面表现出色。日语提示对 Python 质量无明显下降。
⚠️ 一个诚实的注意事项: 在时间序列 / 量化金融代码上,它可能会引入前瞻偏差(并且其推理可能陈述了正确的规则,但代码却做了相反的事情)。作为算法/调试助手很棒 — 但在信任其 pandas/numpy 回测代码之前,请仔细审查。
🔧 量化细节
- imatrix 基于代码密集型校准集(HumanEval + MBPP 问题与解决方案)计算,因此重要性矩阵反映了真实的编码激活模式。
- 来源:作者的
Q8_0GGUF(≈无损)。纯文本gemma4(无视觉/音频)。 - 较高等级将令牌嵌入和输出张量保持在
Q6_K(K-quant 默认值),以在最关键的地方保证保真度;Q3_K 等级在这方面略作牺牲以换取体积。 - 此处使用 K-quant 而非 i-quant: gemma-4 的异质注意力(head_dim 256 / 512 层)能在
Q3_K_*下存活,但会在IQ3_*下崩溃 — 已验证,因此小规模版本以 Q3_K 形式提供。
📚 许可与使用
Gemma 使用条款(https://ai.google.dev/gemma/terms)(衍生作品必须遵守)。已去除拒绝机制 / 未进行安全对齐 — 请自行添加防护措施。最适合 Python/算法任务;对于一般性事实和时间序列代码请再次核对。按原样提供。量化与评估由 Lna-Lab(https://huggingface.co/sakamakismile)完成;感谢 @yuxinlu1。 🐾✨
相似文章
yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
针对代码任务的 Gemma 4 12B 专注微调版本,从思维链数据(Composer 2.5 和 Fable 5)中蒸馏而来,并量化为 GGUF 格式,以在本地离线使用,仅需极低 VRAM 要求
@Tono_Ken3: 我注意到可能有另一个人也意识到,在实际工作中 gemma-4-12b 能够与 qwen3.6-35b 相媲美。是的……
一条推文指出,经过 abliterated 处理、NVFP4 量化的 Gemma-4-12B 模型(7.7 GB)在实际任务中能够与 Qwen 3.6-35B 相媲美,同时在 Blackwell GPU 上运行快速,展现了显著的效率提升。
Gemma 4 12B Q3:通过张量级量化分配实现 +8.55% 编码性能提升
一位开发者创建了一个任务感知的 GGUF 量化流水线,利用张量级比特分配,在手调 imatrix 基础上将 Gemma 4 12B Q3 的编码性能提升了 8.55%,而模型大小仅增加了 0.119%。
@analogalok: gemma-4-12B-agentic-fable5-composer2.5 V2 已发布。对基于 Fable 5 推理训练的模型进行了智能体升级。运行…
Gemma 4 12B 的一个新微调版本,基于 Fable 5 的推理进行训练,在智能体编码基准测试中实现了显著提升(从15%到55%),并且可以使用 llama.cpp 的自定义分支在 8GB VRAM GPU 上本地运行。
通俗版对比:Qwen3.6 35b-a3b 与 Gemma4-26b-a4b-it
Gemma 4-26b-a4b-it 基本是个基础扎实、能稳妥完成任务的 B 等生。Qwen3.6-35b-a3b 则是考出 A+ 的优等生,做完任务后还有余力搞点锦上添花的发挥。在我的 16GB 显存显卡上,两款模型运行速度相当。测试环境为 Windows 下的 LM Studio,采用推荐推理设置。使用的模型:unsloth/gemma-4-26B-A4B-it-UD-Q4_K_S 与 AesSedai/Qwen3.6-35B-A3B IQ4_XS。大家有不同意见吗?**更新:** 看来我之前用 Gemma 4 的方式不太对。[Sadman782 的评论](https://www.redd