yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF

Hugging Face Models Trending 模型

摘要

针对代码任务的 Gemma 4 12B 专注微调版本,从思维链数据(Composer 2.5 和 Fable 5)中蒸馏而来,并量化为 GGUF 格式,以在本地离线使用,仅需极低 VRAM 要求

任务:text-generation 标签:gguf, gemma4, 编码, 代码, 推理, 思考, llama.cpp, local-llm, text-generation, base_model:google/gemma-4-12B-it, base_model:quantized:google/gemma-4-12B-it, license:gemma, endpoints_compatible, region:us, 对话
查看原文
查看缓存全文

缓存时间: 2026/06/15 00:49

yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF · Hugging Face

来源: https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF

https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%92%BB-gemma4-12b-coder-gguf–composer-25-%C3%97-fable-5-%E2%9C%A8💻 Gemma4-12B-Coder (GGUF) — Composer 2.5 × Fable 5 ✨

https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%90%A3-tiny-footprint-big-brain–a-local-coding-model-for-everyone🐣 小体积,大智慧 — 适合所有人的本地编码模型

无论你的 GPU 如何。无论你的 RAM 如何。只要你拥有约 4.5 GB的 VRAM统一内存空闲,现在就能运行你自己的私有离线编码助手。🚀 这是v1 / 代码版—— 从真实的思维链中提炼,因此它会先思考问题,然后写出解决方案。🧠💻 全部本地运行,全部归你所有,无需 API,无需云端。

https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%8E%AF-what-it-is🎯 它是什么

一个专注于可验证 Python 编码数据的 Gemma 4 12B 微调版本 —— 每个训练样本的推理过程都导向实际通过了测试的代码。结果是模型会公开推理(边缘情况、复杂度、方法),然后生成一个清晰、可运行的解决方案。💚


https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%93%9A-training-data-the-interesting-part-%F0%9F%8D%B3📚 训练数据(有趣的部分 🍳)

这是一个蒸馏产物,结合了两个互补的思维链来源,均基于可验证的 Python 编码任务(带有确定性测试的算法/函数级别问题):

  • 🥇 主要数据集 — Composer 2.5真实思维链。真实的、由模型撰写的推理轨迹。教师模型解决了每个问题,其代码针对任务测试运行,只有通过的解决方案才被保留。因此你所学习的推理会导致实际有效的代码。
  • 🥈 辅助数据集 — Fable 5(今天发布!🎉)。一个巧妙的变化:我们拿Composer 2.5 做错的问题,交给Fable 5重新处理 —— 重新推导一个全新的、自洽的思维链和正确的解决方案,同样基于通过测试的门槛。这恢复了一些主要教师遗漏的难题。这些轨迹是合成的(合理化的思维链),并且被单独标记,使两个来源保持可区分。

方法:对大部分稳固覆盖使用真实思维链,加上合成“第二次尝试”思维链来修补失败 —— 两者在进入训练前都通过执行验证。✅


https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%97%BA%EF%B8%8F-roadmap–v2-if-theres-interest-%F0%9F%92%9A🗺️ 路线图 — v2(如果有兴趣!💚)

这是v1。如果点赞/下载量足够,我会推出v2向基准冲击🏁。

https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%93%A2-update-on-v2–the-fable-5-situation-2026-06-14📢 关于 v2 和 Fable 5 情况的更新*(2026-06-14)*

快速提醒所有等待 v2 的人:

Fable 5 的访问权限已被撤销。我之前设法保存的 Fable 5 思维链数据实际上是一个很小的集合 —— 不足以单独作为 v2 的主要信号,否则会有过拟合风险。因此计划正在调整:

  • v2 将更依赖 Composer 2.5 可验证思维链作为骨干(主要的、经过执行验证的来源),并谨慎地使用有限的 Fable 5 数据作为补充,而不是核心。
  • 如果 Fable 5 的访问权限大约一周内没有恢复,我正在考虑引入GLM-5.2作为额外的教师模型。我刚刚查看了基准测试:根据BridgeMind 在 X 上发布的评估,GLM-5.2 在BS推理排行榜上都略胜 Fable 5。我还没有亲自动手测试 —— 我的直觉是它在实践中会略低于Fable 5,但可能非常接近

底线:v2 仍然在来的路上。我宁愿多花一点时间,推出一个能泛化的东西,而不是匆忙发布一个过拟合的模型。感谢大家的耐心和支持 💚

如果您想看 v2,请点赞并下载—— 这就是我正在关注的信号!


https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%93%A6-pick-your-size-gguf-quants📦 选择你的大小(GGUF 量化)

量化级别大小体验🟢Q2_K****4.5 GB最小 — 几乎任何地方都能运行🔵Q4_K_M****6.87 GB最佳选择 👌(推荐)🟣Q6_K****9.11 GB近无损⚪Q8_0****11.8 GB基本全质量


https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%A7%AE-will-it-fit–context-length-cheat-sheet🧮 “能装下吗?” — 上下文长度速查表

粗略估计 🤓(假设q8\_0KV 缓存 + 约 1.5 GB 开销;使用q4\_0KV 缓存可获得约 2 倍上下文!)。最大上下文为131K。“—” = 装不下,请选择更小的量化。✂️

您的 VRAM / 统一内存🟢 Q2_K (4.5G)🔵 Q4_K_M (6.87G)🟣 Q6_K (9.11G)⚪ Q8_0 (11.8G)8 GB~16K 上下文紧张(约 2–4K)——12 GB~48K~30K~12K—16 GB~80K~64K~44K~22K24 GB131K(最大)🎉~128K~110K~88K32 GB131K131K131K131K

💡 Apple Silicon / 集成 GPU 具有统一内存也算 —— 数字相同,只是比独立 GPU 慢。💡 空间不够?降低一级量化或将 KV 缓存切换为q4\_0,你的上下文大约会翻倍。


https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%9A%80-how-to-run-it-super-easy🚀 如何运行(超级简单)

https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#option-a–llamacpp-recommended-%F0%9F%A6%99选项 A — llama.cpp(推荐) 🦙

  1. 从上面选择一个量化(例如...\-Q4\_K\_M\.gguf)并从llama.cpp (https://github.com/ggml-org/llama.cpp) 获取llama\-server。> ⚠️ 需要较新版本的 llama.cpp(此模型使用gemma4\_unified架构 —— 旧版本无法加载)。
  2. 运行服务器(显示的是 Windows\.bat — 可根据需要调整\-\-port\-\-ctx\-size):

@echo off cd /d C:\llama.cpp llama-server.exe ^ -m C:\models\gemma4-coding-Q4_K_M.gguf ^ --ctx-size 16384 ^ --n-gpu-layers 99 ^ --no-mmap ^ -fa on ^ --cache-type-k q8_0 --cache-type-v q8_0 ^ --temp 1.0 --top-p 0.95 --top-k 64 ^ --host 0.0.0.0 --port 18080 pause

  1. 打开http://localhost:18080并开始聊天。🎉 (提示:根据表格增加\-\-ctx\-size;使用q4\_0KV 以获得更多上下文。)

https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#option-b–one-click-apps-%F0%9F%96%B1%EF%B8%8F选项 B — 一键应用 🖱️

适用于LM StudioJanOllama等 —— 只需导入 GGUF,选择量化,即可使用。🐾

https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%A7%A0-thinking-mode🧠 思考模式

该模型在回答前会通过 Gemma 原生的思维通道进行思考 —— 这正是它训练的方式。保持**enable\_thinking=true**(默认聊天模板会处理)。推荐采样参数:temp 1\.0, top\_p 0\.95, top\_k 64。对于编码任务,你也可以使用贪心(temp 0)以获得更确定性的解决方案。


https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%E2%9A%A0%EF%B8%8F-good-to-know⚠️ 须知事项

  • 拒绝减少:训练数据注重任务,没有安全对冲,因此比基础模型拒绝得更少。它做安全对齐 —— 在生产环境中请添加你自己的防护措施。请负责任地使用。🙏
  • 专注于Python / 算法编码。推理质量在该领域最强;常识性事实/数字仍需再次核对。
  • 以英语为中心。

https://huggingface.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF#%F0%9F%93%9A-base–license📚 基础模型与许可证

  • 基础模型:google/gemma\-4\-12B\-it (https://huggingface.co/google/gemma-4-12B-it)。受Gemma 使用条款 (https://ai.google.dev/gemma/terms) 约束(衍生版本必须遵守)。
  • 个人/爱好项目 —— 按原样分享,无任何保证。尽情享受,快乐编程!🐾✨

相似文章

Gemma 4 26B-A4B GGUF 基准测试

Reddit r/LocalLLaMA

嘿,r/LocalLLaMA 社区,我们为不同提供方的 Gemma 4 26B-A4B GGUF 进行了 KL 散度(KL Divergence)基准测试,以帮助大家挑选最佳的量化版本。* 平均 KL 散度结果使几乎所有 **Unsloth GGUF 都位于帕累托前沿** * KLD 用于衡量量化模型与原始 BF16 输出分布的匹配程度,从而反映模型保留的精度。* 这使得 Unsloth 在 21/22 种尺寸中**表现最佳。**99.9% KLD 及其他指标也呈现相似趋势。* 我们还更新了我们的 Q6_K 量化版本以提高动态性。此前,它们...

Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2

Hugging Face Models Trending

SuperGemma4-26B-Uncensored-MLX-4bit-v2 是 Google Gemma 4 26B 的微调量化版本,专为 Apple Silicon 优化,在代码、推理和工具使用任务上性能提升,同时保持比原版基线更快的推理速度。