@MiaAI_lab:我使用Fable-5风格推理和助手轨迹对Gemma 4 12B进行了微调,并将其发布为Gemmable 4 12b。**可用…
摘要
Mia-AiLab发布了Gemmable 4 12B,这是Google Gemma 4 12B模型的微调版本,使用了Fable-5风格推理和助手轨迹,提供GGUF和MLX格式用于本地推理。
查看缓存全文
缓存时间: 2026/06/18 14:16
我对 Gemma 4 12B 采用了 Fable-5 风格的推理和助手轨迹进行了微调,并将其发布为 Gemmable 4 12b。
可用格式:
- GGUF:q4_k_m 至 fp16
- MLX(适用于 Apple Silicon)
仓库中还包含 MTP 草稿。
训练在我的 @NVIDIAAI DGX Spark 上完成。
Mia-AiLab/Gemmable-4-12B-MTP-GGUF · Hugging Face
来源:https://huggingface.co/Mia-AiLab/Gemmable-4-12B-MTP-GGUF Gemmable 4 12b
https://huggingface.co/Mia-AiLab/Gemmable-4-12B-MTP-GGUF#gemmable-4-12bGemmable 4 12B
Gemmable 4 12B 是 Gemma 4 12B 经过 Fable-5 风格推理和助手轨迹微调后的 GGUF 导出版本。
https://huggingface.co/Mia-AiLab/Gemmable-4-12B-MTP-GGUF#highlights亮点
- 基础模型:
google/gemma-4-12B - 格式:GGUF
- 训练风格:Fable-5 风格推理和助手轨迹
- 分发:fp16 GGUF 以及每个量化版本对应的匹配助手 GGUF
- 预期用途:本地推理、编程、推理和助手工作流
https://huggingface.co/Mia-AiLab/Gemmable-4-12B-MTP-GGUF#how-to-use如何使用
https://huggingface.co/Mia-AiLab/Gemmable-4-12B-MTP-GGUF#llamacppllama.cpp
标准加载:
llama-server -m "gemmable-4-12b-fp16.gguf"
推测 / draft-MTP 加载:
llama-server -m "gemmable-4-12b-Q4_K_M.gguf" \ --spec-draft-model "gemmable-4-12b-Q4_K_M-mtp.gguf" \ --spec-type draft-mtp \ --spec-draft-n-max 4
使用匹配的 fp16 或量化主文件及其 -mtp 伴侣文件。
https://huggingface.co/Mia-AiLab/Gemmable-4-12B-MTP-GGUF#lm-studioLM Studio
- 搜索此仓库,下载目标文件 + mtp 文件。
- 加载目标文件。
- 加载设置 → 推测解码 → 选择 mtp 文件。
(需要合并了 am17an 的 PR 或自定义 llama.cpp 运行时的 LM Studio。截至 2026-05,主线 LM Studio 运行时尚未包含针对 Gemma-4 的 draft-mtp —— 请关注上游合并情况。)
https://huggingface.co/Mia-AiLab/Gemmable-4-12B-MTP-GGUF#gguf–local-inference-notesGGUF / 本地推理说明
gemmable-4-12b-fp16.gguf是标准 fp16 主模型。gemmable-4-12b-fp16-mtp.gguf是匹配的 fp16 助手/草稿文件。- 量化配对遵循相同模式,例如
gemmable-4-12b-Q4_K_M.gguf和gemmable-4-12b-Q4_K_M-mtp.gguf。 - 上传时请将配对文件保存在同一个 Hugging Face 仓库中。
https://huggingface.co/Mia-AiLab/Gemmable-4-12B-MTP-GGUF#limitations局限性
- 输出质量取决于提示词和运行时设置。
- MTP / 推测支持取决于客户端应用程序。
- 这不是原始基础检查点;它是微调后的导出版本。
https://huggingface.co/Mia-AiLab/Gemmable-4-12B-MTP-GGUF#naming命名
Gemmable = Gemma + Fable 风格微调。
相似文章
@analogalok: gemma-4-12B-agentic-fable5-composer2.5 V2 已发布。对基于 Fable 5 推理训练的模型进行了智能体升级。运行…
Gemma 4 12B 的一个新微调版本,基于 Fable 5 的推理进行训练,在智能体编码基准测试中实现了显著提升(从15%到55%),并且可以使用 llama.cpp 的自定义分支在 8GB VRAM GPU 上本地运行。
@MiaAI_lab: 运行更高效的 Gemma 4 31B IT NVFP4,轻松获得更强的智能体推理与工具调用能力 • 256k 上下文 • MTP • …
MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。
google/gemma-4-E4B-it-assistant
Google DeepMind 发布了 Gemma 4 E4B 指令微调助手模型,该模型具备多模态能力、推理改进以及针对低延迟端侧应用优化的投机解码功能。
google/gemma-4-31B-it-assistant
Google DeepMind 发布了 Gemma 4,这是一个开源权重的多模态模型家族,支持文本、图像、视频和音频,具备增强的推理和编码能力,并通过多令牌预测(MTP)实现高达 2 倍的解码速度提升。
Gemma 4 发布:前沿多模态智能,端侧可用
Google DeepMind 发布 Gemma 4,这是一系列前沿多模态模型,已在 Hugging Face 上以 Apache 2 协议开源,针对端侧部署进行了优化,并支持多种推理框架。