HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced

Hugging Face Models Trending 模型

摘要

无审查版本的Gemma4-12B发布,采用了量化感知训练(QAT)和多令牌预测头,通过推测解码实现约60%的生成速度提升。该模型在保持质量的同时移除了拒绝回答,现已可在Hugging Face上获取。

任务:图像到文本 Tags: gguf, uncensored, gemma4, vision, multimodal, agentic, coding, creative-writing, roleplay, rp, conversational, image-text-to-text, en, base_model:google/gemma-4-12B-it, base_model:quantized:google/gemma-4-12B-it, license:gemma, endpoints_compatible, region:us
查看原文
查看缓存全文

缓存时间: 2026/06/25 11:10

HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced · Hugging Face

Source: https://huggingface.co/HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced

Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced

**加入 Discord(https://discord.gg/SZ5vacTXYf)**获取更新、路线图、项目或仅闲聊。

Gemma4-12B(QAT)由 HauhauCS 解禁。0/465 次拒绝*

关于

无需修改数据集或能力——完全可用,保留原作者设计的全部功能,仅移除拒绝机制。基于官方 QAT 权重构建,因此 4 位量化后依然接近全精度质量。

平衡版

平衡版(推荐——99%+ 用户对此满意)采用优化的完全解禁,针对代理编码、推理、创意写作和可靠性关键任务进行了特别调校。它会先进行推理再回答,保持稳定且遵循指令。激进版仅在平衡版仍频繁拒绝时使用,当前测试显示非必需。

MTP 带来约 60% 加速

随附一个 MTP(多令牌预测)草稿头,用于推测解码——大约60% 更快的生成速度,输出完全相同(模型会验证每个草拟令牌,质量不变——纯速度提升)。此版本已调校至与附带的 MTP 头良好配合。

llama.cpp:

llama-server \ -m Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf \ -md mtp-gemma-4-12B-it.gguf --spec-type draft-mtp \ -ngl 99 -fa on

注意: MTP 加速已由我通过llama.cppllama-server/llama-cli)测试。

下载

文件类型大小Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.ggufQ4_K_M(文本)6.9 GBmmproj-Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-BF16.ggufmmproj(视觉)168 MBmtp-gemma-4-12B-it.ggufMTP 推测草稿器242 MB

**为什么只有 Q4_K_M?**Gemma 4 经过量化感知训练,针对约 4 位优化,因此 Q4_K_M 是最佳选择——更高精度的量化只会增加体积而无实际质量提升。精心量化,在 4 位下获得最佳质量。

视觉

将 mmproj 与模型一起加载以支持图像输入:

llama-server -m Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf \ --mmproj mmproj-Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-BF16.gguf -ngl 99 -fa on

推荐采样参数

以下参数专为此 HauhauCS 构建调校——使用它们以获得预期的行为和质量:

  • temperature 0.6
  • top_k 64
  • top_p 0.9
  • min_p 0.05
  • repeat_penalty 1.1

此版本作为独立作品进行了端到端调校;上述采样设置是其一部分,并非 Gemma 的默认值。

规格

  • 12B 密集 · 256K(262144)上下文
  • 基于 mmproj 的视觉(图像输入)
  • 基于 Google DeepMind 的 Gemma 4 12B

兼容性

  • 兼容 llama.cpp、LM Studio、Jan、koboldcpp 及其他 GGUF 运行时。
  • **多 GPU + LM Studio:**我个人注意到 Gemma 4 在 LM Studio 的 tensor-split 模式下可能崩溃——请为此模型使用单 GPU(layer-split 或优先级排序)。

致谢

  • Google DeepMind——Gemma 4。
  • 附带的 mtp-gemma-4-12B-it.gguf 推测草稿头来自 Unsloth 的 Gemma 4 发布——衷心感谢 Unsloth 团队。

*通过自动和手动拒绝基准测试均未发现——标准使用中未发现拒绝。少数边缘提示在首次询问时会回避,但再次询问或采用策略性表述后即会遵守。若遇到真正妨碍用例的拒绝,请加入 Discord 并标记,以便我能在未来修订中处理。

相似文章

HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive

Hugging Face Models Trending

HauhauCS 发布了 Google Gemma-4-E4B 模型的无审查变体,采用激进的安全移除方案,并具有自定义 K_P 量化,经过优化以保留质量并增强硬件兼容性。

HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced

Hugging Face Models Trending

HauhauCS 发布了 Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced,这是 Gemma4 的无损无审查变体,经过一个多月的开发,拒绝次数为 0/465,提供 GGUF 格式。

google/gemma-4-12B-it-qat-q4_0-gguf

Hugging Face Models Trending

Google DeepMind 发布了 Gemma 4 模型,这些模型通过量化感知训练(QAT)进行了优化,并提供包括 GGUF 在内的多种格式,在降低内存需求的同时实现了高质量。

unsloth/gemma-4-12B-it-qat-GGUF

Hugging Face Models Trending

Unsloth 发布了Google DeepMind的Gemma 4模型的GGUF量化版本,通过量化感知训练(QAT)优化,在保持质量的同时降低内存需求,支持多种格式和大小,适用于不同的部署场景。