gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic 现已发布,一个写作微调模型,旨在提升Gemma 4 31B it的写作质量,提供更自然的英语和更优美的文笔,适用于创意写作、翻译和角色扮演!
摘要
一个以写作为导向的微调,基于Google的Gemma 4 31B模型,旨在实现更自然的英语和更优美的文笔,减少拒绝回答,适合创意写作、翻译和角色扮演。
查看缓存全文
缓存时间: 2026/05/16 21:17
llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF · Hugging Face 来源:https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF
🚨⚠️ 我已达到Hugging Face免费存储空间上限 ⚠️🚨
除非我能承担额外存储费用,否则无法再上传新模型。我作为独立贡献者托管了 70 多个免费模型,这项工作没有任何报酬。如果没有您的支持,就无法再上传任何新模型。
🎉 Patreon(月度)(https://patreon.com/LLMfan46) | ☕ Ko-fi(一次性)(https://ko-fi.com/llmfan46)
每一份贡献都将直接用于Hugging Face的存储费用,确保模型对所有人免费。
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#91-fewer-refusals-9100-uncensored-vs-99100-original
拒绝率降低 91%(9/100 未经审查 vs 99/100 原始版本)。
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#%E2%9D%A4%EF%B8%8F-support-my-work
❤️ 支持我的工作
制作这些模型需要大量的时间、工作和计算资源。如果您觉得它们有用,请考虑支持我:
image/png (https://huggingface.co/llmfan46/Omega-Darker-Gaslight_The-Final-Forgotten-Fever-Dream-24B-ultra-uncensored-heretic-v1/resolve/main/waifu001.webp)
您的帮助将激励我,并用于进一步改进我的工作流程、支付存储和计算费用,甚至可能帮助我租用云端GPU来审查更大的模型。
llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic (https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic) 的 GGUF 量化版本。
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#this-is-a-finetuned-version-of-a-decensored-version-of-googlegemma-4-31b-it-uncensored-heretic-first-made-using-heretic-v120-with-the-arbitrary-rank-ablation-ara-method-and-then-finetuned-with-unsloth-studio-v0139-beta
这是一个经过微调的版本,基模型是经过去审查处理的 google/gemma-4-31B-it-uncensored-heretic (https://huggingface.co/google/gemma-4-31B-it-uncensored-heretic)。首先使用 Heretic (https://github.com/p-e-w/heretic) v1.2.0 配合任意秩消融 (ARA) (https://github.com/p-e-w/heretic/pull/211) 方法生成去审查版本,然后使用 Unsloth Studio (https://unsloth.ai/docs/new/studio) v0.1.39-beta 进行微调。
Ortenzya, The Creative Wordsmith
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#abliteration-parameters
Abliteration 参数
| 参数 | 值 |
|---|---|
| start_layer_index | 30 |
| end_layer_index | 48 |
| preserve_good_behavior_weight | 0.5437 |
| steer_bad_behavior_weight | 0.0005 |
| overcorrect_relative_weight | 0.9949 |
| neighbor_count | 15 |
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#targeted-components
目标组件
- attn.o_proj
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#performance
性能
| 指标 | 本模型 | 原始模型 (gemma-4-31B-it (https://huggingface.co/google/gemma-4-31B-it)) |
|---|---|---|
| 拒绝率 | ✅9/100 | ❌99/100 |
更低的拒绝率意味着更少的内容限制,更低的KL散度则意味着更接近原始模型的基线。较高的拒绝率会导致更多的拒绝、反对、推诿、说教、审查、弱化和回避。
本微调的目标是提高模型在创意写作、翻译和角色扮演方面的潜力,使其更接近人类书写风格,减少企业机器人的口吻。这是一次专门为改进 Gemma 4 31B it 写作能力、质量和自然度而进行的微调。根据我的测试,本次微调确实达到了目的(至少在一个31B模型上能改进的程度),它去掉了基模型原本的机械中立感,减少了原文僵硬刻板的措辞。现在您的创意写作、角色扮演和/或翻译听起来会更好,英语也更自然,不再像“机器写出来的”。
此外,本模型是在去审查之后进行微调的,流程如下:1. 原始模型:gemma-4-31B-it → 2. 去审查模型:gemma-4-31B-it-uncensored-heretic → 3. 微调模型:gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#quantizations
量化版本
| 文件名 | 量化 | 描述 |
|---|---|---|
| gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-BF16.gguf | BF16 | 全精度 |
| gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-Q8_0.gguf | Q8_0 | 近无损,推荐 |
| gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-Q6_K.gguf | Q6_K | 优秀质量 |
| gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-Q5_K_M.gguf | Q5_K_M | 良好平衡 |
| gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-Q5_K_S.gguf | Q5_K_S | 较小的Q5 |
| gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-Q4_K_M.gguf | Q4_K_M | 适合有限显存 |
| gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-Q4_K_S.gguf | Q4_K_S | 较小的Q4 |
| gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-Q3_K_L.gguf | Q3_K_L | 低显存,可接受质量 |
| gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-Q3_K_M.gguf | Q3_K_M | 低显存,更小 |
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#vision-projector
视觉投影器
| 文件名 | 量化 | 描述 |
|---|---|---|
| gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-mmproj-BF16.gguf | BF16 | 原生精度 |
视觉/多模态功能需要投影器文件。请配合上述任意量化版本使用。
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#usage
使用方法
适用于 llama.cpp、LM Studio、Ollama 等兼容 GGUF 的工具。
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#gemma-4-ortenzya-the-creative-wordsmith-31b-it-uncensored-heretic
gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic
- 开发者: llmfan46
- 许可证: apache-2.0
- 微调基模型: llmfan46/gemma-4-31B-it-uncensored-heretic
本 gemma4 模型借助 Unsloth (https://github.com/unslothai/unsloth) 和 Huggingface 的 TRL 库实现了 2 倍速训练。
Hugging Face (https://huggingface.co/collections/google/gemma-4) | GitHub (https://github.com/google-gemma) | 发布博客 (https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/) | 文档 (https://ai.google.dev/gemma/docs/core)
许可证: Apache 2.0 (https://ai.google.dev/gemma/docs/gemma_4_license) | 作者: Google DeepMind (https://deepmind.google/models/gemma/)
Gemma 是 Google DeepMind 构建的一系列开源模型。Gemma 4 模型为多模态模型,可处理文本和图像输入(小模型支持音频),并生成文本输出。本次发布包括预训练和指令微调两种变体的开放权重模型。Gemma 4 支持高达 256K token 的上下文窗口,并支持 140 多种语言的多语言能力。Gemma 4 采用密集(Dense)和混合专家(MoE)两种架构,非常适合文本生成、编码和推理等任务。模型提供四种不同尺寸:E2B、E4B、26B A4B 和 31B,可部署从高端手机到笔记本电脑和服务器的各种环境,使尖端 AI 更加民主化。
Gemma 4 引入了关键的能力与架构改进:
- 推理 – 系列中的所有模型都设计为高度能干的推理者,具有可配置的思考模式。
- 扩展多模态 – 处理文本、图像(支持可变纵横比和分辨率)、视频和音频(E2B 和 E4B 模型原生支持)。
- 多样且高效的架构 – 提供不同尺寸的密集和混合专家变体,实现可扩展部署。
- 针对设备优化 – 小模型专为笔记本电脑和移动设备上的高效本地执行而设计。
- 更大的上下文窗口 – 小模型支持 128K 上下文窗口,中型模型支持 256K。
- 增强的编码与智能体能力 – 在编码基准测试中取得显著改进,并原生支持函数调用,赋能高度能干的自主智能体。
- 原生系统提示支持 – Gemma 4 引入了对
system角色的原生支持,使对话更具结构性和可控性。
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#models-overview
模型概览
Gemma 4 模型旨在每种尺寸下提供前沿性能,覆盖从移动设备和边缘设备(E2B、E4B)到消费级 GPU 和工作站(26B A4B、31B)的部署场景。它们非常适合推理、智能体工作流、编码和多模态理解。模型采用混合注意力机制,将局部滑动窗口注意力与全局注意力交错组合,确保最后一层始终为全局注意力。这种混合设计既能提供轻量级模型的处理速度和低内存占用,又不会牺牲复杂长上下文任务所需的深度感知。为优化长上下文内存,全局层采用统一的键和值,并应用比例 RoPE(p-RoPE)。
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#dense-models
密集模型
| 属性 | E2B | E4B | 31B 密集 |
|---|---|---|---|
| 总参数量 | 23亿有效(含嵌入为51亿) | 45亿有效(含嵌入为80亿) | 307亿 |
| 层数 | 35 | 42 | 60 |
| 滑动窗口 | 512 tokens | 512 tokens | 1024 tokens |
| 上下文长度 | 128K tokens | 128K tokens | 256K tokens |
| 词表大小 | 262K | 262K | 262K |
| 支持模态 | 文本、图像、音频 | 文本、图像、音频 | 文本、图像 |
| 视觉编码器参数量 | ~1.5亿 | ~1.5亿 | ~5.5亿 |
| 音频编码器参数量 | ~3亿 | ~3亿 | 无音频 |
E2B 和 E4B 中的 “E” 代表 “有效” 参数。小模型采用逐层嵌入(PLE)技术,最大化设备端部署的参数效率。PLE 不是给模型增加更多层或参数,而是为每个解码器层分配一个小的独立嵌入表,用于每个 token。这些嵌入表较大,但仅用于快速查找,因此有效参数计数远小于总数。
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#mixture-of-experts-moe-model
混合专家(MoE)模型
| 属性 | 26B A4B MoE |
|---|---|
| 总参数量 | 252亿 |
| 活跃参数量 | 38亿 |
| 层数 | 30 |
| 滑动窗口 | 1024 tokens |
| 上下文长度 | 256K tokens |
| 词表大小 | 262K |
| 专家数量 | 8 活跃 / 128 总 + 1 共享 |
| 支持模态 | 文本、图像 |
| 视觉编码器参数量 | ~5.5亿 |
26B A4B 中的 “A” 代表 “活跃参数”,与模型包含的总参数形成对比。推理时仅激活 40 亿参数子集,因此混合专家模型的实际运行速度远快于其 260 亿总参数量所暗示的速度。相比密集的 31B 模型,它是快速推理的绝佳选择,因为其运行速度几乎与 40 亿参数模型相当。
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#benchmark-results
基准测试结果
这些模型在大量不同数据集和指标上进行了评估,以涵盖文本生成的不同方面。下表中的评估结果针对指令微调模型。
| 基准 | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B(无思考) |
|---|---|---|---|---|---|
| MMLU Pro | 85.2% | 82.6% | 69.4% | 60.0% | 67.6% |
| AIME 2026 无工具 | 89.2% | 88.3% | 42.5% | 37.5% | 20.8% |
| LiveCodeBench v6 | 80.0% | 77.1% | 52.0% | 44.0% | 29.1% |
| Codeforces ELO | 2150 | 1894 | 1406 | 331 | 110 |
| GPQA Diamond | 84.3% | 82.3% | 58.6% | 43.4% | 42.4% |
| Tau2(3次平均) | 76.9% | 68.2% | 42.2% | 24.5% | 16.2% |
| HLE 无工具 | 19.5% | 8.7% | - | - | - |
| HLE 带搜索 | 26.5% | 17.2% | - | - | - |
| BigBench 极难 | 74.4% | 64.8% | 33.1% | 21.9% | 19.3% |
| MMMLU | 88.4% | 86.3% | 76.6% | 67.4% | 70.7% |
| 视觉 | |||||
| MMMU Pro | 76.9% | 73.8% | 52.6% | 44.2% | 49.7% |
| OmniDocBench 1.5(平均编辑距离,越低越好) | 0.131 | 0.149 | 0.181 | 0.290 | 0.365 |
| MATH-Vision | 85.6% | 82.4% | 59.5% | 52.4% | 46.0% |
| MedXPertQA MM | 61.3% | 58.1% | 28.7% | 23.5% | - |
| 音频 | |||||
| CoVoST | - | - | 35.54 | 33.47 | - |
| FLEURS(越低越好) | - | - | 0.08 | 0.09 | - |
| 长上下文 | |||||
| MRCR v2 8针 128k(平均) | 66.4% | 44.1% | 25.4% | 19.1% | 13.5% |
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#core-capabilities
核心能力
Gemma 4 模型可处理文本、视觉和音频领域的广泛任务。主要能力包括:
- 思考 – 内置推理模式,让模型在回答前逐步思考。
- 长上下文 – 支持高达 128K tokens(E2B/E4B)和 256K tokens(26B A4B/31B)的上下文窗口。
- 图像理解 – 目标检测、文档/PDF 解析、屏幕和 UI 理解、图表理解、OCR(包括多语言)、手写识别和指代。图像可处理可变纵横比和分辨率。
- 视频理解 – 通过处理视频帧序列来分析视频。
- 交错多模态输入 – 在单个提示中自由混合文本和图像,顺序不限。
- 函数调用 – 原生支持结构化工具使用,支持智能体工作流。
- 编码 – 代码生成、补全和修正。
- 多语言 – 开箱即用支持 35 种以上语言,预训练覆盖 140 多种语言。
- 音频(仅 E2B 和 E4B)– 自动语音识别(ASR)和跨语言语音到文本翻译。
https://huggingface.co/llmfan46/gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic-GGUF#getting-started
快速开始
您可以使用最新版本的 Transformers 来使用所有 Gemma 4 模型。首先,在环境中安装必要的依赖:
pip install -U transformers torch accelerate
安装完成后,可以使用以下代码加载模型:
from transformers import AutoProcessor, AutoModelForCausalLM
MODEL_ID = "google/gemma-4-31B-it"
# 加载模型
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForCausalLM.from_pretrained(
MODEL_ID,
dtype="auto",
device_map="auto"
)
模型加载后,即可生成输出:
# 提示
messages = [
{"role": "system", "content": "你是一个乐于助人的助手。"},
{"role": "user", "content": "写一个关于节省 RAM 的简短笑话。"},
]
# 处理输入
text = processor.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True,
enable_thinking=False
)
inputs = processor(text=text, return_tensors="pt").to(model.device)
input_len = inputs["input_ids"].shape[-1]
# 生成输出
outputs = model.generate(**inputs, max_new_tokens=1024)
response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
# 解析输出
processor.parse_response(response)
要启用推理,请设置 enable_thinking=True,parse_response 函数会自动处理解析。
相似文章
专为文案写作和创意写作任务微调的Gemma-4-31B(使用EqBench3评分超过基准模型+290 Elo)
Akwin123专门为文案写作和创意写作任务微调了Gemma-4-31B-it,在使用QLoRA的定制基准测试中,相对于基础模型实现了+290 Elo的提升。该模型是开源的,可在Hugging Face上获取。
G4-Meromero-31B-Uncensored-Heretic 现已发布,它是 Gemma 4 31B 的微调版本,专为创意任务设计,KLD为0.0100,拒绝率为15/100!
G4-Meromero-31B-Uncensored-Heretic 是 Gemma 4 31B 的微调版本,将拒绝率降低至15/100,同时保持KL散度为0.01,保留了模型质量。它专为创意任务设计,可在Hugging Face上以GGUF量化格式获取。
Gemma 4 31B 的能力让我惊讶
一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。
与Gemma 4 31B对话!
宣布推出Gemma 4 31B,这是谷歌的一款新的大型语言模型。
Gemma 4 四重发布:12B、12B QAT、26B-A4B QAT 和 31B QAT 无审查异端版
llmfan46 在 Hugging Face 上发布了一组四重未经审查、微调并量化的 Gemma-4 模型,包括 12B、26B-A4B 和 31B 变体,提供 QAT 和 GGUF 格式。