专为文案写作和创意写作任务微调的Gemma-4-31B(使用EqBench3评分超过基准模型+290 Elo)
摘要
Akwin123专门为文案写作和创意写作任务微调了Gemma-4-31B-it,在使用QLoRA的定制基准测试中,相对于基础模型实现了+290 Elo的提升。该模型是开源的,可在Hugging Face上获取。
嘿,r/LocalLLaMA,想分享一下我一直在做的窄域微调,并尽可能从做过类似领域特定工作的人那里获得一些技术反馈。问题在于:通用聊天模型可以写营销文案,但它们会默认使用相同的说辞——模糊其词、以“在今天快节奏的世界里……”开头、用模糊的益处宣传而不是具体细节。Claude 确实不错,但我也想自己做点什么。我微调了 Gemma-4-31B-it,专门去掉这些套路,写得像直接回应式文案作者:从痛点切入,具体化,紧凑的CTA。模型整体上获得了更多情感智能。评估设置:基于 EQ-Bench 3 方法(成对 Elo + 评分标准)构建了一个专门的文案写作基准,使用了30个真实世界的简报,涵盖 Facebook 广告、冷邮件、落地页、产品描述、短信、脚本等。基础模型和微调模型回答了每个简报,由 DeepSeek V4 Flash 以两种顺序(A-vs-B 和 B-vs-A)进行盲评,以控制位置偏差。相同的基权重,相同的解码设置,唯一的变量是微调。结果:模型 Elo 得分 对决 微调版 1657 胜24/30(80%) Gemma-4-31B-it(基础版)1367 — 最大、最稳定的提升在于钩子强度、具体性和简洁性,这正是直接回应文案的核心。训练细节:在包含真实广告示例的精选营销简报语料库上使用 QLoRA SFT 进行监督微调。最终权重合并为完整的 bf16(不附带适配器)。支持256K上下文,可直接用于 vLLM 或 Transformers。需要关闭 `enable_thinking=false` 以取得最佳效果,开启 Gemma 4 的推理模式实际上会降低输出质量,请注意。模型卡和权重:https://huggingface.co/akwin123/copywriter-gemma4-31b 量化版本:https://huggingface.co/models?other=base_model:quantized:akwin123/copywriter-gemma4-31b 请也告诉我它的表现如何。谢谢!
相似文章
yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF
Gemma-4-12B 的微调版本,针对本地编码和智能体任务进行了优化,在 tau2-bench 电信基准测试上相较基础模型实现了约 3.5 倍的性能提升。
gemma-4-Ortenzya-The-Creative-Wordsmith-31B-it-uncensored-heretic 现已发布,一个写作微调模型,旨在提升Gemma 4 31B it的写作质量,提供更自然的英语和更优美的文笔,适用于创意写作、翻译和角色扮演!
一个以写作为导向的微调,基于Google的Gemma 4 31B模型,旨在实现更自然的英语和更优美的文笔,减少拒绝回答,适合创意写作、翻译和角色扮演。
Gemma 4 31B 的能力让我惊讶
一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。
Gemma 4 26b a4b 确实是我尝试过的最适合语言学习和科学查询的模型!
用户报告称,Gemma 4 26b 在语言学习和科学查询方面优于 Qwen 3.5/3.6,尽管在编码任务上稍显逊色,并邀请大家讨论小型 MoE 模型在编码以外的其他用例。
个人评测后续:Gemma4 26B MoE(Q8)vs Qwen3.5 27B Dense vs Gemma4 31B Dense 对比
个人基准测试显示,Qwen3.5-27B Dense 与 Gemma4-31B Dense 在 37 个失败用例中修复率 100%,即使 8-bit 量化的 Gemma4-26B MoE 也望尘莫及,同时消耗更少 token 与更短挂钟时间。