专为文案写作和创意写作任务微调的Gemma-4-31B(使用EqBench3评分超过基准模型+290 Elo)

Reddit r/LocalLLaMA 模型

摘要

Akwin123专门为文案写作和创意写作任务微调了Gemma-4-31B-it,在使用QLoRA的定制基准测试中,相对于基础模型实现了+290 Elo的提升。该模型是开源的,可在Hugging Face上获取。

嘿,r/LocalLLaMA,想分享一下我一直在做的窄域微调,并尽可能从做过类似领域特定工作的人那里获得一些技术反馈。问题在于:通用聊天模型可以写营销文案,但它们会默认使用相同的说辞——模糊其词、以“在今天快节奏的世界里……”开头、用模糊的益处宣传而不是具体细节。Claude 确实不错,但我也想自己做点什么。我微调了 Gemma-4-31B-it,专门去掉这些套路,写得像直接回应式文案作者:从痛点切入,具体化,紧凑的CTA。模型整体上获得了更多情感智能。评估设置:基于 EQ-Bench 3 方法(成对 Elo + 评分标准)构建了一个专门的文案写作基准,使用了30个真实世界的简报,涵盖 Facebook 广告、冷邮件、落地页、产品描述、短信、脚本等。基础模型和微调模型回答了每个简报,由 DeepSeek V4 Flash 以两种顺序(A-vs-B 和 B-vs-A)进行盲评,以控制位置偏差。相同的基权重,相同的解码设置,唯一的变量是微调。结果:模型 Elo 得分 对决 微调版 1657 胜24/30(80%) Gemma-4-31B-it(基础版)1367 — 最大、最稳定的提升在于钩子强度、具体性和简洁性,这正是直接回应文案的核心。训练细节:在包含真实广告示例的精选营销简报语料库上使用 QLoRA SFT 进行监督微调。最终权重合并为完整的 bf16(不附带适配器)。支持256K上下文,可直接用于 vLLM 或 Transformers。需要关闭 `enable_thinking=false` 以取得最佳效果,开启 Gemma 4 的推理模式实际上会降低输出质量,请注意。模型卡和权重:https://huggingface.co/akwin123/copywriter-gemma4-31b 量化版本:https://huggingface.co/models?other=base_model:quantized:akwin123/copywriter-gemma4-31b 请也告诉我它的表现如何。谢谢!
查看原文

相似文章

Gemma 4 31B 的能力让我惊讶

Reddit r/LocalLLaMA

一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。