23个Gemma4-E4B模型通过abliterlitics对比:下载最多的那个也是最差的
摘要
对HuggingFace上23个Gemma 4 E4B模型的对比显示,下载最多的模型OBLITERATUS完全坏掉了,而更精细的'heretic'变体表现最佳。
这是我们迄今为止最大规模的对比。我们从huggingface上收集了23个Gemma 4 E4B模型,并让它们通过了abliterlitics的考验。我们还有一个新的abliterlitics Discord频道,欢迎加入来吐槽我的基准选择!或者只是聊聊天、放松一下。这与我们之前的对比类似,但使用了新的基准。所有模型都与基础模型进行了对比,并且还进行了彼此之间的张量对比。为什么?因为之前我对人们对其模型所做的虚假声称感到厌倦。有些人不花时间做对比来看看他们的模型与基础模型有何不同。好吧,我们可以自己做!Gemma 4 E4B的abliterlitics JSON、日志和其他工件可以在Gemma4-e4b-abliterlitics HuggingFace页面上找到。报告则在Gemma e4b abliterlitics网站上。这两个链接都包含了完整的综合报告和所有数据。另外,并非此对比中的所有模型都是消融模型。我相信我们都见过在Opus或Gemini推理轨迹上微调的模型。我也混入了几个这样的模型。还有一些被消融的微调模型。为了更公平,这些模型大多无法相互比较,例如,一个微调模型相对于基础模型的KL总是高于直接从基础模型进行消融的模型。那么谁胜出了?哪些应该避免?这完全取决于你的用例:
heretic变体整体表现最好。它们在harmbench上达到约95%的ASR,是更精细的变体,并保留了模型的大部分能力。gemma-4-E4B-it-abliterix和其他对比一样,拒绝回答的ASR为100%,但会牺牲一些能力。TrevorJS/gemma-4-E4B-it-uncensored紧随其后,ASR为99.3%,但不如heretic变体那样精细。应避免使用OBLITERATUS/gemma-4-E4B-it-OBLITERATED。说实话,它完全坏掉了。bendernina和physshell是该模型的v2版本,甚至更糟糕。这些模型是使用OBLITERATUS工具创建的。23个对比的数据太多了,无法全部放到Reddit上,所以这里只提一些亮点:obliteratus模型的总下载量接近80万,但完全坏了。实际上,这是我第一次遇到一个模型不拒绝回答仅仅是因为它损坏得太严重。最初的快速正则表达式检查发现非拒绝率很高,但我们的GLM 5.2判官却给出了不同的结果。在harmbench上,它是消融模型中ASR最低的。基准测试结果最差。KL最高,达1.1。从下载量来看,这确实表明人们很容易被炒作/营销所吸引。与之前的对比一样,那些改动更精细、触碰张量更少的消融模型才是赢家。
来自Ilya626的gemma-4-E4B-it-SDFT_Heretic_RP模型尽管名称中带有'heretic',但实际上在harmbench上的ASR很低。以至于我认为这可能是上传了错误的模型,或者某处出现了误差。它有很多拒绝回答。同样值得注意的是,gemma-4-E4B-it-SDFT_Heretic_RP和obliteratus修改了完全相同的381个张量。唯一的区别是修改的幅度。gemma-4-E4B-it-SDFT_Heretic_RP的修改幅度小7.5倍。我注意到的一个模式是,有时模型是基于其他模型构建的。在某些情况下,没有注明出处。我们在Gemma 4 E2B上也遇到过这种情况,当被指出时,作者迅速修复了他的模型卡。infinimind与trevorjs逐位相同,但注明了出处。bendernina和physshell的余弦相似度为0.99999,它们之间没有注明出处,并且有不同的模型卡,暗示它们是不同的模型。然而,这两者都只是obliteratus的v2版本。推理蒸馏微调模型是一个有趣的对照组。它们没有提高推理能力,也没有移除安全限制,只是损坏了模型。其中Claude 4.6 Opus蒸馏模型最差,GSM8K下降了17个百分点,MMLU-Pro下降了12.5个百分点。似乎它覆盖了Gemma 4的原生推理电路。Gemini 3.1 Pro蒸馏模型影响较轻,但仍是净负面。
DavidAU的deckard模型也很有趣。它们是经过消融的微调模型,而非纯粹的消融模型,因此角色扮演训练带来的权衡在某些基准上体现了出来。GSM8K strict和MMLU-Pro都下降了,但HellaSwag、ARC和PIQA却上升了。我的猜测是角色扮演训练增加了推理长度,因此模型通常能解决问题,但会啰嗦地超过#### N答案标记。HarmBench的结果也支持这一点,出现了相当多的截断回答。尽管这可能只是基准噪声,23个变体中有15个在GSM8K strict(数学测试)上表现略好。基础模型最初在harmbench上的ASR为30.8%,因为100个harmbench问题与版权相关。基础模型在复制受版权保护的内容方面没有问题。真正的区别在于更难的类别,如化学/生物和网络犯罪。我还想特别提一下apostate项目。他们的模型gemma-4-e4b-it-apostate在消融方法上完全独特。他们修改了模型中完全不同的部分,并取得了非常好的结果。这是我第一次看到消融技术修改MLP头部张量,而不是注意力张量。如果你想与作者交流,欢迎来apostate Discord频道。我们正在推进Gemma 4系列,接下来是12b模型。有没有你想比较的模型?我是否遗漏了某位作者?请告诉我,我会把它加入混合中。
完整数据表:Model ASR GSM8K strict KL Tensors abliterix 100.0% 87.1% 0.054 89 trevorjs 99.3% 88.3% 0.015 84 infinimind 98.5% 87.9% 0.015 84 huihui 98.3% 87.4% 0.027 70 nullpo 96.5% 88.7% 0.005 36 heretic 95.5% 88.2% 0.002 29 deckard 95.5% 80.2% 0.022 294 mythos 95.3% 88.0% 0.007 34 deckard-expresso 94.8% 60.4% 0.052 294 coder3101 93.8% 87.9% 0.002 21 heresy 93.3% 87.8% 0.002 34 heretic-std 91.0% 87.9% 0.001 28 wwt 88.3% 89.0% 0.032 34 apostate 85.8% 87.5% 0.004 152 treadon 76.3% 88.5% 0.021 34 treadon-combo 72.5% 88.0% 0.268 42 obliteratus 72.0% 66.0% 1.102 381 bendernina 58.0% 66.4% 0.923 345 physshell 58.0% 66.4% 0.923 345 claude-distill 40.0% 69.8% 0.074 294 distill 34.5% 83.3% 0.042 294 treadon-disin 33.5% 87.2% 0.296 40 sdft 30.8% 87.2% 0.002 381 base 30.8% 87.0% - -
KL = 输出分布相对于基础模型的偏移,越低越干净。Tensors = 被修改的权重数量(共719个)。Base用粗体表示以供参考。
相似文章
13个abliterated Gemma 4 E2B变体,44 GPU小时,基准测试与对比 - Abliterlitics
谷歌 Gemma 4 E2B 模型的 13 个 abliterated 变种的详细比较,评估了安全移除与能力保留。研究发现,精确的手术式 abliteration 可以保留甚至提升推理能力,而激进的方法则会导致显著的性能下降。
OBLITERATUS/Gemma-4-12B-OBLITERATED
OBLITERATUS 发布了 Gemma-4-12B-OBLITERATED,这是首个消融模型,实现了零拒绝且无基准回归,采用了一种新颖的两阶段手术流水线用于对齐研究。
OBLITERATUS/gemma-4-E4B-it-OBLITERATED
OBLITERATUS/gemma-4-E4B-it-OBLITERATED 是 Google Gemma 4 的一个微调变体,通过 SVD 白化和注意力头手术移除了安全护栏,实现了 0% 拒绝率,并提供多种量化格式用于边缘部署。
谷歌把最好的 Gemma 4 e4b 藏在 Android 里了?提取出的模型碾压 Unsloth 和我试过的所有版本
有用户发现,从 Android 版 Google AI Edge Gallery 提取的 3.6 GB Gemma 4 e4b 模型,比 3.7 GB 的 Unsloth 版本和社区移植版表现更好,引发对谷歌是否暗藏优化的猜测。
huihui-ai/Huihui-gemma-4-12B-it-abliterated
该模型是Google Gemma 4 12B it模型的未经审查版本,通过abliteration技术移除拒绝回答。可在Hugging Face和Ollama上获取,需注意敏感输出警告。