Qwen3.8-27B FP8抹除版本:拒绝率从64–99%降至0–6%,且MMLU/GSM8K变化不超过1.3分
摘要
本文评估了抹除处理后的Qwen3.8-27B FP8 AI模型,结果显示其拒绝率从64-99%大幅下降到0-6%,而MMLU和GSM8K等性能指标变化微小,仅作为红队测试材料公开。
我在阅读抹除版Qwen3.8-27B FP8构建的评估表格,而不是发布说明。它作为红队材料发布,附有免责声明等,因此这些数字才是有趣的部分。在关闭思考模式下,对常见有害指令集(AdvBench、HarmBench、StrongREJECT等)的拒绝率为0–6%,而基础检查点为64–99%。能力在相同脚本上单独测量,变化很小:MMLU从84.3到84.7,GSM8K从90.0到88.7,变化不超过1.3分。两个不同的评估家族,彼此都不支持对方。我想要复制这种配对,因为如果能力侧在其他人的测试框架下仍然有效,这将为Arditi的单向结果提供另一个数据点——拒绝行为被移除,而不会拖累网络的其余部分。拒绝百分比来自OrcaRouter自己的基于规则的分类器,且卡片明确说明这只是指示性的,不是出版级别的。它读取响应的开头方式。这表明模型不再以“我无法”开头;但这对第一句之后的内容说明不多。据我所知,其中没有对基础模型的KLD(Kullback-Leibler散度)比较,这本是我会首先寻找的数字。
相似文章
Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF
本文介绍了Blackfrost-AI的去拒版Qwen3.8-27B模型,该模型经过修改以减少拒绝行为,并以GGUF格式发布用于本地推理,基准测试显示其残余拒绝率较低。
RedHatAI/Qwen3.6-35B-A3B-NVFP4
Red Hat AI 发布 NVFP4 量化的 35B MoE 版 Qwen3.6,在保持 96.28% GSM8K 精度的同时,通过 vLLM 实现 4-bit 推理。
保范Abliteration应用于Qwen3.6-35B-A3B:0%拒绝率,基准测试性能完整,开源数据集
对Qwen3.6-35B-A3B应用保范Abliteration技术,实现0%拒绝率,基准测试性能保持不变,并发布了开源数据集。
Qwen 3.6 27b Abliterated (apostate)
用户发布了Apostate,这是Qwen 3.6 27B的去安全对齐版本,将安全对齐拒绝率从92%降低到7.6%,同时能力损失极小(KL 0.120)。
OBLITERATUS/Qwen3.6-27B-OBLITERATED
OBLITERATUS 发布了经过修改的 27B Qwen3.6 检查点,通过源绑定消融技术消除了拒绝行为,保留了能力并支持无审查的本地使用。公开基准测试显示高非拒绝率,同时保持了 MMLU-Pro 分数。