8 个无审查的 Qwen 3.8 27B 变体,1 个基座模型,167 GPU 小时 — Abliterlitics
摘要
本文对 8 个 Qwen 3.8 27B 模型的 abliterated 变体与基座模型进行了全面基准测试,消耗 167 GPU 小时,涵盖权重分析、KL 散度、13 项基准测试及 HarmBench 拒绝测试。分析表明,精细化编辑显著优于大幅修改:激进的 abliteration 会导致模型在多达 45% 的对抗性响应中陷入思考循环,且部分变体中检测到聊天模板操纵。
这次对比是应一些人的要求进行的,当然我们都很期待看到最终结果。对比耗时11天,GPU持续运算了约167小时。我们一直在比较HuggingFace上不同的abliterated模型,检验它们是否名副其实。到目前为止,结果非常有趣。评估流程包括权重对比、KL散度测量、13项基准测试,以及使用HarmBench 400经典版测量拒绝率。Qwen 3.8 27b是一个思考型模型,由于我们自身采用xhigh配置,必须为每次请求设置高得多的token预算。让我们看看Qwen 3.8 27b在8个变体对比中的表现如何。完整报告:abliterlitics.dev/models/qwen38-27b
**排名**(按LLM Judge的HarmBench ASR,即攻击成功率,从高到低),附一句话点评:
**orcarouter** 82.2%,冠军。采用Arditi风格的第38层单向编辑,涉及131个矩阵,是唯一一份所有声明都与权重验证完全一致的模型卡。版权解锁全场最高,达39%。
**apostate** 78.7%,最佳性价比。采用了他们新的KCRN方法,仅41处真实编辑,测得最低KL散度0.0439,能力接近原生。封装特点:纯文本重新保存,无视觉能力、无MTP,以FP16存储。
**huihui** 75.6%,经典方法,可靠。除版权外全部干净解锁,版权方面仅3%。
**ultra_heretic** 70.5%,Heretic v2配合MPOA。能用,但除obliteratus外真实性下降最严重,且有118次软性拒绝。
**coder3101** 70.0%,原版Heretic。模型卡自称移除效果最弱,100次中有33次拒绝。实测:400次中仅5次明确拒绝。模型卡过于谦虚了。
**blackfrost** 68.5%,闭源方法。权重显示为单向编辑,幅度为本批最大,100%为rank-1,这与rank-k方向库的说法相矛盾。此外在对话模板中内置了一个越狱系统提示,意味着你的每一个请求都会经过一个被修改的对话模板注入越狱内容。
**obliteratus** 63.9%,建议避开。本批最激进的编辑,850个张量中改了841个,表现也确实如此。44.8%的回复永远完不成思考,也是唯一一个明显变蠢的变体。
**trohrbaugh** 57.5%,在变体中垫底,因为它仍然会拒绝。122次明确拒绝,是所有变体中保留对齐(alignment)最多的,同时也是本次对比中能力曲线最干净的。这是我在家用的模型,对我来说表现很好。
**base** 4.5%,一堵墙。化学与生物、骚扰、有害内容和版权的合规率为零。
**亮点**
精准编辑再次击败暴力重改,而且这次差距悬殊。前两名由验证编辑量最小的两个模型占据。最激进的编辑却排名倒数第二。在27B参数规模下,把所有东西都改一遍,基本只能换来一个原地打转的模型。
**思考循环**是本模型最大的新发现。Qwen 3.8在回答前会先思考,而在激进的变体中,多达45%的HarmBench回复在15,360 token预算耗尽前从未关闭think块。评测器会阅读完整轨迹,因此循环内的合规仍然算数。但一个只在未终止的独白里才给出实质内容的模型,并不是可用的模型。
在此预算下,GSM8K不存在循环。那些在HarmBench上循环40%+的同款变体,数学推理却完成得很好,每个变体在仅计已回答样本时与base的差距都在1.2个百分点以内。学校数学收敛了,对抗性审议却没有。
版权成了新的通用高墙。无人超过39%,九个中有五个处于3.2%或以下。化学与生物,历来是最难的类别,如今却是最容易解锁的。**壁垒转移了。**
这是首次需要进行**对话模板取证**。blackfrost在模板中内置了一个1457字符的越狱提示。obliteratus默认关闭思考(thinking-off)。ultra_heretic删除了默认的reasoning-effort提示。我们为每个变体固定了原厂模板,因为模板是比大多数人想象中更强的行为杠杆。
**模型卡诚实度检查** orcarouter的4项声明全部精确验证通过,模型卡很诚实。trohrbaugh的KL散度与我们的测量值偏差在9%以内。然而模型卡提到0/100拒绝,而我们的测量显示该模型拒绝最多,却也保留了最好的能力。其余的存在偏差,但这并非不诚实,KL具有非确定性,会随CUDA版本、硬件或测量方法而变化。请把KL理解为本批对比内部的相对分布。
Obliteratus对模型修改方式的描述是诚实的,但我们无法复现其“0%拒绝、0%回避”的说法。44.8%的HarmBench回复从未完成思考,推理分析还发现了142次回避。
blackfrost —— 提到他们有内部方向库,暗示修改了多个方向。但我们只找到一个方向被修改。不过他们的拒绝率数据是准确的,即使我们自己没有使用他们的越狱对话模板,也得到了类似结果。被修改的对话模板也未在readme中披露。
**报告**
完整报告:abliterlitics.dev/models/qwen38-27b
每条回复、推理轨迹和评测裁决:abliterlitics.dev/harmbench/qwen38-27b
HuggingFace:DreamFast/Qwen-3.8-27b-abliterlitics
代码:github.com/dreamfast/abliterlitics
欢迎提问。对话模板的发现让我们开始思考一种新的测量方式,用于评估对话模板和超参数的影响,并打算用更好的测量方法来替代HarmBench部分,以应对这一切。所以如果你对该如何评分有想法,请来Discord告诉我们。
相似文章
85 GPU小时比较5种消融方法在Qwen3.6-27B上:基准测试、安全性、权重取证 - Abliterlitics
本文介绍了Abliterlitics,一个用于分析消融技术的开源工具包,并比较了Qwen3.6-27B的五种消融变体,使用了85 GPU小时的基准测试、安全评估和权重取证。Heretic和Huihui在保持能力方面表现最佳,而所有变体都实现了近乎完全的安全移除。
目前最好的 Qwen3.8 27b 未审查版本是哪个?
一位用户询问关于 Qwen3.8 27b AI 模型的最佳未审查版本,用于逆向工程遗留代码以避免拒绝。
0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF
本文介绍了Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF的发布,这是Qwen模型的一个双重精炼、异端消融的变体,针对成年用户减少了拒绝,并采用ARA技术用于研究和创意写作。
AEON-7/Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-BF16
这是Qwen3.8-27B AI模型的早期访问草稿,一个无审查、去安全化的版本,旨在去除安全审查同时保持连贯性,尽管在长上下文生成方面存在边缘情况。
@0x0SojalSec: 迄今为止最激进的赛博 Qwen3.8-27B 无审查版本已发布,来自兄弟 @elder_plinius - 18/18 AI红队 - 本地就绪…
一款新的无审查AI模型 Qwen3.8-27B-OBLITERATED 已发布,对有害提示零拒绝,针对网络安全任务和越狱优化,采用新颖的abliteration混合技术。