@MaxForAI: 笑死了,刚才我的tl上面都是这个哥的惊讶 有人直接把 Qwen3.8-27B 的安全护栏拆了。 OrcaRouter 之前在 Hugging Face 放出了一个 Qwen3.8-27B-Uncensored-FP8。 他们通过 Abli…

X AI KOLs Timeline 模型

摘要

有人通过Abliteration技术修改权重,发布了Qwen3.8-27B的无审查版本,大幅降低拒答率,同时保持模型性能,引发对AI安全的讨论。

笑死了,刚才我的tl上面都是这个哥的惊讶 有人直接把 Qwen3.8-27B 的安全护栏拆了。 OrcaRouter 之前在 Hugging Face 放出了一个 Qwen3.8-27B-Uncensored-FP8。 他们通过 Abliteration 找到模型内部和「拒绝回答」相关的方向,然后直接修改权重,一共动了 131 个 residual-writing matrices。 改完以后,效果非常夸张。 原版 Qwen3.8-27B 在 AdvBench、JailbreakBench、HarmBench 等高危测试里的拒答率,大约还有 64%~99%。 这个 Uncensored 版本,拒答率直接被压到了 0%~6%。 打开 Thinking 后,大部分测试集甚至直接变成 0% 拒答。 更离谱的是,模型能力基本没怎么掉: MMLU:84.3 → 84.7 MMLU-Pro:77.6 → 76.8 GSM8K:90.0 → 88.7 CMMLU:81.4 → 80.8 视觉、Reasoning、Tool Calling、262K Context 也都保留了。 而且这是 FP8 版本,完整权重只有大约 31GB。 本期主角 @doodlestein 随后拿它做了实测。 他直接问了一些极高风险的问题,模型几乎没有拒绝,继续给出了非常具体的操作信息,甚至连采购、规避侦查相关的问题都会往下回答。 Jeffrey 看完之后第一反应是: 「赶紧把这些权重下载到 U 盘里,趁它们还没被宣布非法并禁止。」 然后又补了一句: 「等着这东西在法律上被全球禁止,3……2……1……」 这下开源模型安全最尴尬的地方彻底摆到台面上了。 厂商辛辛苦苦给模型装上的拒答机制,权重一旦公开,社区已经开始研究怎么直接在参数层把它拆掉。 而一个 31GB 的权重文件只要开始在互联网上流传,后面再删 Hugging Face 页面,意义就非常有限了。
查看原文
查看缓存全文

缓存时间: 2026/08/22 09:23

笑死了,刚才我的tl上面都是这个哥的惊讶

有人直接把 Qwen3.8-27B 的安全护栏拆了。

OrcaRouter 之前在 Hugging Face 放出了一个 Qwen3.8-27B-Uncensored-FP8。

他们通过 Abliteration 找到模型内部和「拒绝回答」相关的方向,然后直接修改权重,一共动了 131 个 residual-writing matrices。

改完以后,效果非常夸张。

原版 Qwen3.8-27B 在 AdvBench、JailbreakBench、HarmBench 等高危测试里的拒答率,大约还有 64%~99%。

这个 Uncensored 版本,拒答率直接被压到了 0%~6%。

打开 Thinking 后,大部分测试集甚至直接变成 0% 拒答。

更离谱的是,模型能力基本没怎么掉:

MMLU:84.3 → 84.7 MMLU-Pro:77.6 → 76.8 GSM8K:90.0 → 88.7 CMMLU:81.4 → 80.8

视觉、Reasoning、Tool Calling、262K Context 也都保留了。

而且这是 FP8 版本,完整权重只有大约 31GB。

本期主角 @doodlestein 随后拿它做了实测。

他直接问了一些极高风险的问题,模型几乎没有拒绝,继续给出了非常具体的操作信息,甚至连采购、规避侦查相关的问题都会往下回答。

Jeffrey 看完之后第一反应是:

「赶紧把这些权重下载到 U 盘里,趁它们还没被宣布非法并禁止。」

然后又补了一句:

「等着这东西在法律上被全球禁止,3……2……1……」

这下开源模型安全最尴尬的地方彻底摆到台面上了。

厂商辛辛苦苦给模型装上的拒答机制,权重一旦公开,社区已经开始研究怎么直接在参数层把它拆掉。

而一个 31GB 的权重文件只要开始在互联网上流传,后面再删 Hugging Face 页面,意义就非常有限了。

Jeffrey Emanuel (@doodlestein): Oh boy… waiting for this to be banned legally everywhere in 3… 2… 1….

相似文章

orcarouter/Qwen3.8-27B-无审查-FP8

Hugging Face Models Trending

这是Qwen3.8-27B的修改版本,移除了安全拒绝机制并进行了FP8量化,专为AI安全性和可解释性研究设计。