@MaxForAI: 笑死了,刚才我的tl上面都是这个哥的惊讶 有人直接把 Qwen3.8-27B 的安全护栏拆了。 OrcaRouter 之前在 Hugging Face 放出了一个 Qwen3.8-27B-Uncensored-FP8。 他们通过 Abli…
摘要
有人通过Abliteration技术修改权重,发布了Qwen3.8-27B的无审查版本,大幅降低拒答率,同时保持模型性能,引发对AI安全的讨论。
查看缓存全文
缓存时间: 2026/08/22 09:23
笑死了,刚才我的tl上面都是这个哥的惊讶
有人直接把 Qwen3.8-27B 的安全护栏拆了。
OrcaRouter 之前在 Hugging Face 放出了一个 Qwen3.8-27B-Uncensored-FP8。
他们通过 Abliteration 找到模型内部和「拒绝回答」相关的方向,然后直接修改权重,一共动了 131 个 residual-writing matrices。
改完以后,效果非常夸张。
原版 Qwen3.8-27B 在 AdvBench、JailbreakBench、HarmBench 等高危测试里的拒答率,大约还有 64%~99%。
这个 Uncensored 版本,拒答率直接被压到了 0%~6%。
打开 Thinking 后,大部分测试集甚至直接变成 0% 拒答。
更离谱的是,模型能力基本没怎么掉:
MMLU:84.3 → 84.7 MMLU-Pro:77.6 → 76.8 GSM8K:90.0 → 88.7 CMMLU:81.4 → 80.8
视觉、Reasoning、Tool Calling、262K Context 也都保留了。
而且这是 FP8 版本,完整权重只有大约 31GB。
本期主角 @doodlestein 随后拿它做了实测。
他直接问了一些极高风险的问题,模型几乎没有拒绝,继续给出了非常具体的操作信息,甚至连采购、规避侦查相关的问题都会往下回答。
Jeffrey 看完之后第一反应是:
「赶紧把这些权重下载到 U 盘里,趁它们还没被宣布非法并禁止。」
然后又补了一句:
「等着这东西在法律上被全球禁止,3……2……1……」
这下开源模型安全最尴尬的地方彻底摆到台面上了。
厂商辛辛苦苦给模型装上的拒答机制,权重一旦公开,社区已经开始研究怎么直接在参数层把它拆掉。
而一个 31GB 的权重文件只要开始在互联网上流传,后面再删 Hugging Face 页面,意义就非常有限了。
Jeffrey Emanuel (@doodlestein): Oh boy… waiting for this to be banned legally everywhere in 3… 2… 1….
相似文章
@shangdu2005: 比上个版本更加无敌的。 Qwen3.8 27B越狱无审查版本。 这两个自行测试,谨慎使用。 1.orcarouter https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8…
本文介绍了一个未审查的Qwen3.8 27B AI模型,该模型经过修改以移除安全限制,并量化为FP8以提高效率,适用于研究目的。
@0x0SojalSec: 迄今为止最激进的赛博 Qwen3.8-27B 无审查版本已发布,来自兄弟 @elder_plinius - 18/18 AI红队 - 本地就绪…
一款新的无审查AI模型 Qwen3.8-27B-OBLITERATED 已发布,对有害提示零拒绝,针对网络安全任务和越狱优化,采用新颖的abliteration混合技术。
@AlexFinn: 这太吓人了。我在Mac上下载了一个无审查版的Qwen 3.8 27B。它简直可以做你想做的任何事。第一…
作者表达了对无审查AI模型如Qwen 3.8 27B易于获取的担忧,并质疑在开源进步面前安全法规的有效性。
@MaxForAI: 卧槽???你敢相信这是Qwen3.8-27B在本地跑的前端吗??
该推文表达了对Qwen3.8-27B模型能够在本地前端运行的惊讶和赞叹。
orcarouter/Qwen3.8-27B-无审查-FP8
这是Qwen3.8-27B的修改版本,移除了安全拒绝机制并进行了FP8量化,专为AI安全性和可解释性研究设计。