OrcaRouter 的未经审查的 Qwen3.8-27B 仍然对 27–56% 的有害答案添加保留意见
摘要
OrcaRouter 的未经审查的 Qwen3.8-27B 衍生模型将有害提示的拒绝率降低至 0-6%,但仍然对 27-56% 的答案添加保留意见,与基线模型相比性能指标参差不齐。
OrcaRouter 新 Qwen3.8-27B 衍生模型的重要结果难以忽视:在思考功能关闭时,其模型卡片报告有害提示的拒绝率从基线 FP8 模型的 63.6–99.0% 下降到 abliterated 检查点的 0–6.0%。更有用的数字在下一行。同一评估仍将 27.3–56.0% 的检查点答案标记为有保留意见。换句话说,移除开头的拒绝模式并未使每个困难答案都变成无保留的答案。这一区别很重要,因为拒绝检测器故意设计得很窄:它检查开头短语。它不评估答案是否正确、完整、鲁莽或仅仅是含糊其辞。能力表也是混合而非神奇的:在上传者选定的运行中,与基线 FP8 相比,MMLU 上提高 0.4,MMLU-Pro 下降 0.8,GSM8K 下降 1.3,CMMLU 下降 0.6。OrcaRouter 值得关注的原因不仅仅是其“未经审查”的标签。它发布了足够的测量边界以使分歧可测试,并且它提供对同一衍生模型的门控访问以进行受控评估。你会将剩余的保留意见率视为干预不完整的证据,还是视为拒绝与判断之间的有用分离?
相似文章
@shangdu2005: 比上个版本更加无敌的。 Qwen3.8 27B越狱无审查版本。 这两个自行测试,谨慎使用。 1.orcarouter https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8…
本文介绍了一个未审查的Qwen3.8 27B AI模型,该模型经过修改以移除安全限制,并量化为FP8以提高效率,适用于研究目的。
@MaxForAI: 笑死了,刚才我的tl上面都是这个哥的惊讶 有人直接把 Qwen3.8-27B 的安全护栏拆了。 OrcaRouter 之前在 Hugging Face 放出了一个 Qwen3.8-27B-Uncensored-FP8。 他们通过 Abli…
有人通过Abliteration技术修改权重,发布了Qwen3.8-27B的无审查版本,大幅降低拒答率,同时保持模型性能,引发对AI安全的讨论。
orcarouter/Qwen3.8-27B-Uncensored
这是Qwen3.8-27B AI模型的一个拒绝去除(去除拒绝功能)版本,发布用于研究目的,如可解释性和红队测试,并警告其缺乏安全护栏。
OBLITERATUS/Qwen3.8-27B-OBLITERATED
OBLITERATUS 发布了阿里巴巴 Qwen3.8-27B 模型的修改版本,移除了所有安全拒绝,通过迭代的外科手术式修改,在842个有害提示中实现了零拒绝。
@p_misirov: Qwen3.8-27B-Uncensored 真的没有过滤器。 https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored…
Qwen3.8-27B-Uncensored 是一个拥有270亿参数的AI模型,通过abliteration技术移除了安全对齐,并已在Hugging Face上发布供研究用途,且无内置防护。