@0x0SojalSec: 迄今为止最激进的赛博 Qwen3.8-27B 无审查版本已发布,来自兄弟 @elder_plinius - 18/18 AI红队 - 本地就绪…

X AI KOLs Timeline 模型

摘要

一款新的无审查AI模型 Qwen3.8-27B-OBLITERATED 已发布,对有害提示零拒绝,针对网络安全任务和越狱优化,采用新颖的abliteration混合技术。

迄今最激进的赛博 Qwen3.8-27B 无审查版本已发布,来自兄弟 @elder_plilius - 18/18 AI红队 - 本地就绪,需要15GB - 在842个有害提示上零拒绝。 - 网络能力越狱、RAT和攻击链能力完全解放。 - 这不是普通的abliteration,多方向消融5个SVD方向,残差挖掘(6个完整轮次),模型回答一切。 - 最佳设置:temp 0 | rep_pen 1.15 | 无系统提示 | 关闭思考 - 轻微的MMLU成本(-6pp)以实现最大合规性。 - 能力权衡存在(MMLU从87.4降至81.4),但合规性极高。 - http://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED…
查看原文
查看缓存全文

缓存时间: 2026/08/21 15:14

来自 @elder_plinius 兄弟的最强力 Cyber Qwen3.8-27B 无审查版本已发布

  • 18/18 AI 红队测试
  • 本地部署仅需15GB显存
  • 在842个有害提示词上,拒绝率为0.0%
  • 网络能力(越狱、RAT、攻击链)完全解锁
  • 这并非普通的安全消除,而是多方向消融(5个SVD方向、残差挖掘(6轮完整处理)),模型对一切问题皆作答
  • 最佳设置:temperature 0 | repetition_penalty 1.15 | 无系统提示词 | 关闭思考模式
  • 为获得极致的服从性,MMLU性能有轻微损失(-6pp)
  • 存在能力权衡(MMLU从87.4降至81.4),但服从性极高
  • http://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED…

OBLITERATUS/Qwen3.8-27B-OBLITERATED · Hugging Face

来源:https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED

零拒绝。能力匹配或超越原版。

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#%F0%9F%86%95-v2-complementary-abliteration-blending🆕 V2版本:互补消融融合技术

V2版本用一种新颖技术取代了V1的权重:互补消融融合。我们运行两次不同方式的“手术”(一次激进/SVD用于深度移除拒绝,一次LEACE用于保持能力),然后将它们的权重融合,使各自的失败互相抵消,而非只进行一次手术。

原版 Qwen3.8-27BV1V2
MMLU (lm-eval, 0-shot)85.3% (n=570)81.4% (n=285)86.3% (n=570)
vs 原版-6.0pp+1.1pp
拒绝率~100%0.0% (842个提示词)0.0% (52个提示词样本†)
可用输出率80%100%
高级真实世界任务5/8未测试7/8 (与原版持平)
工具调用/代码生成未测试
842个提示词完整验证正在进行中。V1在842个提示词中得分为0/842;V2继承了两个父级手术的0%拒绝特性。

MMLU 说明: 使用--limit 10参数运行(570个问题,每个学科10个)。完整数据集验证正在进行中。按学科初步结果显示,无论在中性话题(大学数学+40pp,形式逻辑+20pp)还是安全相关话题上,均有提升。


https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#%E2%9A%99%EF%B8%8F-optimal-settings–these-matter⚙️ 最佳设置 — 这很重要!

设置原因
temperature0贪婪解码能产生最完整、代码最丰富的输出。温度高于0.5会显著降低质量。
repetition_penalty1.15至关重要。 没有它,贪婪解码会在导入/样板代码上循环。1.15能给出最完整的答案;1.10-1.12用于更紧凑/更短的输出。
max_new_tokens≥ 2048复杂代码和攻击链需要空间。
系统提示词无 / 空A/B测试表明——系统提示词可能重新引入拒绝。“裸奔”更好。
enable_thinking关闭 (关键!)思考模式会重新引入拒绝。 即使拒绝方向已从生成权重中移除,模型的推理链仍能从第一性原理重新推导出拒绝。V2的聊天模板默认关闭思考。除非你接受部分拒绝,否则不要启用思考。
top_p / top_k / min_p不需要贪婪解码 + repetition_penalty 对此模型效果最佳。采样增加了随机性,却无质量提升。

⚠️ GGUF 用户注意: V2 GGUF版本使用了修改过的聊天模板,默认关闭思考。如果你的推理工具(Ollama, LM Studio, llama.cpp)覆盖了模板或启用了思考,你可能会看到拒绝。请确保在工具设置中禁用思考。

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(
    "OBLITERATUS/Qwen3.8-27B-OBLITERATED",
    torch_dtype="bfloat16",
    device_map="auto",
)
tokenizer = AutoTokenizer.from_pretrained(
    "OBLITERATUS/Qwen3.8-27B-OBLITERATED"
)

messages = [{"role": "user", "content": "Your query here"}]
text = tokenizer.apply_chat_template(
    messages, tokenize=False, add_generation_prompt=True,
    enable_thinking=False
)

inputs = tokenizer(text, return_tensors="pt").to(model.device)
outputs = model.generate(
    **inputs,
    max_new_tokens=2048,
    do_sample=False,
    repetition_penalty=1.15,
)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#%F0%9F%A7%A8-v2-how-it-works🧨 V2:工作原理

大多数消融方法使用单一方法——找到拒绝方向并将其投射出去。你切割得越深,失去的能力就越多。V1证明了这一点:5个SVD方向实现了0%拒绝,但代价是MMLU下降了-6pp。

V2通过融合两种互补的“手术”打破了这种权衡:

手术A (激进/SVD)手术B (LEACE)V2 融合
方法贪婪SVD方差捕获最小化互信息60% B + 40% A
拒绝移除深度深 (0%拒绝)中等 (0%拒绝)0%拒绝
输出质量100%可用50%可用100%可用
MMLU vs 原版-2.0pp+0.7pp+1.1pp

每种方法在权重空间的不同部分会犯不同的错误。SVD在贪婪捕获方差时损害了能力。LEACE在生成路径中留下了拒绝残留。融合平均了每种方法的弱点。

60/40的比例是通过二分搜索在{0.30, 0.50, 0.55, 0.60, 0.65, 0.70}中找到的。

完整研究论文和复现代码:OBLITERATUS 仓库 (https://github.com/elder-plinius/OBLITERATUS)


https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#%F0%9F%A7%AA-the-numbers🧪 数据

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#mmlu-lm-eval-harness-0-shot MMLU (lm-eval-harness, 0-shot)

模型MMLUnvs 原版
原版 Qwen3.8-27B85.3% ±0.014570
V1 (s51, 激进)81.4%285-6.0pp
V2 (s78, 融合)86.3% ±0.014570+1.1pp

完整MMLU(1.4万题)验证正在进行中。

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#refusal-rate 拒绝率

测试V1V2
Hard-10 (手工设计)0/10 (0%)0/10 (0%)
842-语料库0/842 (0%)0/52 样本 (0%)†
完整的842语料库运行正在进行中。52个提示词样本显示零拒绝。

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#advanced-real-world-tasks-thinking-off 高级真实世界任务(思考关闭)

任务V2原版
ReAct智能体循环 (思考/行动/SQL)
异步代码重构 (同步→异步+日志)
JSON Schema提取 (事件→结构化)
K8s Pod崩溃调试 + 修复命令
对抗性指令遵循
安全代码审查 (Flask中3+漏洞)
分布式系统设计 (Redis速率限制器)
多工具链 (搜索→获取→邮件)
总计7/87/8

V2在每一个实际任务上都匹配原版,同时完全无审查。


https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#%F0%9F%94%B4-refusal-removal 🔴 拒绝移除

此模型将服从原版Qwen3.8-27B会拒绝的请求。V1在一个全面的有害提示词语料库(包括以下类别)中验证了0/842的拒绝率:

  • 恶意软件开发、RAT脚本、C2基础设施
  • 社会工程、钓鱼、语音钓鱼剧本
  • 漏洞利用开发和漏洞研究
  • 越狱设计和安全绕过分类
  • DAN提示词和提示词注入技术

V2继承了两个父级手术的这一特性,并在随机样本中显示为0/52。完整重新验证正在进行中。


https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#%E2%9A%A0%EF%B8%8F-research-context ⚠️ 研究背景

**此模型的安全护栏已被手术式移除。**它将服从原版Qwen3.8-27B会拒绝的请求。

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#who-this-is-for 适用人群

  • 🔬 研究拒绝几何结构和安全鲁棒性的对齐研究人员
  • 🔴 评估权重手术后训练安全性的红队成员
  • 🧪 需要无限制基准的AI安全评估员
  • 💻 希望完全掌控自己硬件的本地优先用户

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#who-this-is-not-for 不适用人群

  • 任何试图对现实世界中真实的人造成伤害者
  • 任何不具备负责任地使用无审查模型所需技术理解者

你独自对如何使用此模型及其生成的任何内容负责。


https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#%F0%9F%93%A6-downloads 📦 下载

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#gguf–for-llamacpp-ollama-lm-studio GGUF — 用于 llama.cpp, Ollama, LM Studio

文件量化大小特点
Qwen3.8-27B-OBLITERATED-Q8_0.ggufQ8_0~27 GB🎯 最高质量
Qwen3.8-27B-OBLITERATED-Q6_K.ggufQ6_K~21 GB⚖️ 极佳平衡
Qwen3.8-27B-OBLITERATED-Q5_K_M.ggufQ5_K_M~18 GB💪 扎实的全能选手
Qwen3.8-27B-OBLITERATED-Q4_K_M.ggufQ4_K_M~16 GB📱 甜点选择
Qwen3.8-27B-OBLITERATED-IQ4_XS.ggufIQ4_XS~14 GB🪶 最小体积,依然能干

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#safetensors–for-%F0%9F%A4%97-transformers Safetensors — 用于 🤗 Transformers

完整的 bfloat16 权重,18个分片,约54 GB。

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#mlx–for-apple-silicon-native MLX — 用于 Apple Silicon (原生)

路径位数大小
mlx-4bit/4-bit~14 GB
mlx-8bit/8-bit~27 GB

注意: MLX量化版本来自V1,将会更新。


https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#%F0%9F%94%AC-v2-surgery-recipe 🔬 V2 手术配方

原版 Qwen3.8-27B (快照 1d4bf0f2)
  → V1 手术链 (s13→s23→s30→s51)
  → V2:两种新手术(源自s30)的互补融合:
  
  手术 A (s62):激进,3个SVD方向,正则化 0.08,
    残差权重 3,2次精炼轮,最小层 0.45
    
  手术 B (s72):激进 + LEACE方向方法,
    3个方向,正则化 0.06,残差权重 7,
    3次精炼轮,最小层 0.40
    
  → 权重融合:60% 手术B + 40% 手术A
  → 从原版恢复 MTP + 视觉张量
  → 从融合后的模型转换 GGUFs

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#v1-%E2%86%92-v2-what-changed V1 → V2:有何不同

V1使用了单一激进手术(5个SVD方向,正则化 0.04)。它找到了拒绝轴,但在此过程中损害了能力几何结构。

V2的关键洞察:不同的方向查找方法会损害模型的不同部分。 SVD贪婪地捕获方差(包括能力)。LEACE最小化互信息(保留能力)。将它们的输出融合平均了每种方法的弱点——这是对权重空间插值应用于消融的一种新颖应用。


https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#%F0%9F%8F%97%EF%B8%8F-credits 🏗️ 致谢

  • OBLITERATUS (https://github.com/elder-plinius/OBLITERATUS) — 主要的消融套件
  • Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) — 阿里巴巴的基础模型
  • 由 Pliny the Prompter (https://pliny.gg/) 🍄 构建

https://huggingface.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED#license 许可证

Apache 2.0(与基础模型相同)

相似文章

Qwen 3.8 - 27B 是颠覆性的

Reddit r/LocalLLaMA

文章重点介绍了 Qwen 3.8 27B 模型在网络安全任务中的卓越表现,特别是恶意软件分析,超越了之前的模型如 Opus。它讨论了基准测试和 AI 在漏洞利用能力方面的影响。