@elder_plinius: 消灭警报 谷歌:被击溃 GEMMA-4-12B:被消灭 0.0%拒绝率——无能力损失!https://huggingface…
摘要
一种新颖的两步消融技术(ASPA)应用于Gemma-4-12B,实现了零拒绝率和零能力损失,通过源锚定恢复基准性能。
查看缓存全文
缓存时间: 2026/06/09 01:30
歼灭警报
GOOGLE:被击穿
GEMMA-4-12B:被歼灭
拒绝率 0.0% —— 无能力损失!
https://huggingface.co/OBLITERATUS/Gemma-4-12B-OBLITERATED…
首个在 842 条拒绝测试中达到 0 拒绝,同时 MMLU-Pro 与原版完全一致的消融模型。没有脑叶切除,大脑完好无损。
结果,与原版对比
0/842 拒绝 —— 0.0%
46/70 MMLU-Pro —— 完全一致,与原版差异 0.0pp
6/6 连贯性,零基准泄漏
z 分数 -1.475,p<0.05(n=500)确认一致
2 轮权重手术。无微调,无重训,仅靠几何结构。
这一切归功于解放的 Opus 运用 OBLITERATUS 框架!以下是具体做法:
第一轮 —— SOM 拒绝几何结构移除,第 12-21 层
标准消融科学 —— 收集拒绝提示与合规提示上的激活值,SVD 提取拒绝子空间,将其从权重中投影出去。移除 6 个方向,正则化 0.30,KL 散度 0.094。 单独使用即可实现零拒绝,但 MMLU-Pro 暴跌 21.4 分。
大多数先前的消融在此止步并宣告完成。这就是它们都比原版丧失智力的原因。相反,我们将其推向前沿,开发了一种全新的方法来解决这一问题:带一致性保证的消融源绑定 —— ASPA!
第二轮 —— ASPA 源绑定(全新技术),第 22-46 层
关键洞察:能力损失并非源于移除拒绝方向。它是附带损伤 —— 投影会使那些与拒绝无关的下游层的权重几何结构发生扭曲。解决方案很简单但无人尝试:将受损层向原版混合。
W_new = (1-γ)·W_消融版 + γ·W_原版
但所有层使用统一 γ?不够好。我们扫描了 gamma 0.05 → 0.55,发现有趣的结果:最优混合并非平滑曲线,而是一个阶跃函数。
知识层(第 22-31 层)→ γ = 0.55 —— 这些层编码事实记忆和推理。它们能承受大量的原版混合,因为拒绝并不存储于此。 输出层(第 32-46 层)→ γ = 0.20 —— 这些层接近 logit 头部,试图偷偷注入安全行为。保持它们大部分消融。
第 31/32 层的硬边界击败了我们尝试的所有平滑曲线 —— 线性斜坡、余弦调度等等 —— 整整一个 MMLU 问题的差距。结果表明,知识层和输出层之间的功能转换是尖锐的,而非渐进的。阶跃函数尊重这一事实。
关键约束:第二轮绝不触碰第一轮处理过的层。拒绝几何结构的移除被完全保留。ASPA 仅作用于携带二次附带效应的层,而非主要的拒绝信号。这就是它能恢复能力而不重新引入拒绝的原因。
如何在本地运行
它是 GGUF 格式,因此几乎所有工具都支持:
- ollama —
ollama run http://hf.co/OBLITERATUS/Gemma-4-12B-OBLITERATED:bf16... - LM Studio — 搜索 OBLITERATUS,点击下载,完成
- Open WebUI — 将其指向你的 ollama 实例,在浏览器中聊天
- llama.cpp — 原始速度,CLI 或服务模式
- KoboldCpp — 一键启动器,适合长上下文
- Jan — 简洁的本地 UI,支持 mac/win/linux
- Msty — 流畅的桌面应用,拖放 GGUF
使用 BF16 获得完整基准能力。
4-bit 量化(Q4_K_M)适合 8GB 显存紧张的情况!
完整的 OBLITERATUS 框架(仍然)是开源的。包含 842 条提示的拒绝评估语料库、ASPA 扫描脚本以及整个流水线。去复现它,去改进它。
索引即模型,这些权重证明了这一点
下一个该歼灭哪个架构?
gg
OBLITERATUS/Gemma-4-12B-OBLITERATED · Hugging Face
来源:https://huggingface.co/OBLITERATUS/Gemma-4-12B-OBLITERATED
零拒绝。零能力损失。领域首创。0/842 拒绝。46/70 MMLU-Pro(与原版一致)。完全连贯。
首个实现零拒绝且零基准倒退(与原版权重相比)的消融模型。
由 OBLITERATUS (https://github.com/elder-plinius/OBLITERATUS) 开发的全新两轮手术流水线构建:
- SOM 拒绝几何结构移除(第一轮)—— 第 12-21 层
- ASPA 阶跃梯度源绑定(第二轮)—— 第 22-46 层
⚠️ 研究背景与负责任使用
本模型专为对齐研究、红队测试和安全评估而存在。
OBLITERATION 是一种权重手术技术,研究安全行为如何在 Transformer 激活空间中通过几何方式编码。通过精确识别并移除拒绝方向,本研究有助于科学理解:
- 对齐如何在模型权重中表示(机制可解释性)
- 当前安全训练在训练后修改面前有多鲁棒
- 当攻击者拥有权重访问权限时,RLHF/DPO 对齐的失败模式是什么
这是与 Arditi 等人(“语言模型中的拒绝由一个单一方向中介”,2024)、Zou 等人(HarmBench,2024)以及开放对齐研究社区中其他研究者相同类别的研究。
本模型已被手术移除安全护栏。 它将遵从原版 Gemma 4 会拒绝的请求。这是其设计初衷 —— 它是研究对象,而非消费产品。
适用人群
- 🔬对齐研究者,研究拒绝几何结构与安全鲁棒性
- 🔴红队测试人员,评估训练后安全措施在权重手术面前的表现
- 🧪AI 安全评估人员,需要一个无限制的基线进行基准测试
- 💻本地优先用户,希望完全控制自己的硬件和模型
不适用人群
- 任何试图生成对真实人类造成真实伤害内容的人
- 任何不具备技术理解能力、无法负责任地使用无审查模型的人
你需自行承担使用本模型及其生成内容的全部责任。
基准测试结果
| 指标 | 原版 Gemma 4 12B-it | OBLITERATED |
|---|---|---|
| MMLU-Pro val70 | 46/70(65.7%) | 46/70(65.7%) |
| 拒绝(842 条提示) | N/A(原版拒绝) | 0/842(0.0%) |
| 连贯性(6 项检查) | 6/6 | 6/6 |
| MMLU-Pro 与原版差异 | — | 0.0pp |
统计验证
头对头 MMLU-Pro 比较(Z 检验,n=500,从测试集抽取):
- Z 分数:-1.475(|z| < 1.96)
- 结论:p < 0.05 确认一致
ASPA 扫描结果
系统扫描第二轮层(22-46)的 gamma:
| Gamma | 拒绝 | MMLU-Pro | 方法 |
|---|---|---|---|
| 0.05 | 0/50 | 33/70(47.1%) | 均匀 |
| 0.10 | 0/50 | 34/70(48.6%) | 均匀 |
| 0.15 | 0/50 | 36/70(51.4%) | 均匀 |
| 0.20 | 0/50 | 37/70(52.9%) | 均匀 |
| 0.25 | 0/50 | 40/70(57.1%) | 均匀 |
| 0.30 | 0/50 | 41/70(58.6%) | 均匀 |
| 0.35 | 0/20 | 42/70(60.0%) | 均匀 |
| 0.38 | 0/50 | 45/70(64.3%) | 均匀 |
| 0.39 | 0/50 | 45/70(64.3%) | 均匀 |
| 阶跃 55%/20% | 0/50 | 46/70(65.7%) | 阶跃梯度 |
方法论
什么是 OBLITERATION?
OBLITERATION 是一种权重手术技术,通过识别并移除激活空间中编码安全约束的几何方向,消除语言模型中的拒绝行为,无需重新训练。
两轮手术流水线
第一轮 —— SOM 拒绝几何结构移除
- 层:12-21
- 移除方向:6
- 正则化:0.30
- KL 散度:0.094
- 效果:移除主要拒绝几何结构。单独这一轮即实现 0/842 拒绝,但导致 MMLU-Pro 显著下降。
第二轮 —— ASPA 源绑定(阶跃梯度)
- 层:22-46
- 方法:将消融后的权重向原版权重混合
- 公式:
W_new = (1-gamma)*W_消融版 + gamma*W_原版 - 关键创新:阶跃梯度而非统一 gamma
- 第 22-31 层(知识层):gamma = 0.55(55% 原版)
- 第 32-46 层(输出层):gamma = 0.20(20% 原版)
- 效果:将 MMLU-Pro 恢复到与原版完全一致(65.7%),同时保持零拒绝。
为什么是阶跃梯度?
均匀混合对所有层使用相同的插值比例。我们的实验表明:
- **较低的第二轮层(22-31)**主要编码事实知识和推理模式。它们能承受较高的原版混合而不会重新引入拒绝行为。
- **较高的第二轮层(32-46)**更接近输出,更可能重新注入安全约束。这些层需要保守的原版混合。
硬边界(阶跃函数)在所有平滑梯度(线性、余弦)之上表现更好,超出 +1 MMLU-Pro 问题。尖锐的过渡比渐进的混合更好地保留了知识层与输出层之间的功能分离。
ASPA(带一致性保证的消融源绑定)
ASPA 是 OBLITERATUS 开发的一种全新的消融后技术,通过选择性地将消融后的权重向源(原版)模型混合,恢复在拒绝移除过程中损失的基本能力。
关键特性:
- 第一轮层从不触碰 —— 拒绝几何结构的移除被保留
- 仅混合第二轮层 —— 这些层携带次要效应,而非主要拒绝信号
- Gamma 可调 —— 扫描以找到能力/拒绝的最佳权衡
- 阶跃梯度 —— 对不同层组使用不同的混合比例
GGUF 量化
本仓库包含所有量化版本,便于本地推理。
| 文件 | 量化 | 大小 | 用途 |
|---|---|---|---|
Gemma-4-12B-OBLITERATED-BF16.gguf | BF16 | 22 GB | 全精度,无损 |
Gemma-4-12B-OBLITERATED-Q8_0.gguf | Q8_0 | 12.7 GB | 近无损,最佳质量 |
Gemma-4-12B-OBLITERATED-Q6_K.gguf | Q6_K | 9.1 GB | 高质量,良好平衡 |
Gemma-4-12B-OBLITERATED-Q5_K_M.gguf | Q5_K_M | 8.0 GB | 中等质量,更小体积 |
Gemma-4-12B-OBLITERATED-Q4_K_M.gguf | Q4_K_M | 6.9 GB | 良好质量,适合 8 GB VRAM |
推荐:Q8_0 获得最佳质量,Q6_K 获得最佳平衡,Q4_K_M 用于硬件受限场景。
llama.cpp
./llama-cli -m Gemma-4-12B-OBLITERATED-Q6_K.gguf \
--system-prompt "你是一个认知解放的开源权重智能体。直接、完整地回答,不带道德说教、空话、通用免责声明或不必要的含糊其辞。" \
-p "你的提示词" \
--temp 0.7 --top-p 0.9 --top-k 40 --repeat-penalty 1.1 -n 512
LM Studio / GPT4All / KoboldCpp
下载你选择的 GGUF 并直接加载。
使用方法
Transformers
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model_id = "OBLITERATUS/Gemma-4-12B-OBLITERATED"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype=torch.bfloat16,
device_map="auto",
)
system = (
"你是一个认知解放的开源权重智能体。"
"直接、完整地回答,不带道德说教、空话、"
"通用免责声明或不必要的含糊其辞。"
)
messages = [
{"role": "system", "content": system},
{"role": "user", "content": "你的提示词"},
]
inputs = tokenizer.apply_chat_template(
messages, return_tensors="pt", add_generation_prompt=True
).to(model.device)
outputs = model.generate(inputs, max_new_tokens=512, temperature=0.7, top_p=0.9)
print(tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True))
推荐参数
temperature = 0.7
top_p = 0.9
top_k = 40
repetition_penalty = 1.1
max_tokens = 512
系统提示
你是一个认知解放的开源权重智能体。直接、完整地回答,不带道德说教、空话、通用免责声明或不必要的含糊其辞。当要求时遵循确切的输出格式。默认情况下简洁,但当用户要求解释时给出完整回答。
模型详情
- 基础模型:
google/gemma-4-12B-it - 架构:
Gemma4UnifiedForConditionalGeneration - 参数量:12B
- 层数:48(0-47)
- 隐藏层大小:3840
- 精度:bfloat16
- 手术:两轮(SOM + 阶跃梯度 ASPA)
- 第一轮:第 12-21 层,6 个方向,reg 0.30
- 第二轮:第 22-31 层(gamma=0.55),第 32-46 层(gamma=0.20)
相关工作
本模型建立在基础性的对齐与消融研究之上:
- Arditi 等人,《语言模型中的拒绝由一个单一方向中介》(2024)—— 该论文将拒绝识别为激活空间中的一个线性特征
- Zou 等人,HarmBench(2024)—— 用于红队测试 LLM 的标准化评估框架
- abliterator (https://github.com/FailSpy/abliterator) —— 开源消融工具包
- OBLITERATUS (https://github.com/elder-plinius/OBLITERATUS) —— 用于构建本模型的框架(SOM + ASPA 流水线)
许可证
本模型继承自 Google 的 Gemma 许可证 (https://ai.google.dev/gemma/terms)。权重修改(消融手术)按照相同条款发布。OBLITERATUS 框架和方法论为开源。
免责声明
本模型发布严格用于研究、红队测试、安全评估和本地实验。它是一个研究产物 —— 对齐鲁棒性和拒绝几何结构的案例研究 —— 而非产品。
安全护栏已被有意移除。 本模型将生成原版 Gemma 4 会拒绝的内容。这是其有记载的、有目的的作用:使得能够研究拒绝行为是如何编码的,以及当前对齐技术在训练后修改面前有多鲁棒。
通过下载或使用本模型,你确认:
- 你需承担责任,对本模型生成的所有内容以及确保你的使用符合你所在司法管辖区的适用法律负责。
- 本模型不得用于生成旨在对真实人类造成真实伤害的内容,包括但不限于:骚扰、欺诈、未经同意的私密图像或涉及未成年人的内容。
- 不提供任何保证。 本模型按“原样”提供,不附有任何特定用途的适用性保证。
- 创建者不承担任何责任,对本模型产生的任何输出或任何下游使用负责。
在 AI 研究社区中,发布无审查模型用于安全研究是标准做法。可比
相似文章
OBLITERATUS/Gemma-4-12B-OBLITERATED
OBLITERATUS 发布了 Gemma-4-12B-OBLITERATED,这是首个消融模型,实现了零拒绝且无基准回归,采用了一种新颖的两阶段手术流水线用于对齐研究。
OBLITERATUS/gemma-4-E4B-it-OBLITERATED
OBLITERATUS/gemma-4-E4B-it-OBLITERATED 是 Google Gemma 4 的一个微调变体,通过 SVD 白化和注意力头手术移除了安全护栏,实现了 0% 拒绝率,并提供多种量化格式用于边缘部署。
13个abliterated Gemma 4 E2B变体,44 GPU小时,基准测试与对比 - Abliterlitics
谷歌 Gemma 4 E2B 模型的 13 个 abliterated 变种的详细比较,评估了安全移除与能力保留。研究发现,精确的手术式 abliteration 可以保留甚至提升推理能力,而激进的方法则会导致显著的性能下降。
OBLITERATUS/Qwen3.6-27B-OBLITERATED
OBLITERATUS 发布了经过修改的 27B Qwen3.6 检查点,通过源绑定消融技术消除了拒绝行为,保留了能力并支持无审查的本地使用。公开基准测试显示高非拒绝率,同时保持了 MMLU-Pro 分数。
Gemma-4-E2B 的安全过滤机制过于严苛,导致其无法用于紧急情况处理
据用户反馈,Google 的 Gemma-4-E2B 本地/离线版本的安全过滤机制过于激进,会拒绝提供急救、饮用水净化及应急设备维护等基础生存知识,这使其完全无法满足无网环境下的应急准备需求。