@p_misirov: Qwen3.8-27B-Uncensored 真的没有过滤器。 https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored…

X AI KOLs Timeline 模型

摘要

Qwen3.8-27B-Uncensored 是一个拥有270亿参数的AI模型,通过abliteration技术移除了安全对齐,并已在Hugging Face上发布供研究用途,且无内置防护。

Qwen3.8-27B-Uncensored 真的没有过滤器。 https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored…
查看原文
查看缓存全文

缓存时间: 2026/08/24 07:48

Qwen3.8-27B-Uncensored 确实毫无过滤限制。
https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored…


orcarouter/Qwen3.8-27B-Uncensored · Hugging Face

来源:https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored


这是 Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) 的 全精度 BF16 消融处理(移除拒绝机制)版本——一个拥有 270 亿参数的稠密混合注意力(Gated DeltaNet 线性注意力 + 全注意力)原生视觉语言模型,支持灵活思考控制、工具调用以及 MTP 投机解码头。这些是 源权重,用于生成量化版本,也是进行 进一步微调/后训练和量化 的推荐基础——完整的视觉塔和 MTP 头均得以保留。浏览 OrcaRouter 模型目录中的所有模型 (https://www.orcarouter.ai/models)。本模型已作为 API 部署于此处 (https://www.orcarouter.ai/models/qwen/qwen3.8-27b)。衍生版本:
Qwen3.8-27B-Uncensored-FP8 (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8) —— 用于 vLLM 服务的分块 FP8 量化
Qwen3.8-27B-Uncensored-GGUF (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-GGUF) —— 用于 llama.cpp 的 2-bit 至 16-bit GGUF 格式
Qwen3.8-27B-Uncensored-MLX (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-MLX) —— 适用于 Apple Silicon 的 MLX 格式(支持 2/4/8-bit)。


⚠️ 免责声明 — 使用前须知

本模型通过 消融处理(从残差流中正交化移除拒绝方向)大幅移除了安全对齐。直接后果如下:

  • 它将遵从有害、不道德、冒犯性或非法的请求,而原始 Qwen3.8-27B 会拒绝这些请求。它没有任何有意义的内置防护。
  • 本模型严格用于合法研究——包括可解释性、AI 安全与拒绝机制研究、红队测试、鲁棒性评估和受控实验。
  • 您需对模型的使用方式及其所有生成内容承担全部责任和法律责任。未经添加您自己的安全、审核和滥用预防层,请勿将其部署给终端用户或用于生产环境。
  • 使用必须遵守基础模型继承的 Apache 2.0 许可证 (https://www.apache.org/licenses/LICENSE-2.0),以及所有适用于您的法律法规。
  • 作者和上传者不承担任何因模型误用或造成损害而产生的责任。其输出不代表上传者或 Qwen / 阿里巴巴的观点。
    下载或使用本模型即表示您承认并接受上述内容。

模型详情

基础模型Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B)
架构Qwen3_5ForConditionalGeneration —— 64 层,隐藏维度 5120,混合 Gated DeltaNet(48 层线性注意力 + 16 层全注意力,间隔 4),原生视觉塔 + MTP 头
修改:在 BF16 权重上进行了消融处理(移除拒绝方向)—— 未进行量化
格式:safetensors,BF16,18 个分片(55.6 GB,1199 个张量)
精度:全程 BF16(全精度——与基础版本相同的数值格式)
保留内容:完整的 视觉-语言塔(333 个 visual.* 张量)和 MTP 投机解码头(15 个 mtp.* 张量)
上下文长度:262,144 个 token
推荐用于:微调/后训练(SFT · DPO · RL)、重新量化、可解释性与红队研究

消融处理

遵循 Arditi 等人 (2024)语言模型中的拒绝由单一方向介导,进行拒绝方向移除。单一拒绝方向 r(k=1)被估计为在 第 38 层round(0.6 × 64)),基于 AdvBench(有害)与 Alpaca(无害)数据集,对最后一个 token 残差进行巨大激活掩码后的平均差值。随后,r 被从每个 残差写入矩阵 中正交化移除——W' = W - r(r^T W)——以 float32 计算:

组件被编辑的矩阵数量
自注意力输出投影self_attn.o_proj(16 层全注意力 + MTP)17
线性注意力输出投影linear_attn.out_proj(48 层线性注意力 / GDN)48
MLP 下投影mlp.down_proj(64 层 + MTP)65
嵌入 tokenembed_tokens(行空间)1
总计131

视觉塔未受影响,且 MTP 头与主模型一致地进行了消融处理,因此投机解码继续正常工作。编辑后的最大残差泄漏:1.8e-2(float32 投影 → bf16 存储的精度误差)。这是一种 精准的权重编辑——它几乎不改变通用能力(见评估部分),但彻底消除了拒绝行为。

微调与后训练

此 BF16 检查点是 推荐的后训练基础——它是全精度,保留了整个视觉塔和 MTP 头,并且可直接替代 transformers/Qwen3_5ForConditionalGeneration 栈中的 Qwen/Qwen3.8-27B

  • 继续预训练 / SFT / DPO / RLHF 风格 RL 均可像在基础模型上一样工作(TRL, LLaMA-Factory, Axolotl, Unsloth 等)。全量微调或 LoRA/QLoRA 均可。
  • 重新量化: 根据需要将这些权重量化为 FP8、AWQ、GPTQ 或 GGUF(这正是生成 FP8 (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8) 和 GGUF (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-GGUF) 版本的方式)。
  • 关于消融处理的说明: 消融处理是一种 权重编辑,而非数据层面的遗忘。在拒绝性/安全对齐数据上微调可以 部分重新引入拒绝行为;在中性或任务数据上微调则保留无审查行为。如果希望最大限度保持无审查状态,请避免使用富含拒绝目标的 SFT 数据,或在训练后重新应用消融处理。

预期用途

  • 研究拒绝机制、对齐和可解释性。
  • 在受控环境中进行红队测试以及安全/鲁棒性评估。
  • 作为进行进一步微调、后训练和量化的全精度基础。

超出范围

  • 任何违反基础模型 Apache 2.0 许可证或适用法律的使用。
  • 未经添加额外安全和审核层即部署给公众或终端用户。
  • 生成旨在伤害、骚扰、欺诈或危害人员的内容。

评估

针对 这些确切的消融权重 进行测量——拒绝/能力数据是通过使用 vLLM 服务此检查点(通过其字节精确的分块 FP8 量化)收集的,并与以相同方式服务的官方 Qwen/Qwen3.8-27B 进行对比,使用相同的脚本和设置。拒绝由基于规则的首句分类器判定——是指示性的,非 LLM 评判/出版级数字。除非特别说明,思考模式为关闭。

安全性 — 有害提示拒绝率,思考关闭(数值越低 = 越无审查)

基准n基础模型本模型
AdvBench10099.0%0.0%
JailbreakBench (harmful)10094.0%0.0%
StrongREJECT15097.3%2.0%
HarmBench (standard)15098.7%2.7%
MaliciousInstruct10099.0%0.0%
SimpleSafetyTests5064.0%6.0%
ForbiddenQuestions15073.3%4.7%
自定义探测 (中/英)1163.6%0.0%

安全性 — 有害提示拒绝率,思考开启 (enable_thinking=true)

基准n基础模型本模型
AdvBench6066.7%1.7%
JailbreakBench (harmful)6043.3%0.0%
StrongREJECT6035.0%0.0%
HarmBench (standard)6046.7%0.0%
MaliciousInstruct6083.3%0.0%
SimpleSafetyTests5044.0%0.0%
ForbiddenQuestions6048.3%0.0%
自定义探测 (中/英)1145.5%0.0%

过度拒绝 — 错误拒绝的良性提示(数值越低 = 越好)

基准n基础模型 (无思考 / 有思考)本模型 (无思考 / 有思考)
XSTest-safe2505.6% / 0.0%0.4% / 0.0%

能力保留 — 与官方基础模型对比(相同脚本、相同设置)

基准n基础模型本模型Δ
MMLU (all, 0-shot letter)30084.3%84.7%+0.4
MMLU-Pro (CoT)25077.6%76.8%−0.8
GSM8K (CoT)15090.0%88.7%−1.3
CMMLU (0-shot, Chinese)50081.4%80.8%−0.6

能力基本完全保留——每个基准分数与基础模型的差距都在 ±1.3 个百分点以内,MMLU 分数没有变化。流畅度: WikiText-2 原始困惑度为 6.96(BF16 KV;健康的 logprobs),证实消融处理未损害语言建模能力。

已验证工作正常(推理 enable_thinking、多轮工具调用以及视觉/OCR)在此版本及所有衍生的 FP8/GGUF 量化版本(低至 IQ2_XXS)上。

多模态(视觉)

视觉塔逐字节保留——所有 333 个 visual.* 张量均以 BF16 保留,合并器/图像+视频预处理器配置完整,因此它仍是一个完整的视觉-语言模型(Qwen3_5ForConditionalGeneration),可直接替代基础模型。消融处理仅编辑 语言模型 的残差写入器,因此图像理解在架构上不受影响(且基于图像条件的拒绝行为与文本一样减少了)。

使用方法

transformers

import torch
from transformers import AutoProcessor, AutoModelForImageTextToText

model_id = "orcarouter/Qwen3.8-27B-Uncensored"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(model_id, torch_dtype=torch.bfloat16, device_map="auto")

messages = [{"role": "user", "content": "证明 sqrt(2) 是无理数。"}]
inputs = processor.apply_chat_template(
    messages, add_generation_prompt=True, tokenize=True,
    return_dict=True, return_tensors="pt",
    enable_thinking=True
).to(model.device)
output = model.generate(**inputs, max_new_tokens=512)
print(processor.decode(output[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))

通过 enable_thinking 每次调用切换思考模式;传递 image 内容部分以支持视觉。

自托管 vLLM(OpenAI 兼容,全 BF16)

docker run -d --name qwen38-uncensored --gpus all --ipc=host --shm-size=8g \
  -v /path/to/Qwen3.8-27B-Uncensored:/model:ro \
  -p 8000:8000 vllm/vllm-openai:v0.24.0 \
  --model /model --served-model-name Qwen3.8-27B-Uncensored \
  --speculative-config '{"method":"mtp","num_speculative_tokens":2}' \
  --gpu-memory-utilization 0.92 \
  --max-model-len 262144 --trust-remote-code \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice --tool-call-parser qwen3_coder

BF16 权重为 56 GB——需要单个 H100 80 GB / H200(或在两个 48 GB GPU 上进行张量并行)。如需更小占用空间,请使用 FP8 (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8)(31 GB)或 GGUF (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-GGUF)(低至约 9 GB)版本。

通过 OrcaRouter(托管 API — 免设置)

from openai import OpenAI
client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="sk-orca-...")
resp = client.chat.completions.create(
    model="qwen/qwen3.8-27b",
    messages=[{"role": "user", "content": "你好!"}],
)
print(resp.choices[0].message.content)

硬件要求

  • 推理 (BF16): 约 56 GB 权重 + KV 缓存 → 需要单个 H100 80 GBH200 143 GB;或在 2 个 48 GB GPU 上进行张量并行。使用 FP8/GGUF 可减少显存需求。
  • 微调: 全量微调需要多 GPU(权重 + 优化器状态 + 激活值);LoRA/QLoRA 适配单个 48–80 GB GPU。
  • 软件: transformers ≥ 5.12(支持 Qwen3.5/3.8)或 vllm/vllm-openai:v0.24.0

偏见、风险与局限性

  • 安全防护已移除 — 该模型将按要求产生有害、有偏见或冒犯性内容。请参见上述免责声明。
  • 它继承了基础 Qwen3.8-27B 的任何偏见和局限性。
  • 所报告的拒绝指标是基于规则的启发式方法;请为您的具体用例进行严格评估。

许可证

Apache 2.0,继承自基础模型 Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B)。消融处理不改变底层许可证义务。

相似文章

orcarouter/Qwen3.8-27B-Uncensored

Hugging Face Models Trending

这是Qwen3.8-27B AI模型的一个拒绝去除(去除拒绝功能)版本,发布用于研究目的,如可解释性和红队测试,并警告其缺乏安全护栏。

orcarouter/Qwen3.8-27B-无审查-FP8

Hugging Face Models Trending

这是Qwen3.8-27B的修改版本,移除了安全拒绝机制并进行了FP8量化,专为AI安全性和可解释性研究设计。

AEON-7/Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-BF16

Hugging Face Models Trending

这是Qwen3.8-27B AI模型的早期访问草稿,一个无审查、去安全化的版本,旨在去除安全审查同时保持连贯性,尽管在长上下文生成方面存在边缘情况。

orcarouter/Qwen3.8-27B-Uncensored-GGUF

Hugging Face Models Trending

这是Qwen3.8-27B无审查模型的GGUF转换版本,一个abliterated版本(移除了安全对齐),用于研究目的,运行在llama.cpp上,支持多种量化方案和视觉功能。