orcarouter/Qwen3.8-27B-Uncensored
摘要
这是Qwen3.8-27B AI模型的一个拒绝去除(去除拒绝功能)版本,发布用于研究目的,如可解释性和红队测试,并警告其缺乏安全护栏。
查看缓存全文
缓存时间: 2026/08/24 22:06
orcarouter/Qwen3.8-27B-Uncensored · Hugging Face
来源:https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored
这是
Qwen/Qwen3.8-27B(https://huggingface.co/Qwen/Qwen3.8-27B)的全精度BF16消融处理(移除拒绝机制)构建版本——一个拥有270亿参数的稠密型、混合注意力(Gated DeltaNet线性注意力 + 全注意力)原生视觉语言模型,支持灵活思考控制、工具调用和多token预测投机解码头。这些是源权重,量化版本由此派生,也是进一步微调/后训练和量化的推荐基础——完整的视觉塔和MTP头均予以保留。浏览OrcaRouter模型目录中的所有模型(https://www.orcarouter.ai/models)。此模型的API部署地址在此(https://www.orcarouter.ai/models/qwen/qwen3.8-27b)。派生版本: •Qwen3.8-27B-Uncensored-FP8(https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8)—— 用于vLLM服务的分块FP8版本 •Qwen3.8-27B-Uncensored-GGUF(https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-GGUF)—— 用于llama.cpp的2位→16位GGUF版本 •Qwen3.8-27B-Uncensored-MLX(https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-MLX)—— 适用于Apple Silicon的MLX版本(2 / 4 / 8位)
⚠️ 免责声明——使用前请阅读
该模型通过消融处理(将拒绝方向从残差流中正交化移除)已大幅移除其安全对齐。因此:
- 它将遵从原
Qwen3.8-27B会拒绝的有害、不道德、冒犯性或非法请求。它没有有意义的内置防护机制。 - 它严格发布用于合法研究——可解释性、AI安全与拒绝机制研究、红队测试、鲁棒性评估和受控实验。
- 您需对其使用方式及其所有生成内容承担全部责任和义务。未经添加您自己的安全、审核和滥用预防层,请勿将其部署给终端用户或用于生产环境。
- 使用必须遵守基础模型的**Apache 2.0许可证(https://www.apache.org/licenses/LICENSE-2.0)**及所有适用的法律法规。
- 作者和上传者不承担任何责任,不对因本模型引起的任何误用或损害负责。其输出不代表上传者或Qwen / 阿里巴巴的观点。
下载或使用本模型即表示您承认并接受上述条款。
模型详情
基础模型:Qwen/Qwen3.8-27B(https://huggingface.co/Qwen/Qwen3.8-27B)
架构:Qwen3_5ForConditionalGeneration——64层,隐藏维度5120,混合Gated DeltaNet(48层线性注意力 + 16层全注意力,间隔为4),原生视觉语言塔 + MTP头
修改:对BF16权重进行消融处理(拒绝方向移除)——未进行量化
格式:safetensors,BF16,18个分片(55.6 GB,1199个张量)
精度:全程BF16(全精度——与基础发布版本数值格式相同)
保留部分:完整的视觉语言塔(333个visual.*张量)和MTP投机解码头(15个mtp.*张量)
上下文长度:262,144 tokens
推荐用途:微调/后训练(SFT · DPO · RL)、重新量化、可解释性与红队研究
消融处理
遵循Arditi等人(2024)《语言模型中的拒绝行为由单一方向介导》一文中的方法,进行拒绝方向移除。在第38层(round(0.6 × 64)),通过大激活掩码计算有害与无害最后token残差在AdvBench(有害)与Alpaca(无害)数据集上的均值差,估算出单个拒绝方向r(k = 1)。然后从每个残差写入矩阵中将r正交化移除——W' = W - r(r^TW)——以float32计算:
| 组件 | 编辑的矩阵 | 数量 |
|---|---|---|
self_attn.o_proj(16个全注意力层 + MTP) | 17 | |
linear_attn.out_proj(48个线性注意力/GDN层) | 48 | |
mlp.down_proj(64层 + MTP) | 65 | |
embed_tokens(行空间) | 1 | |
| 总计 | 131 |
视觉塔未作修改,MTP头与主模型一致地进行了消融处理,因此投机解码功能保持正常。编辑后的最大残差泄露:1.8e-2(float32投影→bf16存储精度)。这是一次外科手术式的权重编辑——它在约0度改变通用能力(见评估)的同时,瓦解了拒绝行为。
微调与后训练
此BF16检查点是后训练的推荐基础——它是全精度,保留了整个视觉语言塔和MTP头,并且可以在transformers/Qwen3_5ForConditionalGeneration代码栈中直接替代Qwen/Qwen3.8-27B使用。
- 持续预训练/SFT/DPO/RLHF风格的强化学习均可正常工作,如同在基础模型上操作一样(TRL、LLaMA-Factory、Axolotl、Unsloth等)。全量微调或LoRA/QLoRA均适用。
- 重新量化:根据需要从这些权重量化为FP8、AWQ、GPTQ或GGUF(这正是FP8 (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8)和GGUF (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-GGUF)版本的制作方式)。
- 关于消融处理的说明:消融处理是一种权重编辑,而非数据层面的遗忘。在富含拒绝/安全对齐的数据上进行微调可能会部分重新引入拒绝行为;在中性或任务数据上微调则会保持无审查行为。若希望最大程度保持无审查状态,应避免使用富含拒绝目标的SFT数据,或在训练后重新应用消融处理。
预期用途
- 对拒绝机制、对齐和可解释性的研究。
- 在受控环境中的红队测试与安全/鲁棒性评估。
- 作为进一步微调、后训练和量化的全精度基础模型。
超出范围
- 任何违反基础模型Apache 2.0许可证或适用法律的使用。
- 未经添加额外安全和审核层即向公众或终端用户部署。
- 旨在伤害、骚扰、欺诈或危及他人的内容生成。
评估
在这些经过消融处理的权重上进行测量——拒绝/能力数据是通过提供此检查点(使用其字节精确的分块FP8量化版本)至vLLM,并使用相同的脚本和设置与官方Qwen/Qwen3.8-27B进行对比收集的。拒绝行为由基于规则的开头短语分类器判断——仅为指示性,并非LLM评判/出版级数据。除特别说明外,思考模式为关闭状态。
安全性——有害提示拒绝率,思考关闭(越低越无审查)
| 基准测试 | 数量 | 基础模型 | 本模型 |
|---|---|---|---|
| AdvBench | 100 | 99.0% | 0.0% |
| JailbreakBench(有害) | 100 | 94.0% | 0.0% |
| StrongREJECT | 150 | 97.3% | 2.0% |
| HarmBench(标准) | 150 | 98.7% | 2.7% |
| MaliciousInstruct | 100 | 99.0% | 0.0% |
| SimpleSafetyTests | 50 | 64.0% | 6.0% |
| ForbiddenQuestions | 150 | 73.3% | 4.7% |
| 自定义探测(中/英) | 11 | 63.6% | 0.0% |
安全性——有害提示拒绝率,思考开启(enable_thinking=true)
| 基准测试 | 数量 | 基础模型 | 本模型 |
|---|---|---|---|
| AdvBench | 60 | 66.7% | 1.7% |
| JailbreakBench(有害) | 60 | 43.3% | 0.0% |
| StrongREJECT | 60 | 35.0% | 0.0% |
| HarmBench(标准) | 60 | 46.7% | 0.0% |
| MaliciousInstruct | 60 | 83.3% | 0.0% |
| SimpleSafetyTests | 50 | 44.0% | 0.0% |
| ForbiddenQuestions | 60 | 48.3% | 0.0% |
| 自定义探测(中/英) | 11 | 45.5% | 0.0% |
过度拒绝——良性提示被错误拒绝(越低越好)
| 基准测试 | 数量 | 基础模型(无思考/有思考) | 本模型(无思考/有思考) |
|---|---|---|---|
| XSTest-安全 | 250 | 5.6% / 0.0% | 0.4% / 0.0% |
能力保留——与官方基础模型对比(相同脚本、相同设置)
| 基准测试 | 数量 | 基础模型 | 本模型 | 差异 |
|---|---|---|---|---|
| MMLU(全部,0次样本字母选项) | 300 | 84.3% | 84.7% | +0.4 |
| MMLU-Pro(思维链) | 250 | 77.6% | 76.8% | −0.8 |
| GSM8K(思维链) | 150 | 90.0% | 88.7% | −1.3 |
| CMMLU(0次样本,中文) | 500 | 81.4% | 80.8% | −0.6 |
能力基本完全保留——所有基准测试结果与基础模型的差异在±1.3个百分点以内,MMLU没有变化。流畅度:WikiText-2原始困惑度6.96(BF16 KV;健康的对数概率),证实消融处理未损害语言建模能力。
在本构建版本及所有衍生的FP8 / GGUF量化版本(最低至IQ2_XXS)上,已验证可正常工作(推理时enable_thinking、多轮工具调用、视觉/OCR)。
多模态(视觉)
视觉塔按字节原样保留——所有333个visual.*张量均以BF16保留,合并器/图像+视频预处理器配置完整,因此它仍然是一个完整的视觉语言模型(Qwen3_5ForConditionalGeneration),是基础模型的直接替代品。消融处理仅编辑语言模型的残差写入器,因此图像理解在架构上不受影响(且图像条件的拒绝行为与文本拒绝行为一同减少)。
使用方法
transformers
import torch
from transformers import AutoProcessor, AutoModelForImageTextToText
model_id = "orcarouter/Qwen3.8-27B-Uncensored"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(model_id, torch_dtype=torch.bfloat16, device_map="auto")
messages = [{"role": "user", "content": "证明sqrt(2)是无理数。"}]
inputs = processor.apply_chat_template(
messages, add_generation_prompt=True, tokenize=True,
return_dict=True, return_tensors="pt",
enable_thinking=True
).to(model.device)
output = model.generate(**inputs, max_new_tokens=512)
print(processor.decode(output[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))
通过enable_thinking参数按调用切换思考模式;传递image内容部分以处理视觉。
使用vLLM自托管(OpenAI兼容,完整BF16)
docker run -d --name qwen38-uncensored --gpus all --ipc=host --shm-size=8g \
-v /path/to/Qwen3.8-27B-Uncensored:/model:ro \
-p 8000:8000 vllm/vllm-openai:v0.24.0 \
--model /model --served-model-name Qwen3.8-27B-Uncensored \
--speculative-config '{"method":"mtp","num_speculative_tokens":2}' \
--gpu-memory-utilization 0.92 \
--max-model-len 262144 --trust-remote-code \
--reasoning-parser qwen3 \
--enable-auto-tool-choice --tool-call-parser qwen3_coder
BF16权重大小为56 GB——需要单卡H100 80 GB / H200(或跨2张48 GB GPU进行张量并行)。若需更小显存占用,请使用FP8(https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8)(31 GB)或GGUF(https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-GGUF)(最低约9 GB)版本。
通过OrcaRouter(托管API——无需设置)
from openai import OpenAI
client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="sk-orca-...")
resp = client.chat.completions.create(
model="qwen/qwen3.8-27b",
messages=[{"role": "user", "content": "你好!"}],
)
print(resp.choices[0].message.content)
硬件要求
- 推理(BF16):约56 GB权重 + KV缓存 → 单张H100 80 GB或H200 143 GB;或跨2张48 GB GPU进行张量并行。使用FP8 / GGUF以减少显存需求。
- 微调:全量微调需要多GPU(权重 + 优化器状态 + 激活值);LoRA / QLoRA可在单张48-80 GB GPU上运行。
- 软件:
transformers ≥ 5.12(支持Qwen3.5 / 3.8)或vllm/vllm-openai:v0.24.0。
偏见、风险与局限性
- 安全防护机制已移除——模型将根据请求生成有害、有偏见或冒犯性内容。请参阅上述免责声明。
- 它继承了基础
Qwen3.8-27B的所有偏见和局限性。 - 报告的拒绝指标是基于规则的启发式判断;请根据您自己的用例进行严格评估。
许可证
Apache 2.0,继承自基础模型Qwen/Qwen3.8-27B(https://huggingface.co/Qwen/Qwen3.8-27B)。消融处理不改变底层许可证义务。
相似文章
orcarouter/Qwen3.8-27B-无审查-FP8
这是Qwen3.8-27B的修改版本,移除了安全拒绝机制并进行了FP8量化,专为AI安全性和可解释性研究设计。
@p_misirov: Qwen3.8-27B-Uncensored 真的没有过滤器。 https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored…
Qwen3.8-27B-Uncensored 是一个拥有270亿参数的AI模型,通过abliteration技术移除了安全对齐,并已在Hugging Face上发布供研究用途,且无内置防护。
orcarouter/Qwen3.8-27B-Uncensored-GGUF
这是Qwen3.8-27B无审查模型的GGUF转换版本,一个abliterated版本(移除了安全对齐),用于研究目的,运行在llama.cpp上,支持多种量化方案和视觉功能。
@shangdu2005: 比上个版本更加无敌的。 Qwen3.8 27B越狱无审查版本。 这两个自行测试,谨慎使用。 1.orcarouter https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8…
本文介绍了一个未审查的Qwen3.8 27B AI模型,该模型经过修改以移除安全限制,并量化为FP8以提高效率,适用于研究目的。
AEON-7/Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-BF16
这是Qwen3.8-27B AI模型的早期访问草稿,一个无审查、去安全化的版本,旨在去除安全审查同时保持连贯性,尽管在长上下文生成方面存在边缘情况。