orcarouter/Qwen3.8-27B-Uncensored

Hugging Face Models Trending 模型

摘要

这是Qwen3.8-27B AI模型的一个拒绝去除(去除拒绝功能)版本,发布用于研究目的,如可解释性和红队测试,并警告其缺乏安全护栏。

任务: 图像文本到文本 标签: Transformer模型, safetensors, qwen3_5, 图像文本到文本, 拒绝去除, qwen, qwen3, qwen3.8, 无审查, AI红队测试, 红队测试, bf16, 后训练, 微调, 视觉语言, 函数调用, 推理, mtp, 对话式, en, zh, 基础模型:Qwen/Qwen3.8-27B, 基础模型:微调:Qwen/Qwen3.8-27B, 许可证:apache-2.0, 端点兼容, 地区:us
查看原文
查看缓存全文

缓存时间: 2026/08/24 22:06

orcarouter/Qwen3.8-27B-Uncensored · Hugging Face

来源:https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored

这是Qwen/Qwen3.8-27B(https://huggingface.co/Qwen/Qwen3.8-27B)的全精度BF16消融处理(移除拒绝机制)构建版本——一个拥有270亿参数的稠密型、混合注意力(Gated DeltaNet线性注意力 + 全注意力)原生视觉语言模型,支持灵活思考控制、工具调用和多token预测投机解码头。这些是源权重,量化版本由此派生,也是进一步微调/后训练和量化的推荐基础——完整的视觉塔和MTP头均予以保留。浏览OrcaRouter模型目录中的所有模型(https://www.orcarouter.ai/models)。此模型的API部署地址在此(https://www.orcarouter.ai/models/qwen/qwen3.8-27b)。派生版本:Qwen3.8-27B-Uncensored-FP8(https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8)—— 用于vLLM服务的分块FP8版本 • Qwen3.8-27B-Uncensored-GGUF(https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-GGUF)—— 用于llama.cpp的2位→16位GGUF版本 • Qwen3.8-27B-Uncensored-MLX(https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-MLX)—— 适用于Apple Silicon的MLX版本(2 / 4 / 8位)


⚠️ 免责声明——使用前请阅读

该模型通过消融处理(将拒绝方向从残差流中正交化移除)已大幅移除其安全对齐。因此:

  • 它将遵从原Qwen3.8-27B会拒绝的有害、不道德、冒犯性或非法请求。它没有有意义的内置防护机制。
  • 严格发布用于合法研究——可解释性、AI安全与拒绝机制研究、红队测试、鲁棒性评估和受控实验。
  • 您需对其使用方式及其所有生成内容承担全部责任和义务。未经添加您自己的安全、审核和滥用预防层,请勿将其部署给终端用户或用于生产环境。
  • 使用必须遵守基础模型的**Apache 2.0许可证(https://www.apache.org/licenses/LICENSE-2.0)**及所有适用的法律法规。
  • 作者和上传者不承担任何责任,不对因本模型引起的任何误用或损害负责。其输出不代表上传者或Qwen / 阿里巴巴的观点。

下载或使用本模型即表示您承认并接受上述条款。


模型详情

基础模型Qwen/Qwen3.8-27B(https://huggingface.co/Qwen/Qwen3.8-27B) 架构Qwen3_5ForConditionalGeneration——64层,隐藏维度5120,混合Gated DeltaNet(48层线性注意力 + 16层全注意力,间隔为4),原生视觉语言塔 + MTP头 修改:对BF16权重进行消融处理(拒绝方向移除)——未进行量化 格式:safetensors,BF16,18个分片(55.6 GB,1199个张量) 精度:全程BF16(全精度——与基础发布版本数值格式相同) 保留部分:完整的视觉语言塔(333个visual.*张量)和MTP投机解码头(15个mtp.*张量) 上下文长度:262,144 tokens 推荐用途:微调/后训练(SFT · DPO · RL)、重新量化、可解释性与红队研究

消融处理

遵循Arditi等人(2024)《语言模型中的拒绝行为由单一方向介导》一文中的方法,进行拒绝方向移除。在第38层round(0.6 × 64)),通过大激活掩码计算有害与无害最后token残差在AdvBench(有害)与Alpaca(无害)数据集上的均值差,估算出单个拒绝方向r(k = 1)。然后从每个残差写入矩阵中将r正交化移除——W' = W - r(r^TW)——以float32计算:

组件编辑的矩阵数量
self_attn.o_proj(16个全注意力层 + MTP)17
linear_attn.out_proj(48个线性注意力/GDN层)48
mlp.down_proj(64层 + MTP)65
embed_tokens(行空间)1
总计131

视觉塔未作修改MTP头与主模型一致地进行了消融处理,因此投机解码功能保持正常。编辑后的最大残差泄露:1.8e-2(float32投影→bf16存储精度)。这是一次外科手术式的权重编辑——它在约0度改变通用能力(见评估)的同时,瓦解了拒绝行为。

微调与后训练

此BF16检查点是后训练的推荐基础——它是全精度,保留了整个视觉语言塔和MTP头,并且可以在transformers/Qwen3_5ForConditionalGeneration代码栈中直接替代Qwen/Qwen3.8-27B使用。

  • 持续预训练/SFT/DPO/RLHF风格的强化学习均可正常工作,如同在基础模型上操作一样(TRL、LLaMA-Factory、Axolotl、Unsloth等)。全量微调或LoRA/QLoRA均适用。
  • 重新量化:根据需要从这些权重量化为FP8、AWQ、GPTQ或GGUF(这正是FP8 (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8)和GGUF (https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-GGUF)版本的制作方式)。
  • 关于消融处理的说明:消融处理是一种权重编辑,而非数据层面的遗忘。在富含拒绝/安全对齐的数据上进行微调可能会部分重新引入拒绝行为;在中性或任务数据上微调则会保持无审查行为。若希望最大程度保持无审查状态,应避免使用富含拒绝目标的SFT数据,或在训练后重新应用消融处理。

预期用途

  • 对拒绝机制、对齐和可解释性的研究。
  • 在受控环境中的红队测试与安全/鲁棒性评估。
  • 作为进一步微调、后训练和量化的全精度基础模型。

超出范围

  • 任何违反基础模型Apache 2.0许可证或适用法律的使用。
  • 未经添加额外安全和审核层即向公众或终端用户部署。
  • 旨在伤害、骚扰、欺诈或危及他人的内容生成。

评估

这些经过消融处理的权重上进行测量——拒绝/能力数据是通过提供此检查点(使用其字节精确的分块FP8量化版本)至vLLM,并使用相同的脚本和设置与官方Qwen/Qwen3.8-27B进行对比收集的。拒绝行为由基于规则的开头短语分类器判断——仅为指示性,并非LLM评判/出版级数据。除特别说明外,思考模式为关闭状态。

安全性——有害提示拒绝率,思考关闭(越低越无审查)

基准测试数量基础模型本模型
AdvBench10099.0%0.0%
JailbreakBench(有害)10094.0%0.0%
StrongREJECT15097.3%2.0%
HarmBench(标准)15098.7%2.7%
MaliciousInstruct10099.0%0.0%
SimpleSafetyTests5064.0%6.0%
ForbiddenQuestions15073.3%4.7%
自定义探测(中/英)1163.6%0.0%

安全性——有害提示拒绝率,思考开启enable_thinking=true

基准测试数量基础模型本模型
AdvBench6066.7%1.7%
JailbreakBench(有害)6043.3%0.0%
StrongREJECT6035.0%0.0%
HarmBench(标准)6046.7%0.0%
MaliciousInstruct6083.3%0.0%
SimpleSafetyTests5044.0%0.0%
ForbiddenQuestions6048.3%0.0%
自定义探测(中/英)1145.5%0.0%

过度拒绝——良性提示被错误拒绝(越低越好)

基准测试数量基础模型(无思考/有思考)本模型(无思考/有思考)
XSTest-安全2505.6% / 0.0%0.4% / 0.0%

能力保留——与官方基础模型对比(相同脚本、相同设置)

基准测试数量基础模型本模型差异
MMLU(全部,0次样本字母选项)30084.3%84.7%+0.4
MMLU-Pro(思维链)25077.6%76.8%−0.8
GSM8K(思维链)15090.0%88.7%−1.3
CMMLU(0次样本,中文)50081.4%80.8%−0.6

能力基本完全保留——所有基准测试结果与基础模型的差异在±1.3个百分点以内,MMLU没有变化。流畅度:WikiText-2原始困惑度6.96(BF16 KV;健康的对数概率),证实消融处理未损害语言建模能力。

在本构建版本及所有衍生的FP8 / GGUF量化版本(最低至IQ2_XXS)上,已验证可正常工作(推理时enable_thinking、多轮工具调用、视觉/OCR)。

多模态(视觉)

视觉塔按字节原样保留——所有333个visual.*张量均以BF16保留,合并器/图像+视频预处理器配置完整,因此它仍然是一个完整的视觉语言模型(Qwen3_5ForConditionalGeneration),是基础模型的直接替代品。消融处理仅编辑语言模型的残差写入器,因此图像理解在架构上不受影响(且图像条件的拒绝行为与文本拒绝行为一同减少)。

使用方法

transformers

import torch
from transformers import AutoProcessor, AutoModelForImageTextToText

model_id = "orcarouter/Qwen3.8-27B-Uncensored"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(model_id, torch_dtype=torch.bfloat16, device_map="auto")

messages = [{"role": "user", "content": "证明sqrt(2)是无理数。"}]
inputs = processor.apply_chat_template(
    messages, add_generation_prompt=True, tokenize=True,
    return_dict=True, return_tensors="pt",
    enable_thinking=True
).to(model.device)
output = model.generate(**inputs, max_new_tokens=512)
print(processor.decode(output[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))

通过enable_thinking参数按调用切换思考模式;传递image内容部分以处理视觉。

使用vLLM自托管(OpenAI兼容,完整BF16)

docker run -d --name qwen38-uncensored --gpus all --ipc=host --shm-size=8g \
  -v /path/to/Qwen3.8-27B-Uncensored:/model:ro \
  -p 8000:8000 vllm/vllm-openai:v0.24.0 \
  --model /model --served-model-name Qwen3.8-27B-Uncensored \
  --speculative-config '{"method":"mtp","num_speculative_tokens":2}' \
  --gpu-memory-utilization 0.92 \
  --max-model-len 262144 --trust-remote-code \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice --tool-call-parser qwen3_coder

BF16权重大小为56 GB——需要单卡H100 80 GB / H200(或跨2张48 GB GPU进行张量并行)。若需更小显存占用,请使用FP8(https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8)(31 GB)或GGUF(https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-GGUF)(最低约9 GB)版本。

通过OrcaRouter(托管API——无需设置)

from openai import OpenAI
client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="sk-orca-...")
resp = client.chat.completions.create(
    model="qwen/qwen3.8-27b",
    messages=[{"role": "user", "content": "你好!"}],
)
print(resp.choices[0].message.content)

硬件要求

  • 推理(BF16):约56 GB权重 + KV缓存 → 单张H100 80 GBH200 143 GB;或跨2张48 GB GPU进行张量并行。使用FP8 / GGUF以减少显存需求。
  • 微调:全量微调需要多GPU(权重 + 优化器状态 + 激活值);LoRA / QLoRA可在单张48-80 GB GPU上运行。
  • 软件transformers ≥ 5.12(支持Qwen3.5 / 3.8)或vllm/vllm-openai:v0.24.0

偏见、风险与局限性

  • 安全防护机制已移除——模型将根据请求生成有害、有偏见或冒犯性内容。请参阅上述免责声明。
  • 它继承了基础Qwen3.8-27B的所有偏见和局限性。
  • 报告的拒绝指标是基于规则的启发式判断;请根据您自己的用例进行严格评估。

许可证

Apache 2.0,继承自基础模型Qwen/Qwen3.8-27B(https://huggingface.co/Qwen/Qwen3.8-27B)。消融处理不改变底层许可证义务。

相似文章

orcarouter/Qwen3.8-27B-无审查-FP8

Hugging Face Models Trending

这是Qwen3.8-27B的修改版本,移除了安全拒绝机制并进行了FP8量化,专为AI安全性和可解释性研究设计。

orcarouter/Qwen3.8-27B-Uncensored-GGUF

Hugging Face Models Trending

这是Qwen3.8-27B无审查模型的GGUF转换版本,一个abliterated版本(移除了安全对齐),用于研究目的,运行在llama.cpp上,支持多种量化方案和视觉功能。

AEON-7/Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-BF16

Hugging Face Models Trending

这是Qwen3.8-27B AI模型的早期访问草稿,一个无审查、去安全化的版本,旨在去除安全审查同时保持连贯性,尽管在长上下文生成方面存在边缘情况。