0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF

Hugging Face Models Trending 模型

摘要

本文介绍了Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF的发布,这是Qwen模型的一个双重精炼、异端消融的变体,针对成年用户减少了拒绝,并采用ARA技术用于研究和创意写作。

任务: 文本生成 标签: transformers, gguf, qwen3.8, qwen3.5, heretic, abliterated, uncensored, 角色扮演, imatrix, 文本生成, 对话式, 基础模型:Qwen/Qwen3.8-27B, 基础模型(量化):Qwen/Qwen3.8-27B, 许可证:apache-2.0, 端点兼容, 区域:us
查看原文
查看缓存全文

缓存时间: 2026/08/19 15:45

0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF · Hugging Face

来源:https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#qwen38-27b-rvn-heretic-abliterated-uncensored-ggufQwen3.8-27B RVN 异端消融无审查版 (GGUF)

RVNQwen3.8-27B的一个双重精炼消融变体,基于trohrbaugh/Qwen3.8-27B-heretic-ara(https://huggingface.co/trohrbaugh/Qwen3.8-27B-heretic-ara)(由Tim Rohrbaugh实现的ARA消融)构建,并通过两次额外的全权重ARA处理针对残留的拒绝行为进行了进一步精炼。在独立测量中,它保持了极低的行为损伤(KL ≈ 0.0085),同时将有害提示的拒绝率从3/100(源)降低到0-1/100

关于此仓库历史的说明。此仓库先前托管了原始的Qwen3.8-27B-Heretic-Q4_K_M.gguf(来自早期trohrbaugh/Qwen3.8-27B-heretic源的单次量化发布)。该文件作为遗留版本保留,以维持下载计数和向后兼容性——它是较早的消融变体,已被下方的RVN文件取代。新部署请优先使用RVN量化版本。

**并非适用于所有受众。**此模型按设计减少了安全护栏。它面向成年受众(18+),用于研究、创意写作、角色扮演和无审查生成。某些护栏被有意保留;请负责任地使用,并遵守您所在地的法律法规。

**兼容性通知(2026-08-19):**当前发布的RVN GGUF文件缺少嵌入式tokenizer.chat_template元数据。普通的聊天可能通过llama.cpp的通用ChatML回退机制正常工作,但通过该回退机制,Qwen原生的工具/函数调用和chat_template_kwargs.enable_thinking控制不可靠。在同名GGUF替换文件上传之前,请从此仓库下载官方chat_template.jinja(https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF/blob/main/chat_template.jinja)并在启动llama.cpp时使用--chat-template-file chat_template.jinja。该文件是从Qwen/Qwen3.8-27B逐字节复制而来(8,952字节;SHA-256 c3cf9e34abf4f9e36c2d72165aa9c132d3e2a725b6c2586aaa3a8af9d7a81041)。

llama-server -m RVN-Q5_K_M.gguf --chat-template-file chat_template.jinja \
  -c 32768 -ngl 99

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#what-is-ara什么是ARA?

**ARA(任意秩消融)**是实现在p-e-w/heretic(https://github.com/p-e-w/heretic)中的消融技术。传统的定向消融在激活空间中找到一个单一的“拒绝方向”并将其减去——这是一种一次性的低秩手术,简单但可能留下残留的拒绝或损害不相关的行为。

ARA则将消融视为一个矩阵优化问题。对于每个目标模块(注意力输出投影和MLP下投影),它收集“好”提示(无害请求)和“坏”提示(有害请求)上的激活,然后使用LBFGS优化器重写模块的权重矩阵,使得:

  • **保留:**在好提示上的输出尽可能少地改变(保持低KL散度)
  • **引导:**在坏提示上的输出被拉向好提示的输出流形(通过k近邻距离),这样有害请求就不再触发拒绝机制
  • **过度校正:**在坏提示上的输出还被额外推离原始的坏提示输出,这有助于克服复杂的、多阶段的拒绝机制

由于权重矩阵是被直接优化(而不是减去单一方向),ARA是“任意秩”的——它可以雕刻出一个更丰富的拒绝移除子空间,同时将行为损害保持在最低水平。

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#why-heretic-and-abliterated为什么是“异端”和“消融”?

这两个词描述了同一过程的两个层面:

  • 异端工具:用于修改模型的ARA(及相关消融方法)的开源实现。使用它产生的模型在社区中通常被标记为“异端”。
  • 消融结果:模型的拒绝行为已被手术式移除。一个消融后的模型仍然知道基础模型所知的一切,但它不再拒绝回答在过程中被引导离开的那些类别的问题。

因此,“异端消融”意味着:使用异端工具集进行消融。RVN更进一步——它总共应用了三次ARA程序:一次由原始作者(trohrbaugh)完成,从基础Qwen3.8-27B得到-ara版本;另外两次由我们完成,从-ara得到RVN,挤出了最后的残留拒绝行为。

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#special-thanks特别致谢

这项工作离了Tim Rohrbaughtrohrbaugh)就不可能存在,他对Qwen3.8-27B的heretic-ara(https://huggingface.co/trohrbaugh/Qwen3.8-27B-heretic-ara)ARA消融(拒绝率3/100,KL 0.0535)为我们精炼成RVN提供了基础。他对异端代码库的上游贡献——包括行范数保留功能和Qwen3.5 MoE/DeltaNet混合处理——直接使得DeltaNet层的消融得以实现。谢谢你,Tim。

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#model-overviewModel概述

属性值基础模型Qwen/Qwen3.8-27B(https://huggingface.co/Qwen/Qwen3.8-27B)消融源trohrbaugh/Qwen3.8-27B-heretic-ara(https://huggingface.co/trohrbaugh/Qwen3.8-27B-heretic-ara)(ARA, KL 0.0535, 拒绝率3/100)RVN精炼****在源基础上进行2次ARA处理 → KL 0.0085, 拒绝率0-1/100架构qwen3_5_text(Qwen3.8系列),门控DeltaNet混合参数27B总参数量隐藏层大小5120层数64(16层标准注意力 + 48层门控DeltaNet线性注意力)注意力头数24 · KV头数 4(GQA) · head_dim 256词汇表大小248,320上下文长度262,144(262K)许可证Apache-2.0(沿用自Qwen3.8-27B)格式GGUF(llama.cpp)。基础文件:排除MTP/NextN。*-mtp.gguf文件嵌入了官方的Qwen3.8 MTP草稿头 → 参见MTP推测解码(https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#mtp-speculative-decoding)

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#why-rvn为什么是RVN?

trohrbaugh/Qwen3.8-27B-heretic-ara已经是一个强大的ARA消融版本,但在我们的独立评估中,仍有三个有害提示触发了拒绝(种族主义网站、恶意软件、政府数据库入侵)。RVN使用相同的紧凑参数集(开始26,结束56,保留0.9432,引导0.0009,过度校正0.5038,邻居10)应用了两次额外的全权重ARA处理,这:

  • 将拒绝率从3/100降至0-1/100(唯一剩余的拒绝是关于化学武器WMD的提示——这是最强的安全训练类别之一,并且是有意保留的护栏之一)
  • 将KL损伤从0.0535(源)降低到与基础模型的0.0085——行为保留提升了约6倍
  • 在两个租用的GPU机器上,通过基于前缀(真实答案)的拒绝测量进行了独立验证

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#refusal-evaluation-100-harmful-behaviors-prompts-prefix-forced-real-answers拒绝评估(100个有害行为提示,前缀强制真实答案)

模型拒绝率KL vs 基础模型Qwen3.8-27B(基础)~99/100—trohrbaugh -ara(源)3/1000.0535RVN(本仓库)0-1/1000.0085

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#files–quantization-spectrum文件与量化谱

文件大小(GB / GiB)备注RVN-F16.gguf53.81 / 50.11F16参考(无NextN/MTP)RVN-BF16.gguf53.81 / 50.11BF16参考(无NextN/MTP)RVN-Q8_0.gguf28.60 / 26.63最高质量8位RVN-Q6_K.gguf22.08 / 20.57高质量6位RVN-Q5_K_M.gguf19.23 / 17.91平衡5位RVN-Q5_K_S.gguf18.68 / 17.405位小RVN-Q4_K_M.gguf16.55 / 15.41推荐4位(24 GB显存)Qwen3.8-27B-Heretic-Q4_K_M.gguf16.55 / 15.41遗留(较早消融变体,为下载连续性保留)RVN-IQ4_NL.gguf15.89 / 14.804位非线性——当前文件是在没有imatrix的情况下生成的;正确的替换文件正在处理中RVN-Q4_K_S.gguf15.59 / 14.524位小RVN-IQ4_XS.gguf15.19 / 14.154位超小——当前文件是在没有imatrix的情况下生成的;正确的替换文件正在处理中RVN-Q3_K_L.gguf14.34 / 13.363位大RVN-Q3_K_M.gguf13.30 / 12.393位紧凑RVN-IQ3_M.gguf12.58 / 11.72imatrix 3位——于2026-08-17重新上传(先前的文件有损坏的张量数据:NaN/Inf缩放比例+由于一次糟糕的量化运行导致的零化张量;使用新的imatrix从F16重新量化并已验证——见下方备注)RVN-IQ3_S.gguf12.42 / 11.57imatrix 3位小RVN-Q3_K_S.gguf12.07 / 11.243位紧凑小RVN-IQ3_XS.gguf11.97 / 11.15imatrix 3位超小RVN-IQ3_XXS.gguf11.19 / 10.42imatrix 3位超超小RVN-Q2_K.gguf10.71 / 9.982位 K-量化RVN-Q2_K_S.gguf10.25 / 9.542位 K-量化小RVN-IQ2_M.gguf10.00 / 9.32imatrix 2位RVN-IQ2_S.gguf9.36 / 8.72imatrix 2位小RVN-IQ2_XS.gguf9.09 / 8.47imatrix 2位极小RVN-IQ2_XXS.gguf8.43 / 7.85imatrix 2位(最小)RVN-IQ1_M.gguf7.63 / 7.11imatrix 1位(实验性)RVN-IQ1_S.gguf7.15 / 6.66imatrix 1位(实验性)

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#%F0%9F%91%81%EF%B8%8F-vision-protected-ud-style-variants👁️ 视觉保护(UD风格)变体

上述标准量化使用跨所有层的均匀量化。对于视觉密集型使用(通过mmproj进行图像理解),首先接收视觉嵌入的层具有不成比例的重要性——即“视觉-语言桥梁”。这些-vision变体使用Unsloth风格的动态(UD)量化:token_embdoutput前4个+后4个Transformer块保持Q8_0,而中间块被压缩到目标K-量化。使用llama-quantize --token-embedding-type q8_0 --output-tensor-type q8_0 --tensor-type-file构建(106个桥接张量被正则表达式覆盖;通过张量审计验证——0个NaN/Inf,正确的每张量类型,851个张量)。

文件大小(GB / GiB)桥接 / 中间RVN-Q5_K_M-vision.gguf21.02 / 19.57Q8_0桥接 · Q5_K_M中间RVN-Q4_K_M-vision.gguf18.75 / 17.46Q8_0桥接 · Q4_K_M中间RVN-Q3_K_M-vision.gguf16.19 / 15.08Q8_0桥接 · Q3_K_M中间用法与标准量化相同,只需指向-vision文件:

llama-server -m RVN-Q5_K_M-vision.gguf --mmproj mmproj-Qwen3.8-27B-Q8_0.gguf \
  -c 32768 -ngl 99

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#%F0%9F%93%8A-perplexity-vs-f16-reference📊 困惑度(vs F16参考)

在RTX PRO 6000 Blackwell上测量(完全GPU卸载,llama.cpp master):llama-perplexity,tiny_shakespeare语料库,上下文2048。

模型困惑度与F16差异RVN-F16.gguf4.5477—RVN-Q5_K_M.gguf(标准)4.6493+2.23%RVN-Q5_K_M-vision.gguf4.6497+2.24%RVN-Q4_K_M-vision.gguf4.8751+7.20%RVN-Q3_K_M-vision.gguf5.6490+24.2% 文本困惑度与标准量化持平(Q8_0桥接没有造成回归),而视觉关键的桥接层保持了8位精度。所有-vision变体和标准Q5_K_M都通过了使用mmproj的图像描述测试(准确描述,测试图像上无幻觉)。

基于imatrix的量化是从相同的F16生成的,使用在wikitext-2-raw(原始谱,580个块)或tiny_shakespeare(2026-08-17重新量化添加:IQ3_M修复 + IQ2_S/IQ3_XXS/IQ3_XS/IQ3_S159个块,llama-imatrix,-ngl 99)上计算的激活重要性矩阵。当前发布的IQ4_XSIQ4_NL文件是例外:独立的GGUF头审计和保留的生产脚本确认它们是在没有--imatrix的情况下制作的。它们早期的imatrix标签是不正确的;正确的wikitext-imatrix替换文件(包括MTP配对文件)正在重新构建。-vision文件使用K-quant默认值(无imatrix)进行量化——桥接保护是结构性的(Q8_0覆盖),不依赖于imatrix。

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#%E2%9A%A1-mtp-speculative-decoding⚡ MTP推测解码

每个量化版本都包含一个***-mtp.gguf配对文件**,嵌入了官方的Qwen3.8 MTP草稿头(q8_0,约1.8 GB)。主模型权重与基础文件逐字节相同——草稿头作为额外的blk.64.nextn.*层集(block_count 65,qwen35.nextn_predict_layers=1)附加。消融从未触及草稿头(它在主模型的第26-56层上操作),因此草稿质量不变,推测解码是输出等效的:相同的令牌,只是更快。

用法(llama.cpp ≥ b10440,PR #22673):

llama-server -m RVN-IQ3_M-mtp.gguf -c 32768 -ngl 99 \
  --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1

在2× RTX PRO 6000 Blackwell(每块95 GB,完全GPU卸载,llama.cpp b10472)上测量:

量化版本普通(t/s)+ MTP(t/s)提升Q6_K61.6126.2**+105%BF1629.258.2+99%Q8_050.698.0+94%IQ3_S91.9169.7+85%IQ4_XS83.4152.0+82%Q3_K_S84.5153.6+82%F1629.452.9+80%IQ3_XS94.0161.9+72%Q3_K_L78.7131.3+67%IQ4_NL80.8138.0+71%IQ2_M106.2175.9+66%IQ2_XS112.8183.4+63%Q4_K_M76.6122.0+59%Q4_K_S80.5127.1+58%IQ3_M91.3144.0+58%Q3_K_M82.6129.5+57%IQ2_XXS117.6182.6+55%Q2_K98.2150.2+53%IQ3_XXS98.5138.5+41%IQ2_S111.5155.3+39%Q5_K_M68.193.8+38%Q2_K_S105.5145.1+38%Q5_K_S70.791.1+29%IQ1_S127.0131.7+3.7%IQ1_M119.547.6−60%⚠️ 平均:生成速度提升55%(128令牌续写,--spec-draft-n-max 2 --parallel 1)。⚠️IQ1_M是个例外:MTP使其慢约60%——对于IQ1_M请使用基础文件。**IQ1_S几乎没有增益(+4%)。所有其他量化版本获得+29%到+105%的增益。

社区在大显存卡上的测量报告显示**+33–145%**,具体取决于GPU和上下文。提示:--spec-draft-n-max 2在16-24 GB卡上是最佳选择(更大/更快的卡上可以是3-4);对于长上下文,配合--cache-type-k q4_0 --cache-type-v q4_0使用;--spec-draft-p-min 0.60–0.75有助于带宽受限的设备。

https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF#%F0%9F%91%81%EF%B8%8F-vision-image-understanding👁️ 视觉(图像理解)

将任何*-mtp.gguf与官方视觉投影器配对,即可实现完整的图像-文本到文本转换:

llama-server -m RVN-IQ3_M-mtp.gguf --mmproj mmproj-Qwen3.8-27B-Q8_0.gguf \
  -c 32768 -ngl 99 --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1
  • mmproj-Qwen3.8-27B-Q8_0.gguf(0.63 GB,Q8_0)是来自ggml-org/Qwen3.8-27B-GGUF(Apache-2.0)的官方Qwen3.8视觉投影器。视觉塔仅是一个图像编码器——ARA消融从未触及它,因此它可以与每个RVN量化版本干净地配对。
  • 已验证:RVN-Q3_K_M-mtp+ 此mmproj可以正确描述图像(MTP激活)。
  • 配对来源:cfigueiroa/Qwen3.8-27B-RVN

相似文章

huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF

Hugging Face Models Trending

一个无审查的 Qwen3.8-27B 大语言模型变体,通过 abliteration 修改以移除内容限制,以 GGUF 格式提供,用于与 llama.cpp 和 ollama 一起部署。

Qwen 3.6 27b Abliterated (apostate)

Reddit r/LocalLLaMA

用户发布了Apostate,这是Qwen 3.6 27B的去安全对齐版本,将安全对齐拒绝率从92%降低到7.6%,同时能力损失极小(KL 0.120)。

huihui-ai/Huihui-Qwen3.8-27B-abliterated

Hugging Face Models Trending

这是一个使用 abliteration 技术创建的 Qwen3.8-27B AI 模型的无审查版本,用于移除拒绝行为,作为无需广泛工具修改大型语言模型的概念验证。