HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF

Hugging Face Models Trending 模型

摘要

此次发布引入了 Qwen3.8-27B AI 模型的无审查激进变体,采用 HauhauCS FastMTP 加速技术,提升文档和推理吞吐量,并支持视觉功能。

任务:image-text-to-text 标签:gguf, uncensored, qwen3.8, multimodal, vision, mtp, speculative-decoding, fastmtp, image-text-to-text, en, zh, multilingual, base_model:Qwen/Qwen3.8-27B, base_model:quantized:Qwen/Qwen3.8-27B, license:apache-2.0, endpoints_compatible, region:us, conversational
查看原文
查看缓存全文

缓存时间: 2026/08/18 15:41

HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF · Hugging Face

来源: https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#qwen38-27b-uncensored-hauhaucs-aggressive-mtpQwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP

HauhauCS FastMTP:相比非MTP模式,文档生成(TG)最高提升3.02倍,推理生成(TG)最高提升1.93倍——并且与标准嵌入式MTP相比,文档TG额外提升高达35.2%,推理TG额外提升高达21.1%。

加入Discord (https://discord.gg/SZ5vacTXYf)获取更新、路线图、项目信息,或只是聊聊天。

Qwen3.8-27B经由HauhauCS去审查处理,无任何拒绝(0/465 Refusals)*。

这是激进(Aggressive)变体:直接回答,无拒绝行为,面对困难提示时最少前置说明。

**每个文本GGUF都保留了Qwen3.8原生的NextN头,本次发布还添加了HauhauCS FastMTP:一个特定的加速组件,已在最大原生上下文下针对所有量化版本进行了验证。**视觉功能通过单独的BF16投影器提供。

Hugging Face的硬件兼容性组件可能无法识别K_P量化版本。如果文件显示缺失,请点击查看变体(View variants)或打开文件和版本(Files and versions)

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#about关于

未对数据集或预期能力进行更改。本次发布保留了Qwen3.8-27B的文本、推理、智能体、图像和视频能力,同时应用了HauhauCS激进(Aggressive)去审查配置。

当你特别希望模型直接给出答案,而不是先说服自己遵守规则时,请选择激进(Aggressive)版本。对于可靠性要求高、特别是长上下文智能体工作,平衡(Balanced)版本(如果可用)通常是更安全的默认选择。

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#downloads下载

BPW是整个文本模型(包括其嵌入的MTP张量)的编码张量载荷平均值,四舍五入到小数点后两位。投影器和FastMTP侧载组件适用于所有文本量化版本;仅当需要图像或视频输入时才需下载投影器。

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#what-are-k_p-quants什么是K_P量化?

K_P(“完美”)量化是HauhauCS的自定义量化方法,利用模型特定分析来选择性保留最重要的质量。每个模型都有其专属的优化量化配置。

K_P量化能在仅比基础量化版本增加约5-15%体积的情况下,有效提升一到两个量化等级的质量。文件保持为标准GGUF格式,可与llama.cpp、LM Studio及其他兼容GGUF的运行时环境配合使用,无需特殊构建或插件。

注意: K_P量化在LM Studio的量化列中可能显示为?。这仅是显示问题——模型加载和运行正常。

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#specs规格

  • 稠密27B参数因果语言模型,配备视觉编码器
  • 64个语言模型层
  • 隐藏层大小5,120;前馈网络大小17,408
  • 248,320个词元(含填充)的词汇表
  • 48个Gated DeltaNet层和16个门控注意力层
  • 保留了原生嵌入式MTP/NextN,以及HauhauCS FastMTP 32K加速配置
  • 原生上下文长度262,144词元;通过特定框架配置可扩展至1,000,000词元
  • 原生文本、图像和视频理解能力
  • 基于Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B)

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#what-is-hauhaucs-fastmtp什么是HauhauCS FastMTP?

HauhauCS FastMTP是为本次激进(Aggressive)发布版本量身定制的自定义加速配置:一个紧凑的32K草稿侧载组件,以及针对TG(生成)、接受率、最大原生上下文和显存验证的逐量化版本服务配置。

它提供了**相比非MTP模式最高3.02倍的文档TG提升和1.93倍的推理TG提升,并且与标准嵌入式MTP配置相比,文档TG额外提升高达35.2%,推理TG额外提升高达21.1%。**未更改的完整目标模型会验证每个草稿词元,因此FastMTP在不替换目标模型或改变其答案的情况下加速生成。其构建和选择方法专属于HauhauCS发布。

基准测试结果阶梯:

对比项文档TG推理TG测试范围
标准嵌入式MTP vs 禁用MTP2.23倍 (\+123.4%)1.60倍 (\+59.6%)Final Q8_K_P,深度2
HauhauCS FastMTP配置 vs 标准嵌入式MTP+35.2%+21.1%Final Q8_K_P,深度3 vs 深度2
HauhauCS FastMTP vs 相同深度的嵌入式MTP+11.1%+18.2%Final Q8_K_P,深度3
HauhauCS FastMTP vs 禁用MTP3.02倍 (\+202.0%)1.93倍 (\+93.3%)Final Q8_K_P服务
这些结果是在单张RTX PRO 6000 Blackwell 96 GB显卡上,使用204800配置上下文、完全CUDA卸载、\-\-no\-mmap标志和官方推理采样器测得的。FastMTP加速TG;此处也报告了PP(提示处理)速度以进行完整的服务比较。

有两种加速路径:

  • 嵌入式MTP: 在当前的上游llama.cpp构建中,单独使用任何目标GGUF,并附带\-\-spec\-type draft\-mtp参数。
  • HauhauCS FastMTP: 将同一目标模型与Qwen3\.8\-27B\-Uncensored\-HauhauCS\-Aggressive\-FastMTP\-32K\.gguf以及下面的HauhauCS运行时补丁配对使用。

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#run-hauhaucs-fastmtp运行HauhauCS FastMTP

紧凑的草稿使用标准的GGUF d2t词元映射加上一个最小的Qwen3.8运行时消费者。只需构建一次。以下示例使用CUDA;对于ROCm/HIP或Vulkan,请将\-DGGML\_CUDA=ON替换为\-DGGML\_HIP=ON\-DGGML\_VULKAN=ON。对于仅CPU运行,请省略后端标志。

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
git checkout 4df29be4f4c3673f428170fda944a5b19f743bb8

curl -L -o HauhauCS-FastMTP-llama.cpp.patch \
  https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-FastMTP-llama.cpp.patch
git apply --check HauhauCS-FastMTP-llama.cpp.patch
git apply HauhauCS-FastMTP-llama.cpp.patch

cmake -S . -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j"$(nproc)"

如果草稿加载报告expected 5120, 248320, got 5120, 32768,说明FastMTP侧载组件正确,但可执行文件未打补丁。请从此检出中启动新构建的\./build/bin/llama\-server

然后使用共享的FastMTP侧载组件来服务任何目标量化版本:

MODEL=Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf
DRAFT=Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-FastMTP-32K.gguf
DEPTH=3

CUDA_VISIBLE_DEVICES=0 ./build/bin/llama-server \
  --model "$MODEL" \
  --spec-draft-model "$DRAFT" \
  --spec-draft-ngl all \
  --spec-type draft-mtp \
  --spec-draft-n-max "$DEPTH" \
  --spec-draft-p-min 0 \
  --ctx-size 204800 \
  --parallel 1 \
  --batch-size 2048 \
  --ubatch-size 512 \
  --n-gpu-layers all \
  --split-mode none \
  --flash-attn on \
  --no-mmap \
  --temp 1.0 \
  --top-k 20 \
  --top-p 0.95 \
  --min-p 0 \
  --presence-penalty 0 \
  --repeat-penalty 1.0 \
  --jinja \
  --reasoning on \
  --reasoning-effort xhigh \
  --reasoning-preserve \
  --reasoning-format deepseek \
  --host 127.0.0.1 \
  --port 8080

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#rtx-pro-6000-blackwell-fastmtp-reference-speedsRTX PRO 6000 Blackwell FastMTP参考速度

未缓存的9.8K词元文档测试用例的三次运行中位数,以及推理测试的三次案例平均值。所有FastMTP结果都重现了对应的嵌入式MTP输出哈希。

量化版本深度PP tok/s文档TG推理TG对比嵌入式MTP,文档 / 推理对比禁用MTP,文档 / 推理
Q2_K_P33351.29213.95145.09+11.6% / +1.7%2.27x / 1.48x
Q3_K_P33317.16216.15137.99+20.5% / +8.8%2.54x / 1.56x
Q4_K_P33204.98187.26123.52+18.0% / +2.3%2.67x / 1.71x
Q5_K_P32842.05168.29110.50+17.8% / +4.6%2.61x / 1.66x
Q6_K_P33081.90156.57103.51+26.5% / +13.8%2.95x / 1.91x
Q8_K_P33285.86138.1890.07+35.2% / +21.1%3.02x / 1.93x
IQ2_M33050.94219.19135.00+13.8% / +0.4%2.33x / 1.39x
IQ3_M33269.27204.98128.45+21.5% / +7.9%2.40x / 1.45x
IQ3_XS33165.75210.64138.34+19.1% / +5.9%2.38x / 1.51x
IQ4_XS33445.30211.09135.77+21.7% / +9.3%2.68x / 1.66x
全窗口门控测试使用了最终的清理后Q3_K_P和FastMTP文件:190,000个未缓存的提示词元加上64个生成的词元,以1613.81 PP tok/s和131.81 TG tok/s完成,草稿接受率为92.0%,在配置的最大原生上下文内没有截断。

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#rtx-6000-ada-embedded-mtp-reference-speedsRTX 6000 Ada嵌入式MTP参考速度

在配置的最大词元上下文、完全CUDA卸载、\-\-no\-mmap、官方思考采样器和嵌入式MTP条件下,使用最终公开文件的单次运行参考结果。工作负载使用了一个未缓存的9.8K词元文档续写提示,随后生成了512个词元。

量化版本PP tok/sTG tok/s
Q2_K_P1959.14121.88
Q3_K_P1944.73112.76
Q4_K_P1860.3492.60
Q5_K_P1737.5183.25
Q6_K_P1747.6072.89
Q8_K_P1827.2959.00
IQ2_M1884.83121.25
IQ3_M1867.48108.45
IQ3_XS1880.59111.77
IQ4_XS1978.46104.25
启用HauhauCS FastMTP后,最终的Q3_K_P在相同的Ada卡上达到了138.37的文档TG和87.95的推理TG——比固定的Unsloth Q3对照组快23.5%和3.9%。

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#recommended-settings推荐设置

根据官方Qwen3.8-27B模型卡 (https://huggingface.co/Qwen/Qwen3.8-27B):

思考模式(默认):

  • temperature=1\.0
  • top\_p=0\.95
  • top\_k=20
  • min\_p=0\.0
  • presence\_penalty=0\.0
  • repetition\_penalty=1\.0
  • reasoning\_effort=xhigh 用于最深度的推理

指令/非思考模式:

  • temperature=0\.7
  • top\_p=0\.80
  • top\_k=20
  • min\_p=0\.0
  • presence\_penalty=1.5
  • repetition\_penalty=1.0
  • enable\_thinking=false

Qwen3.8支持xhighmediumlow推理努力程度。根据官方模型契约,思考和保留推理默认是启用的。

重要:

  • 使用\-\-jinja来启用嵌入的聊天模板。
  • 使用BF16投影器用于视觉功能。
  • 模型的原生最大上下文是262144
  • 上下文长度和KV精度对显存成本影响很大。如果您的工作负载不需要最大原生上下文,请优先减少上下文长度,而不是降低模型质量。
  • 在较低的量化版本上保持默认的F16 K/V,除非显存压力要求必须更改。

如果您的llama.cpp构建无法识别推理或MTP标志,请更新它。旧版本可能仍然可以加载GGUF,但将无法提供完整的Qwen3.8服务路径。

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#turning-thinking-off关闭思考模式

Qwen3.8默认使用思考模式。当您想要更短、更快的直接回答时,请禁用它。

示例:llama-server对所有请求的默认设置:

--chat-template-kwargs '{"enable_thinking":false}'

示例:通过OpenAI兼容API对单个请求设置:

{
  "model": "qwen3.8-27b-aggressive-q3",
  "messages": [{"role": "user", "content": "..."}],
  "chat_template_kwargs": {"enable_thinking": false}
}

示例:用于多轮智能体,以保留先前的推理上下文:

{
  "chat_template_kwargs": {"preserve_thinking": true}
}

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#compatibility兼容性

  • llama.cpp: 推荐使用;请使用支持Qwen3.8/MTP的当前版本构建。
  • LM Studio, Jan, KoboldCpp 及其他GGUF前端: 基础兼容性取决于其捆绑的llama.cpp版本。
  • 嵌入式MTP: 在当前的llama.cpp中是可选的且兼容原版。
  • HauhauCS FastMTP: 可选;需要侧载组件和HauhauCS-FastMTP-llama.cpp.patch (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-FastMTP-llama.cpp.patch)。
  • 视觉功能: 需要单独的BF16投影器。
  • K_P显示问题: 在不识别此后缀的用户界面中可能显示为?

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#authenticity真实性

每个GGUF文件都包含在签名的HauhauCS发布清单中。精确的SHA-256值可用于重命名后的逐字节镜像验证;规范的张量指纹可在仅元数据重写后继续识别HauhauCS张量。

FastMTP侧载组件的精确文件SHA-256为115e618e1f73cb50817ed5856f0551c6bf9c3d94df96f440eaca78dc63b8968b;其规范张量指纹为49e248e799f169b6ccc6a8127b9300a95f06cf3d96a8353266f5d457e81d1c87。公钥DER指纹为f7be4a2335582ab7b2e393ca1c40ce70e483f1492c0f57b8c6e05d8a7223833c

下载HauhauCS-RELEASE-MANIFEST.json (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-RELEASE-MANIFEST.json)、其签名 (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-RELEASE-MANIFEST.json.sig)、FastMTP-PROVENANCE.json (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/FastMTP-PROVENANCE.json)、其签名 (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/FastMTP-PROVENANCE.json.sig) 和HauhauCS-FastMTP-Ed25519-PUBLIC.pem (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-FastMTP-Ed25519-PUBLIC.pem),然后进行验证:

openssl pkeyutl -verify -rawin -pubin \
  -inkey HauhauCS-FastMTP-Ed25519-PUBLIC.pem \
  -in FastMTP-PROVENANCE.json \
  -sigfile FastMTP-PROVENANCE.json.sig

openssl pkeyutl -verify -rawin -pubin \
  -inkey HauhauCS-FastMTP-Ed25519-PUBLIC.pem \
  -in HauhauCS-RELEASE-MANIFEST.json \
  -sigfile HauhauCS-RELEASE-MANIFEST.json.sig

https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#other-models其他模型

  • HauhauCS在Hugging Face上的模型 (https://huggingface.co/HauhauCS/models)

Qwen3.8-27B由Qwen基于Apache 2.0许可协议发布。此量化激进变体保留该许可协议。

相似文章

HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive

Hugging Face Models Trending

HauhauCS 发布了 Google Gemma-4-E4B 模型的无审查变体,采用激进的安全移除方案,并具有自定义 K_P 量化,经过优化以保留质量并增强硬件兼容性。

empero-ai/Qwen3.8-27B-Ridge-GGUF

Hugging Face Models Trending

本文介绍了Qwen3.8-27B AI模型的量化GGUF版本发布,该版本针对有限显存硬件上的高效本地推理进行了优化。