HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF
摘要
此次发布引入了 Qwen3.8-27B AI 模型的无审查激进变体,采用 HauhauCS FastMTP 加速技术,提升文档和推理吞吐量,并支持视觉功能。
查看缓存全文
缓存时间: 2026/08/18 15:41
HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF · Hugging Face
来源: https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#qwen38-27b-uncensored-hauhaucs-aggressive-mtpQwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP
HauhauCS FastMTP:相比非MTP模式,文档生成(TG)最高提升3.02倍,推理生成(TG)最高提升1.93倍——并且与标准嵌入式MTP相比,文档TG额外提升高达35.2%,推理TG额外提升高达21.1%。
加入Discord (https://discord.gg/SZ5vacTXYf)获取更新、路线图、项目信息,或只是聊聊天。
Qwen3.8-27B经由HauhauCS去审查处理,无任何拒绝(0/465 Refusals)*。
这是激进(Aggressive)变体:直接回答,无拒绝行为,面对困难提示时最少前置说明。
**每个文本GGUF都保留了Qwen3.8原生的NextN头,本次发布还添加了HauhauCS FastMTP:一个特定的加速组件,已在最大原生上下文下针对所有量化版本进行了验证。**视觉功能通过单独的BF16投影器提供。
Hugging Face的硬件兼容性组件可能无法识别K_P量化版本。如果文件显示缺失,请点击查看变体(View variants)或打开文件和版本(Files and versions)。
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#about关于
未对数据集或预期能力进行更改。本次发布保留了Qwen3.8-27B的文本、推理、智能体、图像和视频能力,同时应用了HauhauCS激进(Aggressive)去审查配置。
当你特别希望模型直接给出答案,而不是先说服自己遵守规则时,请选择激进(Aggressive)版本。对于可靠性要求高、特别是长上下文智能体工作,平衡(Balanced)版本(如果可用)通常是更安全的默认选择。
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#downloads下载
BPW是整个文本模型(包括其嵌入的MTP张量)的编码张量载荷平均值,四舍五入到小数点后两位。投影器和FastMTP侧载组件适用于所有文本量化版本;仅当需要图像或视频输入时才需下载投影器。
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#what-are-k_p-quants什么是K_P量化?
K_P(“完美”)量化是HauhauCS的自定义量化方法,利用模型特定分析来选择性保留最重要的质量。每个模型都有其专属的优化量化配置。
K_P量化能在仅比基础量化版本增加约5-15%体积的情况下,有效提升一到两个量化等级的质量。文件保持为标准GGUF格式,可与llama.cpp、LM Studio及其他兼容GGUF的运行时环境配合使用,无需特殊构建或插件。
注意: K_P量化在LM Studio的量化列中可能显示为?。这仅是显示问题——模型加载和运行正常。
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#specs规格
- 稠密27B参数因果语言模型,配备视觉编码器
- 64个语言模型层
- 隐藏层大小5,120;前馈网络大小17,408
- 248,320个词元(含填充)的词汇表
- 48个Gated DeltaNet层和16个门控注意力层
- 保留了原生嵌入式MTP/NextN,以及HauhauCS FastMTP 32K加速配置
- 原生上下文长度262,144词元;通过特定框架配置可扩展至1,000,000词元
- 原生文本、图像和视频理解能力
- 基于Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B)
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#what-is-hauhaucs-fastmtp什么是HauhauCS FastMTP?
HauhauCS FastMTP是为本次激进(Aggressive)发布版本量身定制的自定义加速配置:一个紧凑的32K草稿侧载组件,以及针对TG(生成)、接受率、最大原生上下文和显存验证的逐量化版本服务配置。
它提供了**相比非MTP模式最高3.02倍的文档TG提升和1.93倍的推理TG提升,并且与标准嵌入式MTP配置相比,文档TG额外提升高达35.2%,推理TG额外提升高达21.1%。**未更改的完整目标模型会验证每个草稿词元,因此FastMTP在不替换目标模型或改变其答案的情况下加速生成。其构建和选择方法专属于HauhauCS发布。
基准测试结果阶梯:
| 对比项 | 文档TG | 推理TG | 测试范围 |
|---|---|---|---|
| 标准嵌入式MTP vs 禁用MTP | 2.23倍 (\+123.4%) | 1.60倍 (\+59.6%) | Final Q8_K_P,深度2 |
| HauhauCS FastMTP配置 vs 标准嵌入式MTP | +35.2% | +21.1% | Final Q8_K_P,深度3 vs 深度2 |
| HauhauCS FastMTP vs 相同深度的嵌入式MTP | +11.1% | +18.2% | Final Q8_K_P,深度3 |
| HauhauCS FastMTP vs 禁用MTP | 3.02倍 (\+202.0%) | 1.93倍 (\+93.3%) | Final Q8_K_P服务 |
这些结果是在单张RTX PRO 6000 Blackwell 96 GB显卡上,使用204800配置上下文、完全CUDA卸载、\-\-no\-mmap标志和官方推理采样器测得的。FastMTP加速TG;此处也报告了PP(提示处理)速度以进行完整的服务比较。 |
有两种加速路径:
- 嵌入式MTP: 在当前的上游llama.cpp构建中,单独使用任何目标GGUF,并附带
\-\-spec\-type draft\-mtp参数。 - HauhauCS FastMTP: 将同一目标模型与
Qwen3\.8\-27B\-Uncensored\-HauhauCS\-Aggressive\-FastMTP\-32K\.gguf以及下面的HauhauCS运行时补丁配对使用。
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#run-hauhaucs-fastmtp运行HauhauCS FastMTP
紧凑的草稿使用标准的GGUF d2t词元映射加上一个最小的Qwen3.8运行时消费者。只需构建一次。以下示例使用CUDA;对于ROCm/HIP或Vulkan,请将\-DGGML\_CUDA=ON替换为\-DGGML\_HIP=ON或\-DGGML\_VULKAN=ON。对于仅CPU运行,请省略后端标志。
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
git checkout 4df29be4f4c3673f428170fda944a5b19f743bb8
curl -L -o HauhauCS-FastMTP-llama.cpp.patch \
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-FastMTP-llama.cpp.patch
git apply --check HauhauCS-FastMTP-llama.cpp.patch
git apply HauhauCS-FastMTP-llama.cpp.patch
cmake -S . -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j"$(nproc)"
如果草稿加载报告expected 5120, 248320, got 5120, 32768,说明FastMTP侧载组件正确,但可执行文件未打补丁。请从此检出中启动新构建的\./build/bin/llama\-server。
然后使用共享的FastMTP侧载组件来服务任何目标量化版本:
MODEL=Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf
DRAFT=Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-FastMTP-32K.gguf
DEPTH=3
CUDA_VISIBLE_DEVICES=0 ./build/bin/llama-server \
--model "$MODEL" \
--spec-draft-model "$DRAFT" \
--spec-draft-ngl all \
--spec-type draft-mtp \
--spec-draft-n-max "$DEPTH" \
--spec-draft-p-min 0 \
--ctx-size 204800 \
--parallel 1 \
--batch-size 2048 \
--ubatch-size 512 \
--n-gpu-layers all \
--split-mode none \
--flash-attn on \
--no-mmap \
--temp 1.0 \
--top-k 20 \
--top-p 0.95 \
--min-p 0 \
--presence-penalty 0 \
--repeat-penalty 1.0 \
--jinja \
--reasoning on \
--reasoning-effort xhigh \
--reasoning-preserve \
--reasoning-format deepseek \
--host 127.0.0.1 \
--port 8080
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#rtx-pro-6000-blackwell-fastmtp-reference-speedsRTX PRO 6000 Blackwell FastMTP参考速度
未缓存的9.8K词元文档测试用例的三次运行中位数,以及推理测试的三次案例平均值。所有FastMTP结果都重现了对应的嵌入式MTP输出哈希。
| 量化版本 | 深度 | PP tok/s | 文档TG | 推理TG | 对比嵌入式MTP,文档 / 推理 | 对比禁用MTP,文档 / 推理 |
|---|---|---|---|---|---|---|
| Q2_K_P | 3 | 3351.29 | 213.95 | 145.09 | +11.6% / +1.7% | 2.27x / 1.48x |
| Q3_K_P | 3 | 3317.16 | 216.15 | 137.99 | +20.5% / +8.8% | 2.54x / 1.56x |
| Q4_K_P | 3 | 3204.98 | 187.26 | 123.52 | +18.0% / +2.3% | 2.67x / 1.71x |
| Q5_K_P | 3 | 2842.05 | 168.29 | 110.50 | +17.8% / +4.6% | 2.61x / 1.66x |
| Q6_K_P | 3 | 3081.90 | 156.57 | 103.51 | +26.5% / +13.8% | 2.95x / 1.91x |
| Q8_K_P | 3 | 3285.86 | 138.18 | 90.07 | +35.2% / +21.1% | 3.02x / 1.93x |
| IQ2_M | 3 | 3050.94 | 219.19 | 135.00 | +13.8% / +0.4% | 2.33x / 1.39x |
| IQ3_M | 3 | 3269.27 | 204.98 | 128.45 | +21.5% / +7.9% | 2.40x / 1.45x |
| IQ3_XS | 3 | 3165.75 | 210.64 | 138.34 | +19.1% / +5.9% | 2.38x / 1.51x |
| IQ4_XS | 3 | 3445.30 | 211.09 | 135.77 | +21.7% / +9.3% | 2.68x / 1.66x |
| 全窗口门控测试使用了最终的清理后Q3_K_P和FastMTP文件:190,000个未缓存的提示词元加上64个生成的词元,以1613.81 PP tok/s和131.81 TG tok/s完成,草稿接受率为92.0%,在配置的最大原生上下文内没有截断。 |
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#rtx-6000-ada-embedded-mtp-reference-speedsRTX 6000 Ada嵌入式MTP参考速度
在配置的最大词元上下文、完全CUDA卸载、\-\-no\-mmap、官方思考采样器和嵌入式MTP条件下,使用最终公开文件的单次运行参考结果。工作负载使用了一个未缓存的9.8K词元文档续写提示,随后生成了512个词元。
| 量化版本 | PP tok/s | TG tok/s |
|---|---|---|
| Q2_K_P | 1959.14 | 121.88 |
| Q3_K_P | 1944.73 | 112.76 |
| Q4_K_P | 1860.34 | 92.60 |
| Q5_K_P | 1737.51 | 83.25 |
| Q6_K_P | 1747.60 | 72.89 |
| Q8_K_P | 1827.29 | 59.00 |
| IQ2_M | 1884.83 | 121.25 |
| IQ3_M | 1867.48 | 108.45 |
| IQ3_XS | 1880.59 | 111.77 |
| IQ4_XS | 1978.46 | 104.25 |
| 启用HauhauCS FastMTP后,最终的Q3_K_P在相同的Ada卡上达到了138.37的文档TG和87.95的推理TG——比固定的Unsloth Q3对照组快23.5%和3.9%。 |
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#recommended-settings推荐设置
根据官方Qwen3.8-27B模型卡 (https://huggingface.co/Qwen/Qwen3.8-27B):
思考模式(默认):
temperature=1\.0top\_p=0\.95top\_k=20min\_p=0\.0presence\_penalty=0\.0repetition\_penalty=1\.0reasoning\_effort=xhigh用于最深度的推理
指令/非思考模式:
temperature=0\.7top\_p=0\.80top\_k=20min\_p=0\.0presence\_penalty=1.5repetition\_penalty=1.0enable\_thinking=false
Qwen3.8支持xhigh、medium和low推理努力程度。根据官方模型契约,思考和保留推理默认是启用的。
重要:
- 使用
\-\-jinja来启用嵌入的聊天模板。 - 使用BF16投影器用于视觉功能。
- 模型的原生最大上下文是
262144。 - 上下文长度和KV精度对显存成本影响很大。如果您的工作负载不需要最大原生上下文,请优先减少上下文长度,而不是降低模型质量。
- 在较低的量化版本上保持默认的F16 K/V,除非显存压力要求必须更改。
如果您的llama.cpp构建无法识别推理或MTP标志,请更新它。旧版本可能仍然可以加载GGUF,但将无法提供完整的Qwen3.8服务路径。
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#turning-thinking-off关闭思考模式
Qwen3.8默认使用思考模式。当您想要更短、更快的直接回答时,请禁用它。
示例:llama-server对所有请求的默认设置:
--chat-template-kwargs '{"enable_thinking":false}'
示例:通过OpenAI兼容API对单个请求设置:
{
"model": "qwen3.8-27b-aggressive-q3",
"messages": [{"role": "user", "content": "..."}],
"chat_template_kwargs": {"enable_thinking": false}
}
示例:用于多轮智能体,以保留先前的推理上下文:
{
"chat_template_kwargs": {"preserve_thinking": true}
}
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#compatibility兼容性
- llama.cpp: 推荐使用;请使用支持Qwen3.8/MTP的当前版本构建。
- LM Studio, Jan, KoboldCpp 及其他GGUF前端: 基础兼容性取决于其捆绑的llama.cpp版本。
- 嵌入式MTP: 在当前的llama.cpp中是可选的且兼容原版。
- HauhauCS FastMTP: 可选;需要侧载组件和HauhauCS-FastMTP-llama.cpp.patch (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-FastMTP-llama.cpp.patch)。
- 视觉功能: 需要单独的BF16投影器。
- K_P显示问题: 在不识别此后缀的用户界面中可能显示为
?。
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#authenticity真实性
每个GGUF文件都包含在签名的HauhauCS发布清单中。精确的SHA-256值可用于重命名后的逐字节镜像验证;规范的张量指纹可在仅元数据重写后继续识别HauhauCS张量。
FastMTP侧载组件的精确文件SHA-256为115e618e1f73cb50817ed5856f0551c6bf9c3d94df96f440eaca78dc63b8968b;其规范张量指纹为49e248e799f169b6ccc6a8127b9300a95f06cf3d96a8353266f5d457e81d1c87。公钥DER指纹为f7be4a2335582ab7b2e393ca1c40ce70e483f1492c0f57b8c6e05d8a7223833c。
下载HauhauCS-RELEASE-MANIFEST.json (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-RELEASE-MANIFEST.json)、其签名 (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-RELEASE-MANIFEST.json.sig)、FastMTP-PROVENANCE.json (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/FastMTP-PROVENANCE.json)、其签名 (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/FastMTP-PROVENANCE.json.sig) 和HauhauCS-FastMTP-Ed25519-PUBLIC.pem (https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-FastMTP-Ed25519-PUBLIC.pem),然后进行验证:
openssl pkeyutl -verify -rawin -pubin \
-inkey HauhauCS-FastMTP-Ed25519-PUBLIC.pem \
-in FastMTP-PROVENANCE.json \
-sigfile FastMTP-PROVENANCE.json.sig
openssl pkeyutl -verify -rawin -pubin \
-inkey HauhauCS-FastMTP-Ed25519-PUBLIC.pem \
-in HauhauCS-RELEASE-MANIFEST.json \
-sigfile HauhauCS-RELEASE-MANIFEST.json.sig
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF#other-models其他模型
- HauhauCS在Hugging Face上的模型 (https://huggingface.co/HauhauCS/models)
Qwen3.8-27B由Qwen基于Apache 2.0许可协议发布。此量化激进变体保留该许可协议。
相似文章
Qwen3.8-27B Uncensored Aggressive 已发布,支持 K_P quants 和 HauhauCS FastMTP (TG 提升高达 3.02 倍)!
Qwen3.8-27B Uncensored Aggressive AI 模型现已发布,采用 K_P 量化和 HauhauCS FastMTP 技术,带来显著的性能提升,无内容过滤限制并支持多模态功能。
HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
在 Hugging Face 上发布 Qwen3.6-35B-A3B 模型的无审查激进变体,采用自定义 K_P 量化并完全移除了安全拒绝机制。
HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
HauhauCS 发布了 Google Gemma-4-E4B 模型的无审查变体,采用激进的安全移除方案,并具有自定义 K_P 量化,经过优化以保留质量并增强硬件兼容性。
empero-ai/Qwen3.8-27B-Ridge-GGUF
本文介绍了Qwen3.8-27B AI模型的量化GGUF版本发布,该版本针对有限显存硬件上的高效本地推理进行了优化。
@shangdu2005: 比上个版本更加无敌的。 Qwen3.8 27B越狱无审查版本。 这两个自行测试,谨慎使用。 1.orcarouter https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8…
本文介绍了一个未审查的Qwen3.8 27B AI模型,该模型经过修改以移除安全限制,并量化为FP8以提高效率,适用于研究目的。