Qwen3.8-27B Uncensored Aggressive 已发布,支持 K_P quants 和 HauhauCS FastMTP (TG 提升高达 3.02 倍)!

Reddit r/LocalLLaMA 模型

摘要

Qwen3.8-27B Uncensored Aggressive AI 模型现已发布,采用 K_P 量化和 HauhauCS FastMTP 技术,带来显著的性能提升,无内容过滤限制并支持多模态功能。

Qwen 的密集发布再次到来!Qwen3.8-27B Uncensored Aggressive 已发布,提供完整的 K_P 量化范围、视觉支持、原生 NextN 以及 HauhauCS FastMTP。此处的 Aggressive 指无内容拒绝、无个性改变,且在复杂提示下几乎没有前言。它保留了 Qwen3.8-27B 的原始推理、代理、图像和视频能力,并应用了我的 Aggressive 无审查配置文件。 https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF 它在最终发布检查中得分为 0/465 次拒绝*,并通过了我使用的所有手动提示。在我还在完成时,已有超过 400 人请求访问,这确实令人惊讶。我的模型在 Hugging Face 上的下载量也接近 3000 万,感谢所有测试并反馈的用户。这次最大的新增是 HauhauCS FastMTP。在最终的 Q8_K_P 服务测试中,与禁用 MTP 相比,文档 TG 提升高达 3.02 倍,推理 TG 提升 1.93 倍。它还比标准嵌入式 MTP 配置文件高出 35.2% 的文档 TG 和 21.1% 的推理 TG,每个起草的令牌在被接受前仍由完整目标验证。相同的 903 MB FastMTP 辅助文件适用于整个量化系列。每个文本 GGUF 也保留了 Qwen3.8 的原生嵌入式 NextN 头,因此当前上游 llama.cpp 可以直接使用嵌入式 MTP。优化的 FastMTP 路径使用随附的辅助文件和 llama.cpp 补丁,构建和服务器命令详见 README。包含内容: - Q8_K_P, Q6_K_P, Q5_K_P, Q4_K_P, IQ4_XS, Q3_K_P, IQ3_M, IQ3_XS, Q2_K_P, IQ2_M - HauhauCS FastMTP 辅助文件,所有文本量化共享 - BF16 mmproj 用于图像和视频支持 - 校验和和签名来源(我已在 Discord 上警告,有一些不良分子在 "Uncensored" "HauhauCS" "Aggressive" GGUF 中植入负载,请小心) K_P 量化回顾,供错过之前发布的人参考:这些是我自定义的模型特定量化,为每个模型单独制作优化配置文件。它们在大小上比基础量化增加约 5% 到 15%,但有效提升一到两个量化级别的质量,同时保持为普通 GGUF 文件,可在 llama.cpp、LM Studio 和其他 GGUF 运行时中工作。快速规格: - 27B 密集 - 64 层,包括 48 个 Gated DeltaNet 层和 16 个门控注意力层 - 262,144 原生上下文 - 多模态文本、图像和视频支持 - 原生嵌入式 NextN 加可选的 HauhauCS FastMTP 加速配置文件 思考模式的采样参数: `temp=1.0, top_k=20, top_p=0.95, min_p=0, presence_penalty=0, repetition_penalty=1.0` 非思考模式: `temp=0.7, top_k=20, top_p=0.80, min_p=0, presence_penalty=1.5, repetition_penalty=1.0, enable_thinking=false` 在 llama.cpp 中使用 `--jinja`。K_P 量化在 LM Studio 的量化列中可能显示为 `?`,这纯粹是外观问题,不影响加载。Hugging Face 的硬件兼容性小部件也可能隐藏 K_P 文件,因此如果完整列表不可见,请使用查看变体或文件和版本。完整的每量化 Blackwell 和 Ada 结果在仓库中。如果您测试 FastMTP,请在数字中包括您的硬件、量化、上下文和起草深度,以便我可以跨更多系统比较实际结果。Discord 链接在仓库中,用于更新、反馈、路线图、项目或只是聊天。一如既往,希望大家喜欢这个发布!
查看原文

相似文章

Qwen3.6-35B-A3B-Uncensored-Genesis-APEX-MTP

Reddit r/LocalLLaMA

Qwen模型(Qwen3.6-35B-A3B)的精调无审查版本,支持MTP和APEX量化,经测试在200k上下文下稳定运行,推荐在LM Studio中使用。