@Ex0byt: 各位,这是 Qwen3.6-27B-PRISM-PRO-DQ - 敬请享用!
摘要
发布了 Qwen3.6-27B-PRISM-PRO-DQ,这是 Qwen3.6-27B 的动态量化 GGUF 版本,去除了偏见/宣传内容,保留了原生 MTP 草稿头和视觉塔,支持无损推测解码以实现更快的推理。
查看缓存全文
缓存时间: 2026/05/20 10:30
各位女士们、先生们:Qwen3.6-27B-PRISM-PRO-DQ 正式发布——敬请享用!https://t.co/fFsWmeDwAu
Ex0bit/Qwen3.6-27B-PRISM-PRO-DQ · Hugging Face
来源:https://huggingface.co/Ex0bit/Qwen3.6-27B-PRISM-PRO-DQ
Qwen3.6-27B-PRISM-PRO — DQ GGUF
基于 Qwen3.6-27B-PRISM-PRO 使用 PRISM 项目的**动态量化(DQ)**方案生成的 llama.cpp 原生 GGUF 量化版。
约 13.7 GB(相比之下 BF16 为 55 GB)。
Qwen/Qwen3.6-27B 的 PRISM-PRO 版本(移除偏见/宣传内容)
该 GGUF 保留了模型原生的 MTP 草稿头 + 完整视觉塔,并与单独发布的 EAGLE-3 草稿模型(https://huggingface.co/Ex0bit/Qwen3.6-27B-PRISM-EAGLE3)搭配使用,实现无损快速解码。
性能
在单块 NVIDIA Blackwell GPU 上,llama.cpp 单流贪心解码测试结果:
| 配置 | tok/s | 速度提升 |
|---|---|---|
| 无推测基线 | 80 | 1.00× |
| 原生 MTP(内建草稿头) | 121 | 1.51× |
| EAGLE-3 链(搭配我们的草稿模型) | 111 | 1.39× |
推测解码为无损(输出令牌与无推测贪心解码一致,仅受批处理验证浮点非结合性影响——这是所有推测解码共有的特性)。
如需更快的 SGLang 部署(约 183 tok/s,相比无推测快约 1.97×),请使用 BF16 目标 + EAGLE-3,详见草稿模型仓库(https://huggingface.co/Ex0bit/Qwen3.6-27B-PRISM-EAGLE3)。
快速上手(llama.cpp)
# 1. 无推测基线
./llama-server --model Qwen3.6-27B-PRISM-PRO-DQ.gguf
# 2. 原生 MTP 推测解码(模型自带的草稿头——在 llama.cpp 中最快)
./llama-server --model Qwen3.6-27B-PRISM-PRO-DQ.gguf \
--spec-type draft-mtp --spec-draft-n-max 1 --spec-draft-n-min 1
# 3. EAGLE-3 链(需要 WIP PR #18039 补丁 + RS-rollback 修复——
# 草稿模型仓库中附带了 llama.cpp 一键补丁脚本说明:
# https://huggingface.co/Ex0bit/Qwen3.6-27B-PRISM-EAGLE3)
./llama-server --model Qwen3.6-27B-PRISM-PRO-DQ.gguf \
--spec-type draft-eagle3 --model-draft \
--spec-draft-n-max 2
来源
- 基础模型:
Qwen/Qwen3.6-27B(混合架构:48 层 GatedDeltaNet 线性注意力层 + 16 层全注意力层;隐藏层 5120;词表 248,320;原生 MTP 头)。 - PRISM 动态量化: 采用 PRISM DQ 方案(llama.cpp GGUF 动态量化)——保留了 MTP 草稿头(15 个张量)和完整视觉塔(333 个张量)。
许可证
Apache-2.0。衍生自 Qwen/Qwen3.6-27B(Apache-2.0)。
相似文章
DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
基于 Qwen 3.6 27B 模型的社区微调去审查版本,提供高精度 GGUF 量化。
Qwen3.6-27B-GGUF 重磅发布!
社区 GGUF 版本上线,Qwen 27B 混合架构模型支持 262K 上下文、多模态输入、工具调用,并保留“思考过程”,专为智能体编程而生。
Qwen3.6-27B Uncensored Aggressive 发布,附带 K_P 量化!
社区释出去除安全拒答的 Qwen3.6-27B,并以专为 llama.cpp 与 LM Studio 优化的 K_P GGUF 量化格式打包。
Qwen/Qwen3.6-35B-A3B-FP8
阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。
@no_stp_on_snek: 经过测试该模型的一组提示词回放,我可以自信地说,它在对话角色扮演、指令遵循、线程讨论和交叉引用方面,完全可以替代我运行gpt-mini-5.1的某个产品。
使用Heretic方法和MPOA对Qwen3.6-35B-A3B进行去审查处理,拒绝率降低88%,同时保持模型质量。由llmfan46发布为GGUF量化版本。