@Ex0byt: 各位,这是 Qwen3.6-27B-PRISM-PRO-DQ - 敬请享用!

X AI KOLs Timeline 模型

摘要

发布了 Qwen3.6-27B-PRISM-PRO-DQ,这是 Qwen3.6-27B 的动态量化 GGUF 版本,去除了偏见/宣传内容,保留了原生 MTP 草稿头和视觉塔,支持无损推测解码以实现更快的推理。

各位女士们,先生们:Qwen3.6-27B-PRISM-PRO-DQ - 敬请享用! https://t.co/fFsWmeDwAu
查看原文
查看缓存全文

缓存时间: 2026/05/20 10:30

各位女士们、先生们:Qwen3.6-27B-PRISM-PRO-DQ 正式发布——敬请享用!https://t.co/fFsWmeDwAu

Ex0bit/Qwen3.6-27B-PRISM-PRO-DQ · Hugging Face

来源:https://huggingface.co/Ex0bit/Qwen3.6-27B-PRISM-PRO-DQ

Qwen3.6-27B-PRISM-PRO — DQ GGUF

基于 Qwen3.6-27B-PRISM-PRO 使用 PRISM 项目的**动态量化(DQ)**方案生成的 llama.cpp 原生 GGUF 量化版。
约 13.7 GB(相比之下 BF16 为 55 GB)。
Qwen/Qwen3.6-27B 的 PRISM-PRO 版本(移除偏见/宣传内容)
该 GGUF 保留了模型原生的 MTP 草稿头 + 完整视觉塔,并与单独发布的 EAGLE-3 草稿模型(https://huggingface.co/Ex0bit/Qwen3.6-27B-PRISM-EAGLE3)搭配使用,实现无损快速解码。

性能

在单块 NVIDIA Blackwell GPU 上,llama.cpp 单流贪心解码测试结果:

配置tok/s速度提升
无推测基线801.00×
原生 MTP(内建草稿头)1211.51×
EAGLE-3 链(搭配我们的草稿模型)1111.39×

推测解码为无损(输出令牌与无推测贪心解码一致,仅受批处理验证浮点非结合性影响——这是所有推测解码共有的特性)。
如需更快的 SGLang 部署(约 183 tok/s,相比无推测快约 1.97×),请使用 BF16 目标 + EAGLE-3,详见草稿模型仓库(https://huggingface.co/Ex0bit/Qwen3.6-27B-PRISM-EAGLE3)。

快速上手(llama.cpp)

# 1. 无推测基线
./llama-server --model Qwen3.6-27B-PRISM-PRO-DQ.gguf

# 2. 原生 MTP 推测解码(模型自带的草稿头——在 llama.cpp 中最快)
./llama-server --model Qwen3.6-27B-PRISM-PRO-DQ.gguf \
  --spec-type draft-mtp --spec-draft-n-max 1 --spec-draft-n-min 1

# 3. EAGLE-3 链(需要 WIP PR #18039 补丁 + RS-rollback 修复——
#     草稿模型仓库中附带了 llama.cpp 一键补丁脚本说明:
#     https://huggingface.co/Ex0bit/Qwen3.6-27B-PRISM-EAGLE3)
./llama-server --model Qwen3.6-27B-PRISM-PRO-DQ.gguf \
  --spec-type draft-eagle3 --model-draft \
  --spec-draft-n-max 2

来源

  • 基础模型: Qwen/Qwen3.6-27B(混合架构:48 层 GatedDeltaNet 线性注意力层 + 16 层全注意力层;隐藏层 5120;词表 248,320;原生 MTP 头)。
  • PRISM 动态量化: 采用 PRISM DQ 方案(llama.cpp GGUF 动态量化)——保留了 MTP 草稿头(15 个张量)和完整视觉塔(333 个张量)。

许可证

Apache-2.0。衍生自 Qwen/Qwen3.6-27B(Apache-2.0)。

相似文章

Qwen3.6-27B-GGUF 重磅发布!

Reddit r/LocalLLaMA

社区 GGUF 版本上线,Qwen 27B 混合架构模型支持 262K 上下文、多模态输入、工具调用,并保留“思考过程”,专为智能体编程而生。

Qwen/Qwen3.6-35B-A3B-FP8

Hugging Face Models Trending

阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。