empero-ai/Qwen3.8-27B-Ridge-GGUF
摘要
本文介绍了Qwen3.8-27B AI模型的量化GGUF版本发布,该版本针对有限显存硬件上的高效本地推理进行了优化。
查看缓存全文
缓存时间: 2026/08/18 15:41
empero-ai/Qwen3.8-27B-Ridge-GGUF · Hugging Face
来源:https://huggingface.co/empero-ai/Qwen3.8-27B-Ridge-GGUF
Qwen3.8-27B-Ridge-3.7bpw
由Empero开发 (https://empero.org/)
一个针对官方 Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) (1d4bf0f2) 混合量化而成的、具有 Gated-DeltaNet 感知的 GGUF 模型,适用于 llama.cpp (https://github.com/ggml-org/llama.cpp)、Ollama、LM Studio、jan、KoboldCpp 及其他标准 GGUF 运行时。
这是对 Qwen3.8-27B 检查点的量化。Ridge 是为本架构专门编写的探针混合类型:64层 = 16 × (3 × GatedDeltaNet → FFN + 1 × GatedAttn → FFN)。通用的 IQ2_XS 和 UD-IQ2 格式并未将 GDN 状态 (ssm_alpha/ssm_beta) 或 GDN 混合器作为一等公民处理。我们修复了这一点。没有为了缩减文件大小而剥离任何内容。原生的 MTP 草稿头 (blk.64/nextn) 保留在 GGUF 中。视觉部分是独立的 BF16 mmproj 文件。
本卡片涉及文件选择与运行。官方能力说明位于基础模型卡片 (https://huggingface.co/Qwen/Qwen3.8-27B)。
文件
仓库名称为 Qwen3.8-27B-Ridge-GGUF。下载或传递 -m 参数时,请使用以下确切文件名。
| 文件名 | 量化类型 | 大小 | 备注 |
|---|---|---|---|
Qwen3.8-27B-Ridge-3.7bpw.gguf | Ridge 混合, 3.69 bpw | 11.73 GiB / 12.59 GB | 本次发布 — 文本 + 原生 MTP |
mmproj-Qwen3.8-27B-BF16.gguf | BF16 | 0.87 GiB / 0.93 GB | 视觉编码器 + 投影器;处理图片时必需 |
如果你只需要文本,请下载 Ridge GGUF。若要处理图片输入,请额外下载 mmproj。
什么配置的 GPU 能装下?
以下是基于权重大小的实用预估,而非 VRAM 基准测试。假设为适中上下文长度,并为运行时和 KV 缓存预留了空间。图片输入会额外增加 0.87 GiB 的 mmproj。原生的 262k 窗口和 1M 的 YaRN 扩展——使得 KV 成为主要成本,无论权重量化程度如何,都可能需要卸载。
实测: Qwen3.8-27B-Ridge-3.7bpw.gguf 完全卸载到单张 RTX PRO 6000 Blackwell (96 GB) 上时,运行速度约为 ~54 tok/s 生成,~130 tok/s 提示(llama.cpp CUDA,-ngl 99,简短测试)。这是单张卡上的单个数据点,并非全面测试——但一个 11.7 GiB 的 27B 模型在 16–24 GB 显存的卡上,以适中上下文运行是相当舒适的。
| 文件 | 适中上下文下的实用硬件指导 |
|---|---|
| Ridge-3.7bpw | 实用的 16 GB 起步点;一旦加上 KV 和(可选)mmproj,24 GB 卡就很舒适了。 |
| + mmproj | 增加约 1 GiB。日常使用仍推荐 24 GB 卡。 |
量化方案
Qwen3.8 是一个混合模型:每有一个全注意力层,就有三个 Gated-DeltaNet 层。GDN 状态对低位量化异常敏感,因此 Ridge 保持该路径高位量化,并将节省的位数用于降低中间层 FFN 的位数。
Gated-DeltaNet 状态路径使用 Q8_0。 混合器使用 Q4_K,而非 IQ2。这就是本文件与该模型的平坦 2-bit 转储之间的区别。
使用 llama.cpp adb55e5,CUDA 构建,在 80 × 512 token 块上使用重要性矩阵 (--process-output,wikitext + 代码)。MTP 张量在校准过程中未使用且没有重要性矩阵——在 blk.64 上使用 IQ2/IQ3 会失败,因此草稿头保持为 Q6_K。
性能测试
同一台机器,同一校准文件,llama-perplexity,80 个块,-c 512 -b 512。BF16 是我们转换的同一官方检查点。
| 候选文件 | 大小 | BPW | Wiki 风格 PPL | vs BF16 |
|---|---|---|---|---|
| BF16 GGUF (本次转换) | 50.89 GiB | 16.00 | 7.15 ± 0.12 | — |
| Ridge-3.7bpw | 11.73 GiB | 3.69 | 7.82 ± 0.14 | +9.3 % |
对比
发布于 Hugging Face 的文件大小截至 2026-08-15。仅在我们自行测试过的文件中填写了 PPL 值。
| 文件 | 发布者 | 大小 | 名义位宽 | PPL vs 本 BF16 |
|---|---|---|---|---|
| BF16 | 本次转换 | 50.89 GiB | 16 bpw | 7.15 |
UD-IQ2_XXS | unsloth (https://huggingface.co/unsloth/Qwen3.8-27B-GGUF) | 8.39 GiB | ~2.1 bpw | 此处未测量 (Unsloth 引用的 top-1 准确率比 BF16 低 82.5%) |
UD-IQ2_M | unsloth | 9.61 GiB | ~2.4 bpw | 未测量 |
IQ2_XXS | bartowski (https://huggingface.co/bartowski/Qwen3.8-27B-GGUF) | 8.75 GiB | ~2.2 bpw | 未测量 |
Q3_K_S | unsloth | 11.71 GiB | ~3.1 bpw | 未测量 |
| Ridge-3.7bpw | empero-ai | 11.73 GiB | 3.69 bpw | 7.82 (+9 %) |
IQ3_XXS | bartowski | 11.76 GiB | ~2.9 bpw | 未测量 |
UD-Q3_K_XL | unsloth | 12.52 GiB | ~3.4 bpw | 未测量 |
快速开始
llama.cpp (llama-cli)
采样参数参考官方 Qwen3.8 卡片。思考模式默认开启。
# 思考模式
llama-cli \
-m Qwen3.8-27B-Ridge-3.7bpw.gguf \
-ngl 99 -n 16384 \
--temp 1.0 --top-p 0.95 --top-k 20 \
-p "Explain the design tradeoffs in a Gated-DeltaNet hybrid model."
# 指令模式 (关闭思考)
llama-cli \
-m Qwen3.8-27B-Ridge-3.7bpw.gguf \
-ngl 99 --reasoning off \
--temp 0.7 --top-p 0.80 --top-k 20 --presence-penalty 1.5 \
-p "Say hello in one short sentence."
llama.cpp (llama-server)
llama-server \
-m Qwen3.8-27B-Ridge-3.7bpw.gguf \
-c 16384 --port 8080
Ollama
ollama run hf.co/empero-ai/Qwen3.8-27B-Ridge-GGUF
或使用本地 Modelfile:
FROM ./Qwen3.8-27B-Ridge-3.7bpw.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER top_k 20
ollama create qwen38-ridge -f Modelfile
ollama run qwen38-ridge
LM Studio / jan / KoboldCpp
下载 Qwen3.8-27B-Ridge-3.7bpw.gguf 并加载。如果运行时要求选择聊天模板,请保留嵌入的 Qwen3.8 模板。
llama.cpp 启用 MTP 草稿推测
Ridge GGUF 保留了原生的 MTP 头。请使用支持 --spec-type draft-mtp 的较新 llama.cpp 构建版本:
llama-server \
-m Qwen3.8-27B-Ridge-3.7bpw.gguf \
--spec-type draft-mtp \
--spec-draft-n-max 6 \
-c 16384 --port 8080
如果你的运行时不支持 MTP,该文件仍可作为普通 27B 模型运行——只是你无法获得草稿加速。
视觉(图像输入)
下载文本 GGUF 和 mmproj-Qwen3.8-27B-BF16.gguf。
llama.cpp (llama-mtmd-cli)
llama-mtmd-cli \
-m Qwen3.8-27B-Ridge-3.7bpw.gguf \
--mmproj mmproj-Qwen3.8-27B-BF16.gguf \
--image ./photo.jpg \
-p "Describe this image in detail." \
--temp 0.7 --top-p 0.80 --top-k 20 \
-c 16384
llama.cpp 服务器
llama-server \
-m Qwen3.8-27B-Ridge-3.7bpw.gguf \
--mmproj mmproj-Qwen3.8-27B-BF16.gguf \
-c 16384 --port 8080
采样
Qwen3.8 是一个混合思考模型。除非禁用思考,否则回复会以 ...</think> 块开头。
| 模式 | temperature | top_p | top_k | presence_penalty |
|---|---|---|---|---|
| 思考 (默认) | 1.0 | 0.95 | 20 | 0.0 |
| 指令 (关闭思考) | 0.7 | 0.80 | 20 | 1.5 |
请使用运行时的聊天/补全路径,而不是手动构建不同的提示格式。嵌入的模板是 Qwen3.8 的,包括工具使用 (...</think>)。
长上下文
原生上下文长度为 262,144 个 token,可通过 YaRN 扩展至 1,000,000。将 -c 设置为你实际需要的值——在长上下文下,是 KV 缓存,而非 11.7 GiB 的权重,会使 16–24 GB 的卡不堪重负。
局限性
- 非无损。 相比我们的 BF16 转换版本,Wiki 风格 PPL 增加了 +9%。
- 上下文消耗内存。 权重大小只是硬件预算的一部分。
- MTP 依赖运行时。 头部已在文件中;加速效果需要了解
draft-mtp的运行时。
获取最新消息
在 empero.org (https://empero.org/) 注册 Empero 新闻通讯,以获取发布、评估和研究笔记。
支持 / 捐赠
如果这个模型对你有所帮助,请考虑支持该项目:
- BTC:
bc1qx6zepu6sfkvshgdmc4ewu6pk6rpadvpgffpp7v - LTC:
ltc1qv2mefzps2vtjcpwfx8xxdrpplrcvltswm68r7x - XMR:
42Dbm5xg5Nq26fdyzfEU7KBnAJfhi7Cvz5J2ex5CzHXkfKuNEJzYCcmJ1GTbgjFZ5MBx72sdG1G9239Cd6rsZfv4QeDkYJY
来源与许可
对 Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) @ 1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0 进行的量化。权重为 Apache-2.0,继承自 Qwen 基础模型,按原样共享。
致谢
- 由 Empero (https://empero.org/) 开发和发布
- 基础模型:Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) (Alibaba Qwen 团队)
- GGUF 量化:llama.cpp (https://github.com/ggml-org/llama.cpp) (ggml-org)
相似文章
Qwen3.6-27B-GGUF 重磅发布!
社区 GGUF 版本上线,Qwen 27B 混合架构模型支持 262K 上下文、多模态输入、工具调用,并保留“思考过程”,专为智能体编程而生。
更新:适用于ik_llama.cpp的Qwen-27B-IQ4_KS和Qwen-27B-IQ_KS_KT量化版本,尤其针对16GB显存的NVIDIA显卡
面向16GB显存NVIDIA GPU优化的新型Qwen3.6-27B GGUF量化版本,包含实验性Trellis变体,并附带了困惑度基准测试。
JonathanColetti/Qwen3.8-27B-无审查-GGUF
一个量化的GGUF版本,基于Qwen3.8-27B模型,具有减少的拒绝行为,保留了多token预测,并提供多种量化选项以供llama.cpp使用。
Qwen/Qwen3.6-27B-FP8
阿里巴巴发布 Qwen3.6-27B-FP8,一款 27B 参数的 FP8 量化模型,在代理式编码与推理基准上表现强劲,现已上架 Hugging Face。
@WaleedAhmad1a10: 查看 Qwen 3.5 27B MoQ 的 GGUF 文件:
Hugging Face 仓库 (kaitchup/Qwen3.6-27B-GGUF-MoQ) 提供了 Qwen3.6-27B MoQ 模型的 GGUF 量化权重,支持使用 llama.cpp 和 Ollama 等工具进行本地推理。