empero-ai/Qwen3.8-27B-Ridge-GGUF

Hugging Face Models Trending 模型

摘要

本文介绍了Qwen3.8-27B AI模型的量化GGUF版本发布,该版本针对有限显存硬件上的高效本地推理进行了优化。

任务: image-text-to-text 标签: gguf, llama.cpp, 量化, qwen3.8, qwen3.5, ridge, gated-deltanet, imatrix, 推理, 多模态, 视觉, mtp, 长上下文, image-text-to-text, en, zh, 基础模型:Qwen/Qwen3.8-27B, 基础模型:量化:Qwen/Qwen3.8-27B, 许可证:apache-2.0, 端点兼容, 区域:us, 对话式
查看原文
查看缓存全文

缓存时间: 2026/08/18 15:41

empero-ai/Qwen3.8-27B-Ridge-GGUF · Hugging Face

来源:https://huggingface.co/empero-ai/Qwen3.8-27B-Ridge-GGUF

Qwen3.8-27B-Ridge-3.7bpw

由Empero开发 (https://empero.org/)

一个针对官方 Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) (1d4bf0f2) 混合量化而成的、具有 Gated-DeltaNet 感知的 GGUF 模型,适用于 llama.cpp (https://github.com/ggml-org/llama.cpp)、Ollama、LM Studio、jan、KoboldCpp 及其他标准 GGUF 运行时。

这是对 Qwen3.8-27B 检查点的量化。Ridge 是为本架构专门编写的探针混合类型:64层 = 16 × (3 × GatedDeltaNet → FFN + 1 × GatedAttn → FFN)。通用的 IQ2_XS 和 UD-IQ2 格式并未将 GDN 状态 (ssm_alpha/ssm_beta) 或 GDN 混合器作为一等公民处理。我们修复了这一点。没有为了缩减文件大小而剥离任何内容。原生的 MTP 草稿头 (blk.64/nextn) 保留在 GGUF 中。视觉部分是独立的 BF16 mmproj 文件。

本卡片涉及文件选择与运行。官方能力说明位于基础模型卡片 (https://huggingface.co/Qwen/Qwen3.8-27B)


文件

仓库名称为 Qwen3.8-27B-Ridge-GGUF。下载或传递 -m 参数时,请使用以下确切文件名。

文件名量化类型大小备注
Qwen3.8-27B-Ridge-3.7bpw.ggufRidge 混合, 3.69 bpw11.73 GiB / 12.59 GB本次发布 — 文本 + 原生 MTP
mmproj-Qwen3.8-27B-BF16.ggufBF160.87 GiB / 0.93 GB视觉编码器 + 投影器;处理图片时必需

如果你只需要文本,请下载 Ridge GGUF。若要处理图片输入,请额外下载 mmproj

什么配置的 GPU 能装下?

以下是基于权重大小的实用预估,而非 VRAM 基准测试。假设为适中上下文长度,并为运行时和 KV 缓存预留了空间。图片输入会额外增加 0.87 GiB 的 mmproj。原生的 262k 窗口和 1M 的 YaRN 扩展——使得 KV 成为主要成本,无论权重量化程度如何,都可能需要卸载。

实测: Qwen3.8-27B-Ridge-3.7bpw.gguf 完全卸载到单张 RTX PRO 6000 Blackwell (96 GB) 上时,运行速度约为 ~54 tok/s 生成,~130 tok/s 提示(llama.cpp CUDA,-ngl 99,简短测试)。这是单张卡上的单个数据点,并非全面测试——但一个 11.7 GiB 的 27B 模型在 16–24 GB 显存的卡上,以适中上下文运行是相当舒适的。

文件适中上下文下的实用硬件指导
Ridge-3.7bpw实用的 16 GB 起步点;一旦加上 KV 和(可选)mmproj,24 GB 卡就很舒适了。
+ mmproj增加约 1 GiB。日常使用仍推荐 24 GB 卡。

量化方案

Qwen3.8 是一个混合模型:每有一个全注意力层,就有三个 Gated-DeltaNet 层。GDN 状态对低位量化异常敏感,因此 Ridge 保持该路径高位量化,并将节省的位数用于降低中间层 FFN 的位数。

Gated-DeltaNet 状态路径使用 Q8_0。 混合器使用 Q4_K,而非 IQ2。这就是本文件与该模型的平坦 2-bit 转储之间的区别。

使用 llama.cpp adb55e5,CUDA 构建,在 80 × 512 token 块上使用重要性矩阵 (--process-output,wikitext + 代码)。MTP 张量在校准过程中未使用且没有重要性矩阵——在 blk.64 上使用 IQ2/IQ3 会失败,因此草稿头保持为 Q6_K。


性能测试

同一台机器,同一校准文件,llama-perplexity,80 个块,-c 512 -b 512。BF16 是我们转换的同一官方检查点。

候选文件大小BPWWiki 风格 PPLvs BF16
BF16 GGUF (本次转换)50.89 GiB16.007.15 ± 0.12
Ridge-3.7bpw11.73 GiB3.697.82 ± 0.14+9.3 %

对比

发布于 Hugging Face 的文件大小截至 2026-08-15。仅在我们自行测试过的文件中填写了 PPL 值。

文件发布者大小名义位宽PPL vs 本 BF16
BF16本次转换50.89 GiB16 bpw7.15
UD-IQ2_XXSunsloth (https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)8.39 GiB~2.1 bpw此处未测量 (Unsloth 引用的 top-1 准确率比 BF16 低 82.5%)
UD-IQ2_Munsloth9.61 GiB~2.4 bpw未测量
IQ2_XXSbartowski (https://huggingface.co/bartowski/Qwen3.8-27B-GGUF)8.75 GiB~2.2 bpw未测量
Q3_K_Sunsloth11.71 GiB~3.1 bpw未测量
Ridge-3.7bpwempero-ai11.73 GiB3.69 bpw7.82 (+9 %)
IQ3_XXSbartowski11.76 GiB~2.9 bpw未测量
UD-Q3_K_XLunsloth12.52 GiB~3.4 bpw未测量

快速开始

llama.cpp (llama-cli)

采样参数参考官方 Qwen3.8 卡片。思考模式默认开启。

# 思考模式
llama-cli \
  -m Qwen3.8-27B-Ridge-3.7bpw.gguf \
  -ngl 99 -n 16384 \
  --temp 1.0 --top-p 0.95 --top-k 20 \
  -p "Explain the design tradeoffs in a Gated-DeltaNet hybrid model."

# 指令模式 (关闭思考)
llama-cli \
  -m Qwen3.8-27B-Ridge-3.7bpw.gguf \
  -ngl 99 --reasoning off \
  --temp 0.7 --top-p 0.80 --top-k 20 --presence-penalty 1.5 \
  -p "Say hello in one short sentence."

llama.cpp (llama-server)

llama-server \
  -m Qwen3.8-27B-Ridge-3.7bpw.gguf \
  -c 16384 --port 8080

Ollama

ollama run hf.co/empero-ai/Qwen3.8-27B-Ridge-GGUF

或使用本地 Modelfile:

FROM ./Qwen3.8-27B-Ridge-3.7bpw.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER top_k 20
ollama create qwen38-ridge -f Modelfile
ollama run qwen38-ridge

LM Studio / jan / KoboldCpp

下载 Qwen3.8-27B-Ridge-3.7bpw.gguf 并加载。如果运行时要求选择聊天模板,请保留嵌入的 Qwen3.8 模板。

llama.cpp 启用 MTP 草稿推测

Ridge GGUF 保留了原生的 MTP 头。请使用支持 --spec-type draft-mtp 的较新 llama.cpp 构建版本:

llama-server \
  -m Qwen3.8-27B-Ridge-3.7bpw.gguf \
  --spec-type draft-mtp \
  --spec-draft-n-max 6 \
  -c 16384 --port 8080

如果你的运行时不支持 MTP,该文件仍可作为普通 27B 模型运行——只是你无法获得草稿加速。


视觉(图像输入)

下载文本 GGUF 和 mmproj-Qwen3.8-27B-BF16.gguf

llama.cpp (llama-mtmd-cli)

llama-mtmd-cli \
  -m Qwen3.8-27B-Ridge-3.7bpw.gguf \
  --mmproj mmproj-Qwen3.8-27B-BF16.gguf \
  --image ./photo.jpg \
  -p "Describe this image in detail." \
  --temp 0.7 --top-p 0.80 --top-k 20 \
  -c 16384

llama.cpp 服务器

llama-server \
  -m Qwen3.8-27B-Ridge-3.7bpw.gguf \
  --mmproj mmproj-Qwen3.8-27B-BF16.gguf \
  -c 16384 --port 8080

采样

Qwen3.8 是一个混合思考模型。除非禁用思考,否则回复会以 ...</think> 块开头。

模式temperaturetop_ptop_kpresence_penalty
思考 (默认)1.00.95200.0
指令 (关闭思考)0.70.80201.5

请使用运行时的聊天/补全路径,而不是手动构建不同的提示格式。嵌入的模板是 Qwen3.8 的,包括工具使用 (...</think>)。


长上下文

原生上下文长度为 262,144 个 token,可通过 YaRN 扩展至 1,000,000。将 -c 设置为你实际需要的值——在长上下文下,是 KV 缓存,而非 11.7 GiB 的权重,会使 16–24 GB 的卡不堪重负。


局限性

  • 非无损。 相比我们的 BF16 转换版本,Wiki 风格 PPL 增加了 +9%。
  • 上下文消耗内存。 权重大小只是硬件预算的一部分。
  • MTP 依赖运行时。 头部已在文件中;加速效果需要了解 draft-mtp 的运行时。

获取最新消息

empero.org (https://empero.org/) 注册 Empero 新闻通讯,以获取发布、评估和研究笔记。


支持 / 捐赠

如果这个模型对你有所帮助,请考虑支持该项目:

  • BTC: bc1qx6zepu6sfkvshgdmc4ewu6pk6rpadvpgffpp7v
  • LTC: ltc1qv2mefzps2vtjcpwfx8xxdrpplrcvltswm68r7x
  • XMR: 42Dbm5xg5Nq26fdyzfEU7KBnAJfhi7Cvz5J2ex5CzHXkfKuNEJzYCcmJ1GTbgjFZ5MBx72sdG1G9239Cd6rsZfv4QeDkYJY

来源与许可

Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) @ 1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0 进行的量化。权重为 Apache-2.0,继承自 Qwen 基础模型,按原样共享。


致谢

  • Empero (https://empero.org/) 开发和发布
  • 基础模型:Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) (Alibaba Qwen 团队)
  • GGUF 量化:llama.cpp (https://github.com/ggml-org/llama.cpp) (ggml-org)

相似文章

Qwen3.6-27B-GGUF 重磅发布!

Reddit r/LocalLLaMA

社区 GGUF 版本上线,Qwen 27B 混合架构模型支持 262K 上下文、多模态输入、工具调用,并保留“思考过程”,专为智能体编程而生。

JonathanColetti/Qwen3.8-27B-无审查-GGUF

Hugging Face Models Trending

一个量化的GGUF版本,基于Qwen3.8-27B模型,具有减少的拒绝行为,保留了多token预测,并提供多种量化选项以供llama.cpp使用。

Qwen/Qwen3.6-27B-FP8

Hugging Face Models Trending

阿里巴巴发布 Qwen3.6-27B-FP8,一款 27B 参数的 FP8 量化模型,在代理式编码与推理基准上表现强劲,现已上架 Hugging Face。