这款草稿模型在16 GB显卡上为Qwen 3.8 27b性能卓越

Reddit r/LocalLLaMA 模型

摘要

针对Qwen 3.8 27B的草稿模型在16 GB GPU上非常有效,在RX 9070 XT上可达到约60 token/秒的速度,并提供比内置MTP更好的VRAM效率。

https://huggingface.co/HermiHg/Qwen3.8-27B-DFlash2-Q2_K_S-MIX-GGUF 我使用这个草稿模型搭配 https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF ,采用 IQ3_XXS 和 128k 上下文,在16 GB RX 9070 XT 上观察到平均推理速度约为 60 token/秒。这比使用内置 MTP 好得多,因为内置 MTP 似乎会增加所需的 VRAM。对于单线程模式,我认为这是在16 GB GPU 上的最佳选择之一。然而,推测草稿模型似乎使其对 GTT 溢出更敏感,因此如果使用的 VRAM 超过可用量,那么关闭推测解码实际上更快,至少在我的 DDR5 PCIE 5 系统上如此。我为此设置使用 k 8_0 和 v 4_0 的 kv 缓存量化。此人在不同显卡上进行了更广泛的测试 https://huggingface.co/HermiHg/Qwen3.8-27B-DFlash2-Q2_K_S-MIX-GGUF/discussions/3
查看原文

相似文章

Qwen3.6 27B Pure Quant: 16 GB 显存下 40 tok/s

Reddit r/LocalLLaMA

使用纯 Q4_K_M 方法对 Qwen3.6 27B 进行量化的版本完全适配 16 GB 显存,在 MTP 下可实现高达 40 tok/s 的 token 生成速度,相比其他 GGUF 变体显著缩小模型体积。

Qwen 3.8 27B 比预期更快

Reddit r/LocalLLaMA

一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。