这款草稿模型在16 GB显卡上为Qwen 3.8 27b性能卓越
摘要
针对Qwen 3.8 27B的草稿模型在16 GB GPU上非常有效,在RX 9070 XT上可达到约60 token/秒的速度,并提供比内置MTP更好的VRAM效率。
https://huggingface.co/HermiHg/Qwen3.8-27B-DFlash2-Q2_K_S-MIX-GGUF 我使用这个草稿模型搭配 https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF ,采用 IQ3_XXS 和 128k 上下文,在16 GB RX 9070 XT 上观察到平均推理速度约为 60 token/秒。这比使用内置 MTP 好得多,因为内置 MTP 似乎会增加所需的 VRAM。对于单线程模式,我认为这是在16 GB GPU 上的最佳选择之一。然而,推测草稿模型似乎使其对 GTT 溢出更敏感,因此如果使用的 VRAM 超过可用量,那么关闭推测解码实际上更快,至少在我的 DDR5 PCIE 5 系统上如此。我为此设置使用 k 8_0 和 v 4_0 的 kv 缓存量化。此人在不同显卡上进行了更广泛的测试 https://huggingface.co/HermiHg/Qwen3.8-27B-DFlash2-Q2_K_S-MIX-GGUF/discussions/3
相似文章
@DeepTechTR: Qwen 3.6 27B 在16 GB VRAM下速度极快!Pure Quant技术带来的影响——27B模型流畅运行的时代已来临……
Qwen 3.6 27B 在16 GB VRAM上运行快速,得益于'Pure Quant'技术,通过MTP达到40 tokens/s,并支持64k上下文,使得本地AI能在RTX 4060 Ti等消费级GPU上运行。
Qwen3.6 27B Pure Quant: 16 GB 显存下 40 tok/s
使用纯 Q4_K_M 方法对 Qwen3.6 27B 进行量化的版本完全适配 16 GB 显存,在 MTP 下可实现高达 40 tok/s 的 token 生成速度,相比其他 GGUF 变体显著缩小模型体积。
Qwen3.8-27B在24GB RTX PRO 4000 SFF上以256K上下文运行(432 GB/s带宽):通过MTP实现每秒50个token
本文详细描述了一项实验,该实验在24GB GPU上使用多token预测和自定义优化,实现了Qwen3.8-27B在256K上下文下每秒50个token的推理速度。
Qwen 3.8 27B 比预期更快
一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。
大家忽略了 Qwen 3.8 27B Q2 + Q2 DFlash + Q5 KV 的实力
一位用户分享了使用 QAT Q2 和 Q5 KV 运行量化版 Qwen 3.8 27B 模型的经验,在 12GB 显卡上实现了高达 200K token 上下文的高性能,性能超越了 Sonnet 4.6 等模型。