大家忽略了 Qwen 3.8 27B Q2 + Q2 DFlash + Q5 KV 的实力

Reddit r/LocalLLaMA 模型

摘要

一位用户分享了使用 QAT Q2 和 Q5 KV 运行量化版 Qwen 3.8 27B 模型的经验,在 12GB 显卡上实现了高达 200K token 上下文的高性能,性能超越了 Sonnet 4.6 等模型。

好的,补充一点背景信息:这实际上是针对 Qwen 3.8 27B 的 QAT Q2:https://huggingface.co/sdkyuan/qwen3.8-27B-qat-q2_0-gguf 针对 DFlash 模型的 QAT Q2:https://huggingface.co/HermiHg/Qwen3.8-27B-DFlash2-Q2_K_S-MIX-GGUF Q5 KV 对我来说似乎没有任何问题;我已使用它处理高达 200K token 的上下文。总内存使用量大约在 13-14 GB 左右,使用 QAT Q2 3.8 27B 时,我几乎没有看到性能下降。这简直太疯狂了,现在用一张 12GB 显卡(如果降低上下文到 100K 就能装下),就能运行一个比 Sonnet 4.6 更强大的模型,真是不可思议的事情。
查看原文

相似文章