别错过EXL3量化技术
摘要
作者分享了在12GB显存GPU上运行使用EXL3量化的30B参数模型的经验,实现了编码和代理任务的高效性能和速度。
我正在运行Muse Glimmer 30B EXL3-SC 3.00bpw H4,完全驻留在我的12GB显存GPU上,上下文长度为100K,使用Q8\_O KV缓存。在这个尺寸下使用一个密集的30B模型,并且在显存受限的笔记本电脑上仍能获得\~30 tok/s的速度,真是令人愉悦。据称,它只比官方的17GB K-quant稍差一点,但占用空间小得多,而且在我的Hermes Agent用例中,我没有注意到质量差异。它只是快得多。我也试过Qwen 3.8 27B在SC2.20bpw H3下。绝对可用,但我还是坚持使用Unsloth UD\_Q4\_K\_XL来运行Qwen 3.8 27B,因为它主要用于编码。
相似文章
@QuixiAI: 教训总结:始终使用BF16 KV缓存。我之前用的是turboquant。是的,VRAM消耗很糟糕——所以另一个技巧是…
作者分享了使用BF16 KV缓存而非turboquant进行AI模型优化的技术经验,并在SlimServe中为Qwen模型实现了CPU卸载以管理VRAM消耗。
如果显存允许,尽量跑更大的量化模型
有用户反馈,把高度压缩的 IQ4_XS 换成更大的 IQ4_NL_XL 后,Qwen 3.6 的 Agent 编程准确率大幅提升;虽然 tok/s 下降,但只要 VRAM 够,强烈建议优先选更大的量化。
@Tech2Wild:我看到许多关于NFP4和EXL3的讨论,需要一个定论。EXL3在量化方面是否正向前推进?
用户询问EXL3量化技术相较于NFP4在AI模型中是否取得进展,需要一个结论。
大家忽略了 Qwen 3.8 27B Q2 + Q2 DFlash + Q5 KV 的实力
一位用户分享了使用 QAT Q2 和 Q5 KV 运行量化版 Qwen 3.8 27B 模型的经验,在 12GB 显卡上实现了高达 200K token 上下文的高性能,性能超越了 Sonnet 4.6 等模型。
在12GB显存预算下实现真正的本地代理编码。
本文描述了一个实用的设置,用于在12GB显存GPU上运行本地代理编码,使用量化后的Qwen 3.8 27B模型,并通过OpenCode和Magic Context等工具进行上下文管理,实现高效性能。