别错过EXL3量化技术

Reddit r/LocalLLaMA 工具

摘要

作者分享了在12GB显存GPU上运行使用EXL3量化的30B参数模型的经验,实现了编码和代理任务的高效性能和速度。

我正在运行Muse Glimmer 30B EXL3-SC 3.00bpw H4,完全驻留在我的12GB显存GPU上,上下文长度为100K,使用Q8\_O KV缓存。在这个尺寸下使用一个密集的30B模型,并且在显存受限的笔记本电脑上仍能获得\~30 tok/s的速度,真是令人愉悦。据称,它只比官方的17GB K-quant稍差一点,但占用空间小得多,而且在我的Hermes Agent用例中,我没有注意到质量差异。它只是快得多。我也试过Qwen 3.8 27B在SC2.20bpw H3下。绝对可用,但我还是坚持使用Unsloth UD\_Q4\_K\_XL来运行Qwen 3.8 27B,因为它主要用于编码。
查看原文

相似文章

如果显存允许,尽量跑更大的量化模型

Reddit r/LocalLLaMA

有用户反馈,把高度压缩的 IQ4_XS 换成更大的 IQ4_NL_XL 后,Qwen 3.6 的 Agent 编程准确率大幅提升;虽然 tok/s 下降,但只要 VRAM 够,强烈建议优先选更大的量化。

在12GB显存预算下实现真正的本地代理编码。

Reddit r/LocalLLaMA

本文描述了一个实用的设置,用于在12GB显存GPU上运行本地代理编码,使用量化后的Qwen 3.8 27B模型,并通过OpenCode和Magic Context等工具进行上下文管理,实现高效性能。