我尝试了三元分解而不是量化。它的效果与q4km一样好,但占用稍多的VRAM。同时完全是三元,且完全是PTQ(无QAT)

Reddit r/LocalLLaMA 论文

摘要

作者声称,三元分解的性能与Q4_K_M量化一样好,同时使用稍多的VRAM,并且完全是三元和PTQ,无需QAT。

暂无内容
查看原文

相似文章

三元 Qwen3.6 27B 在 3090 上测试!

Reddit r/LocalLLaMA

用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。

CAT-Q: 用于LLM的高效且准确的三值量化

arXiv cs.CL

CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。