为什么AutoRound被严重忽视?

Reddit r/LocalLLaMA 工具

摘要

一位用户质疑为什么AutoRound——这款在低位宽下精度保留出色且能直接导出GGUF的量化工具,尽管在复杂模型(如Qwen3.6 27B)上表现优于标准AWQ和RTN,却仍然被忽视。

说真的,为什么这里几乎没人讨论AutoRound?我最近在Qwen3.6 27B上(用的AMD平台)测试了一下,低位宽下的困惑度/精度保留直接碾压标准AWQ或RTN。尤其是在复杂推理或长上下文模型上,它简直像开了挂。然而,看看Hugging Face,几乎所有主流模型制作者还在发布标准AWQ或基础的GGUF脚本。是因为Intel的名字挂在仓库上,大家觉得它绑定了Gaudi或Arc吗?(实际上它只是PyTorch,任何地方都能跑)。还是说15分钟的校准时间对批量上传者来说太麻烦?现在AutoRound原生支持直接导出标准GGUF(绕过了llama.cpp里通常抛出NotImplementedError的convert_hf_to_gguf.py),简直没理由不用它。我是不是漏了什么?有没有我没注意到的隐藏缺点或推理速度回归?很想听听其他实际制作过这些量化模型的人的意见。
查看原文

相似文章

Qwen3.6-27B 量化基准测试

Reddit r/LocalLLaMA

本文使用 KLD 和 Same Top P 指标,对多种 Qwen3.6-27B 量化版本(Q8 至 Q2)进行基准测试,对比了 Unsloth 和 mradermacher 等提供者的量化结果,并给出了质量与大小权衡的建议。