AtomicChat的欺骗性模型量化?

Reddit r/LocalLLaMA 模型

摘要

一项分析表明,AtomicChat的Qwen3.8-Flash-Next量化可能具有欺骗性,因为它将IQ2_S张量误报为Q4_K_M,这揭示了模型量化中潜在的透明度问题。

我一直在看到这个子版块里有人说AtomicChat的Qwen3.8-Flash-Next量化有多好,当unsloth的量化装不进机器时它能装,运行速度比其他量化更快等等,所以我去查看了那里的情况。我注意到的第一件事是,当移除n-gram表后,AtomicChat的Q4_K_M量化小得可疑(只有约56GB),似乎这个量化中的大多数张量是IQ2_S,而不是通常在Q4_K_M量化中常见的Q4_K、Q5_K和Q6_K。GGUF文件类型元数据也显示为IQ2_S而不是Q4_K_M。在他们的模型卡中,他们的Q4_K_M还有可疑的高KLD(0.084)。在我看来,很明显他们是在将IQ2_S量化伪装成Q4_K_M,但与此同时我真的不确定,因为不可能只有我发现这个吧?为什么没有人指出来?我是不是遗漏了什么,或者他们可能在做什么?他们的HF仓库ID:AtomicChat/Qwen3.8-Flash-Next-GGUF
查看原文

相似文章

Qwen3.8 Flash AP Quants

Reddit r/LocalLLaMA

该帖子宣布了Qwen3.8 Flash模型的新量化版本,通过改进的KLD测量和优化的预填充性能,超越了其他高质量量化版本。