你最喜欢的量化模型发布者是谁?为什么?
摘要
一位用户分享了对Unsloth量化模型的偏好,原因包括发布速度快、困惑度低,并将其与Apex MoE量化模型进行比较,同时向社区询问他们最喜欢的量化发布者。
大家好,我一直是**Unsloth**的忠实粉丝,原因如下:
* 模型发布后他们几乎立刻就放出量化版本。
* 他们通常提供最低的困惑度(PPL)。
* 他们的网站上有大量实用的教程和文档。
最近,我偶然看到这个Reddit帖子,建议尝试**Apex MoE量化**版本的*Mudler*:
👉 [https://www.reddit.com/r/LocalLLaMA/comments/1t3n6jo/apex\_moe\_quants\_update\_25\_new\_models\_since\_the/](https://www.reddit.com/r/LocalLLaMA/comments/1t3n6jo/apex_moe_quants_update_25_new_models_since_the/)
所以我决定自己测试一下。我尝试运行了**Qwen3.5 122B IQuality**,它的大小与Qwen3.5 122B Q4\_K\_XL大致相同。到目前为止,在实际任务中,我没有注意到这两个模型在输出质量上有任何差异,于是我做了一个gsm8k基准测试,Unsloth的成绩略好一些。
所以我现在想问你们,你最喜欢的发布者是谁?为什么?
相似文章
MagicQuant Qwen3.8 27B GGUFs 结合 Unsloth v3 和 Imatrix
MagicQuant 已更新,使用 Unsloth 动态 v3 和 imatrix,展示基于基准测试的量化结果以及 Qwen3.8 27B 模型的混合发现,并与 Unsloth 的版本进行性能比较。
Voodoo Quant 在 Qwen3.5 0.8B 和 2B 模型上超越 Unsloth Dynamic 2.0 KLD 95%
量化方法 Voodoo Quant 在 Qwen3.5 0.8B 和 2B 模型上性能超越 Unsloth Dynamic 2.0 KLD 95%
量化在智能体使用与本地LLM中的影响?
作者分享了测试量化对本地LLM在智能体使用中的影响的结果,发现许多量化版本在统计上无法区分,MoE模型受量化影响小于密集模型,而在Q4量化以下会出现显著性能下降。
新的 Muse-Glimmer-30B SoTA 量化版本——希望是新的阵容 :)
作者发布了 Muse-Glimmer-30B 模型的新 SoTA 量化版本,声称它们通过新颖的技术在各类 VRAM 中优于现有量化版本,其中包括一个更小且更接近 BF16 的 Q8 量化版本。他们在 HuggingFace 上分享了方法论,并讨论了未来的文章。
Gemma4 26b a4b Apex 量化版本表现相当不错
用户对 Gemma4 26B A4B 模型的 APEX 量化版本在 AMD RX 9060 XT 上进行了基准测试,在 90k 上下文下实现了 38 tps,没有质量下降,发现它优于之前的量化版本。