@bnjmn_marie:对于LFM2.5 8B A1B,MoQ GGUFs是最好的,它们拥有最佳的精度/大小比。再次,看到……
摘要
帖子作者指出,LFM2.5 8B A1B模型的MoQ GGUFs提供了最佳的精度/大小比,并建议不要使用精度恢复低于95%的版本。
对于LFM2.5 8B A1B,MoQ GGUFs是最好的
它们拥有最佳的精度/大小比
再次,看到低比特版本的性能差异很有趣,但我不会使用任何未达到至少95%精度恢复的版本。https://t.co/GfXB2re4xQ
查看缓存全文
缓存时间: 2026/06/10 09:47
对于LFM2.5 8B A1B,MoQ GGUFs 是最佳选择
它们在准确率与模型大小之间取得了最佳平衡
同样,观察低比特版本在性能上的差异很有意思,但我不会使用任何无法恢复至少95%准确率的版本。https://t.co/GfXB2re4xQ
相似文章
我将 Qwen3.6 27B 的 GGUF 量化与 NVFP4、AWQ、AutoRound 和 FP8 进行了对比
一项详细基准测试,比较了 Qwen3.6 27B 在 GGUF、NVFP4、AWQ、AutoRound 和 FP8 格式下的 16 种量化,测量与未量化参考的 KL 散度。纯权重的 GGUF 量化通常在质量-大小权衡上表现最佳,而 vLLM 量化则差异显著。
@WaleedAhmad1a10: 查看 Qwen 3.5 27B MoQ 的 GGUF 文件:
Hugging Face 仓库 (kaitchup/Qwen3.6-27B-GGUF-MoQ) 提供了 Qwen3.6-27B MoQ 模型的 GGUF 量化权重,支持使用 llama.cpp 和 Ollama 等工具进行本地推理。
Unsloth Dynamic 3.0 GGUFs
Unsloth已发布适用于Qwen3.8模型的Dynamic v3.0 GGUFs,通过改进的量化技术和校准方法,在相同尺寸下提供超过10%的准确率提升。
@9hills: Qwen3.8-27B 本地部署指南 1. Q4 基本没有质量损失,甚至可以用Q3 2. 用Unsloth的GGUF。 3. 思考开low就行了。 4. 开 dflash2
本文提供了 Qwen3.8-27B 模型的本地部署指南,推荐使用 Q4 量化和 Unsloth GGUF 工具,并分享了与 FP8 基准相比较的性能测试结果。
@aisearchio: GLM 5.2 GGUF 已经来了!8位版本大小约为完整模型的一半。更小版本即将推出 https://huggingfa…
GLM 5.2 GGUF 量化模型已发布,8位版本大小约为完整模型的一半;更小版本即将推出。