MagicQuant Qwen3.8 27B GGUFs 结合 Unsloth v3 和 Imatrix
摘要
MagicQuant 已更新,使用 Unsloth 动态 v3 和 imatrix,展示基于基准测试的量化结果以及 Qwen3.8 27B 模型的混合发现,并与 Unsloth 的版本进行性能比较。
我刚刚使用 Unsloth 动态 v3 和他们的 imatrix 更新了 MagicQuant:HuggingFace 仓库在此 Qwen3.8 27B 的运行更为保守,具有一些 KLD 和尺寸节省。但看到动态 v2 与 v3 之间的运行非常有趣。V3 确实有相当大的提升。如果你不知道 MagicQuant 是什么。简而言之,它是一个基于基准测试的 GGUF 评估和混合发现系统。它消化并学习像 Unsloth 这样的 GGUF 模型,了解它们的张量配置。然后将这些模式分组,构建隔离测试,进入预测阶段,并进行一系列操作,以尝试寻找有趣的潜在混合体。有时混合体真的很疯狂。有时很无聊。这取决于模型和搜索。如果你想深入了解 MagicQuant 的要点,可以在这里查看我的维基:https://github.com/magiccodingman/MagicQuant-Wiki 任何附加 "MQ" 的内容表示它是 MagicQuant 混合体。但 Qwen3.8 27B 的结果非常有趣:名称 提供者 KLD 大小(GB) LM-Q8_0 llama.cpp 0.000712 29.05 MQ-Q6_K_1 MagicQuant 0.000703 29.03 MQ-Q6_K_2 MagicQuant 0.000873 27.26 MQ-Q6_K_3 MagicQuant 0.001047 25.94 UD-Unsloth-UD-Q6_K_XL Unsloth 0.001238 25.33 UD-Unsloth-UD-Q6_K_L Unsloth 0.001439 24.23 MQ-Q6_K_4 MagicQuant 0.001518 23.21 MQ-Q5_K_1 MagicQuant 0.002427 22.00 MQ-Q5_K_2 MagicQuant 0.003146 20.91 MQ-Q5_K_3 MagicQuant 0.003562 20.10 MQ-Q5_K_S_1 MagicQuant 0.004818 18.98 MQ-Q4_K_M_1 MagicQuant 0.007412 17.62 UD-Unsloth-UD-Q4_K_M Unsloth 0.011205 16.50 MQ-IQ4_XS_1 MagicQuant 0.013723 16.34 UD-Unsloth-UD-Q4_K_S Unsloth 0.014502 15.39 UD-Unsloth-UD-IQ4_XS Unsloth 0.020127 14.29 UD-Unsloth-UD-Q3_K_XL Unsloth 0.030770 13.18 UD-Unsloth-UD-IQ3_S Unsloth 0.046499 12.08 MQ-IQ2_M_1 MagicQuant 0.057811 11.96 UD-Unsloth-UD-IQ3_XXS Unsloth 0.070084 10.97 MQ-IQ2_M_2 MagicQuant 0.092394 10.77 UD-Unsloth-UD-Q2_K_XL Unsloth 0.105510 9.86 UD-Unsloth-UD-IQ2_XXS Unsloth 0.182364 9.05 MQ-IQ2_XXS_1 MagicQuant 0.270304 8.27 但一如既往,我的 HuggingFace 仓库旨在展示一切。清单文件夹应包括所有基准测试结果、用于复制的完整克隆配置、运行结论等。通常仓库在上传时是完全自动化的,但这次是一个有趣的混合,所以我做了更多手动操作,以透明地展示内容来源,动态 v2 与 v3 的比较,并检查 imatrix 测量,因为并非每个量化都使用相同的 Imatrix。哦,一如既往,幸存者面板上任何 MagicQuant 没有构建混合体的 GGUF,仓库链接回外部提供者(即:Unsloth)。总之,我认为这是一个有趣的观察。Unsloth 一如既往地表现出色。
相似文章
MagicQuant (v2.0) - 混合式GGUF量化模型 + Unsloth动态学习量化配置 + 包含可折叠赢家的基准表等
MagicQuant v2.0 是一个用于创建混合式GGUF量化模型的管道,它通过学习Unsloth和其他方法,基于KLD基准找到最优量化配置,重点关注非线性赢家和异常检测。
Voodoo Quant 在 Qwen3.5 0.8B 和 2B 模型上超越 Unsloth Dynamic 2.0 KLD 95%
量化方法 Voodoo Quant 在 Qwen3.5 0.8B 和 2B 模型上性能超越 Unsloth Dynamic 2.0 KLD 95%
我们量化了 Qwen 3.8 27B 并在 RTX 6000 上比较了量化版本
团队将 Qwen 3.8 27B 量化为多种 GGUF 格式,并在 RTX 6000 上进行了基准测试,发现不同量化版本性能相似,推荐 AD-Q6_K 以保证安全性。
@TeksEdge: Unsloth 发布了目前我测试过的最快的 Qwen3.6-27B MTP GGUF。是时候升级了。与之前的 GGUF 相比,Q4/Q6 XL 版本的推理速度快了约 55%…
Unsloth 发布了优化后的 Qwen3.6-27B MTP 模型 GGUF 版本,与前序量化版本相比,推理速度显著提升(在 RTX 5090 上最高可达 114 tok/s)。
unsloth/Qwen3.6-27B-GGUF
Unsloth 发布了 Qwen3.6-27B 模型的 GGUF 量化版本,具备更强的智能体编程能力、工具调用功能,并支持 Unsloth Studio。