ByteShape Qwen 3.8 27B:是否进行KL散度量化,第二部分:指标狂想曲
摘要
ByteShape发布了针对Qwen 3.8 27B的ShapeLearn GGUF模型,在基准测试中实现了高精度,并讨论了KLD在量化中的作用,相关论文已被EMNLP 2026接受。
嗨,r/LocalLLaMA社区,我们已经发布了针对Qwen 3.8 27B的完整ShapeLearn GGUF模型。博客 / 下载模型 摘要 3.84 bpw(GPU-5)达到了BF16在8项基准测试中总分的99.63%,这是我们评估过的最精确的量化模型;3.23 bpw(GPU-4)达到了98.72%。这些是跨指令和思考基准测试的平均BF16归一化分数。所有五个新模型都在六个GPU上测得的质量/速度-bpw前沿上。在这个模型中,较低的BPW直接转化为TPS。比较包括Unsloth v3、ISTA-DASLab、AtomicChat和Bartowski(不是Bartowski的最新版本)。祝贺ISTA团队也推出了前沿模型。DFlash2提供了1.34-2.10倍的基线吞吐量;MTP提供了1.28-1.66倍,使用温度采样而非贪婪解码。Lite版本表现非常好。正如我们所预期的。我们在Qwen发布后几天内发布了ShapeLearn-Lite量化模型:优化较少,针对完整性检查,发布后进行完整基准测试。然后Unsloth v3在几个相当尺寸中以更低的KLD推出。Lite看起来被超越了,直到任务结果公布。在我们的RTX Pro 6000比较中,六个Lite模型中有三个在质量/速度前沿上与十二个Unsloth v3模型竞争。对于一个急于发布的版本来说,这相当不错。完整的ShapeLearn现在进一步推动了那个前沿。这就引出了KLD。Unsloth Dynamic V3的UD-IQ3_S比我们尺寸相近的最小Lite模型KLD低约20%,但得分95.55%,而Lite为97.33%的BF16总基准分数。更接近的令牌分布并不意味着更好的任务性能。KLD有助于避免量化模型失效,但它不是一个量化排行榜。这个区别是我们关于KLD和量化保真度的论文主题,该论文最近被EMNLP 2026 Industry Track接受发表。我们几周前还发布了论文的博客文章版本。我们在RTX 6000 Pro Blackwell、RTX 5090、RTX 4090、RTX 3090、RTX 4080和RTX 5060 Ti上基准测试了这个版本。我们用于衡量质量的基准测试有:GSM8K用于数学,IFEval用于指令遵循,MMLU用于通用知识,LiveCodeBench V6用于编码,Multi-IF用于多轮和多语言指令遵循,ACEBench用于工具使用和代理任务(思考和指令),Multiple HumanEval用于编码(思考),BFCL V4用于工具调用和代理任务(思考)。如果您想深入了解或为您的用例选择最佳模型,博客提供了所有测试GPU的完整结果,以及方法论、模型大小和完整图例。
相似文章
Qwen3.6-27B 量化基准测试
本文使用 KLD 和 Same Top P 指标,对多种 Qwen3.6-27B 量化版本(Q8 至 Q2)进行基准测试,对比了 Unsloth 和 mradermacher 等提供者的量化结果,并给出了质量与大小权衡的建议。
Qwen 3.6 27B 的量化是否会破坏 pelican?
本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。
我将 Qwen3.6 27B 的 GGUF 量化与 NVFP4、AWQ、AutoRound 和 FP8 进行了对比
一项详细基准测试,比较了 Qwen3.6 27B 在 GGUF、NVFP4、AWQ、AutoRound 和 FP8 格式下的 16 种量化,测量与未量化参考的 KL 散度。纯权重的 GGUF 量化通常在质量-大小权衡上表现最佳,而 vLLM 量化则差异显著。
Qwen3.6-35B-A3B 工具调用基准测试:ByteShape 对比 Unsloth GGUFs、KV 缓存量化及长上下文性能
一份详细的基准测试,比较 ByteShape 和 Unsloth 对 Qwen3.6-35B-A3B 的量化在工具调用性能、KV 缓存量化效果以及使用 llama.cpp 和 tool-eval-bench 的长上下文退化情况。
Qwen 3.6 27B 30GB 相同 top p: 98.358 ± 0.033 % vs UD Q8 K XL 33GB 相同 top p: 97.426 ± 0.041 %
一位社区研究员分享了为Qwen3.6-27B定制的量化方案,通过将高异常值子层保留为BF16格式,生成体积更小的30GB Q8 GGUF模型,在KLD和top-p指标上优于Unsloth的33GB Q8_K_XL变体。