ByteShape Qwen 3.8 27B:是否进行KL散度量化,第二部分:指标狂想曲

Reddit r/LocalLLaMA 模型

摘要

ByteShape发布了针对Qwen 3.8 27B的ShapeLearn GGUF模型,在基准测试中实现了高精度,并讨论了KLD在量化中的作用,相关论文已被EMNLP 2026接受。

嗨,r/LocalLLaMA社区,我们已经发布了针对Qwen 3.8 27B的完整ShapeLearn GGUF模型。博客 / 下载模型 摘要 3.84 bpw(GPU-5)达到了BF16在8项基准测试中总分的99.63%,这是我们评估过的最精确的量化模型;3.23 bpw(GPU-4)达到了98.72%。这些是跨指令和思考基准测试的平均BF16归一化分数。所有五个新模型都在六个GPU上测得的质量/速度-bpw前沿上。在这个模型中,较低的BPW直接转化为TPS。比较包括Unsloth v3、ISTA-DASLab、AtomicChat和Bartowski(不是Bartowski的最新版本)。祝贺ISTA团队也推出了前沿模型。DFlash2提供了1.34-2.10倍的基线吞吐量;MTP提供了1.28-1.66倍,使用温度采样而非贪婪解码。Lite版本表现非常好。正如我们所预期的。我们在Qwen发布后几天内发布了ShapeLearn-Lite量化模型:优化较少,针对完整性检查,发布后进行完整基准测试。然后Unsloth v3在几个相当尺寸中以更低的KLD推出。Lite看起来被超越了,直到任务结果公布。在我们的RTX Pro 6000比较中,六个Lite模型中有三个在质量/速度前沿上与十二个Unsloth v3模型竞争。对于一个急于发布的版本来说,这相当不错。完整的ShapeLearn现在进一步推动了那个前沿。这就引出了KLD。Unsloth Dynamic V3的UD-IQ3_S比我们尺寸相近的最小Lite模型KLD低约20%,但得分95.55%,而Lite为97.33%的BF16总基准分数。更接近的令牌分布并不意味着更好的任务性能。KLD有助于避免量化模型失效,但它不是一个量化排行榜。这个区别是我们关于KLD和量化保真度的论文主题,该论文最近被EMNLP 2026 Industry Track接受发表。我们几周前还发布了论文的博客文章版本。我们在RTX 6000 Pro Blackwell、RTX 5090、RTX 4090、RTX 3090、RTX 4080和RTX 5060 Ti上基准测试了这个版本。我们用于衡量质量的基准测试有:GSM8K用于数学,IFEval用于指令遵循,MMLU用于通用知识,LiveCodeBench V6用于编码,Multi-IF用于多轮和多语言指令遵循,ACEBench用于工具使用和代理任务(思考和指令),Multiple HumanEval用于编码(思考),BFCL V4用于工具调用和代理任务(思考)。如果您想深入了解或为您的用例选择最佳模型,博客提供了所有测试GPU的完整结果,以及方法论、模型大小和完整图例。
查看原文

相似文章

Qwen3.6-27B 量化基准测试

Reddit r/LocalLLaMA

本文使用 KLD 和 Same Top P 指标,对多种 Qwen3.6-27B 量化版本(Q8 至 Q2)进行基准测试,对比了 Unsloth 和 mradermacher 等提供者的量化结果,并给出了质量与大小权衡的建议。