Prism-ML Bonsai 2 加入我们的 Qwen3.8 量化比较
摘要
Prism-LM 的基于 Qwen3.8 的 Bonsai 2 QAT 模型已被评估并加入比较研究,在综合基准测试中达到约 91.5%,并为模型权衡提供了可靠的参考。
嘿 r/LocalLLaMA,Prism-LM 最近发布了其基于 Qwen3.8 的 Bonsai 2 QAT 模型,并迅速获得了关注。在我们的评估中,这些模型在吞吐量和质量之间取得了良好的平衡,在我们的综合基准测试中达到约 91.5%。我们想看看在相同的方法论下,这些模型与其他 Qwen3.8 评估的对比情况,因此我们通过自己的基准测试套件运行了 Bonsai 2。一个重要澄清:这些是我们评估的结果,不是 Prism 报告的基准测试数字。我们使用了 Prism 的 fork/runtime 来运行他们的模型,同时保持工作负载、基准测试套件和评估方法论与我们其他比较一致。我们的评估包括单独的 Instruct 和 Thinking 基准测试。对于 Thinking,我们使用中等思考力度并采用推荐的采样参数。我们添加 Bonsai 2 是因为这些模型已成为 Qwen3.8 领域的重要部分,我们希望为比较可用选项的人提供一个共同的参考点。不同的提供商通常使用不同的基准测试套件、运行时、推理设置、采样参数和评估方法论来报告结果,因此这些数字并不总是可以直接比较。通过相同的评估运行这些模型,为理解质量、模型大小和吞吐量之间的权衡提供了另一个参考点。更新后的比较和结果:https://byteshape.com/blogs/Qwen3.8-27B/
相似文章
Prism-ML Bonsai Qwen 3.6 27B
Prism ML 发布了 Ternary-Bonsai-27B,这是 Qwen3.6-27B 的三元量化版本,在约 7.2 GB 的占用下保留了 FP16 智能的 95%,能够在笔记本电脑和单 GPU 上实现完整的 27B 级推理,在 Apple M5 Pro 上速度可达 26 tok/s。
Prism-ML 的 Bonsai-27B 基准测试
Prism-ML 发布了其 Bonsai-27B 模型的基准测试结果。
prism-ml/Bonsai-27B-gguf
Prism ML 发布了 Bonsai-27B-gguf,这是一个拥有 270 亿参数的语言模型,采用二进制(1.125 位)权重,实现了约 14 倍的尺寸缩减,同时保留了约 90% 的 FP16 推理性能。它可以在消费级硬件上运行,并具有高吞吐量。
prism-ml/Ternary-Bonsai-27B-mlx-2bit
Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。
我对比测试了 Qwen3.8 27B IQ3_XXS (10.18GiB) 和 Bonsai Ternary PQ2 (6.42GiB)
作者在有限的显存下比较了 Qwen3.8 27B IQ3_XXS 和 Bonsai Ternary PQ2 的性能,发现 Qwen 更快且使用的 token 更少,而 Bonsai 文件更小但生成时间更长。