Qwen3.8 27B 模型量化基准测试:4位量化保持性能,1位量化严重退化

Reddit r/LocalLLaMA 新闻

摘要

基准测试表明,4位量化的Qwen3.8 27B在Terminal-Bench 2.1等基准测试中保持性能,且适配24GB显卡,但1位量化导致严重性能下降。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/26 19:27

# Qwen3.8 27B 量化版本基准测试:4位保持稳定,1位性能崩塌 来源:https://quesma.com/blog/qwen38-27b-quantizations-benchmarked/ 在不牺牲质量的前提下,运行 Qwen3.8 27B 到底需要多少显存? 完整的`BF16`模型体积为 55 GB,超出了大多数消费级硬件的能力。但 17 GB 的`Q4_K_M`量化版本在流行的智能体编码基准测试 Terminal-Bench 2.1 上与完整模型表现相当。它可以装进 24 GB 显存的显卡(如 RTX 4090),同时还留有约 64k 令牌的上下文空间。 压缩终究会撞上性能断崖。在 1 位量化下,模型在 GPQA Diamond 基准上的表现接近随机猜测,且更长的推理过程反而会加剧这种情况。 ## 背景 Qwen3.8 27B GGUF 量化版本可从 Unsloth 在 Hugging Face 上获取 (https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)。选择太多了!我将测试 8 位`Q8_0` (29 GB)、4 位`Q4_K_M` (17 GB)、2 位`UD-Q2_K_XL` (10.7 GB),以及尽可能小的 1 位`UD-IQ1_S` (6.2 GB)。 此前,我研究过 Qwen3.6 27B 模型,它在 12GB 显存下仍然擅长生成 SVG 鹈鹕 (https://quesma.com/blog/qwen-quantization-quality/),并且在 16GB 下保持了大部分知识 (https://quesma.com/blog/quantization-hurts-knowledge/)。与此同时,在 Reddit 讨论中,许多人抱怨所有量化版本,即使是 8 位的,效果也更差——有人问道为什么你的本地大语言模型感觉变笨了 (https://forum.level1techs.com/t/why-your-local-llm-feels-dumber-than-it-is/253917)。这些抱怨有根据吗? 测量令牌预测差异(KL 散度、Top-1 预测)很容易,但这并不能告诉我们模型在解决任务时是否变差了。某些噪声对于解决任务可能无关紧要,因为(比如说)量化模型生成的答案质量完全相同,只是稍微改写了措辞。而在其他情况下,一个不同的令牌可能就是逻辑错误,甚至会突然中断输出。 [图表:磁盘上模型大小(GB)vs 与 BF16 相同的 Top-1 令牌占比] 70% 80% 90% 100% 6 10 20 30 50 GB 图表显示了 UD-IQ1_S、UD-IQ1_M、UD-Q2_K_XL、Q4_K_M、Q8_0、BF16 各版本在与 BF16 模型 Top-1 预测一致率上的表现。 因此,我专注于直接测量在流行基准上的结果——GPQA Diamond (https://artificialanalysis.ai/evaluations/gpqa-diamond)、指令跟随 IFBench (https://github.com/allenai/IFBench)、编程 Terminal-Bench 2.1 (https://www.tbench.ai/leaderboard/terminal-bench/2.1)。首先,重现完整模型`BF16`的官方结果,然后观察量化如何影响结果。 在使用 llama.cpp (https://github.com/ggml-org/llama.cpp)(使用 2026 年 8 月 16 日的构建版本,因为更早的版本对该模型不适用 (https://www.paulsprogrammingnotes.com/2026/08/running-qwen-3-8-27b-16gb.html))运行模型时,我在 Modal (https://modal.com/) 的 GPU 上花费了大约 3,000 美元。原则上,我可以在自己的笔记本电脑上运行,但(与生成鹈鹕不同)这些基准测试非常耗时。 请注意,无论模型量化精度如何,我都使用`F16`精度的 KV 缓存,每 32k 令牌约重 2.3 GB。 我使用了 Unsloth 的量化版本 (https://huggingface.co/unsloth/Qwen3.8-27B-GGUF):2位、4位和8位模型使用 v2 版本,1位模型使用 v3 (https://unsloth.ai/docs/basics/dynamic-3.0-ggufs) 版本。Unsloth 在 2026 年 8 月 19 日替换了 v2 文件 (https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/discussions/74),因此大多数测试使用的确切文件已不再可用。 简而言之,如果你选择 4 位量化`Q4_K_M`(17GB),在这些基准测试上你不会注意到差异。同时,推理努力程度设置非常重要(注意默认是`xhigh`)——这是一个棘手的选择,因为模型可能会过度思考 (https://simonwillison.net/2026/Aug/16/qwen-38-27b/)。 ## 单次测试 最简单的是单次测试:这里包括研究生级科学测试 GPQA Diamond 和指令跟随测试 IFBench。我在三种推理努力程度上运行:`low`、`medium` 和默认的`xhigh`。 ### GPQA Diamond [图表:磁盘上模型大小(GB)vs GPQA Diamond 得分] 70% 75% 80% 85% 90% 95% 100% 10 20 30 50 GB 图表显示了在不同推理努力程度下,UD-Q2_K_XL、Q4_K_M、Q8_0、BF16 各版本的得分。xhigh(默认)和 Qwen 官方报告得分最高,medium 次之,low 最低。 首先,我很高兴我成功重现了官方结果。运行基准测试很难;有很多隐藏的设置或假设可能会极大地改变结果。这里,首次尝试的结果就与 Qwen 报告的相符。 其次,除了噪声(条形图是 Wilson 95% 置信区间 (https://en.wikipedia.org/wiki/Binomial_proportion_confidence_interval#Wilson_score_interval),对运行间的噪声非常保守),低至 4 位量化几乎没有差异;只有 2 位量化得分略低。 同时,推理努力程度的改变极大地影响了得分。最佳结果来自`xhigh`,需要约 8k 推理令牌。 ### IFBench [图表:磁盘上模型大小(GB)vs IFBench 遵循率(严格)] 60% 80% 10 20 30 50 GB 图表显示了在不同推理努力程度下,UD-Q2_K_XL、Q4_K_M、Q8_0、BF16 各版本的遵循率。各版本表现相似,xhigh(默认)和 Qwen 官方报告得分最高,medium 次之,low 最低。 在这里,令我大为惊讶的是,直到一个相当不错的 2 位量化版本(重量不到 11 GB),模型之间几乎没有变化。不过,这里的上下文令牌数更低,约 4k。 ## 智能体编码与 Terminal-Bench 2.1 在编程方面表现如何?Terminal-Bench 2.1 是一个标准的智能体基准,包含 89 个任务。这里我使用 3 小时超时,`xhigh`努力程度,并预留 98k 上下文。 [图表:磁盘上模型大小(GB,对数标度)vs Terminal-Bench 2.1 通过率] 55% 60% 65% 70% 75% 80% 10 20 30 40 50 GB 图表显示了 UD-Q2_K_XL、Q4_K_M、BF16 的通过率。Qwen 官方报告得分最高。 不仅我对`BF16`的测量重现了声明的结果,而且令我惊讶的是,`Q4_K_M`也做到了。我不小心跳过了运行`Q8_0`;但在这种情况下,我可以安全地在 4 位和完整模型的值之间进行插值。运行它既昂贵又没有必要(而且会超出一篇非正式博客文章的预算)。只有在 2 位`UD-Q2_K_XL`时,情况才开始有点崩坏。一个明显的下降,但仍处于 Opus 4.7 或 Gemini 3.1 Pro (https://www.tbench.ai/leaderboard/terminal-bench/2.1?lf=%7B%22agent_display%22:%7B%22kind%22:%22categorical%22,%22values%22:%5B%22Terminus+2%22%5D%7D%7D) 的水平。同样,远离前沿,但也——远非无用。 结果是一回事,但过程呢?较小的模型是否需要更多的轮次、令牌或时间才能得到结果? [图表:与 BF16 相同的任务解决情况下,输出令牌数与 BF16 的比较] same as BF16 0.8x 1.0x 1.2x 1.4x 1.6x 1.8x 图表比较了在相同解决任务下,UD-Q2_K_XL、Q4_K_M、Q8_0 各版本在 Terminal-Bench 2.1、GPQA Diamond、IFBench 上所需的输出令牌数(相对于 BF16)。 在相同解决的任务上,`UD-Q2_K_XL`需要与 BF16 相同的轮次,但多写约四分之一的令牌。轮次数量大致保持不变。 ## 1 位量化断崖 在 1 位量化时,质量断崖式下跌。就像知识 (https://quesma.com/blog/quantization-hurts-knowledge/) 一样,量化损伤是非线性的:首先是没有可测量的变化,然后是轻微下降,最后是崩塌。 虽然 2 位量化在一定程度上有效,但即使是最好的 1 位量化模型在这些基准测试上也毫无用处: [图表:推理努力程度(xhigh 为模型默认)vs GPQA Diamond 得分] 0% 20% 40% 60% 80% 100% low medium xhigh 图表显示了 Q4_K_M、Qwen 官方报告、UD-Q2_K_XL、UD-IQ1_M、随机猜测、UD-IQ1_S 的得分。各模型在 xhigh 下的得分普遍低于 low 和 medium,其中 UD-IQ1_S 和随机猜测得分极低。 正如你所见,得分在随机猜测水平附近,最小的模型甚至低于该阈值。而更长的推理会让情况更糟:在`xhigh`下,得分降至`low`之下,因为模型更频繁地推理到令牌预算用尽并返回空答案。当然,Unsloth 宣称: > 我们还制作了一些较小的 UD-1 位量化版本,其中 UD-IQ1_S 为 6.2GB(不含 MTP),保留了约 72% 的 Top-1% 准确率,同时体积减小了 89%。 但在这种情况下,剩下的 28% 准确率至关重要。这与另一位用户的经验相符,参见 r/LocalLLaMA 上的 Qwen3.8 27b 1bit brain damage quant (https://www.reddit.com/r/LocalLLaMA/comments/1vtr3h0/ladies_and_gentlemen_i_present_to_you_qwen38_27b/)。 ## 成本 运行这些基准测试并不便宜。通过 API 运行基准测试成本很高,正如我从之前的基准测试 (https://www.reddit.com/r/LocalLLaMA/comments/1vtr3h0/ladies_and_gentlemen_i_present_to_you_qwen38_27b/) 中所知。在租用 GPU 上运行则更加昂贵。 [图表:各版本/任务的成本明细] BF16 $804 任务容器 $759 Q4_K_M $502 UD-Q2_K_XL $243 UD-IQ1_S $167 UD-IQ1_M $143 Q4_K_M $120 UD-Q2_K_XL $80 BF16 $80 Q8_0 $73 Terminal-Bench 2.1 $2,308 GPQA + IFBench $663 我使用了 Modal,因为它很容易从命令行运行,包括从智能体运行。其他设置可能有不同的定价。显然,如果你有自己的设备,这个计算会改变。 找到运行模型的最佳方式需要一些测试。通常,我使用几个并行流,而不是使用对单流效果很好的多令牌预测(MTP)。关键限制是 GPU 是否有足够的内存同时容纳模型和所需的 KV 缓存。 我使用了 NVIDIA L40S(与 RTX 4090 相同的 Ada Lovelace 芯片,但内存加倍:48 GB)、H100(80 GB)和 H200(141 GB)。我想分享成本,以便如果你想自己运行基准测试,可以有个大致的估算。 [图表:每个流的速度(令牌/秒)vs 每百万输出令牌的价格] $3 $5 $10 20 30 50 80 tok/s 图表比较了 UD-Q2_K_XL、Q4_K_M、Q8_0、BF16 在 L40S、H100、H200 上运行 8 个并行流、1 个流(MTP 草稿)以及 OpenRouter 的价格。 作为对比,DeepSeek V4 Flash 0731 (https://openrouter.ai/deepseek/deepseek-v4-flash-0731#providers),一个 284B 模型,从 OpenRouter 上最便宜的提供商获取输出,成本约为每百万令牌 $0.1。我不确定这种差异有多少来自大规模运行模型的效率、定价策略或流行度。 ## 结论 如果你在本地运行实验,通常选择能装入你 GPU 内存并满足所需上下文的最佳模型即可。对于大多数任务,Unsloth 的`Q4_K_M`应该足够好,没有任何明显差异;对于一些更简单的任务,`UD-Q2_K_XL`应该绰绰有余。由于有人报告说 KV 缓存更容易受到量化影响,我也可能会测试这一点。 但总的来说,我认为量化应该被拥抱,而不是被畏惧。 你的经验如何?

相似文章

Qwen3.6-27B 量化基准测试

Reddit r/LocalLLaMA

本文使用 KLD 和 Same Top P 指标,对多种 Qwen3.6-27B 量化版本(Q8 至 Q2)进行基准测试,对比了 Unsloth 和 mradermacher 等提供者的量化结果,并给出了质量与大小权衡的建议。

Qwen 27B 3.8 量化:极限在哪里?

Reddit r/LocalLLaMA

一位用户分享了在 Mac mini M4 上使用 Unsloth 的 Q3 XXS 量化版本运行 Qwen 27B 3.8 的积极体验,并询问他人对低于 Q3 量化版本的使用感受。

# Qwen 3.6 27B - VLLM 性能基准测试结果(BF16、FP8、NVFP4)

Reddit r/LocalLLaMA

使用 VLLM 对 Qwen 3.6 27B 在 BF16、FP8 和 NVFP4 三种量化方式下的详细基准测试显示:NVFP4 在 token 生成方面最快,但 FP8 在提示处理方面表现最佳。本文还提供了针对编码任务选择合适量化的实用建议。