个人评测后续:Gemma4 26B MoE(Q8)vs Qwen3.5 27B Dense vs Gemma4 31B Dense 对比

Reddit r/LocalLLaMA 模型

摘要

个人基准测试显示,Qwen3.5-27B Dense 与 Gemma4-31B Dense 在 37 个失败用例中修复率 100%,即使 8-bit 量化的 Gemma4-26B MoE 也望尘莫及,同时消耗更少 token 与更短挂钟时间。

本文是前帖 [Qwen 3.6 35B vs Gemma 4 26B 对比](https://www.reddit.com/r/LocalLLaMA/comments/1soc98n/qwen_36_35b_crushes_gemma_4_26b_on_my_tests/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button) 的后续更新,重点回答:1. Gemma 4 26B 是否因量化“交税”而表现下滑,改用 UD 的 Q8_K_XL 能否逆袭;2. 很多人(包括我)好奇 Qwen 3.5 27B dense 的实际表现;3. 同为 dense 的 Gemma 4 31B 能否一战。下文合并上一轮数据,方便一次性对比。 --- ## 1. 测试结果 | 指标 | Qwen3.6-35B Q4 | Gemma4-26B Q4 | Gemma4-26B Q8 | Qwen3.5-27B Q4 | **Gemma4-31B Q4** | | ----------------------- | -------------- | ------------- | ------------- | -------------- | ----------------- | | 基线失败数 | 37 | 37 | 37 | 37 | 37 | | **修复数** | 32 (86.5%) | 28 (75.7%) | 17 (45.9%) | **37 (100%)** | **37 (100%)** | | **回退数** | **0** | 8 | **0** | **0** | **0** | | **净得分** | 32 | 20 | 17 | **37** | **37** | | 仍失败(/37) | 5 | 9 | 20 | **0** | **0** | | 跑后总失败 | 5 | 17 | 20 | **0** | **0** | | 护栏违规 | 0 | 0 | 0 | 0 | 0 | --- ## 2. Token 消耗 | 指标 | Qwen3.6 Q4 | Gemma4 26B Q4 | Gemma4 26B Q8 | Qwen3.5-27B Q4 | **Gemma4 31B Q4** | |---|---|---|---|---|---| | 输入 token | 634,965 | 1,005,964 | 703,732 | 553,137 | 1,115,666 | | 输出 token | 39,476 | 89,750 | 68,055 | 42,183 | 62,465 | | **总计(I+O)** | 674,441 | 1,095,714 | 771,787 | **595,320** | 1,178,131 | | 缓存读取 token | 4,241,502 | 3,530,520 | 3,044,400 | **7,518,047** | 3,335,808 | | 输出/输入比 | 1:16 | 1:11 | 1:10 | 1:13 | 1:17 | | **每修复 token** | ~21K | ~39K | ~45K | **~16K** | ~32K | | **每净分 token** | ~21K | ~55K | ~45K | **~16K** | ~32K | --- ## 3. 工具调用 | 工具 | Qwen3.6 Q4 | Gemma4 26B Q4 | Gemma4 26B Q8 | Qwen3.5-27B Q4 | **Gemma4 31B Q4** | |---|---|---|---|---|---| | read | 46 | 39 | 25 | **91** (1 错) | 37 | | bash | **33** | 30 | 31 | 23 | 29 | | edit | 14 | 13 | 12 (1 错) | **31** | 21 | | grep | 16 | 10 | 6 | **33** | 6 | | write | 1 | 0 | 4 | 1 | 1 | | glob | 1 | 1 | 3 | 1 | 2 | | todowrite | 4 | 3 | 1 | 1 | 4 | | **总计** | 115 | 96 | 82 | **181** | 100 | | 成功 | 115 (100%) | 96 (100%) | 81 (98.8%) | 180 (99.4%) | **100 (100%)** | | 失败 | 0 | 0 | 1 | 1 | 0 | 派生指标 | 派生指标 | Qwen3.6 Q4 | Gemma4 26B Q4 | Gemma4 26B Q8 | Qwen3.5-27B Q4 | **Gemma4 31B Q4** | |---|---|---|---|---|---| | 独立读取文件数 | 18 | 27 | 19 | 23 | 27 | | 独立编辑文件数 | 7 | 13 | 9 | 9 | 12 | | 每文件读取次数 | 2.6 | 1.4 | 1.3 | **4.0** | 1.4 | | 工具调用/分钟 | **2.3** | 1.1 | 1.2 | 1.2 | 0.16 | | 每修复编辑数 | 0.44 | 0.46 | 0.65 | 0.84 | 0.57 | | Bash(pytest)次数 | **33** | 30 | 31 | 23 | 29 | --- ## 4. 耗时与效率 | 指标 | Qwen3.6 Q4 | Gemma4 26B Q4 | Gemma4 26B Q8 | Qwen3.5-27B Q4 | **Gemma4 31B Q4** | | --------------------- | ---------------- | ------------- | ------------- | -------------- | ----------------- | | **挂钟时间** | **2,950s (49m)** | 5,129s (85m) | 4,142s (69m) | 8,698s (145m) | 37,748s (629m) | | 总步数 | 120 | 104 | 88 | 186 | 109 | | **单步平均时长** | **10.0s** | 21.7s | 24.0s | 15.9s | **82.2s** | --- ## 5. 模型与服务器配置 | 属性 | Qwen3.6-35B Q4 | Gemma4-26B Q4 | Gemma4-26B Q8 | Qwen3.5-27B Q4 | **Gemma4-31B Q4** | | ----------------- | -------------- | ------------- | ------------- | -------------- | ----------------- | | 总参数量 | 35B | 26B | 26B | 27B | 31B | | 激活参数量 | **3B** | 4B | 4B | 27B | 31B | | 量化方案 | Q4_K_XL | Q4_K_XL | Q8_K_XL | Q4_K_XL | Q4_K_XL | | 上下文长度 | 100,000 | 100,000 | 100,000 | 100,000 | 100,000 | | temperature | 0.6 | 1.0 | 1.0 | **0.6** | 1.0 | | top_p | 0.95 | 0.95 | 0.95 | 0.95 | 0.95 | | top_k | 20 | 64 | 64 | **20** | 64 | --- ## 关键观察 - Gemma 4 26B 换 Q8 后并未起飞,成绩与 Q4 同一梯队,甚至略低,差异可视为噪声。我仍继续用 Q4_K_XL。 - Qwen 3.5 27B 与 Gemma 4 31B 双双满分,dense 模型与 MoE 根本不在一个次元(尤其 Gemma 31B)。 - Gemma 4 31B 工具调用效率最高,100 次零错误搞定全部问题。 - Qwen 3.5 27B 最省 token,平均每次修复仅 16k。 - Gemma 4 31B 推理速度莫名极慢,跑了 ***10 小时 29 分***,DRAM 甚至涨到 70GB(已加 -cram 与 -ctkcp)。不确定是否属预期行为。 综合来看,Gemma4 31B 在我测试中能力最强,却也最慢;Qwen 3.5 27B 性能相近、速度快得多;Qwen 3.6 35B 仍是“性价比速度王”,会继续当我的日常主力。
查看原文

相似文章

我针对 Gemma 4 和 Qwen 3.5 的 30B 级别模型进行了一项实验,旨在探究能耗与性能的权衡关系。换句话说,我想弄清楚哪些模型在输出同等质量的回答时会消耗更多的电能。

Reddit r/LocalLLaMA

针对四款 30B 级别的稠密模型与 MoE 模型的实证研究显示,Gemma-4 26B MoE 在处理相同推理任务时,仅需 1.9–15 Wh 的能耗即可实现同等精度;而稠密模型及更大规模的 MoE 变体在该场景下的功耗最高可达 34 Wh。

通俗版对比:Qwen3.6 35b-a3b 与 Gemma4-26b-a4b-it

Reddit r/LocalLLaMA

Gemma 4-26b-a4b-it 基本是个基础扎实、能稳妥完成任务的 B 等生。Qwen3.6-35b-a3b 则是考出 A+ 的优等生,做完任务后还有余力搞点锦上添花的发挥。在我的 16GB 显存显卡上,两款模型运行速度相当。测试环境为 Windows 下的 LM Studio,采用推荐推理设置。使用的模型:unsloth/gemma-4-26B-A4B-it-UD-Q4_K_S 与 AesSedai/Qwen3.6-35B-A3B IQ4_XS。大家有不同意见吗?**更新:** 看来我之前用 Gemma 4 的方式不太对。[Sadman782 的评论](https://www.redd