个人评测后续:Gemma4 26B MoE(Q8)vs Qwen3.5 27B Dense vs Gemma4 31B Dense 对比
摘要
个人基准测试显示,Qwen3.5-27B Dense 与 Gemma4-31B Dense 在 37 个失败用例中修复率 100%,即使 8-bit 量化的 Gemma4-26B MoE 也望尘莫及,同时消耗更少 token 与更短挂钟时间。
本文是前帖 [Qwen 3.6 35B vs Gemma 4 26B 对比](https://www.reddit.com/r/LocalLLaMA/comments/1soc98n/qwen_36_35b_crushes_gemma_4_26b_on_my_tests/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button) 的后续更新,重点回答:1. Gemma 4 26B 是否因量化“交税”而表现下滑,改用 UD 的 Q8_K_XL 能否逆袭;2. 很多人(包括我)好奇 Qwen 3.5 27B dense 的实际表现;3. 同为 dense 的 Gemma 4 31B 能否一战。下文合并上一轮数据,方便一次性对比。
---
## 1. 测试结果
| 指标 | Qwen3.6-35B Q4 | Gemma4-26B Q4 | Gemma4-26B Q8 | Qwen3.5-27B Q4 | **Gemma4-31B Q4** |
| ----------------------- | -------------- | ------------- | ------------- | -------------- | ----------------- |
| 基线失败数 | 37 | 37 | 37 | 37 | 37 |
| **修复数** | 32 (86.5%) | 28 (75.7%) | 17 (45.9%) | **37 (100%)** | **37 (100%)** |
| **回退数** | **0** | 8 | **0** | **0** | **0** |
| **净得分** | 32 | 20 | 17 | **37** | **37** |
| 仍失败(/37) | 5 | 9 | 20 | **0** | **0** |
| 跑后总失败 | 5 | 17 | 20 | **0** | **0** |
| 护栏违规 | 0 | 0 | 0 | 0 | 0 |
---
## 2. Token 消耗
| 指标 | Qwen3.6 Q4 | Gemma4 26B Q4 | Gemma4 26B Q8 | Qwen3.5-27B Q4 | **Gemma4 31B Q4** |
|---|---|---|---|---|---|
| 输入 token | 634,965 | 1,005,964 | 703,732 | 553,137 | 1,115,666 |
| 输出 token | 39,476 | 89,750 | 68,055 | 42,183 | 62,465 |
| **总计(I+O)** | 674,441 | 1,095,714 | 771,787 | **595,320** | 1,178,131 |
| 缓存读取 token | 4,241,502 | 3,530,520 | 3,044,400 | **7,518,047** | 3,335,808 |
| 输出/输入比 | 1:16 | 1:11 | 1:10 | 1:13 | 1:17 |
| **每修复 token** | ~21K | ~39K | ~45K | **~16K** | ~32K |
| **每净分 token** | ~21K | ~55K | ~45K | **~16K** | ~32K |
---
## 3. 工具调用
| 工具 | Qwen3.6 Q4 | Gemma4 26B Q4 | Gemma4 26B Q8 | Qwen3.5-27B Q4 | **Gemma4 31B Q4** |
|---|---|---|---|---|---|
| read | 46 | 39 | 25 | **91** (1 错) | 37 |
| bash | **33** | 30 | 31 | 23 | 29 |
| edit | 14 | 13 | 12 (1 错) | **31** | 21 |
| grep | 16 | 10 | 6 | **33** | 6 |
| write | 1 | 0 | 4 | 1 | 1 |
| glob | 1 | 1 | 3 | 1 | 2 |
| todowrite | 4 | 3 | 1 | 1 | 4 |
| **总计** | 115 | 96 | 82 | **181** | 100 |
| 成功 | 115 (100%) | 96 (100%) | 81 (98.8%) | 180 (99.4%) | **100 (100%)** |
| 失败 | 0 | 0 | 1 | 1 | 0 |
派生指标
| 派生指标 | Qwen3.6 Q4 | Gemma4 26B Q4 | Gemma4 26B Q8 | Qwen3.5-27B Q4 | **Gemma4 31B Q4** |
|---|---|---|---|---|---|
| 独立读取文件数 | 18 | 27 | 19 | 23 | 27 |
| 独立编辑文件数 | 7 | 13 | 9 | 9 | 12 |
| 每文件读取次数 | 2.6 | 1.4 | 1.3 | **4.0** | 1.4 |
| 工具调用/分钟 | **2.3** | 1.1 | 1.2 | 1.2 | 0.16 |
| 每修复编辑数 | 0.44 | 0.46 | 0.65 | 0.84 | 0.57 |
| Bash(pytest)次数 | **33** | 30 | 31 | 23 | 29 |
---
## 4. 耗时与效率
| 指标 | Qwen3.6 Q4 | Gemma4 26B Q4 | Gemma4 26B Q8 | Qwen3.5-27B Q4 | **Gemma4 31B Q4** |
| --------------------- | ---------------- | ------------- | ------------- | -------------- | ----------------- |
| **挂钟时间** | **2,950s (49m)** | 5,129s (85m) | 4,142s (69m) | 8,698s (145m) | 37,748s (629m) |
| 总步数 | 120 | 104 | 88 | 186 | 109 |
| **单步平均时长** | **10.0s** | 21.7s | 24.0s | 15.9s | **82.2s** |
---
## 5. 模型与服务器配置
| 属性 | Qwen3.6-35B Q4 | Gemma4-26B Q4 | Gemma4-26B Q8 | Qwen3.5-27B Q4 | **Gemma4-31B Q4** |
| ----------------- | -------------- | ------------- | ------------- | -------------- | ----------------- |
| 总参数量 | 35B | 26B | 26B | 27B | 31B |
| 激活参数量 | **3B** | 4B | 4B | 27B | 31B |
| 量化方案 | Q4_K_XL | Q4_K_XL | Q8_K_XL | Q4_K_XL | Q4_K_XL |
| 上下文长度 | 100,000 | 100,000 | 100,000 | 100,000 | 100,000 |
| temperature | 0.6 | 1.0 | 1.0 | **0.6** | 1.0 |
| top_p | 0.95 | 0.95 | 0.95 | 0.95 | 0.95 |
| top_k | 20 | 64 | 64 | **20** | 64 |
---
## 关键观察
- Gemma 4 26B 换 Q8 后并未起飞,成绩与 Q4 同一梯队,甚至略低,差异可视为噪声。我仍继续用 Q4_K_XL。
- Qwen 3.5 27B 与 Gemma 4 31B 双双满分,dense 模型与 MoE 根本不在一个次元(尤其 Gemma 31B)。
- Gemma 4 31B 工具调用效率最高,100 次零错误搞定全部问题。
- Qwen 3.5 27B 最省 token,平均每次修复仅 16k。
- Gemma 4 31B 推理速度莫名极慢,跑了 ***10 小时 29 分***,DRAM 甚至涨到 70GB(已加 -cram 与 -ctkcp)。不确定是否属预期行为。
综合来看,Gemma4 31B 在我测试中能力最强,却也最慢;Qwen 3.5 27B 性能相近、速度快得多;Qwen 3.6 35B 仍是“性价比速度王”,会继续当我的日常主力。
相似文章
Reddit r/LocalLLaMA
Qwen3.5-9B 在 8 项基准测试中的 5 项中优于 gemma-4-12b-it,尽管模型体积更小。gemma 仅在编程能力上略胜一筹。
Reddit r/LocalLLaMA
针对四款 30B 级别的稠密模型与 MoE 模型的实证研究显示,Gemma-4 26B MoE 在处理相同推理任务时,仅需 1.9–15 Wh 的能耗即可实现同等精度;而稠密模型及更大规模的 MoE 变体在该场景下的功耗最高可达 34 Wh。
Reddit r/LocalLLaMA
Gemma 4-26b-a4b-it 基本是个基础扎实、能稳妥完成任务的 B 等生。Qwen3.6-35b-a3b 则是考出 A+ 的优等生,做完任务后还有余力搞点锦上添花的发挥。在我的 16GB 显存显卡上,两款模型运行速度相当。测试环境为 Windows 下的 LM Studio,采用推荐推理设置。使用的模型:unsloth/gemma-4-26B-A4B-it-UD-Q4_K_S 与 AesSedai/Qwen3.6-35B-A3B IQ4_XS。大家有不同意见吗?**更新:** 看来我之前用 Gemma 4 的方式不太对。[Sadman782 的评论](https://www.redd
Reddit r/LocalLLaMA
一位用户分享了针对不同量化版本的Gemma和Qwen模型在算术、总统出生日期和注意力测试中的准确率对比基准结果,强调了模型规模与量化级别之间的权衡。
Reddit r/LocalLLaMA
在 RTX 5090 上,让四款本地大模型——Qwen3.6-27B、Qwen3.6-35B、Qwen3.5-27B 与 Gemma 4——完成 2 万 token 架构写作任务,结果显示 Qwen3.6-27B 在清晰度、完整性与实用性上取得最佳综合平衡。