Qwen3.6-35B 与 Gemma4-26B 在 7900 XTX 上的对比
摘要
一项详细的基准测试对比了 Radeon 7900 XTX 上的 Qwen3.6-35B 和 Gemma4-26B,结果显示尽管 Gemma 的 token 生成速度较慢,但端到端快了约 20%,原因是 Qwen 因内部推理生成了约两倍的 token。文章建议:在吞吐量受限的批量任务中使用 Qwen,在延迟敏感的单次请求中使用 Gemma。
在我的 Radeon 7900 XTX 上对 Qwen3.6-35B-A3B 和 Gemma4-26B-A4B 进行了公平对比。两者均启用推理能力,预算同为 32K,无输出上限,使用了六个通用真实世界提示词(会议纪要、事故复盘、日志分类转 JSON、代码审查、自建与购买决策、创意提示)。**TL;DR:解码器更慢的模型反而在挂钟时间上获胜。** Qwen 的 MTP 使其 token 生成速度约快 1.65 倍(130 vs 78 tok/s),但为了回答相同提示词,它生成了约两倍的 token,其中大部分用于内部推理。最终结果:Gemma 端到端快约 20%。六个任务总计:Qwen 118.8 秒 vs Gemma 95.6 秒。
**配置:** Ryzen 9600X、Sapphire NITRO+ 7900 XTX 24GB、96GB DDR5-6800、ROCm 7.2.3、HIP gfx1100、llama.cpp 构建 9425、GGML\_HIP=ON、ROCWMMA\_FATTN=OFF。
Qwen3.6-35B-A3B:IQ4\_XS-Q8next 混合 MTP(约 20GB),draft-n-max 3
Gemma4-26B-A4B:UD-Q4\_K\_XL(约 17GB),无 MTP
**关键发现:**
Qwen 在六个任务中共生成了 14,811 个 token,而 Gemma 为 7,386 个——约两倍。Qwen 在思考上的 token 占比也更高(总占比 74% vs 57%)。
各任务挂钟时间:
- meeting-notes:Qwen 12.2 秒 vs Gemma 10.8 秒(Gemma 胜)
- incident-postmortem:Qwen 28.2 秒 vs Gemma 21.6 秒(Gemma 胜)
- log-triage-json:Qwen 10.4 秒 vs Gemma 9.0 秒(Gemma 胜)
- code-review:Qwen 20.6 秒 vs Gemma 23.1 秒(Qwen 胜——这是两个模型推理最少的任务)
- build-vs-buy:Qwen 33.1 秒 vs Gemma 21.5 秒(Gemma 胜)
- creative-spark:Qwen 14.4 秒 vs Gemma 9.5 秒(Gemma 胜)
**MTP 问题:**
纯解码方面,MTP 实现了 130 vs 78 tok/s,接受率为 41-62%(总体 52.5%)。但 MTP 只加快了 token 的发出速度,并不减少数量。一旦启用思考,token 数量成为瓶颈,解码优势基本消失。以有用内容字符/秒衡量,两者基本持平(约 137 vs 约 130)。
**质量:**
两者非常接近,但存在有趣的分歧。在代码审查中,Gemma 发现了 Qwen 遗漏的一个缺失参数 TypeError。在自建与购买决策中,它们给出了相反但均合理的答案(Qwen:使用托管 Algolia;Gemma:仅用 Postgres,别碰 Elasticsearch)。在严格的 JSON 任务中,Qwen 遵循“无散文字”规则,输出纯 JSON;Gemma 将其包裹在代码围栏中。两者均未产生幻觉。
**我的结论:**
两者都用。吞吐量受限的批量任务用 Qwen(解码速度在多个连续请求中叠加,且它严格遵循输出格式)。延迟敏感的单次请求用 Gemma(尽管解码器更慢,但这里挂钟时间快了约 20%)。一份规格表不会告诉你的要点是:更快的解码器并不意味着更快的响应。一旦推理加入循环,**回答所需的 token 数**胜过**每秒 token 数**。
完整基准细节和原始提示词/输出对:[Qwen3.6-35B vs Gemma4-26B: Real Workload Benchmarks on Radeon 7900 XTX · kmarble.dev](https://kmarble.dev/posts/qwen36-vs-gemma4-7900xtx-workload-benchmarks/)
原始数据可应要求提供。
相似文章
Reddit r/LocalLLaMA
Qwen3.5-9B 在 8 项基准测试中的 5 项中优于 gemma-4-12b-it,尽管模型体积更小。gemma 仅在编程能力上略胜一筹。
Reddit r/LocalLLaMA
在 RTX 5090 上,让四款本地大模型——Qwen3.6-27B、Qwen3.6-35B、Qwen3.5-27B 与 Gemma 4——完成 2 万 token 架构写作任务,结果显示 Qwen3.6-27B 在清晰度、完整性与实用性上取得最佳综合平衡。
Reddit r/LocalLLaMA
一位用户在 AMD 7900 XTX 上对 Google 的 Gemma 4 QAT 模型进行了基准测试,报告显示生成速度提升高达 45%,吞吐量提高 83%,显存占用大幅减少(例如 12B QAT 模型节省 5.7GB),且与标准权重相比质量无损。
Reddit r/LocalLLaMA
Gemma 4-26b-a4b-it 基本是个基础扎实、能稳妥完成任务的 B 等生。Qwen3.6-35b-a3b 则是考出 A+ 的优等生,做完任务后还有余力搞点锦上添花的发挥。在我的 16GB 显存显卡上,两款模型运行速度相当。测试环境为 Windows 下的 LM Studio,采用推荐推理设置。使用的模型:unsloth/gemma-4-26B-A4B-it-UD-Q4_K_S 与 AesSedai/Qwen3.6-35B-A3B IQ4_XS。大家有不同意见吗?**更新:** 看来我之前用 Gemma 4 的方式不太对。[Sadman782 的评论](https://www.redd
X AI KOLs Timeline
Gemma 4 26B 在 RTX 4060 上运行,通过 llama.cpp 和 Q4_K_XL 量化实现 248K Token 上下文和每秒 20 Token 的速度,从而在消费级硬件上本地处理整个代码库。