Qwen3.6-35B 与 Gemma4-26B 在 7900 XTX 上的对比

Reddit r/LocalLLaMA 工具

摘要

一项详细的基准测试对比了 Radeon 7900 XTX 上的 Qwen3.6-35B 和 Gemma4-26B,结果显示尽管 Gemma 的 token 生成速度较慢,但端到端快了约 20%,原因是 Qwen 因内部推理生成了约两倍的 token。文章建议:在吞吐量受限的批量任务中使用 Qwen,在延迟敏感的单次请求中使用 Gemma。

在我的 Radeon 7900 XTX 上对 Qwen3.6-35B-A3B 和 Gemma4-26B-A4B 进行了公平对比。两者均启用推理能力,预算同为 32K,无输出上限,使用了六个通用真实世界提示词(会议纪要、事故复盘、日志分类转 JSON、代码审查、自建与购买决策、创意提示)。**TL;DR:解码器更慢的模型反而在挂钟时间上获胜。** Qwen 的 MTP 使其 token 生成速度约快 1.65 倍(130 vs 78 tok/s),但为了回答相同提示词,它生成了约两倍的 token,其中大部分用于内部推理。最终结果:Gemma 端到端快约 20%。六个任务总计:Qwen 118.8 秒 vs Gemma 95.6 秒。 **配置:** Ryzen 9600X、Sapphire NITRO+ 7900 XTX 24GB、96GB DDR5-6800、ROCm 7.2.3、HIP gfx1100、llama.cpp 构建 9425、GGML\_HIP=ON、ROCWMMA\_FATTN=OFF。 Qwen3.6-35B-A3B:IQ4\_XS-Q8next 混合 MTP(约 20GB),draft-n-max 3 Gemma4-26B-A4B:UD-Q4\_K\_XL(约 17GB),无 MTP **关键发现:** Qwen 在六个任务中共生成了 14,811 个 token,而 Gemma 为 7,386 个——约两倍。Qwen 在思考上的 token 占比也更高(总占比 74% vs 57%)。 各任务挂钟时间: - meeting-notes:Qwen 12.2 秒 vs Gemma 10.8 秒(Gemma 胜) - incident-postmortem:Qwen 28.2 秒 vs Gemma 21.6 秒(Gemma 胜) - log-triage-json:Qwen 10.4 秒 vs Gemma 9.0 秒(Gemma 胜) - code-review:Qwen 20.6 秒 vs Gemma 23.1 秒(Qwen 胜——这是两个模型推理最少的任务) - build-vs-buy:Qwen 33.1 秒 vs Gemma 21.5 秒(Gemma 胜) - creative-spark:Qwen 14.4 秒 vs Gemma 9.5 秒(Gemma 胜) **MTP 问题:** 纯解码方面,MTP 实现了 130 vs 78 tok/s,接受率为 41-62%(总体 52.5%)。但 MTP 只加快了 token 的发出速度,并不减少数量。一旦启用思考,token 数量成为瓶颈,解码优势基本消失。以有用内容字符/秒衡量,两者基本持平(约 137 vs 约 130)。 **质量:** 两者非常接近,但存在有趣的分歧。在代码审查中,Gemma 发现了 Qwen 遗漏的一个缺失参数 TypeError。在自建与购买决策中,它们给出了相反但均合理的答案(Qwen:使用托管 Algolia;Gemma:仅用 Postgres,别碰 Elasticsearch)。在严格的 JSON 任务中,Qwen 遵循“无散文字”规则,输出纯 JSON;Gemma 将其包裹在代码围栏中。两者均未产生幻觉。 **我的结论:** 两者都用。吞吐量受限的批量任务用 Qwen(解码速度在多个连续请求中叠加,且它严格遵循输出格式)。延迟敏感的单次请求用 Gemma(尽管解码器更慢,但这里挂钟时间快了约 20%)。一份规格表不会告诉你的要点是:更快的解码器并不意味着更快的响应。一旦推理加入循环,**回答所需的 token 数**胜过**每秒 token 数**。 完整基准细节和原始提示词/输出对:[Qwen3.6-35B vs Gemma4-26B: Real Workload Benchmarks on Radeon 7900 XTX · kmarble.dev](https://kmarble.dev/posts/qwen36-vs-gemma4-7900xtx-workload-benchmarks/) 原始数据可应要求提供。
查看原文

相似文章

通俗版对比:Qwen3.6 35b-a3b 与 Gemma4-26b-a4b-it

Reddit r/LocalLLaMA

Gemma 4-26b-a4b-it 基本是个基础扎实、能稳妥完成任务的 B 等生。Qwen3.6-35b-a3b 则是考出 A+ 的优等生,做完任务后还有余力搞点锦上添花的发挥。在我的 16GB 显存显卡上,两款模型运行速度相当。测试环境为 Windows 下的 LM Studio,采用推荐推理设置。使用的模型:unsloth/gemma-4-26B-A4B-it-UD-Q4_K_S 与 AesSedai/Qwen3.6-35B-A3B IQ4_XS。大家有不同意见吗?**更新:** 看来我之前用 Gemma 4 的方式不太对。[Sadman782 的评论](https://www.redd