对密集模型 gemma-4-31b-it 与 MoE 模型 gemma-4-26b-a4b-it 进行基准测试,验证成本降低在实际中是否成立
摘要
一项对 Gemma 密集模型(31B)与 MoE 模型(26B)的实际基准测试显示,MoE 模型每次查询速度快 25.5%,成本低 20%,且质量相同,验证了理论上的成本节约。
将相同的 100 个提示从密集模型切换为 MoE 模型。成本降低 20%。速度快 25.5%。Token 输出不变。人人都说 MoE 模型更便宜。每个 Token 激活的参数更少,推理成本更低。但理论不是生产决策。于是进行了量化测试。测试使用了 100 个相同的提示。两个 Gemma 模型。通过 OpenRouter 进行了 200 次实时 API 调用。没有模拟,没有估算。密集模型:gemma-4-31b-it,MoE 模型:gemma-4-26b-a4b-it。MoE 胜出:平均延迟快 25.5%。每次查询便宜 20%。双方的 Token 输出相同,架构变更未影响质量。结论:理论成立。差距缩小的地方:在中位负载(P50)下,优势为 27.3%。在高压力(P95)下,优势降至 12.9%。两个模型在峰值负载下都触及相同的基础设施上限。如果你的服务水平协议(SLA)关注尾部延迟,承诺前请检查你自己的 P95。大规模场景:20% 的成本差异在每天 1 亿次查询下相当于每月 2,970 美元。每天 100 万次查询下为每月 30 美元。完全取决于你的流量。该基准测试由 Neo 构建并运行,你可以在自己的提示上运行。
相似文章
我针对 Gemma 4 和 Qwen 3.5 的 30B 级别模型进行了一项实验,旨在探究能耗与性能的权衡关系。换句话说,我想弄清楚哪些模型在输出同等质量的回答时会消耗更多的电能。
针对四款 30B 级别的稠密模型与 MoE 模型的实证研究显示,Gemma-4 26B MoE 在处理相同推理任务时,仅需 1.9–15 Wh 的能耗即可实现同等精度;而稠密模型及更大规模的 MoE 变体在该场景下的功耗最高可达 34 Wh。
个人评测后续:Gemma4 26B MoE(Q8)vs Qwen3.5 27B Dense vs Gemma4 31B Dense 对比
个人基准测试显示,Qwen3.5-27B Dense 与 Gemma4-31B Dense 在 37 个失败用例中修复率 100%,即使 8-bit 量化的 Gemma4-26B MoE 也望尘莫及,同时消耗更少 token 与更短挂钟时间。
Gemma 4 MTP 与 DFlash 在单张 H100 上:密集模型 vs MoE 模型结果
该基准测试将 Gemma 4 的多 Token 预测 (MTP) 与 z-lab 的 DFlash 推测性解码方法在单张 H100 GPU 上进行了比较,结果显示 MTP 在密集模型上更快,而 DFlash 在 MoE 模型上更快。
将 Gemma 4 31B 密集模型转变为原生 Gemma 4 加法型 MoE 模型
一个概念验证的训练脚本实现了将 Gemma 4 31B 密集模型转换为加法型 MoE 架构,灵感来自 JDONE-Research 的一个韩语专用微调模型。
Gemma 4 31B 的能力让我惊讶
一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。