对密集模型 gemma-4-31b-it 与 MoE 模型 gemma-4-26b-a4b-it 进行基准测试,验证成本降低在实际中是否成立

Reddit r/AI_Agents 新闻

摘要

一项对 Gemma 密集模型(31B)与 MoE 模型(26B)的实际基准测试显示,MoE 模型每次查询速度快 25.5%,成本低 20%,且质量相同,验证了理论上的成本节约。

将相同的 100 个提示从密集模型切换为 MoE 模型。成本降低 20%。速度快 25.5%。Token 输出不变。人人都说 MoE 模型更便宜。每个 Token 激活的参数更少,推理成本更低。但理论不是生产决策。于是进行了量化测试。测试使用了 100 个相同的提示。两个 Gemma 模型。通过 OpenRouter 进行了 200 次实时 API 调用。没有模拟,没有估算。密集模型:gemma-4-31b-it,MoE 模型:gemma-4-26b-a4b-it。MoE 胜出:平均延迟快 25.5%。每次查询便宜 20%。双方的 Token 输出相同,架构变更未影响质量。结论:理论成立。差距缩小的地方:在中位负载(P50)下,优势为 27.3%。在高压力(P95)下,优势降至 12.9%。两个模型在峰值负载下都触及相同的基础设施上限。如果你的服务水平协议(SLA)关注尾部延迟,承诺前请检查你自己的 P95。大规模场景:20% 的成本差异在每天 1 亿次查询下相当于每月 2,970 美元。每天 100 万次查询下为每月 30 美元。完全取决于你的流量。该基准测试由 Neo 构建并运行,你可以在自己的提示上运行。
查看原文

相似文章

我针对 Gemma 4 和 Qwen 3.5 的 30B 级别模型进行了一项实验,旨在探究能耗与性能的权衡关系。换句话说,我想弄清楚哪些模型在输出同等质量的回答时会消耗更多的电能。

Reddit r/LocalLLaMA

针对四款 30B 级别的稠密模型与 MoE 模型的实证研究显示,Gemma-4 26B MoE 在处理相同推理任务时,仅需 1.9–15 Wh 的能耗即可实现同等精度;而稠密模型及更大规模的 MoE 变体在该场景下的功耗最高可达 34 Wh。

Gemma 4 31B 的能力让我惊讶

Reddit r/LocalLLaMA

一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。