标签
一项对 Gemma 密集模型(31B)与 MoE 模型(26B)的实际基准测试显示,MoE 模型每次查询速度快 25.5%,成本低 20%,且质量相同,验证了理论上的成本节约。
谷歌发布了其Gemma 4模型系列的QAT(4位)版本,包括31B Dense和26B MoE模型,进一步推动了开源AI。