@no_stp_on_snek: Dense 与 MOE - MOE 能否跟上 Dense 的质量?源于一个朋友遇到的问题。他有一个 agentic 运行任务…

X AI KOLs Timeline 新闻

摘要

对稠密模型和 Mixture of Experts (MoE) 模型进行比较,以评估 MoE 是否能在代理任务中匹配稠密模型的质量,基于多种模型的基准测试结果显示性能指标。

Dense 与 MOE - MOE 能否跟上 Dense 的质量? 源于一个朋友遇到的问题。他有一个使用 gemma4 的 agentic 运行任务需要 5 小时。对他来说有点慢。他正试图决定是否要获取一个 Spark 来加速,但不能牺牲质量。那么,拥有更少活跃参数的 MOE 模型能否真正跟上? 所以我拿了他的独立测试,并在一堆模型上运行,包括 MOE 和 Dense 模型。Ornith 1.5 是我比较的第一个接近的模型,因此重点关注它。 它足够接近,可以开始在他的流程中测试,但不确定最终结果是否真的能产生与 gemma4 相等的质量,因为在失败中存在明显差异,这就引出了问题:有多少通过的结果也存在差异? 那么他应该使用 MOE 而不是 Dense 吗?这取决于你的用例。回答一部分问题来衡量“质量”是不够的。他需要进行完整运行,并在多次迭代中比较输出。 在我测试 Ornith 之后,我测试了一堆其他模型。如你所见,可靠的老牌 qwen3-Code-Next(以及 qwen 系列表现相当不错: 完整 3,700 个问题运行结果 Gemma 4 31B Turbo3 3,447–3,459 | 93.16–93.49% Qwen3-Coder-Next Q8 3,444 | 93.08% Qwen3.8-27B FP8 3,442 | 93.03% Gemma 4 Turbo4 3,437 | 92.89% Ornith 1.5 35B-A3B Q8 3,413 | 92.24% Nemotron 3 Super 120B-A12B NVFP4 3,407 | 92.08% Ornith abliterated NVFP4 3,324 | 89.84% DeepSeek V4 Flash abliterated Headroom128 1,958 | 52.92% 注意:问题是一个私有的精选列表,应该有可判断的答案,要么正确要么不正确。
查看原文
查看缓存全文

缓存时间: 2026/08/26 03:32

密集模型 vs MOE 模型——MOE 能否保持与密集模型相当的质量?

起因是一位朋友遇到的问题:他运行一个基于 Gemma 4 的智能体任务需要 5 小时,这让他觉得有点慢。他正考虑是否使用 Spark 模型来加速,但不想牺牲质量。因此,他想知道 MOE 模型(尽管活跃参数较少)是否能真正保持同等质量?

于是我参考了他的独立测试结果,对比了一系列模型,包括 MOE 和密集模型。Ornith 1.5 是第一个结果相近的模型,因此我们重点对比了它。

该模型表现接近,足以在他现有的流程中开始测试,但尚不确定其最终产出质量是否真能达到 Gemma 4 的水平,因为失败案例中存在明显差异,这引出了一个问题:那些通过测试的案例中,又有多少存在类似的差异?

那么,他应该选择 MOE 模型还是密集模型?这取决于具体使用场景。仅仅通过回答一部分问题来衡量“质量”是不够的。他需要进行完整的全流程运行,并在多次迭代中比较输出结果。

在测试 Ornith 之后,我又测试了许多其他模型。如您所见,经典的 Qwen3-Code-Next(以及整个 Qwen 系列表现)相当出色:

完整的 3,700 题测试结果

模型得分准确率
Gemma 4 31B Turbo33,447–3,45993.16–93.49%
Qwen3-Coder-Next Q83,44493.08%
Qwen3.8-27B FP83,44293.03%
Gemma 4 Turbo43,43792.89%
Ornith 1.5 35B-A3B Q83,41392.24%
Nemotron 3 Super 120B-A12B NVFP43,40792.08%
Ornith (abliterated) NVFP43,32489.84%
DeepSeek V4 Flash (abliterated Headroom128)1,95852.92%

注:题目来自一个私有精选列表,旨在考察可判断为“正确”或“错误”的答案。

相似文章

MobileMoE:扩展端侧混合专家模型

Hugging Face Daily Papers

MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。