moe-vs-dense

标签

Cards List
#moe-vs-dense

恕我无知,但27B模型怎么会比397B更强?

Reddit r/LocalLLaMA · 2026-04-22

用户质疑Qwen的27B稠密模型为何能胜过其397B MoE版本,引发关于MoE效率与稠密模型质量的讨论。

0 人收藏 0 人点赞
#moe-vs-dense

我针对 Gemma 4 和 Qwen 3.5 的 30B 级别模型进行了一项实验,旨在探究能耗与性能的权衡关系。换句话说,我想弄清楚哪些模型在输出同等质量的回答时会消耗更多的电能。

Reddit r/LocalLLaMA · 2026-04-21

针对四款 30B 级别的稠密模型与 MoE 模型的实证研究显示,Gemma-4 26B MoE 在处理相同推理任务时,仅需 1.9–15 Wh 的能耗即可实现同等精度;而稠密模型及更大规模的 MoE 变体在该场景下的功耗最高可达 34 Wh。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈