中型MoE大语言模型

Reddit r/LocalLLaMA 新闻

摘要

用户寻求中等规模的混合专家大语言模型(MoE)推荐(最高60B参数(float8)/110B参数(mxfp4)),列出了Qwen 3.5 35B、Gemma 4 A4B和Nemotron 3 Nano,并询问除此之外还有哪些小众选择。

目前有哪些值得使用的中等规模MoE模型(最高60B参数(float8)/110B参数(mxfp4))?据我所知,有Qwen 3.5 35B、Gemma 4 A4B、Nemotron 3 Nano。Qwen似乎在这一参数区间的模型性能中占据主导地位。DeepSeek v4 flash略高于该参数限制。还有更小众的选择吗?
查看原文

相似文章

为什么A10b以下的MOE让我像在赌博

Reddit r/LocalLLaMA

开发者报告称,像 qwen3.6-35b-A3b 这种“活跃参数量”较小的 MOE 模型,相比稠密的 qwen3.5-27b,一致性更低、需要更多引导,很难直接塞进智能体工作流。

我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测

Reddit r/LocalLLaMA

一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。