中型MoE大语言模型
摘要
用户寻求中等规模的混合专家大语言模型(MoE)推荐(最高60B参数(float8)/110B参数(mxfp4)),列出了Qwen 3.5 35B、Gemma 4 A4B和Nemotron 3 Nano,并询问除此之外还有哪些小众选择。
目前有哪些值得使用的中等规模MoE模型(最高60B参数(float8)/110B参数(mxfp4))?据我所知,有Qwen 3.5 35B、Gemma 4 A4B、Nemotron 3 Nano。Qwen似乎在这一参数区间的模型性能中占据主导地位。DeepSeek v4 flash略高于该参数限制。还有更小众的选择吗?
相似文章
为什么A10b以下的MOE让我像在赌博
开发者报告称,像 qwen3.6-35b-A3b 这种“活跃参数量”较小的 MOE 模型,相比稠密的 qwen3.5-27b,一致性更低、需要更多引导,很难直接塞进智能体工作流。
@AlmustyFX: 混合专家模型轻量级解决方案正日益成熟。Ling-3.0-tiny 总参数规模为7.9B…
Ling-3.0-tiny 采用混合专家模型架构,总参数7.9B,但每次运行仅激活1.3B参数,从而降低计算开销,使Mac上的本地执行更加流畅。
总共124B参数但仅~5B活跃——这正是我想要的本地模型形态。低激活参数的MoE现在成为了本地最佳选择吗?
关于专家混合模型(MoE)的讨论,该模型总参数为124B但仅约5B活跃,表明低激活参数的MoE可能成为本地最佳选择。
我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测
一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。
在老款GTX 1080(8GB显存,128k上下文)上,约30B的MoE模型达到24+ tok/s的推理速度
一位开发者展示了如何使用llama.cpp,通过MoE卸载和TurboQuant KV缓存量化技术,在老款GTX 1080(8GB显存)上以128k上下文运行Qwen 3.6 35B-A3B和Gemma 4 26B-A4B等MoE模型,达到24+ tok/s的推理速度,并揭示了针对Gemma MTP投机解码的优化技巧。