总共124B参数但仅~5B活跃——这正是我想要的本地模型形态。低激活参数的MoE现在成为了本地最佳选择吗?
摘要
关于专家混合模型(MoE)的讨论,该模型总参数为124B但仅约5B活跃,表明低激活参数的MoE可能成为本地最佳选择。
暂无内容
相似文章
MoE模型中活跃参数数量是否有上限?
关于混合专家(MoE)模型中活跃参数数量限制的讨论,质疑是否存在一个活跃参数数量的上限,超过该上限后质量不再提升。
中型MoE大语言模型
用户寻求中等规模的混合专家大语言模型(MoE)推荐(最高60B参数(float8)/110B参数(mxfp4)),列出了Qwen 3.5 35B、Gemma 4 A4B和Nemotron 3 Nano,并询问除此之外还有哪些小众选择。
为什么A10b以下的MOE让我像在赌博
开发者报告称,像 qwen3.6-35b-A3b 这种“活跃参数量”较小的 MOE 模型,相比稠密的 qwen3.5-27b,一致性更低、需要更多引导,很难直接塞进智能体工作流。
LongCat-2.0,大规模MoE模型,总参数量1.6万亿,激活参数480亿
LongCat-2.0是一个大规模混合专家(MoE)模型,总参数量1.6万亿,激活参数量480亿。
@sheriyuo: 仅3B活跃参数的35B参数MoE代理模型,声称通过后训练即可匹配或超越100B级模型
一个35B参数的MoE模型,仅3B活跃参数,通过后训练强化学习匹配或超越100B级模型,实现显著效率提升。