MoE模型中活跃参数数量是否有上限?

Reddit r/LocalLLaMA 新闻

摘要

关于混合专家(MoE)模型中活跃参数数量限制的讨论,质疑是否存在一个活跃参数数量的上限,超过该上限后质量不再提升。

你好。我们最近见到了一些总参数量达到1T和1.6T的MoE模型。我原本对总参数与活跃参数比例的预期大约是10:1,这样我们可以在更小、'真正本地化'的模型中节省资源。然而,这些新的巨型模型相对于其规模,活跃参数数量要小得多(大约40B?)。这让我思考。是采用了新的架构吗?还是说超过一定数量后增加活跃参数就没有意义了?我们会不会永远看不到像2T/A200B这样的MoE模型?MoE模型中是否存在一个上限,超过这个上限后增加活跃参数不会改善结果质量?谢谢
查看原文

相似文章

输出稀释:MoE 模型中冗余但脆弱的表示

arXiv cs.LG

本文揭示,Mixture-of-Experts 模型在探测中编码道德内容的鲁棒性与密集模型相当,但由于输出稀释,它们更为脆弱。输出稀释是指聚合的专家输出稀释了信号,使表示容易受到噪声的影响。