AMD Instella-MoE-16B-A3B
摘要
AMD 在 HuggingFace 上发布了一个开源的混合专家模型 Instella-MoE-16B-A3B。
https://huggingface.co/amd/Instella-MoE-16B-A3B-Think 我在浏览 HuggingFace 时发现了这个模型,似乎是一天前上传的,想着在这里分享一下。我还没有尝试过,但很高兴看到 AMD 加入开源模型的行列。
相似文章
amd/Instella-MoE-16B-A3B-Think
AMD发布Instella-MoE,一个完全开源的160亿参数混合专家语言模型,其中28亿参数被激活,从头使用AMD Instinct GPU训练,并发布了从预训练到强化学习的所有训练阶段。
tencent/Hy3
腾讯发布了Hy3,这是一个295B参数的混合专家模型,拥有21B活跃参数,基于Apache 2.0许可证,性能优于相同规模模型,并能与参数规模大2-5倍的开源模型相抗衡。
MobileMoE:扩展端侧混合专家模型
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。
混合专家模型中的涌现式模块化(8 分钟阅读)
Ai2 发布了 EMO,一个 14B 参数的混合专家语言模型,训练用于发展涌现式模块化。它允许在特定任务中使用一小部分专家,同时保持接近全模型性能。
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。