composable-architectures

标签

Cards List
#composable-architectures

EMO:用于涌现模块化的专家混合模型预训练

Hugging Face Daily Papers · 2026-05-07 缓存

EMO 是一种专家混合模型(Mixture-of-Experts),通过将相似领域的词元与共享专家分组实现模块化部署,在保持与标准 MoE 相当的性能的同时,支持显著的专家剪枝(保留 25% 的专家即可保留 99% 的性能)且不会导致性能下降。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈