EMO:用于涌现模块化的专家混合模型预训练
摘要
EMO 是一种专家混合模型(Mixture-of-Experts),通过将相似领域的词元与共享专家分组实现模块化部署,在保持与标准 MoE 相当的性能的同时,支持显著的专家剪枝(保留 25% 的专家即可保留 99% 的性能)且不会导致性能下降。
查看缓存全文
缓存时间: 2026/05/09 02:30
论文页面 - EMO: 突发模块化的专家混合模型预训练
来源:https://huggingface.co/papers/2605.06663
摘要
EMO 是一个专家混合(Mixture-of-Experts)模型,通过将相似领域的 token 聚合到共享专家中实现模块化部署,在保持与标准 MoE 相当性能的同时,允许大幅剪枝专家而不会导致性能下降。
大型语言模型通常以单体系统部署,即使应用只需要狭窄的能力子集(如代码、数学或领域知识),也要求完整的模型。专家混合(MoEs)看似提供了一种替代方案,即仅激活每个输入的专家子集,但实际上,将推理限制在给定领域的专家子集会严重损害其性能。这限制了其在内存受限环境中的实用性,尤其是随着模型变得更大更稀疏。我们推出了 EMO,一种为模块化设计的 MoE——专家子集的独立使用和组合——无需人工定义的先验。我们的关键思路是鼓励来自相似领域的 token 依赖相似的专家。由于文档内的 token 通常共享一个领域,EMO限制它们从共享池中选择专家,同时允许不同文档使用不同的池。这个简单的约束使得在预训练期间,仅使用文档边界就能涌现出连贯的专家分组。我们在一个包含 1T token 的数据集上预训练了一个 1B 激活参数、14B 总参数的 EMO。作为完整模型,它达到了标准 MoE 的性能。关键的是,它支持选择性专家使用:仅保留 25%(12.5%)的专家只会导致 1%(3%)的绝对性能下降,而标准 MoE 在相同设置下会崩溃。我们进一步发现,EMO 中的专家子集在语义层面专业化(如数学或代码等领域),这与标准 MoE 中观察到的低层句法专业化形成对比。总的来说,我们的结果为大型稀疏模型的模块化、内存高效部署开辟了道路,并为可组合架构带来了新的机遇。
查看 arXiv 页面 (https://arxiv.org/abs/2605.06663)查看 PDF (https://arxiv.org/pdf/2605.06663)项目页面 (https://allenai.org/blog/emo)GitHub (https://github.com/allenai/EMO)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.06663)
在您的 agent 中获取此论文:
hf papers read 2605.06663
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 10
allenai/Emo_1b14b_1T 文本生成 • 14B • 更新于约 11 小时前 • 31 • 6 (https://huggingface.co/allenai/Emo_1b14b_1T)
allenai/EMO 文本生成 • 14B • 更新于约 10 小时前 • 3 (https://huggingface.co/allenai/EMO)
allenai/Emo_1b14b_130B 文本生成 • 14B • 更新于约 11 小时前 • 68 • 2 (https://huggingface.co/allenai/Emo_1b14b_130B)
allenai/StdMoE_1b4b_130B 文本生成 • 4B • 更新于约 11 小时前 • 23 • 2 (https://huggingface.co/allenai/StdMoE_1b4b_130B)
浏览引用此论文的 10 个模型 (https://huggingface.co/models?other=arxiv:2605.06663)
引用此论文的数据集 0
没有链接此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2605.06663 以便从此页面链接。
引用此论文的 Spaces 0
没有链接此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2605.06663 以便从此页面链接。
包含此论文的收藏集 1
相似文章
EMO:通过预训练混合专家实现涌现模块化
Allen AI 发布了 EMO 模型,这是一种混合专家模型,其中模块化结构从数据中自然涌现,使得仅使用 12.5% 的专家就能完成一项任务,同时保持接近完整模型的性能。
混合专家模型中的涌现式模块化(8 分钟阅读)
Ai2 发布了 EMO,一个 14B 参数的混合专家语言模型,训练用于发展涌现式模块化。它允许在特定任务中使用一小部分专家,同时保持接近全模型性能。
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。
ConMoE: 基于原型重分配的专家池整合实现MoE压缩
ConMoE提出了一种无需训练的混合专家模型压缩框架,通过选择一部分专家作为可重用原型,并确定性地将原始专家调用重新映射到这些原型,从而在不更新权重或微调的情况下减少内存占用。
AI2推出的新MoE模型:EMO
AI2发布了EMO,一个混合专家(MoE)语言模型,总参数量14B,其中1B活跃参数,基于1万亿tokens训练,并采用文档级路由,即专家会按领域(如健康、新闻等)进行聚类。