EMO:用于涌现模块化的专家混合模型预训练

Hugging Face Daily Papers 论文

摘要

EMO 是一种专家混合模型(Mixture-of-Experts),通过将相似领域的词元与共享专家分组实现模块化部署,在保持与标准 MoE 相当的性能的同时,支持显著的专家剪枝(保留 25% 的专家即可保留 99% 的性能)且不会导致性能下降。

大型语言模型通常以整体系统形式部署,即使应用只需要狭窄的能力子集(如代码、数学或领域特定知识),也必须加载完整模型。专家混合模型(Mixture-of-Experts,MoE)看似提供了一种替代方案,可以仅激活每个输入的部分专家,但在实践中,将推理限制在特定领域的专家子集会导致严重的性能下降。这限制了其在内存受限环境中的实用性,尤其是随着模型变得更大、更稀疏。我们引入了 EMO,这是一种为模块化设计的 MoE——即专家子集的独立使用和组合——无需人工定义的先验。我们的核心思路是鼓励来自相似领域的词元依赖相似的专家。由于文档内的词元通常共享同一领域,EMO 将它们限制为从共享专家池中选择专家,同时允许不同文档使用不同的专家池。这种简单的约束使得专家分组能够在预训练阶段仅使用文档边界就能涌现出来。我们在一个包含 1T 词元的数据集上预训练了一个 1B 激活、14B 总参数的 EMO。作为完整模型,它的性能与标准 MoE 相当。关键在于,它支持选择性使用专家:仅保留 25%(12.5%)的专家只会导致 1%(3%)的绝对性能下降,而标准 MoE 在相同设置下则会失效。我们进一步发现,EMO 中的专家子集在语义层面(如数学或代码等领域)实现了专业化,这与标准 MoE 中观察到的低层次句法专业化形成对比。总体而言,我们的研究结果为大型稀疏模型的模块化、内存高效部署开辟了道路,并为可组合架构带来了新的机遇。
查看原文
查看缓存全文

缓存时间: 2026/05/09 02:30

论文页面 - EMO: 突发模块化的专家混合模型预训练

来源:https://huggingface.co/papers/2605.06663

摘要

EMO 是一个专家混合(Mixture-of-Experts)模型,通过将相似领域的 token 聚合到共享专家中实现模块化部署,在保持与标准 MoE 相当性能的同时,允许大幅剪枝专家而不会导致性能下降。

大型语言模型通常以单体系统部署,即使应用只需要狭窄的能力子集(如代码、数学或领域知识),也要求完整的模型。专家混合(MoEs)看似提供了一种替代方案,即仅激活每个输入的专家子集,但实际上,将推理限制在给定领域的专家子集会严重损害其性能。这限制了其在内存受限环境中的实用性,尤其是随着模型变得更大更稀疏。我们推出了 EMO,一种为模块化设计的 MoE——专家子集的独立使用和组合——无需人工定义的先验。我们的关键思路是鼓励来自相似领域的 token 依赖相似的专家。由于文档内的 token 通常共享一个领域,EMO限制它们从共享池中选择专家,同时允许不同文档使用不同的池。这个简单的约束使得在预训练期间,仅使用文档边界就能涌现出连贯的专家分组。我们在一个包含 1T token 的数据集上预训练了一个 1B 激活参数、14B 总参数的 EMO。作为完整模型,它达到了标准 MoE 的性能。关键的是,它支持选择性专家使用:仅保留 25%(12.5%)的专家只会导致 1%(3%)的绝对性能下降,而标准 MoE 在相同设置下会崩溃。我们进一步发现,EMO 中的专家子集在语义层面专业化(如数学或代码等领域),这与标准 MoE 中观察到的低层句法专业化形成对比。总的来说,我们的结果为大型稀疏模型的模块化、内存高效部署开辟了道路,并为可组合架构带来了新的机遇。

查看 arXiv 页面 (https://arxiv.org/abs/2605.06663)查看 PDF (https://arxiv.org/pdf/2605.06663)项目页面 (https://allenai.org/blog/emo)GitHub (https://github.com/allenai/EMO)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.06663)

在您的 agent 中获取此论文:

hf papers read 2605.06663

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 10

allenai/Emo_1b14b_1T 文本生成 • 14B • 更新于约 11 小时前 • 31 • 6 (https://huggingface.co/allenai/Emo_1b14b_1T)

allenai/EMO 文本生成 • 14B • 更新于约 10 小时前 • 3 (https://huggingface.co/allenai/EMO)

allenai/Emo_1b14b_130B 文本生成 • 14B • 更新于约 11 小时前 • 68 • 2 (https://huggingface.co/allenai/Emo_1b14b_130B)

allenai/StdMoE_1b4b_130B 文本生成 • 4B • 更新于约 11 小时前 • 23 • 2 (https://huggingface.co/allenai/StdMoE_1b4b_130B)

浏览引用此论文的 10 个模型 (https://huggingface.co/models?other=arxiv:2605.06663)

引用此论文的数据集 0

没有链接此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2605.06663 以便从此页面链接。

引用此论文的 Spaces 0

没有链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2605.06663 以便从此页面链接。

包含此论文的收藏集 1

相似文章

EMO:通过预训练混合专家实现涌现模块化

Hugging Face Blog

Allen AI 发布了 EMO 模型,这是一种混合专家模型,其中模块化结构从数据中自然涌现,使得仅使用 12.5% 的专家就能完成一项任务,同时保持接近完整模型的性能。

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。

ConMoE: 基于原型重分配的专家池整合实现MoE压缩

arXiv cs.AI

ConMoE提出了一种无需训练的混合专家模型压缩框架,通过选择一部分专家作为可重用原型,并确定性地将原始专家调用重新映射到这些原型,从而在不更新权重或微调的情况下减少内存占用。

AI2推出的新MoE模型:EMO

Reddit r/LocalLLaMA

AI2发布了EMO,一个混合专家(MoE)语言模型,总参数量14B,其中1B活跃参数,基于1万亿tokens训练,并采用文档级路由,即专家会按领域(如健康、新闻等)进行聚类。