MobileMoE:扩展端侧混合专家模型
摘要
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。
查看缓存全文
缓存时间: 2026/05/27 06:48
论文页面 - MobileMoE: Scaling On-Device Mixture of Experts
来源:https://huggingface.co/papers/2605.27358
摘要
MobileMoE 引入了高效的设备端混合专家语言模型,参数量低于十亿级,与密集基线和现有的 MoE 模型相比,实现了更优的性能和效率。
混合专家模型(Mixture-of-Experts,https://huggingface.co/papers?q=Mixture-of-Experts,MoE)已成为千亿参数语言模型的事实标准架构,然而其在十亿级以下参数规模、面向设备端部署(https://huggingface.co/papers?q=on-device%20deployment)的优势尚未得到充分探索。为填补这一空白,我们提出了 MobileMoE——一系列面向设备的 MoE 语言模型,其激活参数少于十亿(0.3–0.9B 活跃参数,1.3–5.3B 总参数),为设备端大语言模型建立了新的帕累托前沿。我们首先推导出面向设备的 MoE 缩放定律(https://huggingface.co/papers?q=scaling%20law),该定律在移动内存与计算约束下联合优化 MoE 架构,并确定了设备端的最佳平衡点——中等稀疏度配合细粒度与共享专家(https://huggingface.co/papers?q=shared%20experts),此设计同时满足内存与计算最优。基于所推导的架构,我们采用四阶段训练方案训练 MobileMoE,涵盖预训练(https://huggingface.co/papers?q=pre-training)、中期训练、指令微调(https://huggingface.co/papers?q=instruction%20fine-tuning)和量化感知训练(https://huggingface.co/papers?q=quantization-aware%20training),所有阶段均使用开源数据集。在 14 个基准测试中,MobileMoE 达到或超越了领先的设备端密集大语言模型,同时推理 FLOPs(https://huggingface.co/papers?q=inference%20FLOPs)减少 2–4 倍;并达到或超越了当前最先进的 MoE 模型 OLMoE-1B-7B,参数量最多减少 60%。为打通移动部署的最后一公里,我们首次在商用智能手机上实现了高效的 MoE 推理,并提供了全面的设备端性能分析。在可比的 INT4 权重内存(https://huggingface.co/papers?q=INT4%20weight%20memory)下,MobileMoE-S 的预填充(https://huggingface.co/papers?q=prefill)速度比密集基线 MobileLLM-Pro 快 1.8–3.8 倍,解码(https://huggingface.co/papers?q=decode)速度快 2.2–3.4 倍。
查看 arXiv 页面(https://arxiv.org/abs/2605.27358)查看 PDF(https://arxiv.org/pdf/2605.27358)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.27358)
在您的智能体中使用此论文:
hf papers read 2605.27358
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
无模型关联本论文
请在模型 README.md 中引用 arxiv.org/abs/2605.27358 以在此页面建立链接。
引用本论文的数据集0
无数据集关联本论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.27358 以在此页面建立链接。
引用本论文的空间0
无 Space 关联本论文
请在 Space README.md 中引用 arxiv.org/abs/2605.27358 以在此页面建立链接。
包含本论文的收藏集0
无收藏集包含本论文
请将本论文添加至收藏集(https://huggingface.co/new-collection)以在此页面建立链接。
相似文章
除了更快之外,MoE 模型的意义何在?
讨论混合专家(MoE)模型在速度之外相对于密集模型的优势,考虑内存限制和扩展限制。
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。
XPERT:通过专家知识迁移实现语言模型的高效训练
本文介绍了 XPERT,这是一个从预训练混合专家(MoE)语言模型中提取和复用专家知识的框架,旨在提高下游模型的训练效率和性能。
FlexMoE: 面向MoE语言模型的一体通用嵌套式专家内剪枝
FlexMoE提出了一种面向MoE语言模型的一体通用嵌套式专家内部剪枝方法,能够在单次训练中生成多个可部署的子网络,且性能损失极小。