MobileMoE:扩展端侧混合专家模型

Hugging Face Daily Papers 论文

摘要

MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。

混合专家模型(MoE)已成为千亿参数语言模型的事实标准架构,但其在十亿参数以下规模、面向端侧部署的优势仍鲜有探索。为填补这一空白,我们提出了 MobileMoE,一系列端侧 MoE 语言模型,其活跃参数低于十亿(0.3-0.9B 活跃参数,总参数 1.3-5.3B),为端侧大语言模型建立了新的帕累托前沿。我们首先制定了端侧 MoE 缩放定律,在移动内存和计算约束下联合优化 MoE 架构,找到了端侧的甜点——具有细粒度和共享专家的中等稀疏度——同时实现内存和计算最优。基于推导出的架构,我们通过四阶段流程训练 MobileMoE,涵盖预训练、中期训练、指令微调和量化感知训练,全部基于开源数据集。在 14 个基准测试中,MobileMoE 达到或超越领先的端侧密集大语言模型,推理 FLOPs 减少 2-4 倍,并以最多减少 60% 的参数达到或超越最先进的 MoE 模型 OLMoE-1B-7B。为打通移动部署的最后一公里,我们首次在商用智能手机上提供了高效的 MoE 推理,并进行了全面的端侧性能剖析。在相当的 INT4 权重内存下,MobileMoE-S 相比密集基线模型 MobileLLM-Pro,预填充速度提升 1.8-3.8 倍,解码速度提升 2.2-3.4 倍。
查看原文
查看缓存全文

缓存时间: 2026/05/27 06:48

论文页面 - MobileMoE: Scaling On-Device Mixture of Experts

来源:https://huggingface.co/papers/2605.27358

摘要

MobileMoE 引入了高效的设备端混合专家语言模型,参数量低于十亿级,与密集基线和现有的 MoE 模型相比,实现了更优的性能和效率。

混合专家模型(Mixture-of-Experts,https://huggingface.co/papers?q=Mixture-of-Experts,MoE)已成为千亿参数语言模型的事实标准架构,然而其在十亿级以下参数规模、面向设备端部署(https://huggingface.co/papers?q=on-device%20deployment)的优势尚未得到充分探索。为填补这一空白,我们提出了 MobileMoE——一系列面向设备的 MoE 语言模型,其激活参数少于十亿(0.3–0.9B 活跃参数,1.3–5.3B 总参数),为设备端大语言模型建立了新的帕累托前沿。我们首先推导出面向设备的 MoE 缩放定律(https://huggingface.co/papers?q=scaling%20law),该定律在移动内存与计算约束下联合优化 MoE 架构,并确定了设备端的最佳平衡点——中等稀疏度配合细粒度与共享专家(https://huggingface.co/papers?q=shared%20experts),此设计同时满足内存与计算最优。基于所推导的架构,我们采用四阶段训练方案训练 MobileMoE,涵盖预训练(https://huggingface.co/papers?q=pre-training)、中期训练、指令微调(https://huggingface.co/papers?q=instruction%20fine-tuning)和量化感知训练(https://huggingface.co/papers?q=quantization-aware%20training),所有阶段均使用开源数据集。在 14 个基准测试中,MobileMoE 达到或超越了领先的设备端密集大语言模型,同时推理 FLOPs(https://huggingface.co/papers?q=inference%20FLOPs)减少 2–4 倍;并达到或超越了当前最先进的 MoE 模型 OLMoE-1B-7B,参数量最多减少 60%。为打通移动部署的最后一公里,我们首次在商用智能手机上实现了高效的 MoE 推理,并提供了全面的设备端性能分析。在可比的 INT4 权重内存(https://huggingface.co/papers?q=INT4%20weight%20memory)下,MobileMoE-S 的预填充(https://huggingface.co/papers?q=prefill)速度比密集基线 MobileLLM-Pro 快 1.8–3.8 倍,解码(https://huggingface.co/papers?q=decode)速度快 2.2–3.4 倍。

查看 arXiv 页面(https://arxiv.org/abs/2605.27358)查看 PDF(https://arxiv.org/pdf/2605.27358)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.27358)

在您的智能体中使用此论文:

hf papers read 2605.27358

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

无模型关联本论文

请在模型 README.md 中引用 arxiv.org/abs/2605.27358 以在此页面建立链接。

引用本论文的数据集0

无数据集关联本论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.27358 以在此页面建立链接。

引用本论文的空间0

无 Space 关联本论文

请在 Space README.md 中引用 arxiv.org/abs/2605.27358 以在此页面建立链接。

包含本论文的收藏集0

无收藏集包含本论文

请将本论文添加至收藏集(https://huggingface.co/new-collection)以在此页面建立链接。

相似文章

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。