UniMoMo:基于专家合并的大型推荐模型MoE加速
摘要
UniMoMo通过基于功能行为和路由流量合并专家来压缩基于MoE的推荐模型,在加速推理的同时保持质量。
查看缓存全文
缓存时间: 2026/08/12 08:19
论文页面 - UniMoMo:基于专家合并的大型推荐模型MoE加速
来源:https://huggingface.co/papers/2608.08627
🚀UniMoMo,一种用于压缩基于MoE的推荐模型的实用方法。
其核心思想简单而有效:不是基于参数相似性合并专家,而是关注专家在校准数据上的实际行为以及每个专家获得的路由流量。
我特别喜欢的几点:
🔹功能级专家相似性——通过专家在共享隐藏状态上的输出来比较专家,而不仅仅是权重距离。
🔹流量感知合并——在聚类过程中保护高频使用的专家,降低损害重要路由路径的风险。
🔹校准感知重建——合并SwiGLU专家后,UniMoMo使用最小二乘校正来更好地恢复原始中间激活。
🔹无额外服务复杂度——最终压缩模型仍然是标准的top-(k) MoE,因此不需要特殊的推理时模块。
结果也非常出色:将8个专家压缩到4个专家可以在保留几乎所有推荐质量的同时实现显著的推理加速,而更激进的8→2/top-1设置则进一步提升了加速效果。⚡
总的来说,这是一个很好的例子,展示了如何让MoE压缩变得更加功能感知、路由感知和部署友好。如果你从事大规模推荐或MoE效率方面的工作,值得一看。👀
相似文章
ConMoE: 基于原型重分配的专家池整合实现MoE压缩
ConMoE提出了一种无需训练的混合专家模型压缩框架,通过选择一部分专家作为可重用原型,并确定性地将原始专家调用重新映射到这些原型,从而在不更新权重或微调的情况下减少内存占用。
先共享,再路由剩余:一种面向Token自适应MoE计算的统一框架
本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。
PuzzleMoE:通过稀疏专家合并和位打包推理实现大型混合专家模型的高效压缩
PuzzleMoE 提出了一种成对双掩码专家合并算法和位级打包技术,用于压缩大型混合专家模型,在保持性能的同时减少存储并加速推理。
MobileMoE:扩展端侧混合专家模型
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。
FlexMoE: 面向MoE语言模型的一体通用嵌套式专家内剪枝
FlexMoE提出了一种面向MoE语言模型的一体通用嵌套式专家内部剪枝方法,能够在单次训练中生成多个可部署的子网络,且性能损失极小。