UniMoMo:基于专家合并的大型推荐模型MoE加速

Hugging Face Daily Papers 论文

摘要

UniMoMo通过基于功能行为和路由流量合并专家来压缩基于MoE的推荐模型,在加速推理的同时保持质量。

稀疏混合专家(MoE)层通过条件计算扩展了推荐模型的容量,但训练后的检查点仍然会存储并路由其完整的专家库。我们研究一个部署问题:在明确的专家预算下,将该检查点转换为更小的标准MoE,而无需添加压缩专用的在线模块。为此,我们提出UniMoMo,一种将后训练压缩框架形式化为约束图粗化问题的方法。UniMoMo不依赖参数距离,而是基于功能相似性对专家进行分组,使用未标记的校准集来度量专家对共享推荐状态的响应相似程度。为防止性能下降,我们引入了一种层自适应保护机制,根据路由暴露度限制高流量专家的合并。在包含2、4和6个MoE块的Amazon Beauty、KuaiRec和TenRec数据集上,最终的4专家检查点相对于源模型取得了99.92%--102.30%的五次运行平均NDCG@10比值,以及实测A100加速比1.28倍--1.63倍。激进的2专家top-1运行点获得了98.36%--104.24%的比值和1.47倍--2.21倍的加速比。这些端到端结果评估了完整的转换与适配流程,表明训练好的推荐MoE可以在多种服务预算下导出。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:19

论文页面 - UniMoMo:基于专家合并的大型推荐模型MoE加速

来源:https://huggingface.co/papers/2608.08627

🚀UniMoMo,一种用于压缩基于MoE的推荐模型的实用方法。

其核心思想简单而有效:不是基于参数相似性合并专家,而是关注专家在校准数据上的实际行为以及每个专家获得的路由流量。

我特别喜欢的几点:

🔹功能级专家相似性——通过专家在共享隐藏状态上的输出来比较专家,而不仅仅是权重距离。

🔹流量感知合并——在聚类过程中保护高频使用的专家,降低损害重要路由路径的风险。

🔹校准感知重建——合并SwiGLU专家后,UniMoMo使用最小二乘校正来更好地恢复原始中间激活。

🔹无额外服务复杂度——最终压缩模型仍然是标准的top-(k) MoE,因此不需要特殊的推理时模块。

结果也非常出色:将8个专家压缩到4个专家可以在保留几乎所有推荐质量的同时实现显著的推理加速,而更激进的8→2/top-1设置则进一步提升了加速效果。⚡

总的来说,这是一个很好的例子,展示了如何让MoE压缩变得更加功能感知、路由感知和部署友好。如果你从事大规模推荐或MoE效率方面的工作,值得一看。👀

相似文章

ConMoE: 基于原型重分配的专家池整合实现MoE压缩

arXiv cs.AI

ConMoE提出了一种无需训练的混合专家模型压缩框架,通过选择一部分专家作为可重用原型,并确定性地将原始专家调用重新映射到这些原型,从而在不更新权重或微调的情况下减少内存占用。

MobileMoE:扩展端侧混合专家模型

Hugging Face Daily Papers

MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。