Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
摘要
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。
查看缓存全文
缓存时间: 2026/05/26 02:41
论文页面 - Mix-MoE:通过混合MoE提升大语言模型的多语言机器翻译能力
来源:https://huggingface.co/papers/2605.24681 发布于5月23日
·
由 https://huggingface.co/liboaccn 提交
Bo Li (https://huggingface.co/liboaccn) 于5月25日
摘要
Mix-MoE是一种混合专家混合框架,通过将语言建模与翻译能力分离到由傅里叶变换增强路由的专门化专家组中,解决了多语言机器翻译中的参数干扰问题。
大语言模型(LLMs)在多语言机器翻译(https://huggingface.co/papers?q=multilingual%20machine%20translation)中展现出巨大潜力,即便在双语监督有限的情况下也不例外。然而,使用平行语料(https://huggingface.co/papers?q=parallel%20corpora)微调LLMs会带来重大挑战,即参数干扰(https://huggingface.co/papers?q=parameter%20interference)。为解决这些问题,我们提出了Mix-MoE,一种用于训练LLMs进行多语言机器翻译的混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)框架。我们的框架分两个不同阶段运行:(1)在单语语料(https://huggingface.co/papers?q=monolingual%20corpora)上进行基于MoE的后预训练(https://huggingface.co/papers?q=post-pretraining),以及(2)在平行语料(https://huggingface.co/papers?q=parallel%20corpora)上进行基于MoE的后预训练(https://huggingface.co/papers?q=post-pretraining)。关键在于,我们将MoE层划分为两个专门化组:语言模型专家(https://huggingface.co/papers?q=Language%20Model%20Experts)(LM Experts)和机器翻译专家(https://huggingface.co/papers?q=Machine%20Translation%20Experts)(MT Experts)。LM Experts旨在捕获并保留预训练LLM学到的单语知识。而MT Experts则专门训练以获取并存储双语翻译知识。此外,为促进这些专门化专家之间的有效交互并充分利用文本中潜在的结构模式,我们引入了一种由模型表示中提取的傅里叶变换(https://huggingface.co/papers?q=Fourier%20Transform)特征增强的路由机制(https://huggingface.co/papers?q=routing%20mechanism)。实验结果表明,Mix-MoE在多语言机器翻译中表现卓越,显著优于现有基线,并在缓解参数干扰(https://huggingface.co/papers?q=parameter%20interference)方面取得了显著进展。
查看 arXiv 页面(https://arxiv.org/abs/2605.24681)查看 PDF(https://arxiv.org/pdf/2605.24681)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.24681)
在您的 agent 中获取本文:
hf papers read 2605\.24681
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接到本文
在模型 README.md 中引用 arxiv.org/abs/2605.24681 即可从本页链接。
引用本文的数据集 0
没有数据集链接到本文
在数据集 README.md 中引用 arxiv.org/abs/2605.24681 即可从本页链接。
引用本文的 Spaces 0
没有 Space 链接到本文
在 Space README.md 中引用 arxiv.org/abs/2605.24681 即可从本页链接。
包含本文的收藏集 0
没有收藏集包含本文
将本文添加至 收藏集(https://huggingface.co/new-collection)即可从本页链接。
相似文章
面向混合专家模型中一致专家选择的多层级上下文建模
本文提出了多层级上下文融合MoE(MCF-MOE)框架,通过集成跨层语义聚合和局部词元级交互,提升了混合专家模型中的路由一致性,在语言建模和理解基准测试上优于强基线。
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。
MobileMoE:扩展端侧混合专家模型
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。
XPERT:通过专家知识迁移实现语言模型的高效训练
本文介绍了 XPERT,这是一个从预训练混合专家(MoE)语言模型中提取和复用专家知识的框架,旨在提高下游模型的训练效率和性能。
少即是MoE:裁剪领域专用语言模型中的专家
本文介绍了Fisher-MoE,一种通过使用Fisher重要性裁剪FFN层中间维度来压缩混合专家模型的方法,实现了45%的权重内存减少和21%的吞吐量提升,且未造成显著的能力损失。