Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译

Hugging Face Daily Papers 论文

摘要

Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。

大语言模型在多语言机器翻译中展现出巨大潜力,即使仅依靠有限的双语监督。然而,使用平行语料库微调大语言模型带来了主要挑战,即参数干扰。为了解决这些问题,我们提出了Mix-MoE,一种混合专家混合框架,旨在训练大语言模型进行多语言机器翻译。我们的框架分两个不同阶段运行:(1)在单语语料库上进行使用MoE的后预训练,(2)在平行语料库上进行使用MoE的后预训练。关键的是,我们将MoE层分为两个专门的组:语言模型专家和机器翻译专家。语言模型专家旨在捕获和保留预训练大语言模型学到的单语知识。另一方面,机器翻译专家则专门训练以获取和存储双语翻译知识。此外,为了促进这些专门专家之间的有效交互并利用文本中潜在的结构模式,我们引入了一种路由机制,该机制通过从模型表示中提取的傅里叶变换特征进行增强。实验结果表明,Mix-MoE在多语言机器翻译中表现出色,显著优于现有基线,并在缓解参数干扰方面取得了显著进展。
查看原文
查看缓存全文

缓存时间: 2026/05/26 02:41

论文页面 - Mix-MoE:通过混合MoE提升大语言模型的多语言机器翻译能力

来源:https://huggingface.co/papers/2605.24681 发布于5月23日

·

由 https://huggingface.co/liboaccn 提交

Bo Li (https://huggingface.co/liboaccn) 于5月25日

摘要

Mix-MoE是一种混合专家混合框架,通过将语言建模与翻译能力分离到由傅里叶变换增强路由的专门化专家组中,解决了多语言机器翻译中的参数干扰问题。

大语言模型(LLMs)在多语言机器翻译(https://huggingface.co/papers?q=multilingual%20machine%20translation)中展现出巨大潜力,即便在双语监督有限的情况下也不例外。然而,使用平行语料(https://huggingface.co/papers?q=parallel%20corpora)微调LLMs会带来重大挑战,即参数干扰(https://huggingface.co/papers?q=parameter%20interference)。为解决这些问题,我们提出了Mix-MoE,一种用于训练LLMs进行多语言机器翻译的混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)框架。我们的框架分两个不同阶段运行:(1)在单语语料(https://huggingface.co/papers?q=monolingual%20corpora)上进行基于MoE的后预训练(https://huggingface.co/papers?q=post-pretraining),以及(2)在平行语料(https://huggingface.co/papers?q=parallel%20corpora)上进行基于MoE的后预训练(https://huggingface.co/papers?q=post-pretraining)。关键在于,我们将MoE层划分为两个专门化组:语言模型专家(https://huggingface.co/papers?q=Language%20Model%20Experts)(LM Experts)和机器翻译专家(https://huggingface.co/papers?q=Machine%20Translation%20Experts)(MT Experts)。LM Experts旨在捕获并保留预训练LLM学到的单语知识。而MT Experts则专门训练以获取并存储双语翻译知识。此外,为促进这些专门化专家之间的有效交互并充分利用文本中潜在的结构模式,我们引入了一种由模型表示中提取的傅里叶变换(https://huggingface.co/papers?q=Fourier%20Transform)特征增强的路由机制(https://huggingface.co/papers?q=routing%20mechanism)。实验结果表明,Mix-MoE在多语言机器翻译中表现卓越,显著优于现有基线,并在缓解参数干扰(https://huggingface.co/papers?q=parameter%20interference)方面取得了显著进展。

查看 arXiv 页面(https://arxiv.org/abs/2605.24681)查看 PDF(https://arxiv.org/pdf/2605.24681)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.24681)

在您的 agent 中获取本文:

hf papers read 2605\.24681

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接到本文

在模型 README.md 中引用 arxiv.org/abs/2605.24681 即可从本页链接。

引用本文的数据集 0

没有数据集链接到本文

在数据集 README.md 中引用 arxiv.org/abs/2605.24681 即可从本页链接。

引用本文的 Spaces 0

没有 Space 链接到本文

在 Space README.md 中引用 arxiv.org/abs/2605.24681 即可从本页链接。

包含本文的收藏集 0

没有收藏集包含本文

将本文添加至 收藏集(https://huggingface.co/new-collection)即可从本页链接。

相似文章

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。

MobileMoE:扩展端侧混合专家模型

Hugging Face Daily Papers

MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。

少即是MoE:裁剪领域专用语言模型中的专家

arXiv cs.LG

本文介绍了Fisher-MoE,一种通过使用Fisher重要性裁剪FFN层中间维度来压缩混合专家模型的方法,实现了45%的权重内存减少和21%的吞吐量提升,且未造成显著的能力损失。