MoLGE:混合语言组专家实现大规模多语言语音识别的高效扩展
摘要
MoLGE在混合专家框架中为相似语言簇分配专用专家模块,用于大规模多语言ASR,在参数增加极小的情况下提升495种语言的性能。
arXiv:2607.24030v1 公告类型:新论文
摘要:覆盖数百种语言的大规模多语言自动语音识别(ASR)模型必须维持对不同语言和声学条件的稳健性能。然而,这些模型常遭遇多语言诅咒,即模型能力被分散到多种语言中。为解决这一挑战,我们提出了基于语音自监督模型(S3Ms)的混合语言组专家(MoLGE)。MoLGE为相似语言簇分配专用专家模块,相较于传统语言特定的混合专家(MoE)方案,减少了所需子模块数量。它进一步将层次化低秩适配(LoRA)策略整合到S3M架构的解耦声学与语言组件中,在保持参数效率的同时实现语言特定特征的高效建模。此外,我们研究了基于语言和数据驱动标准的语言分组策略对整体性能的影响,为语言结构如何影响多语言语音系统的可扩展性提供了可解释的视角。在实验中,我们在涵盖495种语言的多语言基准上评估了MoLGE。结果表明,MoLGE在可训练参数增加极小的情况下,一致优于密集多语言基线。值得注意的是,这些语言分组策略在ASR建模的语音和正字法方面均带来了显著改进。我们的发现表明,结构化语言专业化为大规模扩展多语言ASR的语言覆盖提供了有效途径。
查看缓存全文
缓存时间: 2026/07/28 06:31
# MoLGE: 面向大规模多语言语音识别的高效扩展的语言组专家混合模型
来源:https://arxiv.org/html/2607.24030
Sangmin Lee, Woojin Chung, Woongjib Choi, Hong-Goo Kang
延世大学电子与电气工程系,韩国首尔
{sangmin_lee, woojinchung, woongzip1}@dsp.yonsei.ac.kr, [email protected]
###### 摘要
覆盖数百种语言的大规模多语言自动语音识别(ASR)模型必须在多样化的语言和声学条件下保持稳健性能。然而,这些模型常常遭遇"多语言诅咒",即模型能力在不同语言间被稀释。为了应对这一挑战,我们提出了基于语音自监督模型(S3Ms)的语言组专家混合模型(MoLGE)。MoLGE将专用专家模块分配给相似语言簇,与传统的语言特定混合专家(MoE)方案相比,减少了所需子模块的数量。它进一步将分层低秩适应(LoRA)策略整合到S3M架构的解耦声学与语言组件中,从而在保持参数效率的同时高效建模语言特定特征。此外,我们研究了基于语言标准和数据驱动标准的语言分组策略对整体性能的影响,为语言结构如何影响多语言语音系统的可扩展性提供了可解释的视角。实验中,我们在包含495种语言的多语言基准上评估了MoLGE。结果表明,MoLGE在可训练参数增幅极小的情况下,持续优于密集多语言基线。值得注意的是,这些语言分组策略对ASR建模的语音和正字法方面均带来了显著改进。我们的发现表明,结构化语言专业化为大规模扩展多语言ASR的语言覆盖范围提供了一条有效路径。
## 1 引言
将自动语音识别(ASR)扩展至统一模型中涵盖数百种语言,仍然是多语言语音处理领域的核心挑战。尽管这些系统旨在实现广泛的可访问性,但它们必须应对显著的语言和声学多样性。因此,随着支持的语言数量增加,性能往往会下降,这一现象主要源于相对于任务复杂性的有限模型容量。
自语音自监督模型(S3Ms)(Baevski等人,2020;Hsu等人,2021;Chen等人,2022)问世以来,语音表示学习通过利用大规模无标注语料库取得了显著进展。这些模型在各种下游任务(包括ASR)中表现出稳健性能,在某些情况下甚至在单语基准上超越了人类水平的转录准确率。因此,近期研究越来越关注将S3Ms扩展到多语言环境(Conneau等人,2021;Babu等人,2022;Zanon Boito等人,2024;Pratap等人,2024;Chen等人,2024)。当前方法主要依赖于将训练数据扩展到数百万小时(Zhang等人,2023)以及将模型容量增加到数十亿参数(Keren等人,2025),以提升多语言覆盖范围和跨语言泛化能力。
尽管取得了这些进展,但仍面临重大挑战。增加数据集规模和模型容量计算成本高昂,且在大规模场景下往往不切实际(Zhang等人,2024;Yang等人,2025)。近期的大规模多语言系统已经需要数亿到数十亿参数,使得预训练和适配过程资源密集,尤其在计算资源受限的环境中(Lugo和Vielzeuf,2024)。
此外,多语言语音模型通常在高资源语言主导的高度不平衡数据集上训练。这种不平衡加剧了"多语言诅咒"(Conneau等人,2020;Gurgurov等人,2024),因为固定的模型容量在许多语言之间共享,却不成比例地针对一小部分语言进行优化。因此,单一的密集多语言模型往往相对于专门的单语系统表现不佳(Wang等人,2020;Chen等人,2025),凸显了均匀缩放方法在多语言语音建模中的局限性。这些局限性揭示了语言可扩展性与资源可及性之间的根本矛盾。虽然扩展多语言模型的目标是支持代表性不足的语言,但其由模型大小和训练数据驱动的日益增长的计算需求限制了它们在预期服务场景中的实际效用(Zhong等人,2024;Cahyawijaya,2024;Pava等人,2025)。
为此,我们认为可以通过从均匀容量缩放转向基于语言关系的结构化架构设计来缓解这一矛盾。语言并非独立实体,它们共享音系、形态和谱系特性,构成了一个结构化的语言相似性空间(Bloomfield,1983; Littell等人,2017)。利用这种结构作为架构先验,可以以一种语言学上合理的方式分配模型容量,为多语言扩展提供一条比全面扩展参数或数据更高效的路径。
基于这一动机,我们提出了**语言组专家混合模型(MoLGE)**,一种面向大规模多语言语音建模的参数高效且语言感知的框架。MoLGE通过将语言关系直接纳入其专家分配机制,实现了结构化的语言专业化,而非仅仅依赖扩展。
具体而言,我们的框架建立在两个设计原则之上。首先,受到较低S3M层捕获通用声学特征而较高层编码语言特定信息这一证据的启发(Pasad等人,2021;2023),我们采用了面向语音的适配策略。这包括分层适配,其中共享的LoRA模块在较低层建模通用声学特征,而语言组特定专家在较高层捕获语言特性;此外还包括共享专家和注意力池化路由器,以改善声学建模并稳定专家专业化。
其次,我们探索语言分组作为将语言学先验知识注入模型架构的机制。我们假设语言或声学相似的语言共享结构模式,将它们归入共享专家之下可以有效增加每个专家可用的训练信号,作为一种隐式数据增强形式。为此,我们研究了六种分组策略,涵盖隐式、嵌入引导和知识引导方法,从而全面评估不同类型的语言先验如何影响专家专业化。
除了架构设计,我们还进行了系统分析,探讨何时以及为何语言感知建模最为有益。通过将MoLGE应用于两种具有不同输出特征的ASR模型——音素型(语言无关的罗马化转录)和正字法型(语言特定文字),我们考察了目标语言空间的复杂性如何调节结构化语言分组的有效性。
我们的贡献总结如下:
- • 我们提出了MoLGE,一种高效且可扩展的大规模多语言ASR框架,将语言结构作为专家专业化的架构先验。
- • 我们将语音建模原理整合到LoRA和MoLE中,结合了分层适配、共享专家和注意力池化路由器,以改善声学建模和专家专业化。
- • 我们系统研究了495种语言上的六种语言分组策略,表明显式语言先验始终优于隐式或随机先验,并且其收益与目标语言空间的复杂性成正比。
## 2 相关工作
### 2.1 多语言语音基础模型
多语言语音基础模型主要通过扩展模型容量和训练数据来支持日益增多的语言。早期研究如XLSR-53(Conneau等人,2021)证明,利用wav2vec 2.0(Baevski等人,2020)进行多语言自监督预训练可以改善ASR的跨语言迁移和泛化能力。后续模型,包括XLS-R(Babu等人,2022)、MMS(Pratap等人,2024)、mHuBERT-147(Zanon Boito等人,2024)、AfriHuBERT(Alabi等人,2025)、XEUS(Chen等人,2024)以及Omnilingual ASR(Keren等人,2025),通过扩展到数百或数千种语言并将模型容量提升至十亿参数级别,进一步拓展了这一范式。与此同时,大规模监督式的Whisper风格方法(Radford等人,2023;Peng等人,2025)通过在大量标注数据集上训练,实现了稳健的多语言ASR性能。尽管取得了这些进展,现有方法主要依赖于模型规模和训练数据的均匀缩放,而很少关注明确考虑语言多样性的语言感知建模。
### 2.2 可扩展的参数高效微调
参数高效微调(PEFT)方法已被广泛用于适配大型预训练模型,而无需更新全部参数。适配器(Houlsby等人,2019;Pfeiffer等人,2021)和低秩适应(LoRA)(Hu等人,2022)等方法通过引入最小数量的可训练参数,实现了高效的任务特定适配。这些方法已成功应用于自然语言处理(NLP)和语音领域,在保持性能的同时降低了计算开销。在多语言语音建模中,PEFT已被用于在众多语言上扩展模型。例如,Pratap等人(2024)使用语言特定适配器将密集多语言模型扩展到数千种语言。然而,随着规模扩大,为每种语言分配独立适配器变得不切实际。
为了提高可扩展性,专家混合(MoE)(Jacobs等人,1991)方法通过仅为每个输入激活参数子集,引入了条件计算。近期研究进一步将MoE与PEFT结合,例如LoRA专家混合(MoLE)(Wu等人,2024),通过轻量级适配模块实现专家专业化。尽管如此,现有的基于MoE的多语言方法通常以单个语言为粒度分配专家(Gaur等人,2021;Kwon和Chung,2023;Mu等人,2025),这限制了它们在大规模多语言场景中的可扩展性。
最近NLP领域的研究开始探索在MoE框架内进行语言分组(Zheng等人,2024;Li等人,2025a;Liang等人,2025;Janeiro等人,2025),表明在相关语言之间进行结构化参数共享可以提高可扩展性。然而,这种方法在大规模多语言语音建模中仍未充分探索。现有方法通常仅对一小部分语言应用语言特定LoRA模块(Wang等人,2023;Bagat等人,2025;Li等人,2025b),或专注于代码切换等特殊场景(Ma等人,2023;Huang等人,2025),限制了它们对大规模多样化语言集的适用性。
### 2.3 我们工作的定位
我们的工作与先前方法在两个关键维度上有所不同。
首先,我们并非依赖均匀缩放,而是将PEFT与语音感知适配和基于语言组的路由相结合,以实现大规模语言集合的结构化、可扩展的专业化。其次,先前的组感知路由主要关注文本输入,而我们则从语音导向的角度出发,深入分析各种语言分组策略,以应对语言分组中的独特挑战。
综上所述,我们提出了一种面向大规模多语言语音识别的高效扩展方法,并首次对语言分组及其影响进行了系统研究。
参见图注
图1:MoLGE的整体架构。传统S3M被分解为较低的声学层和较高的语言层,每层采用不同的适配策略。
## 3 提出方法
我们通过两个主要假设来探讨语言分组在多语言语音识别中的作用。首先,将语言或声学相似的语言分组,使专家能够捕捉共同的结构特征,从而提高参数效率和表示质量,尤其是在大规模多语言场景中。其次,在固定模型容量(即专家数量受限)的情况下,基于语言或统计先验的显式语言分组策略比仅从数据中学习到的隐式、由路由器驱动的分组更能促进有效的专家专业化。
### 3.1 语言组专家混合模型
在本节中,我们介绍**语言组专家混合模型(MoLGE)**,这是一个面向语音的MoLE框架,通过结构化语言分组实现高效的专家专业化。与传统的在单个语言级别分配专家的方法不同,MoLGE将相关语言聚类,并为每个组分配共享专家。这一策略显著提高大规模场景中的可扩展性。相似文章
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。
MobileMoE:扩展端侧混合专家模型
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。
MoVE:通过语音专家混合模型在语音到语音翻译中保留笑声与哭泣
MoVE 提出一种 Mixture-of-LoRA-Experts 架构,在仅 30 分钟精选数据下即可在语音到语音翻译中保留 76% 的非语言发声(笑声、哭泣)。
MEUSLI:一个面向基于LLM的ASR及其他任务的多语言投影器
MEUSLI是一个开源的多语言投影器家族,它将Whisper编码器与多语言LLM连接起来,支持28种欧洲语言的端到端ASR,并扩展到语音翻译和主题识别。
XPERT:通过专家知识迁移实现语言模型的高效训练
本文介绍了 XPERT,这是一个从预训练混合专家(MoE)语言模型中提取和复用专家知识的框架,旨在提高下游模型的训练效率和性能。