MEUSLI:一个面向基于LLM的ASR及其他任务的多语言投影器

arXiv cs.CL 论文

摘要

MEUSLI是一个开源的多语言投影器家族,它将Whisper编码器与多语言LLM连接起来,支持28种欧洲语言的端到端ASR,并扩展到语音翻译和主题识别。

arXiv:2607.22100v1 公告类型:新发布 摘要:轻量级投影器是连接预训练语音编码器与大语言模型(LLM)的成熟方式,它将声学特征映射到token级嵌入,用于ASR和口语问答等任务。然而,现有系统通常只支持少数语言,且往往局限于英语。我们推出了MEUSLI,这是首个开放科学的多语言投影器家族,它将Whisper编码器与开源多语言LLM连接起来,支持28种欧洲语言的完全开源端到端ASR。MEUSLI扩展了之前的单语言流水线,在高资源和低资源语言上都取得了强劲的结果。通过使用合适的持续学习技术,MEUSLI可以轻松扩展到训练中未见的其他语言。我们进一步证明,MEUSLI投影器可用于超越ASR的应用,仅需每种语言数小时的任务特定监督,即可实现多语言语音翻译和主题识别。总体而言,MEUSLI为多语言语音理解任务提供了坚实的基础,支持可扩展和包容性的开源SpeechLLM。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:40

# MEUSLI:面向基于LLM的ASR及其他任务的多语言投影器
来源:https://arxiv.org/html/2607.22100
Concina Fong Matassoni Brutti

SeraphinaMarcoAlessio1增强智能中心,布鲁诺·凯斯勒基金会,意大利特伦托 2特伦托大学信息工程与计算机科学系
\{lconcina, mfong, brutti, matasso\}@fbk\.eu (https://arxiv.org/html/2607.22100v1/mailto:%7Blconcina,%20mfong,%20brutti,%20matasso%[email protected])

###### 摘要

轻量级投影器是一种将预训练语音编码器与大型语言模型(LLM)连接起来的成熟方法,可将声学特征映射为令牌级嵌入,用于ASR和口语问答等任务。然而,现有系统通常仅支持少数几种语言,且往往局限于英语。我们提出MEUSLI,这是首个面向开源科学的多语言投影器系列,它将Whisper编码器与开源多语言LLM相连接,从而支持28种欧洲语言的完全开源端到端ASR。MEUSLI扩展了先前的单语言流水线,在高资源和低资源语言上均取得了强劲的性能。通过适当的持续学习技术,MEUSLI可以轻松扩展到训练中未见过的其他语言。

我们进一步证明,MEUSLI投影器可超越ASR,在每种语言仅需几小时任务特定监督的情况下,实现多语言语音翻译和主题识别。

总体而言,MEUSLI为多语言语音理解任务提供了坚实基础,支持可扩展且包容性的开源SpeechLLM。

###### 关键词:

语音识别,LLM,低资源语言,多语言,音频编码器

## 1 引言

大型语言模型(LLM)已彻底变革自然语言处理,使系统能够泛化处理多种基于文本的任务。将这些能力扩展到语音对于自然的多模态交互至关重要,从而推动了语音语言模型(SLM)的兴起,使LLM能够直接处理音频[surveySLM]。传统的语音增强LLM依赖于级联流水线:自动语音识别(ASR)、LLM处理,以及可选的文本转语音(TTS)。尽管有效,但这些架构存在错误传播、副语言线索丢失[audioVisualASR]、缺乏共享上下文以及延迟增加[recentAdvancesSLM]等问题。这些局限性激发了对统一SLM(集成语音和语言建模)的研究兴趣。

最近的多模态系统,如Qwen-Audio[chu2023qwen,chu2024qwen2]和SALMONN[tang2023salmonn],展示了将语音编码器直接连接到LLM的潜力。然而,它们通常仅支持高资源语言,适应性有限,或依赖于专有数据。基于SLAM-ASR[ma2024embarrassingly]的SLM通过引入可训练的投影器(将预训练编码器的声学表示映射到LLM嵌入空间)缓解了这些问题(图1 (https://arxiv.org/html/2607.22100#S1.F1))。

请参阅图注图1:提出的MEUSLI(多语言欧盟语音线性投影器)训练流水线,遵循[ma2024embarrassingly,fong25_interspeech]中的SLAM-ASR架构。语音编码器将音频转换为高维特征,投影器将其映射到LLM的嵌入空间。投影器范围从简单的线性层到更复杂的架构[Yu2023ConnectingSE,Geng2024UnveilingTP],通常包含时间下采样以降低LLM成本。在训练期间,投影器学习在统一生成框架内对齐声学和文本表示,从而实现端到端语音任务,如ASR、语音翻译和口语理解[Yang2024CTCAssistedLC,Shi2024AdvancingMA,Ma2025SpeechRM,geng2025osum]

尽管对轻量级SLM[verdini25_interspeech,SLAM-ASR-eval]和提示策略[Ma2024EffectiveTA,burdisso_promptor]的兴趣日益增长,当前方法仍主要以英语为中心,多语言范围有限。在低资源语言支持、多语言适应策略、训练数据组成或专门编码器的系统分析,以及可复现的开源研究实践方面,仍存在关键差距。

### 1\.1 相关工作

近期工作已开始解决这些差距,包括针对低资源印度语言的适应[mittal24_salsa_interspeech,mittal25_skip_salsa_interspeech]、对病理语音的鲁棒性[zhang25t_atypical_asr_llm_interspeech],以及八种语言的多语言ASR[fathullah2024prompting]。此外,[denisov-vu-2024-multilingllm]提出了一个多语言SLM,在139种语言的1900小时语音上训练。虽然这展示了强大的多语言覆盖能力,但对低资源语言的适应性探索不足。高资源预训练结合最少数据微调有潜力帮助缩小这一差距[fong25_interspeech],并且近期工作表明,按语系分组使用共享投影器可以增强多语言鲁棒性和跨语言迁移[zhang2026languagefamily]。然而,在更大规模的多语言环境中进行系统研究仍然有限。最后,尽管BLOOMZMMS[denisov-vu-2024-multilingllm]支持大量语言,但未探索训练材料或专用编码器组合的影响。文献中当前可用模型的另一个局限性是训练数据的不开放性及相关模型许可问题,这阻碍了可复现性和透明度。表1 (https://arxiv.org/html/2607.22100#S1.T1)总结了当前模型在语言数量、低资源语言包含情况、任务及其开放性方面的局限性。

表1:近期开源SLM综述。

## 2 MEUSLI:面向28种欧盟语言(及更多)的多语言投影器

在本工作中,我们通过引入MEUSLI来解决这些差距,这是首个完全开源的多语言投影器,用于基于LLM的ASR,支持28种欧洲语言。MEUSLI将SLAM-ASR架构扩展到大规模多语言环境,通过轻量级线性投影器将预训练的Whisper编码器与开源预训练多语言LLM连接起来。由此产生的系统无需修改语音编码器或LLM即可实现高效的端到端ASR。除了多语言ASR,我们还证明MEUSLI可作为微调低资源语言的强大初始化点,并且即使对于训练期间未见过的语言,也可用于引导或扩展ASR能力。

虽然SLAM架构已在多种任务中探索,甚至包括多任务设置和有限数量的语言,但本工作专注于多语言,并以ASR作为案例研究。这一选择的原因是ASR数据在多种语言中广泛可用(即使低资源语言的量很小),并且存在成熟的评估基准。我们表明,尽管针对ASR进行训练,MEUSLI可作为起点将其能力扩展到其他语音处理任务,尤其是那些数据有限的任务。我们的结果突显了该方法在可扩展性、开放性和实用性方面的优势,为包容性的、由LLM驱动的语音技术奠定了基础。

我们建立在之前[Fong25_interspeech]的研究发现基础上,该研究考察了SLAM-ASR方法在低资源场景中的能力。我们观察到,大约需要100-200小时的训练数据才能匹配纯Whisper的性能。然而,在数据稀缺条件下,多语言高资源预训练可以大幅改善结果,仅需微调10小时数据即可。因此,本文的目标是将这些发现扩展到高度多语言的环境,获得一个SLM,其(i)支持大部分欧洲(EU)语言,(ii)提升低资源语言的性能,(iii)允许引导新语言,以及(iv)作为其他语音处理任务的起点。总体而言,本文提出以下贡献:

1.  1\.MEUSLI(多语言欧盟语音语言模型线性投影器)将SLAM-ASR框架及相关基于语音的LLM范式从有限的语言集扩展到28种欧洲语言。我们在HuggingFace上发布了一个投影器系列,支持28种欧盟语言,并使用多个开源LLM进行训练。https://huggingface.co/collections/SpeechTek/meultilingual-speechllm-projectors
2.  2\.我们提供模型配置的详细信息,以促进在SLAM-ASR框架内的成功微调。
3.  3\.与近期关于SpeechLLM的工作不同,我们考虑低资源语言,并证明MEUSLI可以有效地微调以支持它们,从而仅需有限的语音数据即可引导新语言。此外,我们展示了如何使用最先进的持续学习方法添加新语言。
4.  4\.我们通过实验表明,从MEUSLI出发,仅需少量适应数据即可获得多语言多任务投影器,将支持范围扩展到ASR之外,涵盖语音翻译和主题识别。

总之,我们的工作为可扩展、开放且包容的、由LLM驱动的语音到文本系统奠定了基础。

### 2\.1 MEUSLI模型

在本工作中,我们使用SLAM-ASR框架[ma2024embarrassingly]作为多语言SLM的基础。我们采用*Whisper-large-v3-turbo*作为编码器,以及三个后端LLM:*EuroLLM 1.7B-Instruct*、*EuroLLM 9B*[EUROLLM]和*Apertus-8B*[swissai2025apertus]。遵循SLAM-ASR方法论,编码器和LLM均保持冻结,仅训练线性投影器。虽然投影器设计可以从简单的线性层到更复杂的架构[surveySLM],但本研究采用线性投影器,因为它始终在ASR性能上表现最佳[Kumar-2025,concina25_mlcslm]。在我们的实现中,投影器由一个带有ReLU激活的单隐藏层和一个回归层组成,包含17.31M个可训练参数。为了进一步提升性能,我们对LLM应用了低秩适应(LoRA)[hu2022lowrank]。最佳LoRA配置采用秩r=8r=8和缩放因子α=32\\alpha=32,引入了额外的1.38M可调参数。

### 2\.2 训练配置

输入音频被转换为具有128个频率仓的梅尔频谱图。来自冻结语音编码器的输出语音嵌入通过因子k= 5进行下采样,以缓解语音和文本表示之间的长度不匹配。模型使用Adam优化器训练,初始学习率为1×10−41\\times 10^{-4},线性预热步骤为1,000步,随后进行计划的学习率衰减。训练进行3个周期,批次大小为8,验证批次大小为2,以平衡GPU内存限制和训练稳定性。模型通过LLM输出的交叉熵损失进行优化。训练期间,投影后的语音嵌入与文本提示(例如,\`\`将语音转录为文本\`\`)拼接后传递给LLM。训练在一块NVIDIA Ada Lovelace L40S GPU上进行。该配置作为我们多语言实验的基础,提供了稳定的训练和跨多种欧洲语言具有竞争力的识别精度。

### 2\.3 数据集

我们使用三个广泛使用的开源语音数据集训练模型:Common Voice 17.0 (CV)[commonvoice:2020]、FLEURS (FL)[fleurs2022arxiv]和VoxPopuli[wang-etal-2021-voxpopuli]。从这些来源中,我们收集了涵盖28种欧洲语言的数据,总计7622小时:英语、法语、德语、意大利语、西班牙语、葡萄牙语、荷兰语、波兰语、匈牙利语、捷克语、罗马尼亚语、保加利亚语、斯洛伐克语、斯洛文尼亚语、塞尔维亚语、希腊语、丹麦语、瑞典语、芬兰语、拉脱维亚语、立陶宛语、爱沙尼亚语、威尔士语、马耳他语、布列塔尼语、爱尔兰语、加利西亚语和巴斯克语。为了解决数据分布不平衡并确保计算可行性,我们将每个数据集每种语言的音频样本数量上限设为100K。这一策略减少了数据倾斜,使训练更加高效。

先前的工作[SLAM-ASR-eval,fong25_interspeech]表明,SLM可能对领域偏移和语音条件变化(如噪声、口音或其他扰动)敏感。因此,我们采用迭代训练和评估方法,逐步添加新数据集、重新训练模型并测量其性能,以通过暴露于更多样化的音频样本来增强MEUSLI的鲁棒性。此外,模型不仅在教学数据集的测试集(领域内)上评估,还在来自INTERSPEECH 2025 MLC-SLM挑战赛111https://www.nexdata.ai/competition/mlc-slm的领域外数据上评估。增加训练数据在领域内和领域外评估中均持续改善词错误率(WER),验证了我们的迭代多语言训练方法。

## 3 结果与讨论

我们首先在第2.3节 (https://arxiv.org/html/2607.22100#S2.SS3)描述的28种欧洲语言上评估了多语言投影器的性能。表2 (https://arxiv.org/html/2607.22100#S3.T2)报告了在Common Voice (CV)、FLEURS (FL)和2025 MLC-SLM挑战赛 (MLC)测试集上获得的WER。我们将三个LLM获得的结果与*Whisper-large-v3-turbo*进行比较。虽然与Whisper的比较在训练数据和资源方面不完全公平,但我们将其作为不同语言性能的参考点。

结果中出现了几个趋势。高资源语言(表2 (https://arxiv.org/html/2607.22100#S3.T2)顶部)实现了强大的转录精度,而低资源语言(表2 (https://arxiv.org/html/2607.22100#S3.T2)底部)则以非常高的WER为特征。由于训练材料跨语言平衡,这些差距主要反映了语音编码器和LLM在特定语言上的精度(见Sec.3.1 (https://arxiv.org/html/2607.22100#S3.SS1))。这也体现在更大的LLM表现出比EuroLLM-1.7B更好的性能,其中Apertus-8B平均略优。关于与Whisper的比较,使用较大模型的基于LLM的方法通常表现更好,尤其对低资源语言有显著提升,即使这些语言原本不在预训练LLM的覆盖范围内。但请注意,Whisper在MLC领域外数据上似乎更有效,这一行为可能与Whisper更大的训练数据量有关。

总体而言,这些结果表明MEUSLI在28种语言上实现了强大的性能:高资源语言的WER较低,中等资源语言观察到一致的改进。虽然布列塔尼语、爱尔兰语和马耳他语等非常低资源的语言仍然具有挑战性,但模型仍显示出明显的增益,证实了该方法在多样化语言条件下的可扩展性和鲁棒性。这些结果激励了进一步针对低资源语言的微调和引导未见语言的实验,如Sec.3.1 (https://arxiv.org/html/2607.22100#S3.SS1)和3.2 (https://arxiv.org/html/2607.22100#S3.SS2)所述。

表2:使用3种基于LLM的模型(EuroLLM-1.7B, EuroLLM-9B, Apertus-8B)和Whisper在28种语言上的WER。Apertus-8B支持所有这些语言,而EuroLLM模型不涵盖标记为\*的语言。### 3\.1 在低资源语言上的进一步微调

虽然提出的流水线展示了广泛的语言覆盖,但其性能

相似文章

基于SpeechLLM的流式语音转文本翻译

arXiv cs.CL

提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。