SpeechLLM与联邦学习结合实现端到端ASR:英语和意大利语案例研究

arXiv cs.CL 论文

摘要

本文首次系统研究了基于SpeechLLM的端到端ASR系统的联邦训练,在英语和意大利语任务上进行了评估,在降低通信成本的同时取得了具有竞争力的词错误率。

arXiv:2607.25716v1 Announce Type: new 摘要:联邦学习(FL)能够在分布式数据源上实现自动语音识别(ASR)系统的隐私保护训练,但其在大型语音语言模型(SpeechLLMs)上的应用尚未被探索。本文首次系统研究了基于SpeechLLM的端到端ASR系统的联邦训练。我们设计了一种通信高效的联邦优化策略,专门针对SpeechLLM架构的独特挑战,解决了高维参数空间、梯度通信开销以及分布式环境中的计算约束问题。通过在英语和意大利语的单语ASR任务上进行大量实证评估,我们展示了我们的联邦方法在多种声学条件和说话风格下,与集中式训练基线相比的有效性和稳定性。此外,我们进行了全面的消融研究,分析了不同语音编码器架构在联邦框架内对单语英语ASR性能的影响,为分散训练的最佳模型配置提供了见解。我们的结果在降低通信成本的同时取得了具有竞争力的词错误率,为联邦SpeechLLM在实际多语言场景中的部署奠定了实践基础。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:55

# SpeechLLM 遇见联邦学习:面向端到端 ASR 的英语与意大利语案例研究
来源:https://arxiv.org/html/2607.25716
###### 摘要

联邦学习(FL)能够在分布式数据源上实现隐私保护的自动语音识别(ASR)系统训练,但其在大规模语音语言模型(SpeechLLMs)中的应用仍未得到探索。本文首次系统性地研究了基于 SpeechLLM 的端到端 ASR 系统的联邦训练。我们设计了一种通信高效的联邦优化策略,专门针对大型语音语言架构的独特挑战,解决了高维参数空间、梯度通信开销以及分布式环境中的计算限制。通过在英语和意大利语单语 ASR 任务上的广泛实证评估,我们展示了所提出的联邦方法相对于集中式训练基线在不同声学条件和说话风格下的有效性和稳定性。此外,我们进行了一项全面的消融研究,分析了在联邦框架内不同语音编码器架构对单语英语 ASR 性能的影响,为分布式训练的最佳模型配置提供了见解。我们的结果在降低通信成本的同时取得了具有竞争力的词错误率,为联邦 SpeechLLM 在真实世界多语言场景中的实际部署奠定了基础。

## I 引言

大规模语言模型(LLMs)通过展示在语言理解、推理和生成方面的卓越能力,革命性地改变了人工智能在广泛应用中的表现[14 (https://arxiv.org/html/2607.25716#bib.bib152)]。它们的成功已从纯文本处理扩展到多模态领域,包括语音[52 (https://arxiv.org/html/2607.25716#bib.bib153)]。特别是,语音大规模语言模型(SpeechLLMs)将声学建模与LLM强大的上下文建模能力相结合,实现了用于自动语音识别(ASR)、语音翻译和口语对话的统一端到端系统。最近的框架如SLAM-ASR[26 (https://arxiv.org/html/2607.25716#bib.bib151)]已证明,与传统的编码器-解码器或基于CTC的系统[46 (https://arxiv.org/html/2607.25716#bib.bib154)]相比,将基于LLM的架构融入语音识别流水线可以显著提高鲁棒性、上下文感知能力和泛化能力。这些方法趋向于一种统一的建模范式,其中语音和文本在共享的表示空间中进行处理,减少了对复杂级联流水线和任务特定架构的需求。

尽管取得了这些进展,基于 SpeechLLM 的 ASR 系统的训练通常依赖于集中式数据收集,即大量语音数据在远程服务器上聚合[1 (https://arxiv.org/html/2607.25716#bib.bib155)]。这种范式引发了重大的隐私和数据治理问题,特别是在涉及个人设备、呼叫中心、医疗保健应用或多语言社区的真实场景中[24 (https://arxiv.org/html/2607.25716#bib.bib156)]。例如,语音数据本质上是敏感的,通常包含生物特征信息和个人内容,可能因数据隐私问题而敏感[10 (https://arxiv.org/html/2607.25716#bib.bib158)]。

联邦学习(FL)提供了一种有前景的替代方案,能够在无需将原始数据传输到中央服务器的情况下进行协作式模型训练[3 (https://arxiv.org/html/2607.25716#bib.bib2)]。相反,客户端设备计算本地更新,这些更新在全局进行聚合,从而保留数据本地性并增强隐私[30 (https://arxiv.org/html/2607.25716#bib.bib3)]。联邦学习在移动键盘预测和医疗分析等领域已显示出有效性;然而,其在基于 SpeechLLM 的大规模 ASR 中的应用仍未得到充分探索[4 (https://arxiv.org/html/2607.25716#bib.bib1)]。当扩展到大型语音语言架构时,包括客户端异质性、通信效率和模型稳定性在内的挑战变得更加突出[15 (https://arxiv.org/html/2607.25716#bib.bib157)]。

在这项工作中,我们提出了一种面向端到端基于 SpeechLLM 的 ASR 的联邦训练框架。我们的方法实现了 SpeechLLM 模型的分散优化,同时保持了具有竞争力的识别性能。我们专注于单语设置,并在英语和意大利语两种语言中进行了全面的实验,以验证我们的方法在不同语言条件下的鲁棒性和通用性。所提出的框架解决了联邦语音训练中的关键挑战,包括通信约束和大模型适应。通过仔细的优化策略和聚合机制,我们证明了 SpeechLLM 可以在联邦环境中有效训练,而不会牺牲准确性。

本文的主要贡献总结如下:

- • 我们首次系统性地研究了基于 SpeechLLM 的端到端 ASR 的联邦训练。
- • 我们提出了一种针对大型 SpeechLLM 模型的通信高效联邦优化方法,该方法仅在服务器上聚合可训练参数。
- • 我们引入了一种改进的 FedAvg,采用统一的指数学习率衰减。
- • 我们在英语和意大利语的单语 ASR 任务上提供了广泛的实证评估,展示了所提出方法的有效性和稳定性。
- • 作为消融研究,我们分析了不同语音编码器对英语单语 ASR 的影响。

## II 相关工作

在本节中,我们回顾了最先进的研究,首先检查应用于 ASR 的 FL 及相关常见实践,然后讨论 FL 中最常见的通信高效方法。

### II-A 面向 ASR 的联邦学习

除了非独立同分布和不平衡数据的标准障碍外,ASR 的联邦学习还因现代架构对资源的密集需求而进一步复杂化。诸如 Transformer[50 (https://arxiv.org/html/2607.25716#bib.bib63)]、Transducer[29 (https://arxiv.org/html/2607.25716#bib.bib64),49 (https://arxiv.org/html/2607.25716#bib.bib65)] 和 RNN[32 (https://arxiv.org/html/2607.25716#bib.bib93)] 等模型常常带来的计算负担超出了边缘设备的硬件限制。此外,ASR 传统上依赖于集中的大规模数据集[43 (https://arxiv.org/html/2607.25716#bib.bib103)],这些数据通常在客户端级别不可用。客户端设备上真实标签的稀缺使得必须采用无监督或自监督范式。

近年来,关于基于 FL 的 ASR 的文献显著扩展。虽然 [5 (https://arxiv.org/html/2607.25716#bib.bib104),48 (https://arxiv.org/html/2607.25716#bib.bib33)] 提供了优化和训练策略的详尽综述,但我们在这里重点关注最相关的方法论进展。

[11 (https://arxiv.org/html/2607.25716#bib.bib95)] 的基础工作针对 ASR 任务引入了动态梯度聚合。后续研究,如 [12 (https://arxiv.org/html/2607.25716#bib.bib40)],已证明按词错误率(WER)对客户端更新进行加权,相较于传统的基于损失的加权能获得更优的性能。这项研究还强调了集中式预训练阶段对确保收敛的必要性,并辅以聚合后训练阶段来减轻通信轮次间的模型发散——这一发现得到了 [13 (https://arxiv.org/html/2607.25716#bib.bib30)] 的证实。相反,[31 (https://arxiv.org/html/2607.25716#bib.bib74)] 提出,在 FL 环境中有效的跨域 ASR 主要只能通过大规模预训练模型(如 Wav2Vec2.0[7 (https://arxiv.org/html/2607.25716#bib.bib75)])来实现。

为了应对本地标签的缺乏,一些工作 [20 (https://arxiv.org/html/2607.25716#bib.bib110),11 (https://arxiv.org/html/2607.25716#bib.bib95)] 探索了自监督和无监督 FL 框架。然而,由于本研究专注于特定神经架构以实现高效联邦学习(EFL),我们将这些监督策略视为正交的,并适用于我们提出的结构改进。

### II-B 通信高效的 FL

已经开发了多种技术来优化分布式系统中的带宽效率,通过最小化传输到中央服务器的数据量。稀疏化方法(如将通信限制在模型更新的一个战略性子集,例如 top-K 梯度[38 (https://arxiv.org/html/2607.25716#bib.bib136),23 (https://arxiv.org/html/2607.25716#bib.bib137),39 (https://arxiv.org/html/2607.25716#bib.bib138)])已成功应用于 ASR 框架 [20 (https://arxiv.org/html/2607.25716#bib.bib110)]。或者,量化策略在传输前压缩本地梯度以降低比特率需求,尽管这通常需要在通信增益与可能的精度损失或增加的本地计算之间进行权衡 [41 (https://arxiv.org/html/2607.25716#bib.bib139),47 (https://arxiv.org/html/2607.25716#bib.bib140),25 (https://arxiv.org/html/2607.25716#bib.bib141)]。此外,知识蒸馏已成为一种可行的解决方案,通过训练紧凑的学生模型来模仿高容量教师架构的行为,从而减少交换开销 [55 (https://arxiv.org/html/2607.25716#bib.bib142)]。

除了压缩之外,最近的研究转向修改模型参数化以缓解资源瓶颈。低秩分解有助于将紧凑表示分发到异构设备,以便后续进行全秩全局聚合——这一技术在 CNNs 中已得到探索 [45 (https://arxiv.org/html/2607.25716#bib.bib143)]。同样,早退架构允许客户端在聚合过程中仅传输特定的模型组件 [2 (https://arxiv.org/html/2607.25716#bib.bib144),22 (https://arxiv.org/html/2607.25716#bib.bib145)]。

最近,参数高效微调(PEFT)方法,包括低秩适应(LoRA)[17 (https://arxiv.org/html/2607.25716#bib.bib128),54 (https://arxiv.org/html/2607.25716#bib.bib129)] 和各种适配器模块 [34 (https://arxiv.org/html/2607.25716#bib.bib130),16 (https://arxiv.org/html/2607.25716#bib.bib131)],已被证明在适应像 Llama[42 (https://arxiv.org/html/2607.25716#bib.bib132)]、Gemini[40 (https://arxiv.org/html/2607.25716#bib.bib133)] 和 Mistral[21 (https://arxiv.org/html/2607.25716#bib.bib134)] 这样的大规模预训练模型方面非常有效。鉴于 PEFT 通常只向基础模型引入 1%–2% 的额外参数 [6 (https://arxiv.org/html/2607.25716#bib.bib135)],它特别适用于计算和带宽限制严格的环境。然而,需要注意的是,PEFT 方法可能比全微调对非独立同分布数据分布更敏感,因此需要使用专门的缓解策略 [6 (https://arxiv.org/html/2607.25716#bib.bib135)]。

尽管在通信效率方面取得了进展,当前的 FL 方法主要针对较小的专用架构进行了优化。因此,它可能难以扩展到 SpeechLLMs。当应用于非独立同分布语音数据上的十亿参数架构时,现有策略常常面临收敛不稳定问题。这导致出现“客户端漂移”,即全局模型无法调和不同声学和语言学特征在分散设备上的表现,导致准确率低下和训练波动。

这项工作首次系统性地研究了面向基于 SpeechLLM 的 ASR 的联邦学习。我们提出了一种通信高效的框架,仅聚合可训练参数,显著减少了大规模模型的带宽需求。通过引入改进的 FedAvg 与统一的指数学习率衰减,我们确保了在异构数据集上的稳定收敛。我们的方法在英语和意大利语 ASR 任务上得到了验证,并包含了一项关于不同语音编码器影响的消融研究。

## III 联邦 SpeechLLM 架构

所提出的流水线如图1 (https://arxiv.org/html/2607.25716#S3.F1) 所示,由两个主要组成部分构成:(a) 传统的基于 SpeechLLM 的 ASR 架构,以及 (b) 联邦训练流水线。在以下小节中,我们将详细讨论所提流水线的每个部分。

参见图注(a)
参见图注(b)

图 1:(a) 传统 Speech-LLM 架构。(b) 所提出的联邦 Speech-LLM 训练流水线。

### III-A 基于 SpeechLLM 的 ASR 架构

如图1 (https://arxiv.org/html/2607.25716#S3.F1)(a) 所示,SpeechLLM 架构集成了三个组件:语音编码器、投影层和集成了 LoRA 的 LLM 主干。语音编码器将原始波形转换为帧级别的声学嵌入。然后,投影层将这些嵌入映射到 LLM 的词嵌入空间。最后,LLM 执行自回归解码以生成转录。为了实现高效适应,LoRA 模块被集成到 LLM 层中,允许仅训练 LoRA 和投影器参数,同时保持 LLM 主干冻结。在以下小节中,我们将简要解释 SpeechLLM 流水线的每个组件。

### III-B 语音编码器

在我们的实验中,我们研究了两种常见语音编码器的性能:❶ WavLM-large 和 ❷ Whisper-medium。

❶ WavLM-Large [9 (https://arxiv.org/html/2607.25716#bib.bib7)] 是微软开发的一种自监督语音编码器,拥有 3.17 亿个参数。它使用在未标注语音数据(LibriLight、GigaSpeech、VoxPopuli)上训练的掩码预测和去噪目标。该模型擅长提取鲁棒的语音表示,这些表示能捕捉内容和说话人特征,使其在说话人验证、语音分离和 ASR 等下游任务中非常有效 [19 (https://arxiv.org/html/2607.25716#bib.bib159)]。其基于 Transformer 的架构可以在不需要标注数据的情况下学习可泛化的特征。

❷ Whisper-Medium [37 (https://arxiv.org/html/2607.25716#bib.bib150)] 是 OpenAI 的 7.69 亿参数多语言语音识别模型,在 68 万小时弱监督数据上训练。它使用编码器-解码器 Transformer 架构,其中编码器处理梅尔频谱图,解码器生成文本转录。Whisper-Medium 支持 99 种语言的识别以及到英语的翻译。它对不同口音、背景噪音和音频质量变化表现出强大的鲁棒性,使其适用于实际 ASR 应用。

### III-C 大规模语言模型

在我们的流水线中,我们依赖 TinyLlama-1.1B-Chat-v1.0 [53 (https://arxiv.org/html/2607.25716#bib.bib6)],这是一个紧凑的开源语言模型,拥有 11 亿参数,遵循 Llama 2 架构在约 3 万亿个 token 上训练。尽管体积较小,但它专门使用指令遵循和聊天数据集进行了微调,以处理对话交互。该模型旨在资源受限的设备上高效部署,同时在对话任务、问答和文本生成方面保持合理的性能。TinyLlama 使用与更大 Llama 模型相同的分词器和架构原则,但推理速度显著更快,内存需求更低,使得

相似文章

如何利用合成语音构建基于LLM的ASR系统?

arXiv cs.CL

本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。

基于SpeechLLM的流式语音转文本翻译

arXiv cs.CL

提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。

迈向LLM的下一个前沿:私有数据训练——联邦微调的跨域基准

arXiv cs.LG

本文提出了一个在私有数据上对大型语言模型进行联邦微调的跨域基准,评估了LoRA、QLoRA和IA3策略在医疗和金融数据集上的表现。结果表明,联邦微调接近集中式训练的性能,并优于孤立学习,证明了在数据无法共享时通过联邦微调适配LLM的可行性。