LuxSQA: 用卢森堡语问我——基于TTS增强的语音问答

arXiv cs.CL 论文

摘要

本文探讨了使用文本转语音(TTS)为低资源语言卢森堡语的语音问答生成合成训练数据,并评估了采用参数高效型SLAM架构的多源TTS配置。

arXiv:2607.02763v1 公告类型:新 摘要:语音问答(SQA)主要集中于高资源语言和精心录制的语音,限制了语音-LLM方法在低资源场景中的覆盖范围。本文探究了文本转语音(TTS)能否为卢森堡语SQA提供特定任务的训练数据,而无需大量人工录制的问答语料库。从现有的基于文本的问答资源出发,我们将问题翻译成卢森堡语,使用多个TTS系统合成语音问题,并将其与文本答案配对。我们训练了一种参数高效的SLAM风格架构,通过一个可学习的投影器和LoRA适配器将冻结的Whisper编码器连接到冻结的多语言LLM后端。我们比较了MMS-TTS、Qwen3-TTS和OmniVoice变体,包括约4.8万个问题的单源语料库和约23万个问题的4TTS多源混合语料。在LLAMA-LB-Test上使用两个真实卢森堡语说话者条件进行的评估表明,多源和基于语音设计的合成训练配置可获得最强的SQA性能。结果还显示,无参考TTS质量评分并不能单调预测下游QA性能,这表明合成语音必须作为特定任务的训练数据进行评估,而不仅仅是作为听起来自然的音频。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:36

# LuxSQA: 用 TTS 增强的口语问答系统来问卢森堡语

来源:https://arxiv.org/html/2607.02763

###### 摘要

口语问答(SQA)仍主要集中于高资源语言和精心录制的语音,这限制了语音-LLM 方法在低资源场景中的应用。本文研究了文本转语音(TTS)是否能为卢森堡语 SQA 提供任务特定的训练数据,而无需大规模人工录制的问答语料库。从现有的基于文本的问答资源出发,我们将问题翻译成卢森堡语,使用多个 TTS 系统合成口语问题,并将其与文本答案配对。我们训练了一个参数高效的 SLAM 式架构,该架构通过一个可学习的投影器和 LoRA 适配器将冻结的 Whisper 编码器连接到冻结的多语言 LLM 后端。我们比较了 MMS-TTS、Qwen3-TTS 和 OmniVoice 的变体,包括包含约 4.8 万个问题的单源语料库和包含约 23 万个问题的 4TTS 多源混合语料库。在 LLAMA-LB-Test 上,使用两种真实卢森堡说话者条件的评估表明,多源和基于语音设计的合成训练配置取得了最强的 SQA 性能。结果还表明,无参考的 TTS 质量分数并不能单调地预测下游 QA 性能,这表明合成语音必须作为任务特定的训练数据来评估,而不仅仅是作为听起来自然的音频。

## I. 引言

口语问答(SQA)将问答扩展到口语输入,要求模型理解语言内容和语音的声学特性[29]。因此,SQA 必须处理不流畅、非正式措辞、说话者和信道变化以及背景噪音。早期的系统主要采用级联方法,即自动语音识别(ASR)模块在文本 QA 模型生成答案之前转录音频。虽然在干净条件下有效,但这种设计在 ASR 输出有噪声时会遭受错误传播,并且丢弃了诸如重音和短语等韵律线索,这些线索有助于定位答案跨度[24]。

最近的语音-LLM 架构通过将强大的语音编码器与经过指令微调的语言模型通过轻量级连接器或投影器连接来解决这些问题:投影器将声学嵌入映射到冻结 LLM 的标记/嵌入空间,这样只需更新少量参数。这种参数高效的连接器思想(小型适配器 + LoRA)已被证明可以在保持计算和数据需求适中的同时实现强劲性能(例如,SLAM-ASR 及相关 LLM-ASR 研究)[26, 12, 13, 11] 展示了该框架。后续工作探索了基于投影器的系统的鲁棒性、扩展性和多语言迁移;参见近期 SLAM/SLM/SLAM-ASR 分析中的评估和参考文献[8]。投影器 + LLM 方法对低资源场景有吸引力,因为它复用了大型预训练组件,并将大部分任务适配推入一个紧凑的层中,该层可以在有限的硬件和数据下进行训练;多篇文章明确研究了低资源语音任务的数据量、多语言迁移和基于适配器的解决方案[4]。

这引出了一个实际问题:我们能否在不录制新说话者的情况下利用 TTS 构建有用的 SQA 训练数据?如果能,结果系统对 TTS 质量、语音多样性和语料库大小的敏感程度如何?先前自动生成 SQA 数据或将文本 QA 语料库转换为语音的工作表明,这是一种可行且有用的策略:自动 SQA 生成框架[30] 以及使用合成语音的实验已被提出和评估,并对 TTS 选择和 ASR 噪声影响进行了明确分析。参见 Menevşe 等人的自动生成框架及后续工作[16, 15]以及诸如 HeySQuAD 和 LibriSQA 等实证数据集研究[27, 33]。

早期的 SQA 系统主要依赖 ASR 后接基于文本的问答,使得性能强烈依赖于转录质量。最近的工作已转向直接建模口语输入。端到端 SQA 和口语对话式 QA 已被研究用于多轮对话和基于语音的答案生成[29, 2, 3]。诸如 GSQA 之类的生成系统通过将口语问题映射到口语或文本答案来减少对显式 ASR 转录的依赖,而 Spectron 则使用基于频谱图的表示将预训练的 LLM 适配到语音输入和输出[23, 19]。这些研究表明直接 SQA 是可行的,但通常需要大量任务特定的训练,并且不关注低资源语言。一系列相关工作通过轻量级投影器将语音编码器连接到 LLM。基于 LLM 的 ASR 和 SLAM 式系统将声学嵌入映射到 LLM 嵌入空间,可以在保持语音编码器和 LLM 冻结或轻度调整的情况下实现有竞争力的性能[4, 12]。遵循指令的语音 LLM 将该方法扩展到诸如口语摘要、分类和对话等任务,包括具有封闭式和开放式语音指令的基准测试[25]。然而,大部分这类工作针对的是转录或一般语音指令跟随,而非低资源 SQA。合成语音也已广泛应用于 ASR、语音翻译和相关低资源语音任务的数据增强。先前研究表明,通过将可用文本与合成语音配对,TTS 生成的音频可以改善 ASR,并且在无法录制真实说话者时,TTS 或语音转换有助于构建多说话者数据集[31, 1, 17]。在 SQA 中,口语问题的增强可以提高对噪声和口音变化的鲁棒性[24]。然而,大多数增强工作是为 ASR、检索或翻译设计的,而不是为了构建口语问答对来训练基于投影器的 SQA 模型。基于 TTS 的增强还支持可复现的资源创建:即使无法发布原始语音,也可以共享流程、质量检查和设计选择,以指导类似的低资源 SQA 数据集。

先前工作的重要实证发现可以归纳如下。

**合成语音质量和多样性**。合成语音可以产生有用的 SQA 训练数据,但模型增益强烈依赖于 TTS 语音的真实性和多样性,以及后续评估是否使用真实的人类语音[27, 15]。

**ASR 和流程鲁棒性**。ASR/转录错误会严重降低级联流程中的检索和 QA 性能;当 ASR 较差时,端到端或无 ASR 的方法(语音检索、直接语音→答案模型、或基于投影器的语音-LLM)更加鲁棒[9, 24]。

**基于投影器的语音→LLM 系统**。在配对的语音→文本指令数据上训练时,小型线性投影器和 LoRA 风格适配器可以实现强大的迁移,但对领域偏移和噪声语音的鲁棒性仍然需要 (a) 更大/更多样化的合成语料库,(b) 在高资源语言上预训练投影器,或 (c) 用于多语言性的适配器混合 / 专家混合(MoE)技术[12]。

**有监督的投影器训练**。在我们的设置中,语音→LLM 连接器(线性投影器)是在配对的语音问题/文本答案数据上通过监督学习的;我们不使用数据蒸馏或自监督目标[12, 26]。

在本文中,我们为卢森堡语 SQA 探索这种设置。我们从现有的基于文本的问答资源和英语 SQA 语料库出发,通过结合机器翻译与多个 TTS 系统构建一组卢森堡语口语问题。我们训练一个参数高效的 SLAM 式模型,该模型通过线性投影器和 LoRA 适配器将冻结的 Whisper large v3 turbo 编码器连接到多语言 LLM 后端。该模型被训练直接将口语问题映射到文本答案,因此它运行在语音指令跟随机制下,而非纯转录。

### I-A 我们工作的定位

与诸如 GSQA 或 Spectron 之类的端到端 SQA 模型相比,我们的方法保持语音编码器和多语言 LLM 冻结,仅训练一个紧凑的投影器以及 LoRA 适配器,提供从语音到文本答案的参数高效路径[23]。不同于优化投影器进行转录的基于 LLM 的 ASR 框架,我们直接用 QA 对对其进行监督,使模型学习将低资源语言的口语问题映射为文本形式的答案。在数据层面,我们遵循低资源语音的 TTS 增强精神,但我们将 TTS 应用于从大型文本语料库生成口语问题,并将其与文本答案配对,而不是合成通用的朗读语音或 ASR 风格的语句[31]。

因此,本文的主要贡献是方法论性的。我们提出了一个完整的流程,用于在低资源语言中构建和利用 TTS 增强的 SQA 数据,包括翻译选择、TTS 选择、语料过滤和评估。卢森堡语作为一个具体的案例研究,但设计和误差分析旨在移植到其他设置。我们强调什么有效、什么无效,以及合成数据在哪些方面不如人类录音,以便未来的数据收集工作能更好地平衡人工和合成语音。

参见标题图 1:LuxSQA 训练流程,包含冻结的语音编码器、可训练的投影器以及 LoRA 适配的多语言 LLM 后端。

## II. 方法论

### II-A 设计考量

我们从先前的 SQA 和语音 LLM 工作中提炼实证发现,以指导卢森堡语流程和模型设置(参见图1)。主要考量因素如下:

1. **TTS 质量和自然度**。先前工作表明,合成语音可以为 SQA 及相关任务提供有用的训练数据,但增益强烈依赖于生成音频的真实性和伪影的存在[15, 27]。当 TTS 语音更自然且更接近人类韵律时,模型能更好地迁移到真实口语查询。这促使我们使用高质量的 TTS 系统并对生成的音频进行质量控制。
2. **语音多样性**。对 HeySQuAD 和 LibriSQA 等合成语料库的分析表明,使用多种语音(不同说话者、性别或音色)可以减少对单一合成语音的过拟合,并提高对未见说话者的鲁棒性[27, 32]。因此,我们使用了多个 TTS 引擎,并在可能的情况下每个引擎使用多种语音,以便合成的卢森堡语问题覆盖一系列说话风格。
3. **语料库大小和迁移**。基于投影器的系统受益于大规模的配对语音-文本语料库,先前关于 SLAM 式架构的工作表明,重用强大的多语言编码器和 LLM 可以提高低资源目标的数据效率[4, 12]。我们不是预训练新的编码器,而是采用冻结的 Whisper 编码器和冻结的 EuroLLM/Apertus 后端,并改变用于训练投影器和 LoRA 适配器的合成和人工口语数据的数量。
4. **流程鲁棒性**。关于 SQA 和语音检索的研究证实,当 ASR 质量较低时,级联流程会受到影响,因为转录错误会传播到 QA 模型中[24, 9]。直接语音到响应的架构,其中投影器馈送到冻结的 LLM,在这种条件下更加鲁棒。这一证据促使我们选择 SLAM 式的语音指令设置,而不是级联 ASR 加文本 QA 流程。
5. **任务的泛化能力**。SQA 代表了更广泛的语音中心应用类别,如口语对话系统、语音助手和基于音频的推理;因此,从分析 SQA 中获得的见解可以泛化到使用 LMM 的各种其他多模态语音理解任务[29]。

这些考量塑造了我们的 TTS 选择、多语音和多引擎的使用、关于合成语音与人类语音的语料库扩展实验,以及采用基于投影器的语音到答案模型的决定。

### II-B TTS 模型

我们使用以下模型生成合成数据:(i) **MMS-TTS**[20]。Meta 的大规模多语言语音 TTS 模型是一个多语言语音合成系统,能够使用统一架构生成超过一千种语言的自然语音,为多语言评估提供一致且可扩展的语音生成。(ii) **Qwen3-TTS**[7]。它是一个在 Qwen 生态系统内开发的神经文本转语音系统,旨在生成高质量、听起来自然的各种语言语音,具有较强的可控性和鲁棒性;它支持两种互补的合成模式:CustomVoice(CV)从短参考话语中克隆目标说话者,而 VoiceDesign(VD)根据所需特征的文本描述生成新语音,无需参考音频即可实现可控的语音合成。(iii) **OmniVoice**[35],一个最新最先进的大规模多语言零样本 TTS 模型,支持超过 600 种语言。它基于受语言建模启发的新型扩散架构,实现高质量语音合成和快速推理。与 Qwen3-TTS 类似,该模型支持语音克隆(C)和可控语音设计(VD)。

总体而言,我们评估了五种基于 TTS 的合成数据生成策略:MMS-TTS、两种 Qwen3-TTS 变体(Qwen-CV 和 Qwen-VD)以及两种 OmniVoice 变体(Omni-C 和 Omni-VD),如表 II 所列。

相似文章