T-SANDHI:一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,采用解耦混合注入

arXiv cs.CL 论文

摘要

该论文提出了T-SANDHI,一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,它通过显式解耦声调变化来在Whisper骨干网络基础上提高准确性。

arXiv:2609.18194v1 公告类型:新 摘要:在Taiwanese Hokkien自动语音识别(ASR)中,先前的研究通常将声调变调视为一个主要挑战,假设模型无法处理隐含的音系变化。然而,我们对Taiwanese Hokkien的实验表明,语音基础模型实际上能有效处理声调变调变化,真正的性能瓶颈源于这些变化与保留的引用声调之间的局部混淆。为此,我们提出了T-SANDHI,以在冻结的Whisper骨干网络基础上显式解耦表面声学与底层词汇意图。通过使用基于文本派生伪标签的词典引导多任务学习结构,我们的轻量级混合注入模块通过动态门控集成独立的引用和变调语音流。在TAT-MOE语料库和两个盲测集上的广泛评估表明,这种显式解耦有效解决了声调映射混淆,在严格的参数效率下超越了基线方法。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:09

# T-SANDHI:面向低资源台语语音识别的音调变调自适应网络与解耦混合注入
来源:https://arxiv.org/html/2609.18194
Sung Hung-Yang<sup>1</sup>, Wang Chien-Chun<sup>2</sup>, Lo Tien-Hong<sup>1</sup>, Tsao Yu-Sheng<sup>3</sup>, Hsu Yung-Chang<sup>3</sup>, Chen Berlin<sup>1</sup>
<sup>1</sup> 台湾师范大学 资讯工程系,台湾  
<sup>2</sup> 玉山金融控股股份有限公司,台湾  
<sup>3</sup> EZAI,台湾

###### 摘要

在台语自动语音识别中,先前研究通常将音调变调视为主要挑战,其假设是模型无法处理隐含的音韵变化。然而,我们对台语的实验表明,语音基础模型实际上能有效处理音调变调,真正的性能瓶颈在于这些变调与保留的本调之间存在的局部混淆。为此,我们提出 T-SANDHI,该方法在冻结的 Whisper 主干网络之上显式地将表面声学与底层词汇意图解耦。通过由文本派生伪标签驱动的词典引导多任务学习结构,我们的轻量级混合注入模块通过动态门控整合独立的本调和变调音韵流。在 TAT-MOE 语料库及两个盲测集上的广泛评估表明,这种显式解耦有效解决了音调映射混淆问题,在严格的参数效率下超越了基线方法。

###### 关键词:

自动语音识别,低资源,台语,音调变调,词典引导

## 一、引言

大多数自动语音识别系统的一个基本假设是表面声学与底层词汇单元之间存在一致、可靠的映射关系。然而,在具有复杂音韵变化的声调语言中,这种映射关系变得不那么直接。一个典型例子是台语。与保持相对静态音调映射的普通话不同,台语具有一个复杂的音调变调网络,根据音节在句法单元中的位置应用变调。在连续语音中,变调应用于每个非末音节,这意味着实际表面音调会根据语法语境频繁变化。因此,音节的底层字典发音(即本调)仅出现在特定的形态句法定义的边界处,而所有其他音节都以变化的音调(即变调)实现。如图 1 所示,当说话者发出代词“你”(台语汉字:你)时,本调音节为“lí”(第 2 声),而变调音调为第 1 声。

当前的语音识别系统通常依赖模型通过最终的转录损失隐式内化这些复杂的音韵映射。虽然在数据丰富的场景中,通过参数扩展可以部分吸收这种变化,但这种隐式学习范式在低资源约束下常常面临巨大挑战。为了应对这些限制,采用参数高效微调技术(如 AdaLoRA)已成为将语音基础模型适配到各种低资源语言的标准且高效的方法。遵循这一既定范式,我们在参数高效框架的基础上进行研究,以探索基础模型的行为。先前的研究侧重于利用带本调的音节作为目标标签,评估各种自监督学习模型与连接时序分类损失。他们的研究结果表明,音调变调是字符替换错误的主要来源,在预测中经常混淆语音上相似的音素,因此建议未来的努力采用独立的音调处理机制。然而,目前尚不清楚现代语音基础模型(如 Whisper)是否同样受到音调变调变化的影响。

图 1:台语连续语音中声学与标签差异的示意图。由于音调变调系统,实际表面音调(变调,橙色高亮)频繁偏离其字典发音(本调)。例如,在短语“今天你要去哪里”中,代词“lí”从第 2 声变为第 1 声,而只有句末音节保留了其原始本调(蓝色高亮)。

为了弥补这一空白,我们进行了实证分析,评估了不同模型规模下的基线预测。我们的发现揭示了一个反直觉的现象:尽管现代基础模型在处理音调变调方面表现出相当熟练的能力,但其性能瓶颈显著出现在真正保留本调的音节上。正如我们将在第二部分详细阐述的,这种局部性能差距主要是由连续语音中极端的音量不平衡驱动的,其中不同的底层本调类别经常混淆为相同的表面实现。这些实证结果表明,显式地结合本调和变调音节信息可以成为减少这种局部性能差距并提高整体语音识别准确性的可行途径。

表 1:TAT-MOE 数据集在训练、开发和测试集划分上的统计信息,包括说话者数量、话语数量和总时长(小时)。

为了解决这一关键差距,我们提出了 T-SANDHI,即音调变调自适应网络,专门用于解决音调映射歧义。我们没有将声学到标签的映射视为一个整体的黑盒,而是在冻结的 Whisper 主干网络之上引入了一个参数高效的解耦混合注入机制。为了克服数据稀缺而不依赖昂贵的音韵标注,我们采用了一个由规则驱动的多任务学习框架,该框架由自动生成的基于文本的伪标签驱动。具体来说,通过利用 CTC,我们显式地构建了两个辅助流:一个预测本调音节,另一个跟踪变调音调。由于变调变化高度依赖上下文,因此采用动态门控机制无缝集成这两个音韵流。这种显式解耦允许解码器同时基于表面声学变化和底层词汇意图进行预测。

本研究的主要贡献如下:
1.  **关于音调变调的新见解**:我们揭示了虽然基础模型能够有效处理音调变调,但由于严重的音调混淆,它们难以将这些声学信息映射回本调形式。
2.  **显式解耦架构**:我们提出了第一个通过动态门控、双流注入模块将表面声学与底层词汇意图解耦的语音识别框架。
3.  **高效且开销极小**:我们的方法有效缓解了 TAT-MOE 上的映射歧义,在仅为主干网络增加 3% 参数的情况下,实现了稳健的性能提升。

表 2:TAT-MOE 语料库上的基线性能分析,评估变调和本调上下文。

## 二、语料库与音韵分析

### 二-A、语料库

为了在真实的低资源条件下进行评估,我们使用了 TAT-MOE 语料库,以及两个外部的盲测集:FSRC 2020 语料库和 yttd_taigi_trs 语料库。这三个数据集都包含多样化的口音和自发语音。TAT-MOE 语料库在训练、开发和测试集划分上的详细统计信息总结在表 I 中。声学信号统一重采样至 16 kHz 以对齐主干网络。作为一种声调语言,台语拥有丰富而复杂的音调变调系统。在连续的语音流中,这些变调变化系统性地应用于形态句法定义的单元内几乎每个非末音节,导致字典本调形式与上下文表面实现之间存在显著差异。以下详细介绍了关于这种音调分布及其对现代语音识别影响的统计音韵分析。

### 二-B、音调变调影响的定量分析

为了研究这种音韵差异对现代语音基础模型的影响,我们基于音韵边界评估了不同规模的 Whisper 基线。训练集中的上下文音调变调变体由标准变调规则确定性地推导得出。如表 II 所详细说明的,扩大架构可以提高整体性能,但局部差距依然存在。与解码本调形式音节相比,模型在解码变调形式音节时始终表现出更低的字符错误率。无论模型规模大小,相应的精确度和召回率下降都证实了音调映射混淆的存在,即网络难以区分本调特征和音调变调变化。

为了分析这种局部性能差距,我们从音韵学的角度检查了数据分布。图 2(a) 显示了台语连续语音中严重的音量不平衡,其中约 87% 的音节经历了变调,而只有约 12% 保留了其本调。这种极端的不平衡使基础模型在预训练期间偏向变调的声学特征。因此,在低资源微调下,隐式端到端学习无法为保留本调的音节构建足够鲁棒的表示。此外,图 2(b) 中的音调转换矩阵说明,不同的底层本调类别经常混淆为相同的表面实现。例如,底层的第 1 声和第 5 声在变调后常常汇聚为表面的第 7 声。这种多对一的映射歧义在变调和本调形式之间造成了局部混淆,限制了整体性能,并促使我们提出架构中的显式音韵解耦。

## 三、所提方法

### 三-A、架构概述

如前所述,迫使语音识别模型隐式地记忆语音(经历变调)与本调标签之间复杂的非线性映射,会导致严重的表层到底层映射差异。为了显式打破这种纠缠,我们提出了 T-SANDHI。如图 3 所示,该架构建立在冻结的 Whisper 编码器-解码器主干网络的强大声学先验之上。为了在适应复杂台语音韵学的同时保持参数效率,我们仅对注意力模块和前馈模块应用 AdaLoRA,以避免灾难性遗忘。关键是,我们没有依赖解码器来隐式解决音调歧义,而是直接在编码器之上引入了一个解耦混合注入模块。该模块显式地构建了两个独立的辅助流:一个建模底层词汇意图(本调音节),另一个跟踪实际的表面音调(变调音调)。

图 3:T-SANDHI 架构图。为显式解耦词汇意图与表面声学,一个解耦混合注入模块增强了冻结的 Whisper 编码器。它将特征投影到独立的本调和变调流中,并通过一个门生成器将它们动态融合为 H_fused。轻量级线性头在训练期间提供 CTC 监督,在推理时提供解耦表示,且开销可忽略不计。

### 三-B、解耦混合注入

我们的注入模块背后的核心设计哲学是强制进行表示解耦,而不引入沉重的计算开销。令 H_enc ∈ R^{T×d} 表示来自 Whisper 编码器的声学隐藏状态,其中 T 是序列长度,d 是隐藏维度。我们通过两个辅助 CTC 头将这些状态投影,以获得本调 logits Z_cit ∈ R^{T×|V_cit|} 和变调 logits Z_san ∈ R^{T×|V_san|}:

Z_cit = H_enc W_cit + b_cit,     (1)
Z_san = H_enc W_san + b_san,     (2)

相似文章

基于音调条件的课程学习用于低资源班图语语音识别

arXiv cs.CL

本文提出了一种基于音调条件的课程学习框架,用于低资源班图语语音识别,结合了混合难度评分、门控适配器和分阶段课程训练。对六种南部班图语的评估显示,W2V-BERT在恩古尼语上优于Whisper,而Whisper在索托-茨瓦纳语上表现更好。

DialectS2S:面向低资源中文方言的端到端语音对话建模

arXiv cs.CL

DialectS2S是一个面向低资源中文方言的端到端语音对话模型,引入了可扩展的数据合成流程和一种带有自对齐语音监督的两阶段后训练策略。实验表明,在方言一致性、响应质量和可懂度方面均有提升,并且模型、数据和代码全部开源。