利用多模态特征融合联合改进印度语言中的方言识别与语音识别
摘要
本文提出了一种多模态框架,利用瓶颈编码器和带门控机制的RoBERTa,联合改进印度语言的自动语音识别(ASR)和方言识别(DID)。在包含33种方言的八种语言上评估,该方法实现了81.63%的方言识别准确率,并将CER/WER降低至4.65%/17.73%。
arXiv:2607.02862v1 公告类型:新
摘要:自动语音识别(ASR)和方言识别(DID)对印度语言至关重要,其中许多是低资源语言,且存在显著的方言差异。现有方法通常单独优化ASR或DID,导致性能权衡。本文提出了一种多模态框架,联合改进ASR和DID。我们的方法使用瓶颈编码器从基于Conformer的语音表示中提取方言特征,并使用RoBERTa编码器处理ASR生成的CTC嵌入。门控机制融合这些特征,随后通过注意力编码器精炼表示。学习到的嵌入与Conformer输出连接以增强ASR特征。在包含三十三种方言的八种印度语言上评估,我们的方法实现了平均81.63%的DID准确率,以及平均4.65%的CER和17.73%的WER。这些结果突出了我们的方法在联合ASR-DID建模中的有效性。
查看缓存全文
缓存时间: 2026/07/07 04:36
# 利用多模态特征融合联合提升印度语言方言识别与语音识别性能 来源:https://arxiv.org/html/2607.02862 \\interspeechcameraready Kumar Ghosh nocounter\]Department of Electrical EngineeringIndian Institute of Science, BangaloreIndia ###### 摘要 自动语音识别(ASR)和方言识别(DID)对于印度语言至关重要,其中许多语言资源匮乏且存在显著方言差异。现有方法通常分别优化 ASR 或 DID,导致性能权衡。本文提出了一种多模态框架,可联合提升 ASR 和 DID 性能。我们的方法采用瓶颈编码器从基于 Conformer 的语音表示中提取方言特征,并使用 RoBERTa 编码器处理 ASR 生成的 CTC 嵌入。门控机制融合这些特征,随后通过注意力编码器精炼表示。学习到的嵌入与 Conformer 输出拼接以增强 ASR 特征。在包含三十三种方言的八种印度语言上评估,我们的方法实现了 81.63% 的平均 DID 准确率,以及 4.65% 和 17.73% 的平均字符错误率(CER)和词错误率(WER)。这些结果凸显了我们的方法在联合 ASR-DID 建模中的有效性。 ###### 关键词: 自动语音识别,方言识别,印度语言 ## 1 引言 自动语音识别(ASR)和方言识别(DID)对于推进语音技术至关重要,尤其是在印度等语言多样性地区。ASR 系统依赖稳健的声学和语言模型来准确转录语音,而 DID 有助于使 ASR 模型适应不同的方言变体。准确识别方言可通过减轻由发音、词汇和语法差异引起的错误来提升 ASR 性能 [Udupa_ASRU2023]。然而,尽管 ASR 和 DID 相互依赖,传统上它们作为独立任务被研究,导致方言敏感的 ASR 应用性能欠佳。 DID 本质上比语言识别(LID)更具挑战性。LID 涉及区分不同语言,而 DID 需要区分同一语言的不同方言,这些方言通常共享相似的语音、词汇和句法特征 [singh2021spoken, montavon2009deep, punjabi2021joint, lyu2022ant]。这些相似性使得 DID 比 LID 困难得多。许多前期研究利用多任务学习探索联合 ASR 和 LID 以提升系统性能 [punjabi2021joint, zhang22da_interspeech, William_LID_ICASSP2023, Zhou_ICASSP2022],但专注于联合 ASR 和 DID 的研究较少 [Imaizumi_Japanese_DID2022, lonergan2024low, ICASSP25_DID]。针对印度语言的联合 ASR-DID 研究仍有限 [ICASSP25_DID],尽管近期研究引入了针对这些语言的方言 ASR 系统 [Bhardwaj_Punjabi_ASR_2021, Priya_MLASR2022, Arunkumar2022DuDeDM, Amitoj_ASR_Survey_2020, diwan21_interspeech, Udupa_ASRU2023, ICASSP25_DID]。 虽然联合 ASR-DID 方法 [Imaizumi_Japanese_DID2022, lonergan2024low, ICASSP25_DID] 显著优于单纯依赖音频或文本特征的传统的 DID 方法 [luo23c_interspeech, sullivan23_interspeech, kakouros23_interspeech, shaik_24_icassp, radhakrishnan23_interspeech, mishra-mujadia-2019-arabic, Althobaiti_text_DID_2020, goswami2020unsupervised],但此类设置中的 ASR 系统往往性能次优。在许多情况下,DID 的提升是以 ASR 性能下降为代价的。例如,[Imaizumi_Japanese_DID2022] 报告称,一个多方言日语 ASR 系统通过将 DID 作为辅助任务提高了 DID 准确率。然而,最佳 ASR 和 DID 性能是在不同设置下实现的,最佳 DID 模型会降低 ASR 性能,尤其在 DID 预测错误的情况下。类似地,[lonergan2024low] 提出了一种针对爱尔兰方言的基于 ASR 的 DID 系统,采用中间 CTC 损失,提高了 DID 性能但导致 ASR 性能轻微下降。这种权衡凸显了需要一种有效平衡两项任务的联合建模方法。 近期,[ICASSP25_DID] 提出了一种基于 ASR 的 DID 方法,利用在多任务设置中联合训练的方言感知 ASR 模型的多模态特征,在八种印度语言上达到了最先进的 DID 准确率。然而,未报告 ASR 性能提升,这很可能源于固有局限性,例如 DID 块到 ASR 块的梯度传播缺失,以及将文本前缀加上方言标记,当预测的方言 ID 不正确时可能导致 ASR 模型学习到错误上下文。 受这些挑战的启发,我们提出了一种新颖的多任务设置下的联合 ASR-DID 框架,采用多模态特征融合¹。我们的方法使用瓶颈编码器捕捉基于 Conformer 的语音表示中的方言变化,并使用 RoBERTa 编码器提取从 Conformer 输出派生的 CTC 嵌入中的方言线索。这些互补表示通过门控机制融合,随后由注意力编码器精炼方言表示。为进一步提升 ASR 性能,学习到的注意力嵌入与 Conformer 编码器输出拼接,通过额外的注意力层提取更丰富的 ASR 特征。与先前方法不同,我们提出的 ASR-DID 框架不会在训练文本前添加方言 ID,从而在方言预测错误的语句中实现了显著的 ASR 性能提升。 我们在八种印度语言上评估了所提出的方法,涵盖来自印度不同地区的 33 种方言。实验结果表明,与现有最先进方法相比,ASR 和 DID 均取得了显著提升。所提出的框架通过利用多模态注意力融合实现稳健的联合建模,有效缓解了 ASR 和 DID 之间的权衡。这项工作有助于为印度语言(尤其在语言多样性环境中)开发更准确、更具适应性的语音技术这一更广泛目标。 ## 2 提出方法 参见图注 \(\(a\)\) 参见图注 \(\(b\)\) 图 1:\(a\) 提出的架构和 \(b\) 瓶颈编码器(左)与注意力编码器(右)的示意图。我们提出的方法采用多模态特征融合来联合提升印度语言的自动语音识别(ASR)和方言识别(DID)。如图 1\(a\) 所示,架构包含两个主要组件:ASR 块和 DID 块,整合了语音和基于文本的方言线索以实现有效的表示学习。 ### 2.1 ASR 块 ASR 块使用自监督学习(SSL)编码器处理输入语音以提取语音和韵律特征,随后由 Conformer 编码器进行精炼。该模块通过卷积层捕捉局部语音模式,并通过自注意力捕捉长程依赖。 Conformer 输出被送入 DID 块,在其中通过融合来自瓶颈编码器和 RoBERTa 编码器的特征获得多模态表示。RoBERTa 编码器处理 CTC 嵌入,这些嵌入是通过将 Conformer 输出通过线性层投影到词汇表大小后经 softmax 函数得到的(如图 1\(a\) 中 CTC Softmax 块所示)。门控机制结合这些表示,再经注意力编码器进一步精炼并线性投影以提取帧级方言嵌入。 为了整合多模态特征,DID 块的方言嵌入在 ASR 块中与 Conformer 输出拼接。为防止梯度干扰,这些嵌入在拼接前从计算图中分离,确保梯度仅在 ASR 块内流动。 最终组合表示由注意力编码器和线性投影处理,然后送入两个并行解码器:(1) 用于上下文感知 token 预测的注意力解码器和 (2) 用于非自回归转录的 CTC 解码器。两个解码器共同生成最终的 ASR 输出。 ### 2.2 DID 块 DID 块旨在通过整合语音和文本特征来分类方言。它以 Conformer 编码器的输出作为输入,并通过多个专用组件进行处理。 #### 2.2.1 瓶颈编码器 瓶颈编码器提取并精炼基于语音的方言特征。它由一个用于特征提取的卷积块和一个用于全局表示学习的瓶颈 Transformer [Srinivas_bneck_2021] 组成。如图 1\(b\)(左)所示,该架构受 [Alhakeem_bneck_did2024] 启发,后者在多头部自注意力(MHSA)两侧使用 2D 卷积层和自适应平均池化。然而,为了更好地保留时间信息,我们将 2D 卷积替换为 1D 卷积,并移除平均池化层。这一优化保留了 ASR 编码的语音表示中对于方言分类至关重要的关键时间动态。 #### 2.2.2 RoBERTa 编码器 受 [Liu2019RoBERTaAR] 启发,该模块从 CTC 嵌入中提取上下文方言特征。这些嵌入首先线性投影到低维空间,然后由 RoBERTa 处理,以补充来自瓶颈编码器的基于语音的特征。 #### 2.2.3 门控机制 为了动态平衡语音和文本特征的贡献,采用门控机制。给定两个特征表示,自适应权重函数通过线性变换和 sigmoid 激活计算一组可学习权重: G=σ\(Wg\[Hbottleneck, Hrob\] + bg\) (1) 其中 σ 表示 sigmoid 激活,Wg 和 bg 是可学习参数。拼接后的特征表示为 \[Hbottleneck, Hrob\]。最终融合表示计算为: Hfused = G ⊙ Hrob + (1 - G) ⊙ Hbottleneck (2) 其中 ⊙ 表示逐元素乘法。 #### 2.2.4 注意力编码器 融合表示通过注意力编码器进一步精炼,该编码器通过多头自注意力(MHSA)和层归一化增强上下文依赖性。该模块包含上投影和下投影层及激活函数以精炼特征表示,同时使用残差连接实现稳定学习。注意力编码器与 ASR 块中使用的架构相同,如图 1\(b\)(右)所示。最终输出线性投影以获取帧级方言嵌入。 应用平均池化获得固定长度表示,然后通过带 softmax 激活的分类器进行方言预测。通过自适应门控和注意力机制整合语音和文本特征,DID 块有效捕捉语言和声学细微差别,实现稳健的方言识别。 ### 2.3 目标函数 为了联合优化 ASR 和 DID 任务,我们采用加权损失函数。总损失 L 由 CTC 损失 L_CTC、注意力损失 L_ATT 和交叉熵损失 L_CE 组成,公式如下: L = λ_CTC L_CTC + (1 - λ_CTC) L_ATT + γ_CE L_CE (3) 其中 λ_CTC 管理 CTC 和基于注意力的 ASR 损失之间的平衡,γ_CE 调节 DID 交叉熵损失的影响。 我们的框架通过多模态语音-文本表示整合 ASR 和 DID。门控平衡特征,分离防止梯度干扰,确保稳定优化。这增强了转录和方言分类,使其非常适合印度的多样语言。 ## 3 实验 ### 3.1 数据集 我们使用 RESPIN 数据集的一个子集,涵盖八种印度语言:博杰普尔语(bh)、孟加拉语(bn)、恰蒂斯加尔语(ch)、卡纳达语(kn)、马加希语(mg)、迈蒂利语(mt)、马拉地语(mr)和泰卢固语(te)。训练-测试划分遵循 [ICASSP25_DID]²,每种语言大约有 140-175 小时的训练数据、2 小时的开发数据和 6-8 小时的测试数据,均为朗读语音环境。 ### 3.2 实验设置 我们的实验在 ESPnet³ 中进行,将所提方法与最先进的 ASR-DID 框架进行比较。混合 CTC/注意力 ASR 模型包含一个 8 块 Conformer 编码器(256 维输出,4 头,1024 维前馈)和一个 6 块 Transformer 解码器(4 头,2048 维前馈),两者的 dropout 均为 0.1。应用 CTC 权重 0.3、交叉熵缩放 5 和标签平滑 0.1。使用 Adam 优化,学习率 0.002,权重衰减 1×10⁻⁶,预热步数 1.5×10⁴。批大小动态调整为 6M 批 bin,早停耐心值为 5。根据验证准确率选择前 5 个模型。前端采用预训练的 IndicWav2Vec 模型⁴,从第 7-11 层提取特征并投影到 80 维。数据增强包括 3 路速度扰动和 SpecAugment(时间扭曲、频率掩蔽最多 27 个 bins、时间掩蔽序列的 5%)。上游模型参数冻结。超参数基于验证性能经验调优。 ### 3.3 评估方法 我们评估了以下配置: - **Base-ASR**:无 DID 作为辅助任务的标准 ASR。 - **ASR-DID**:Base-ASR 并在文本前添加方言 ID。 - **ASR-DID-SC**:ASR-DID 并基于 CTC 的自条件(第 2 个 Conformer 层)[William_LID_ICASSP2023]。 - **ASR-DID-AUX**:ASR-DID 并为 DID 任务添加辅助 CTC(第 2 个 Conformer 层)[lonergan2024low]。 - **ASR-DID-ROB**:类似于 [ICASSP25_DID] 中报告的基于 ASR 的 DID,ASR 配置与 Base-ASR 相同。 - **ASR-BN**:联合 ASR-DID,包含带瓶颈编码器的 DID 块(见图 1\(b\)),后接平均池化和线性分类器进行方言预测(瓶颈维度:32,4 注意力头,dropout 0.1)。 - **ASR-ROB**:使用 RoBERTa 编码器的联合 ASR-DID;从 Conformer 输出派生的 CTC 嵌入被投影通过……
相似文章
利用双语微调与语言识别改进低资源ASR:一项跨语言评估
本研究评估了使用语言识别令牌进行双语微调以改进低资源语言ASR的方法,涉及九个多样化的语言对。结果发现,高语言识别准确率是有益的,而在语言识别准确率低的情况下,在推理时提供语言识别令牌可以提升性能。
Vividh-ASR:面向稳健印度语音识别的复杂度分层基准与优化动态
介绍了用于印地语和马拉雅拉姆语ASR的复杂度分层基准Vividh-ASR,指出了微调中的录音室偏差,并提出了R-MFT以高效提升自发言语性能。
Voice of India:面向印度真实场景的大规模语音识别基准
研究者发布 Voice of India,一个包含 536 小时、覆盖 15 种印度语言和 139 个区域集群的即兴电话对话闭源基准,揭示地理与人口统计学层面的 ASR 性能差异。
课堂环境下的多模态说话人识别
本文评估了一种用于K-12课堂说话人识别的多模态框架,通过将声学嵌入(ECAPA-TDNN)与基于LLM的转录本语义上下文相结合,将整体准确率从39%提升至50.3%,对于较长话语,准确率从64.9%提升至76.9%。
SamaVaani:印度语言多语言临床ASR的审计与去偏
本文对印度语言的精神病学访谈中的多语言临床ASR系统进行了系统性审计,并提出了SamaVaani,一种统一的去偏技术,旨在提升跨人口群体的性能与公平性。