受限CTC解码实现高效变音符号恢复

arXiv cs.CL 论文

摘要

本文提出了一种基于CTC的非自回归方法,用于阿拉伯语语音到文本的变音符号恢复,在解码过程中引入硬约束以提高效率并降低错误率。

arXiv:2607.18946v1 公告类型: 新 摘要: 在这项工作中,我们研究了阿拉伯语语音转录文本的变音符号恢复问题。大多数语音数据未标注变音符号,这限制了建模细粒度语音区别的能力。最近,语音模态被探索作为文本变音恢复工作的补充方式。我们提出了一种基于连接时序分类(CTC)的高效非自回归语音到文本变音符化方法。我们的方法在解码过程中引入硬约束,通过从未加变音符号的转录文本构建字符级变音符号格,并将假设限制为有效的变音符号实现。我们在古典阿拉伯语和现代标准阿拉伯语测试集(即ArVoice和ClArTTS)上进行了评估,与计算复杂度更高的多模态变音恢复基线相比,在两者上均显示出统计上显著的变音错误率降低,证明了所提方法在性能和效率上的双重优势。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:24

# 受约束的CTC解码用于高效变音符号复原 来源:https://arxiv.org/html/2607.18946 Marew Keleg Aldarmaki ###### 摘要 本文针对阿拉伯语语音转录中的变音符号复原问题展开研究。大多数语音数据未标注变音符号,限制了建模细粒度语音区分的能力。最近,语音模态被探索作为文本变音符号复原的补充手段。我们提出了一种基于连接主义时序分类(CTC)的高效非自回归方法,用于语音到文本的变音标注。该方法在解码过程中引入硬约束,通过从未标注变音符号的转录构建字符级变音标注网格,并将假设限定为有效的变音标注实现。我们在古典阿拉伯语和现代标准阿拉伯语测试集(即 ArVoice 和 ClArTTS)上进行了评估,与计算复杂度更高的多模态变音符号复原基线相比,两者在变音符号错误率上均取得了统计学显著降低,证明所提方法在性能和效率方面均有提升。111代码库地址:https://github.com/rufaelfekadu/DiaCTC ###### 关键词:语音识别,变音符号复原 ## 1 引言 阿拉伯文字是一种辅音音素文字系统,字母字符主要表示辅音和长元音,额外的变音符号表示短元音、叠音、鼻音或元音缺失。然而,变音符号通常在文本中被省略[habash2010introduction],需根据上下文推断,这使得阿拉伯文字在语音应用中表达不足。在下游流程中,如文本转语音(TTS)和辅助阅读界面,缺少变音符号会导致系统性发音错误和歧义,尤其是同形异义词和形态复杂形式。此外,自动语音识别(ASR)模型通常无法生成完全标注变音符号的转录,因为缺乏大规模完全标注变音符号的数据。训练数据通常具有*混合覆盖*:有些语料库完全标注变音符号,如古典阿拉伯语数据(CA)或精心整理的现代标准阿拉伯语(MSA)资源,而大型ASR语料库和对话语音转录通常完全没有变音符号,较少情况下部分标注变音符号。 参见图注 图 1:一个具有歧义的未标注变音符号句子示例,有多种可能的变音标注方式,附有英文释义和音译(依据 HSB 方案[Habash2007])。 变音符号复原是填补缺失变音符号的任务,作为纯文本任务已有长久的研究和发展历史。在此设定中,变音符号复原被构建为序列标注任务,输入为未标注变音符号的文本,输出为对应的标注变音符号文本。该设定的一处局限是,单词在上下文中仍可能存在歧义[mohamed-mubarak-2025-advancing],如图 1 (https://arxiv.org/html/2607.18946#S1.F1) 所示。相反,相应语音信号的存在可能使这些歧义从声学线索(例如,元音质量/长度、叠音、仔细言语中的格尾、方言实现)中恢复,表明以语音为条件的变音标注可以优于纯文本复原。最近的研究表明,融入语音数据提供了互补信号,能够改善变音符号复原,因为元音信息可以从声学数据中推断[shatnawi_automatic_2024,shatnawi-etal-2024-data,ghannam2025abjad]。这些工作解决了*语音到文本的变音标注*:给定声学输入和*未标注变音符号*的文本参考,目标是预测与语音信号和给定未标注变音符号参考一致的完全标注变音符号转录。所有这些先前方法提出将声学或ASR模型与基于文本的解码器结合,形成多模态学习框架。这种设定确保基础未标注变音符号的字母字符保持不变,仅以受约束的方式向转录中添加变音符号,而直接ASR系统通常包含字符插入、删除和替换错误。虽然这些多模态方法在古典阿拉伯语中显示出潜力,但其对现代标准和方言阿拉伯语的泛化能力仍然较差[talafha-etal-2025-nadi],需要进行更多研究以推广性能。 在本工作中,我们提出了一种更高效的基于语音的变音符号复原方法,直接利用ASR CTC解码机制来满足所需语言约束,无需额外的文本模块和多模态训练。我们的关键思想是从未标注变音符号的转录构建一个*字符级变音标注网格*,并将解码假设限制为对应有效变音标注输出的路径。这产生了一个部分强制对齐的解码图:模型在各自位置发出参考字母字符,仅在预期的变音符号位置预测变音符号。与此前的多模态语音和文本变音标注解码器不同,这种设计保留了CTC解码的简洁性和速度优势,并可作为即插即用的解码约束集成到标准CTC-based ASR模型之上。我们通过实验证明,与基线相比,该方法在古典阿拉伯语和现代标准阿拉伯语上实现了更鲁棒、更泛化的变音符号复原性能,同时更加精简高效。 参见图注 \(a\) 默认CTC拓扑(适用于标注变音符号的阿拉伯语) 012345⟨b⟩\langle b\rangle:⟨ε⟩\langle\varepsilon\rangleA:AA:⟨ε⟩\langle\varepsilon\rangle⟨b⟩\langle b\rangle:⟨ε⟩\langle\varepsilon\rangle⟨δ⟩\langle\delta\rangle:⟨δ⟩\langle\delta\rangle⟨b⟩\langle b\rangle:⟨ε⟩\langle\varepsilon\rangle⟨δ⟩\langle\delta\rangle:⟨δ⟩\langle\delta\rangle⟨δ⟩\langle\delta\rangle:⟨ε⟩\langle\varepsilon\rangle⟨b⟩\langle b\rangle:⟨ε⟩\langle\varepsilon\rangleB:B⟨b⟩\langle b\rangle:⟨ε⟩\langle\varepsilon\rangleB:BB:⟨ε⟩\langle\varepsilon\rangle \(b\) 变音符号解码拓扑(针对模式 A.B) 图 2:\(a\) 典型ASR CTC拓扑,其中C表示阿拉伯字母字符集,与 \(b\) 我们提出的用于受约束变音符号解码的修改拓扑(针对模式`A.B')。δ\delta 表示通配符字符(变音符号 + 特殊标记)。 ## 2 背景与相关工作 ### 2.1 阿拉伯语变音符号复原 阿拉伯语变音标注已被广泛研究,但主要是作为基于文本的变音符号复原问题,其动机是尽管短元音和其他语音标记对于消除歧义至关重要[habash_arabic_2007,belinkov_arabic_2015],但在日常阿拉伯语写作中通常被省略。它被构建为序列标注任务,并使用不同类型的经典和神经架构进行训练,以预测每个输入字母字符对应的变音符号。最近一系列工作研究语音识别背景下的变音符号,要么通过训练ASR系统发出标注变音符号的文本,要么分析在不同监督条件下的变音符号识别行为[aldarmaki_diacritic_2023,alaqel_improving_2025]。这些研究报告称,当ASR使用人工标注变音符号的转录进行微调时,变音符号恢复可以改善,并提出了将变音符号识别质量与整体识别准确性分离的评估视角[aldarmaki_diacritic_2023]。由于完全标注变音符号的阿拉伯语音数据稀缺,先前工作探索了利用有限的标注变音符号语音监督以及基于文本的增强策略,或使用强大的预训练ASR模型来引导后续多模态复原模型的标注变音符号转录[shatnawi-etal-2024-data,ghannam2025abjad]。在[shatnawi_automatic_2024]中,语音通过用标注变音符号的ASR假设增强未标注变音符号的文本输入来间接使用。这些工作表明,将语音作为除文本输入之外的辅助输入模态可以显著改善变音符号复原性能。 ### 2.2 受约束解码与基于网格的推理 受约束解码是语音和语言处理中一个成熟的概念,加权有限状态转录机(WFST)提供了原则性框架来高效编码发音词典、语法和解码约束[mohri_weighted_2002]。在神经生成中,词汇受约束解码方法(例如,网格束搜索)将输出限制为满足所需约束,而不改变模型参数[hokamp_lexically_2017]。最近的工作扩展了CTC以通过扩展允许的对齐集合来纳入部分或灵活监督[starctc,gao_bypass_2023,gao_otc_2023]。例如,[nakagome_wctc-biasing_2025]在解码期间应用通配符CTC进行*偏置*和罕见词处理,使用启用通配符的评分/搜索过程来促进期望术语,而无需重新训练基础模型。Mask-CTC[higuchi_mask_2020]使用贪婪CTC初始化一个假设,然后通过掩盖低置信度标记并根据剩余上下文预测它们来迭代细化序列,将CTC对齐与掩码预测目标相结合。我们的方法与这些互补:我们不细化任意标记,而是施加一个*硬*转录骨架(未标注变音符号的字符)并将推理限制在允许位置插入变音符号。 表 1:实验中使用的数据集描述。CA 指古典阿拉伯语,MSA 指现代标准阿拉伯语(MSA),(*)指纯文本数据。 ## 3 提出的模型 我们在一个设定下解决*语音到文本的变音标注*,其中给定声学输入 xx 和未标注变音符号的字符序列 u=c_1...c_Nu=c\_1\\ldots c\_N 作为输入。我们的目标是在*保持基础字符不变*的情况下使用语音信号恢复缺失的变音符号,得到标注变音符号的字符序列 y=c_1d_1...c_Nd_Ny=c\_1d\_1\\ldots c\_Nd\_N。 标签设计。每个基础字符最多有一个变音符号;多变音符号组合被合并为单个字符标记,以保持 1 对 1 的字符级表示。这等同于大多数基于文本的变音符号复原方法,被表述为字符级序列标注任务。在真实标注不含变音符号的情况下,常用做法是使用特殊的`无变音符号`标记。在我们的方法中,我们使用CTC空白标记来表示变音符号的缺失。 ### 3.1 声学模型与CTC训练 对于训练,我们使用带有标注变音符号转录的可用语音数据。我们训练一个基于CTC的ASR模型来预测目标字符序列,包括字母及其各自的变音符号。给定声学特征序列 xx,神经编码器产生帧级后验概率: p_t(k∣x), t=1...T, k∈V∪{ε},p\_t(k\\mid x),\\quad t=1\\ldots\\mathcal{T}, k\\in\\mathcal{V}\\cup\\{\\varepsilon\\},(1) 其中 V\\mathcal{V} 是输出词汇表,ε\\varepsilon 是CTC空白符号。在CTC下,标签序列 yy 的概率为: P(y∣x)=∑_{π∈B(y)}P(π∣x),P(y\\mid x)=\\sum_{\\pi\\in\\mathcal{B}(y)}P(\\pi\\mid x),(2) 其中 π\\pi 是帧级对齐路径,B(⋅)\\mathcal{B}(\\cdot) 是所有映射到 yy 的有效路径 π\\pi 的集合。训练最小化负对数似然: L_{CTC}=−log P(y⋆∣x),\\mathcal{L}\_{\\mathrm{CTC}}=-\\log P(y^{\\star}\\mid x),(3) 其中 y⋆y^{\\star} 是参考标注变音符号的转录。 ### 3.2 带变音标注约束网格的推理 在典型ASR推理中,CTC解码找到最可能的标签序列,每个时间步的标签词汇包括所有输出字符,实现为加权有限状态转录机(WFST)。默认CTC拓扑如图2(a) (https://arxiv.org/html/2607.18946#S1.F2.sf1) 所示。在我们的应用中,我们只需预测变音符号序列,同时保持参考字母序列不变。为了实现此约束,我们构建一个网格 G_char(u)G\_{\\mathrm{char}}(u),它是一个线性链WFST,其状态跟踪未标注变音符号转录 uu 的进度,并在每个阿拉伯字母 u_iu\_i 之后插入额外的通配符状态用于变音符号预测。例如,如果未标注变音符号的转录是 c_1c_2c_3c\_1c\_2c\_3,则包含通配符(`.' 字符)的结果模式 pp 将是 `c_1.c_2.c_3.c\_1.c\_2.c\_3.'。令 W⊆VW\\subseteq\\mathcal{V} 为通配符字符集,在我们的模型中,这些是复合阿拉伯变音符号标签以及CTC空白符号;网格构建如下:对于 pp 中的每个字符, - • 如果 p_jp\_j 是通配符,则添加并行弧用于 W 中的每个通配符字符: s_{j−1}→δ s_j, ∀δ∈W.s\_{j-1}\\xrightarrow{\\delta}s\_j,\\quad\\forall\\delta\\in W.(4) - • 否则,直接发出字符: s_{j−1}→c_i s_j.s\_{j-1}\\xrightarrow{c\_i}s\_j.(5) 该网格紧凑地表示了所有与 uu 兼容的标注变音符号字符串,并可作为WFST风格的接收器实现。产生的解码图可见于2(b) (https://arxiv.org/html/2607.18946#S1.F2.sf2)。操作上,这可以通过将CTC解码图与 G_char(u)G\_{\\mathrm{char}}(u) 组合来实现,或者将束扩展限制为仅由网格状态中对应当前字符位置的出弧所允许的符号。直观上,这是一种*部分强制对齐*形式:解码图强制基础字母以与 uu 相同的顺序出现在输出中,模型仅预测每个字母伴随哪个变音符号(如果有)。 ## 4 实验细节 ### 4.1 数据集 表 1 (https://arxiv.org/html/2607.18946#S2.T1) 列出了用于训练和测试基线及提出模型的数据集。我们使用涵盖不同阿拉伯语变体的两个数据集来测试模型的泛化能力: 1. 1. ClArTTS[kulkarni2023clartts] 提供基于经典宗教书籍的古典阿拉伯语中精心朗读的单说话人语音,转录带有手动完全标注的变音符号。 2. 2. ArVoice[toyin25_interspeech] 包含来自新闻领域的现代标准阿拉伯语多说话人朗读语音数据;我们使用完全标注变音符号的部分(部分 1 和 3)。 ### 4.2 数据预处理 我们应用轻量级标准化流程来统一文本并减少不一致性。关键的是,我们将字符串标准化为 Unicode 标准定义的*规范化形式规范合成 (NFC)* 形式,以统一具有多种编码的字符表示(例如,`Alef with Hamza' 作为单个字符 `\U0623' 或多个字符 `\U0627\U0654')。这也将连续变音符号的顺序标准化为规范顺序。我们另外将多个连续空白符折叠为单个空格。 表 2:来自[grosman2021xlsr53-large-arabic]的ASR模型在ClArTTs和ArVoice合并训练集上微调前后的性能。WER/CER分别使用标注变音符号文本(Diac)和未标注变音符号文本(Undiac)计算,以分离变音符号错误与基础字符错误。参考变音符号覆盖率(DCov):ArVoice=73.19,ClarTTS=79.13。 ### 4.3 基线 作为基线,我们使用以下两个模型:

相似文章

CohereLabs/cohere-transcribe-arabic-07-2026

Hugging Face Models Trending

Cohere 发布了一个开源的 2B 参数阿拉伯语 ASR 模型,该模型基于 Conformer 编码器-解码器架构,针对阿拉伯方言性能和阿拉伯语-英语代码切换进行了优化。

评估阿拉伯语言模型对抗鲁棒性

arXiv cs.CL

本文评估了五种阿拉伯语言模型在字符级、单词级和句子级攻击下的对抗鲁棒性,结果表明插入变音符号可使准确率降低92%,对抗训练能提升鲁棒性但存在局限性。