代码混合语音强制对齐的评估:以印地语-英语为例
摘要
本文使用Montreal Forced Aligner评估印地语-英语代码混合语音的强制对齐,证明引导策略和代码混合训练数据相比单语替代方案,对齐精度提高了十倍。
arXiv:2607.25581v1 公告类型:新
摘要:代码混合语音对强制对齐提出了独特挑战:扩展的音素库、拼写错误和说话人变化。我们使用Montreal Forced Aligner评估印地语-英语代码混合语音的强制对齐。我们解决了两个问题:(1)涉及本地与非本地对的自发变异;(2)话语中间英语单词的音位边界检测。引导策略显著优于未修改的词典。基于句子级代码混合数据训练的声学模型实现了4.15ms的平均误差,比单语印地语(38.18ms)或孤立英语(37.58ms)替代方案低十倍。合理的词典设计和代码混合训练数据对于双语语音的可靠对齐都至关重要。
查看缓存全文
缓存时间: 2026/07/29 09:55
# 代码混合语音的强制对齐评估:以印地语-英语为例 来源:https://arxiv.org/html/2607.25581 Pandey Gogoi Tang\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English PamirKevin1Karya, India 2海因里希·海涅大学杜塞尔多夫分校英语与美洲研究学院英语语言与语言学系,德国 3佛罗里达大学语言学系,美国 ayushi@karya\.in, pamir\.gogoi@karya\.in, kevin\.tang@hhu\.de (https://arxiv.org/html/2607.25581v1/mailto:[email protected],%[email protected],%[email protected]) ###### 摘要 代码混合语音给强制对齐带来了独特挑战:扩展的音位清单、拼写错误以及说话人变异。我们使用蒙特利尔强制对齐器评估了印地语-英语代码混合语音的强制对齐。我们解决了两个问题:(1) 涉及母语与非母语音位对的自由变异,以及 (2) 语句中间英语单词的音位边界检测。引导策略显著优于未修改的词典。基于句子级代码混合数据训练的声学模型实现了 4.15 毫秒的平均误差,即比单语印地语 (38.18 毫秒) 或孤立英语 (37.58 毫秒) 替代方案低十倍。原则性的词典设计和代码混合训练数据对于双语语音的可靠对齐都至关重要。 ###### 关键词: 代码混合,语码转换,强制对齐,发音变异,语音识别 ## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1 引言 代码混合(在句子框架中插入另一种语言的词级成分)经常出现在双语和多语社区的日常言语中。英语作为印度官方语言之一,被公认为广泛的教育媒介,并在国内享有高级双语地位[parasher1981indian]。因此,印度语言使用者经常在其地区母语 (L1) 和英语之间进行转换。 代码混合现象已在印度语言的语音技术全栈中得到积极处理:从数据集策展[pandey2018phonetically,nayak2022l3cube,senthamizhselvi2025building]、语音识别[palivela2025code,bhogale2026towards],到语言模型中的推理,以及用于语音界面的音频生成[gourav2025code,murthy2025building]。然而,在代码混合中进行音位对齐这一基础任务在印度语言中很大程度上被忽视了。这意味着对于代码混合进行语音学、语言学分析所需的计算资源的范围和理解严重不足。 音位对齐产生时间对齐的音位边界,是语言大规模语音学分析的关键组成部分。强制对齐器[mcauliffe17\_interspeech,gorman2011prosodylab,bain2023whisperx]自动执行此过程,使语音学家能够记录低资源语言[chodroff2025comparing,wang2023evaulating,Tang\_Bennett2019\_bootstrapping\_FA]、建模说话人变异,并用真实世界数据补充其实验室产出结果[chodroff2014burst]。代码混合语音的强制对齐为研究双语说话人的扩展音位清单[amazouz2019exploring,pandey2020understanding]以及在真实世界、通常低资源的环境中检查其结果[ahn\-etal\-2025\-automatic]提供了独特的机会。因此,本文对代码混合语言(印地语和英语)的强制对齐进行了结构化实验。它识别并解决了此类开发中出现的两个问题。 第一个问题是语音学性质的。研究问题1:如何在强制对齐框架内自动建模代码混合语音中的发音变异?印地语的双语产出在跨语言共享的音段中经常表现出自由变异。例如,英语单词“phone”可能被实现为 [phon] 或 [fon]。这与同一目标音位的说话人变异不同,因为目标有时会在同一说话人内部发生变化。当文字没有明确指定目标音位时,问题会进一步加剧。我们在实验一中解决了这个问题,我们确定这种变异的确切位置存在于 []∼\\sim[z] 变异中。这个问题已通过引导方法解决。 代码混合强制对齐中的第二个问题是技术性质的。研究问题2:哪种声学训练数据(代码混合、单语印地语或语料库内英语)最适合对齐双语语音中语句中间的英语单词?语句中间英语单词的准确音位边界检测取决于声学训练数据的组成。仅使用单语印地语或单语英语训练的声学模型可能无法充分反映双语产出模式。因此,尚不清楚句子级代码混合训练数据是否在强制对齐方面比单语替代方案更具优势[ahn\-etal\-2025\-automatic,ahn2025investigating]。 研究问题1解决了在发音词典内建模双语段变异性问题,超越了单语音位假设,以更好地反映实际存在的产出模式。研究问题2评估了声学训练数据的组成如何影响混合语言上下文中的对齐质量,特别是对于嵌入的英语项目。为了解决这些问题,我们进行了两个实验:实验一侧重于双语变异性的词典设计(研究问题1),而实验二检查了声学训练数据对对齐性能的影响(研究问题2)。这些实验共同为代码混合语音强制对齐中的词典设计和声学模型选择提供了原则性评估。 ## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2 变异的来源:强制对齐的问题 这里讨论两种类型的变异:语音学变异和拼写变异。语音学变异是代码混合语音中发音变异的一个例子,其中目标音位的声学实现不是固定的。另一方面,拼写变异是书写形式变异的例子。尽管 PBCM 语料库来自报纸,但一些拼写不一致仍然存在。两种形式的详细说明如下: ### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.1 音段自由变异 #### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.1.1 [ph]∼\\sim[f] 印地语母语清双唇送气音 [ph] 与清唇齿擦音 [f] 交替。两种声音都涉及湍流唇齿气流,[ph] 是送气,[f] 是摩擦,这很可能导致它们在双语语音中的感知重叠。例如,英语单词“phone”可能被实现为 [phon] 或 [fon],印地语单词“safal”('成功的') 可能被实现为 [saph@l] 或 [saf@l]。单语使用者倾向于使用母语音位 [ph],而双语使用者可能正确交替,或默认为非母语音位 [f]。 #### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.1.2 []∼\\sim[z] 在包含浊齿龈擦音 [z] 的借词(例如,zebra, zero)的情况下,印地语的母语浊腭塞擦音 [] 与浊齿龈擦音 [z] 交替。例如,“zebra”可能被实现为 [i:br@] 或 [zi:br@]。 单语使用者倾向于使用母语音位,而双语使用者可以选择正确的替代项。需要注意的是,类似的模式存在于来自乌尔都语的借词(例如,zulfein (头发),fizool (浪费))中,单语使用者会默认为上述母语对应音位。然而,这里我们只关注英语-印地语之间的代码混合。 ### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.2 拼写变异 天城文使用下标变音符号“努克塔”(\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindi) 来区分借语音位与其母语对应音位:(i) \\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiज [] 与 \\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiज़ [z] 和 (ii) \\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiफ [ph] 与 \\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiफ़ [f]。 在书面作品中,努克塔经常被省略,从而中和了每对内的拼写对比。这在字形到音位 (G2P) 转换中引入了**系统性歧义**。问题因母语使用者对这种省略的文化意识而进一步复杂化。这意味着知道该变音符号经常被省略的**双语使用者**可能会**补偿**:当一个 [z] 词(如“zebra”)用裸体的 \\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiज 书写时,他们要么推断努克塔被错误地删除了并正确地产出 [z];当一个 [] 词(如“juice”)没有努克塔书写时,他们忠实于拼写并产出 []。这产生了**双向变异**,其中每对的两个成员都出现在原本只打算出现一个的环境中。由于这种不一致,字形到音位的一对一映射变得无效。 ## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3 数据 ### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3.1 声学数据 语音平衡代码混合 (PBCM) 语料库[pandey2018phonetically]由在海得拉巴 IIIT 录制的 6,941\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1在原始出版物之后添加了更多语音平衡的句子,该出版物报告了 6,126 个话语条语音平衡的朗读语音话语组成。该语料库的文本提示是从一家领先全国性报纸《Dainik Bhaskar》的选定栏目(生活方式、科技、体育)中采样的。数据集由 113 名说话人(58 名男性和 55 名女性)录制,他们的母语是印地语,并在英语授课的学校接受教育。为了进行分析,语音库中的每个词类都手动分配了印地语和英语标签。 \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English表 1:印地语-英语单词和音位的分布。印地语英语词(类型)4,7903,754词(例符)54,96118,839音位(类型)7352音位(例符)194,67297,137 ### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3.2 词汇精炼与音位集标准化 为了解决印地语-英语代码混合数据即用型 G2P 系统固有的局限性,我们实施了一个多阶段精炼流程,以生成高保真词典: 1. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1. 双语音位映射:我们通过将英式英语 (\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=Englisheng\-uk) G2P 结果映射到印地语相近的语音空间来协调不同的语音输出。这确保了罗马和天城文脚本中的英语单词具有一致的声学表示。 2. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2. 音节去噪:我们手动处理了系统性的 G2P 错误,特别是由于 \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=EnglisheSpeak 模型中不正确的音节划分规则导致的过度插入非重读央元音。 3. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3. 鼻音消歧:为了解决鼻化元音和鼻辅音之间的混淆,我们实施了语音条件触发的鼻音插入(例如,在双唇音前插入 /m/,在齿音前插入 /n/)。 4. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English4. 语音引导:对于拼写不明确的案例(例如,/ph/ 与 /f/ 和 // 与 /z/),我们利用引导将浊/送气音段映射到更稳健的清音代理,从而显著减少了对齐漂移。更多细节见第 4.1 节。 ### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3.3 黄金标准发音和对齐数据 对于实验一,每个自由变异类别中的 100 个单词被手动标注。类似地,对于实验二,选择了 10% 的代码混合英语单词来创建黄金标准标注。换句话说,从每个说话人所说的 62 个话语中随机选择了 6 个话语。在这些话语中发现的代码混合单词首先由一位流利的印地语使用者(第二作者)手动标注,并由另一位母语印地语使用者(第一作者)交叉检查。 ## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English4 方法 本节详细描述了两个实验的实验过程。在第一个实验中,我们描述了在 /ph-f/ 和 //-z/ 上下文中发音变体的处理。在第二个实验中,我们描述了为英语单词强制对齐选择最合适声学模型的方法。这些实验的代码可在 \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2https://github\.com/Ayushi113/mfa\-hindi\-code\-mixed 获取。 ### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English4.1 实验一 整个实验使用了蒙特利尔强制对齐器 (MFA) v1.0(一个基于 Kaldi 的 GMM-HMM 系统,使用 fMLLR)。尽管该模型相对较不现代,但其充分性已在最近的强制对齐工作中得到证实[rousso2024tradition]。该架构通过五种引导配置进行了测试,以确定两对自由变异的最佳代理音位: 1. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1. 模型 1(无映射):这是控制模型,词典保持未编辑状态。使用原始 G2P 输出执行强制对齐,将 [ph, f, , z] 视为四个不同的声学单元。 2. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2. 模型 2(多数基线):该模型将所有变异实例映射到特定说话人数据中观察到的最常见实现,测试说话人依赖的主导音位是否可以覆盖拼写错误。 3. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3. 模型 3(主导基线映射):此版本针对主要的母语印地语对应音位。它将送气音 [ph] 映射到 [p](不送气)或将浊塞擦音 [] 映射到 [c](清音),旨在将语音与结构上最相似的母语音位对齐。 4. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English4. 模型 4(擦音/咝音映射
相似文章
Montreal Forced Aligner与2026年语音转文字对齐的现状
本文记录了Montreal Forced Aligner 3.0,一款广泛使用的开源强制对齐工具,在英语、日语和韩语上实现了最先进的性能,平均边界误差低于15毫秒。
基于自监督表示和学习动态规划的多语言词级强制对齐
一种新颖的多语言词级强制对齐方法,结合了来自MMS的自监督表示和音素边界检测器,以及一个学习动态规划解码器,在英语和未见过的语言上优于现有对齐方法,无需额外训练。
easyaligner: 支持GPU加速和灵活文本归一化的强制对齐工具(兼容HF Hub上的所有w2v2模型)[P]
easyaligner是一个开源强制对齐库,具有GPU加速和灵活的文本归一化功能,适配Hugging Face Hub上的所有wav2vec2模型。它针对实际工作流进行了优化,可以处理部分转录、无关语音段落和长音频(无需分块),同时保留原始文本格式。
迈向基于音系学的多语言TTS评估
本文提出了一种基于分类器的框架,用于审计多语言TTS系统的音系忠实性,以阿萨姆语ATR元音和谐为案例研究。结果显示,Meta的MMS TTS频繁错误生成舌根前伸元音,而这种偏差在人类语音中不存在。
人类与分类模型在语码转换语音中的协同行为跨语言比较
本文对普通话-英语、印地语-英语和西班牙语-英语的语码转换对话中的协同行为进行了跨语言分析,发现词汇协同具有泛化性,而声学韵律和风格协同则表现出差异。同时评估了分类模型捕捉这些行为的能力,结果显示模型优先考虑的特征与人类不同。