基于自监督表示和学习动态规划的多语言词级强制对齐
摘要
一种新颖的多语言词级强制对齐方法,结合了来自MMS的自监督表示和音素边界检测器,以及一个学习动态规划解码器,在英语和未见过的语言上优于现有对齐方法,无需额外训练。
arXiv:2606.10675v1 Announce Type: new
摘要:我们提出了一种精确的多语言词级强制对齐方法,包括一个对齐编码器和一个学习对齐解码器。编码器集成了两种表示:一种来自大规模多语言语音(MMS)模型,另一种来自自监督音素边界检测器(UnSupSeg)。它学习融合这两种表示,并在长时间上下文上估计词边界概率。对齐解码器是一个学习动态规划,它将编码器输出与基于MMS和UnSupSeg表示的段特征相结合,以推断最终的词边界。在TIMIT和Buckeye数据集上迭代训练后,所提方法在两个数据集上的表现均优于蒙特利尔强制对齐器(MFA)和基于MMS的对齐方法。在未见过的语言(荷兰语、德语和希伯来语)上,所提模型的性能始终优于或与现有对齐方法相当,表明其具有无需额外训练即可扩展到MMS支持的1100多种语言的潜力。
查看缓存全文
缓存时间: 2026/06/10 06:12
# 基于自监督表示与可学习动态规划的多语言词级强制对齐 来源:https://arxiv.org/html/2606.10675 Weber Zehavi Rousso Keshet MeidanRotemJosephFaculty of Electrical and Computer Engineering, Technion – Israel Institute of Technology, Haifa, 3200003, Israeljkeshet@technion\.ac\.il (https://arxiv.org/html/2606.10675v1/mailto:[email protected]) ###### 摘要 我们提出了一种精确的多语言词级强制对齐方法,该方法由对齐编码器和可学习对齐解码器组成。编码器整合了两种表示:一种来自大规模多语言语音(MMS)模型,另一种来自自监督音素边界检测器(UnSupSeg)。它学习融合这两种表示,并在长时域上下文中估计词边界概率。对齐解码器是一种可学习动态规划,它将编码器输出与基于MMS和UnSupSeg表示的片段级特征相结合,以推断最终的词边界。该方法在TIMIT和Buckeye数据集上迭代训练,在两个数据集上的表现均优于蒙特利尔强制对齐器(MFA)和基于MMS的对齐方法。在未见过的语言(荷兰语、德语和希伯来语)上,所提出的模型性能始终优于或持平于现有对齐方法,表明其具有无需进一步训练即可扩展到MMS支持的1100+种语言的潜力。 ###### 关键词: 强制对齐、词对齐、自监督表示、多语言 ## 1 引言 精确的词级强制对齐是语音和语言处理中的基本组成部分。音频信号与文本转录之间的精确时间对齐能够支持语言学中的细粒度分析,包括跨语言的语音学、音系学、韵律学和方言变异研究。除语言学外,可靠的对齐对于语音技术的开发和评估也至关重要,例如自动语音识别(ASR)、语音合成、音频索引和分割系统。 近年来,序列建模的进展显著提升了语音建模和ASR的性能,典型系统如wav2vec 2.0\[wav2vec2\]、HuBERT\[Hsu21\-HUB\]和Whisper\[Radford22\-RSR\]。这些方法在不同声学环境和语言中显著提高了识别准确率和鲁棒性。然而,在强制对齐任务中,传统的HMM-GMM框架仍然被广泛使用且极具竞争力\[Rousso24\-FACOMP\]。特别是,蒙特利尔强制对齐器(MFA)\[McAuliffe17\-MFA\]已成为词级和音素级对齐的领先工具包之一,在近期评估中始终排名顶尖\[Rousso24\-FACOMP\]。 本文最后进行了全面的实证评估。我们首先详细介绍了超参数调优和模型选择过程,然后在多个带有词级时间戳的手工标注语音语料库上报告了结果。这些语料库包括TIMIT\[Garofolo93\-TIM\]、Buckeye\[Pitt05\-BUC\]、一个希伯来语数据集\[benshalom14\]、荷兰语IFA Corpus\[VanSon01\-IFA\]以及德语PHONDAT\[tillmann1993theoretical\]。结果表明,我们的方法在英语数据集上优于包括MFA和基于CTC的MMS强制对齐在内的竞争方法。在未见过的语言上,所提出的方法在50毫秒及以上的对齐容差下实现了更优的性能。代码和预训练检查点将在论文接收后发布111https://github.com/MLSpeech/Multilingual-Word-Aligner。 ## 2 方法 我们假设包含TT个样本的波形被转换为LL帧序列,帧持续时间为10毫秒。语音语句表示为X=\(x1,...,xL\)\\mathbf\{X\}=\(\\mathbf\{x\}\_\{1\},\\dots,\\mathbf\{x\}\_\{L\}\),其中每个帧xl∈Rd\\mathbf\{x\}\_\{l\}\\in\\mathbb\{R\}^\{d\}(1≤l≤L1\\leq l\\leq L)是一个dd维特征向量,因此X∈RL×d\\mathbf\{X\}\\in\\mathbb\{R\}^\{L\\times d\}。 设w=\(w1,...,wK\)\\mathbf\{w\}=\(w\_\{1\},\\dots,w\_\{K\}\)表示语句中的词序列,其中KK是语句中的词数,每个词wk∈Vw\_\{k\}\\in\\mathcal\{V\}属于词汇表V\\mathcal\{V\}。我们的目标是给定输入语音及其对应的词序列,确定每个词的起始时间。这些起始时间的序列,称为*对齐序列*,表示为a=\(a1,...,aK\)\\mathbf\{a\}=\(a\_\{1\},\\dots,a\_\{K\}\),其中每个ak∈L=\{1,...,L\}a\_\{k\}\\in\\mathcal\{L\}=\\\{1,\\dots,L\\\}表示第kk个词结束的帧索引。 我们的方法基于MM预训练模型进行语音对齐表示,旨在通过精炼这些表示以产生比任何单一模型更精确的对齐序列。每个模型以语音语句X\\mathbf\{X\}和对应的词序列w\\mathbf\{w\}为输入,输出一个长度为LL的向量序列,每个向量指示相应帧索引属于对齐点的置信度。词序列对于预训练模型是可选的,因为有些模型仅从语音语句直接生成对齐序列。具体地,第mm个模型产生的向量维度为DmD\_\{m\}。第mm个模型表示为Sm=fm\(X,w\)\\mathbf\{S\}\_\{m\}=f\_\{m\}\(\\mathbf\{X\},\\mathbf\{w\}\),其中Sm=\[sm,1,...,sm,L\]∈RDm×L\\mathbf\{S\}\_\{m\}=[\\mathbf\{s\}\_\{m,1\},\\ldots,\\mathbf\{s\}\_\{m,L\}\]\\in\\mathbb\{R\}^\{D\_\{m\}\\times L\},sm,l∈RDm\\mathbf\{s\}\_\{m,l\}\\in\\mathbb\{R\}^\{D\_\{m\}\}(对于预训练模型1≤m≤M1\\leq m\\leq M)。 预训练模型的输出向量经过归一化和拼接后,作为对齐表示编码器gθg\_\{\\theta\}的输入,其中θ\\theta是编码器参数。该编码器输出z=gθ\(S\)\\mathbf\{z\}=g\_\{\\theta\}\(\\mathbf\{S\}\),其中z∈\[0,1\]L\\mathbf\{z\}\\in\[0,1\]^\{L\}是精炼后的词边界概率分布,表示每帧是词边界的可能性。 我们提出模型的最后部分是对齐解码器hψh\_\{\\psi\},其中ψ\\psi是解码器参数。该解码器是一个可学习动态规划模块,它以编码器概率分布z\\mathbf\{z\}、表示S\\mathbf\{S\}和词序列w\\mathbf\{w\}为输入,并输出与输入词结束时间相对应的对齐序列a^∈LK\\hat\{\\mathbf\{a\}\}\\in\\mathcal\{L\}^\{K\}。 ### 2.1 对齐表示 我们使用了两个表示模型(M=2M=2)。第一个表示模型f1f\_\{1\}基于无监督音素分割框架,称为*UnSupSeg*,该框架采用自监督对比学习进行训练\[Kreuk20\-SCL\]。该模型无需标注数据即可直接从原始语音信号中学习识别音素边界,从而捕获对下游词分割有用的细粒度声学转换。该模型以语音样本X\\mathbf\{X\}为输入,生成向量序列S1=\[s1,1,...,s1,L\]\\mathbf\{S\}\_\{1\}=[\\mathbf\{s\}\_\{1,1\},\\ldots,\\mathbf\{s\}\_\{1,L\}\],其中每个向量s1,l∈RD1\\mathbf\{s\}\_\{1,l\}\\in\\mathbb\{R\}^\{D\_\{1\}\}对应一个10毫秒音频帧(使用30毫秒分析窗口计算)。 第二个表示f2f\_\{2\}来自MMS自监督语音模型\[pratap2024scaling\]。对于给定的语音语句X\\mathbf\{X\}和词序列w\\mathbf\{w\},应用CTC对齐。该表示定义为第kk个词wkw\_\{k\}起始于帧aka\_\{k\}的可能性,否则为零。形式化地, s2,l=\{P\(wk∣X\),l=ak0,otherwise\.s\_\{2,l\}=\\begin\{cases\}P\(w\_\{k\}\\mid\\mathbf\{X\}\),&l=a\_\{k\}\\\\ 0,&\\text\{otherwise\}\\end\{cases\}~\.\(1\)该表示每20毫秒提取一次,每个元素维度为D2=1D\_\{2\}=1。为保持10毫秒的时间分辨率,我们通过简单插值上采样该表示。虽然可能存在利用CTC对齐置信度度量的其他策略,但我们采用这种简单的公式作为词级对齐置信度的直观可解释表示。 ### 2.2 对齐编码器 预训练表示模型的表示经过归一化和拼接后,作为对齐编码器的输入,其目标是生成这些表示的改进精炼版本z=gθ\(S\)\\mathbf\{z\}=g\_\{\\theta\}\(\\mathbf\{S\}\),其中S∈RL×D\\mathbf\{S\}\\in\\mathbb\{R\}^\{L\\times D\},z∈\[0,1\]L\\mathbf\{z\}\\in\[0,1\]^\{L\}。我们评估了多种编码器架构来实现gθg\_\{\\theta\},包括VGG\[Simonyan15\-VGG\]、Transformer编码器\[Hsu21\-HUB\]和Conformer\[Gulati20\-CON\]。在所有架构中,最后一层均采用softmax层。 编码器参数θ\\theta独立于对齐解码器进行训练。具体地,编码器针对二进制分类任务进行优化,预测输入序列中给定帧是否属于词边界。由于边界帧的数量远少于非边界帧,该任务存在显著的类别不平衡。为解决此问题,我们采用*焦点损失*\[lin2017focal\]代替标准交叉熵损失,因为它专门设计用于缓解类别不平衡的影响。焦点损失的超参数(α,γ\\alpha,\\gamma)通过验证集上的网格搜索进行选择。 ### 2.3 对齐解码器 我们方法的最后部分是对齐解码器,它是一个可学习动态规划(DP)模块,用于精炼编码器生成的原始边界概率。具体地,解码器的目标是预测与KK个输入词w\\mathbf\{w\}相对应的KK个对齐(起始时间)序列a\\mathbf\{a\}。解码器的输入包括预测的帧级边界概率z=g\(S,w\)\\mathbf\{z\}=g\(\\mathbf\{S\},\\mathbf\{w\}\)、对齐表示S\\mathbf\{S\}和输入词序列w\\mathbf\{w\}。形式化地,解码器定义为 a^=argmaxahψ\(S,z,w,a\)\.\\hat\{\\mathbf\{a\}\}=\\operatorname\*\{arg\\,max\}\_\{\\mathbf\{a\}\}~h\_\{\\psi\}\(\\mathbf\{S\},\\mathbf\{z\},\\mathbf\{w\},\\mathbf\{a\}\)\.\(2\)遵循Keshet等人\[keshet2007large\]的方法,我们将解码器建模为NN个特征函数φn\{\\phi\_\{n\}\}的线性组合,每个特征函数通过为位置良好的对齐分配更高分数、为位置不当的对齐分配更低分数来评估所提出的对齐。形式化地,解码器公式如下: hψ\(S,z,w,a\)=∑n=1N∑k=1Kψnφn\(S,z,wk,ak−1,ak\)h\_\{\\psi\}\(\\mathbf\{S\},\\mathbf\{z\},\\mathbf\{w\},\\mathbf\{a\}\)=\\sum\_\{n=1\}^\{N\}\\sum\_\{k=1\}^\{K\}\\psi\_\{n\}\\phi\_\{n\}\(\\mathbf\{S\},\\mathbf\{z\},w\_\{k\},a\_\{k\-1\},a\_\{k\}\)\(3\)每个特征函数捕捉对齐质量的独特结构方面,例如时间一致性、边界似然性或与输入词序列的一致性。解码器使用的特征函数将在下文描述。寻找最大化hψh\_\{\\psi\}的对齐序列通过带有最小词时长约束的动态规划完成: a^=argmaxa:ak−ak−1\>Lmin∑n=1N∑k=1Kψnφn\(S,z,wk,ak−1,ak\)\\hat\{\\mathbf\{a\}\}=\\operatorname\*\{arg\\,max\}\_\{\\mathbf\{a\}:a\_\{k\}\-a\_\{k\-1\}\>L\_\{\\text\{min\}\}\}~~\\sum\_\{n=1\}^\{N\}\\sum\_\{k=1\}^\{K\}\\psi\_\{n\}\\phi\_\{n\}\(\\mathbf\{S\},\\mathbf\{z\},w\_\{k\},a\_\{k\-1\},a\_\{k\}\)\(4\)参数\{ψn\}\\\{\\psi\_\{n\}\\\}通过迭代优化过程\[keshet2007large\]进行优化。 第一个特征函数φ1\\phi\_\{1\}测量候选边界aka\_\{k\}周围表示之间的欧氏距离。该特征使用UnSupSeg模型表示计算,假设当边界aka\_\{k\}放置正确时,边界前后的表示之间距离较大。形式化地: φ1\(S,z,wk,ak−1,ak\)=∥s1,ak−1−s1,ak\+1∥22\.\\phi\_\{1\}\(\\mathbf\{S\},\\mathbf\{z\},w\_\{k\},a\_\{k\-1\},a\_\{k\}\)=\\lVert\\mathbf\{s\}\_\{1,a\_\{k\}\-1\}\\-\\mathbf\{s\}\_\{1,a\_\{k\}\+1\}\\rVert^\{2\}\_\{2\}~\.\(5\) 第二个特征函数结合了来自编码器输出的词转换分数。词转换分数计算如下: φ2\(S,z,wk,ak−1,ak\)=zak\.\\phi\_\{2\}\(\\mathbf\{S\},\\mathbf\{z\},w\_\{k\},a\_\{k\-1\},a\_\{k\}\)=z\_\{a\_\{k\}\}~\.\(6\) 第三个特征函数也基于编码器输出。对于每个词wkw\_\{k\},该特征函数是从词开始到结束的编码器输出归一化之和。即: φ3\(S,z,wk,ak−1,ak\)=−1ak−ak−1−1∑l=ak−1\+1ak−1zl\.\\phi\_\{3\}\(\\mathbf\{S\},\\mathbf\{z\},w\_\{k\},a\_\{k\-1\},a\_\{k\}\)=\-\\frac\{1\}\{a\_\{k\}\{\-\}a\_\{k\-1\}\{\-\}1\}\\sum\_\{l=a\_\{k\-1\}\+1\}^\{a\_\{k\}\-1\}z\_\{l\}~\.\(7\)注意,该特征函数被赋予负号,因为当编码器输出的归一化和对应单个词时,它产生低值,否则产生高值。 第四个特征函数来自MMS表示\[pratap2024scaling\]。MMS发射矩阵表示为UMMS\\mathbf\{U\}^\{\\text\{MMS\}\},代表给定语音语句X\\mathbf\{X\}下每个字母的概率分布。该矩阵的维度为帧数乘以语言中的字母数。第四个特征函数定义为词wkw\_\{k\}的字符发射似然度。我们对该时间区间内构成该词的字母的发射值求和: φ4\(S,z,wk,ak−1,ak\)=∑l=ak−1ak∑c∈wkUl,cMMS\.\\phi\_\{4\}\(\\mathbf\{S\},\\mathbf\{z\},w\_\{k\},a\_\{k\-1\},a\_\{k\}\)=\\sum\_\{l=a\_\{k\-1\}\}^\{a\_\{k\}\}\\sum\_\{c\\in w\_\{k\}\}U^\{\\text\{MMS\}\}\_\{l,c\}~\.\(8\)当对齐序列准确表示词序列时,该特征值较高。 ## 3 实验结果 ### 3.1 数据集 我们在TIMIT\[Garofolo93\-TIM\]和Buckeye\[Pitt05\-BUC\]语音语料库上训练和评估了所提出的方法。这些数据集提供了朗读语音(5.1小时)和对话语音(40小时)的手工对齐音标和正字法转录。对于每个语料库,数据按说话人级别划分为训练集、验证集和测试集,比例为80/10/10。 我们在TIMIT和Buckeye上评估模型,并额外在未见过的语言上进行评估:希伯来语、德语和荷兰语。对于希伯来语,我们使用一个广播新闻数据集,包含10分钟由专业语言学家在音素级别标注的语音\[benshalom14\]。对于荷兰语,我们使用IFA Corpus\[VanSon01\-IFA\],这是一个包含约五个小时手工分割语音的数据库,来自八位说话人,涵盖多种说话风格。对于德语,我们在完整的PHONDAT德语语料库上进行评估,该语料库包含201位说话人和21,587个语句\[tillmann1993theoretical\]。 ### 3.2 架构、模型选择与超参数 对齐表示在第2.1节(https://arxiv.org/html/2606.10675#S2.SS1)中描述。对于对齐编码器,我们考虑了三种骨干架构:VGG\[Simonyan15\-VGG\]、Transformer编码器\[Hsu21\-HUB\]和Conformer\[Gulati20\-CON\]。模型选择基于验证集上的F1分数,反映编码器预测边界似然度的事实,该边界数可能与输入词数不同
相似文章
代码混合语音强制对齐的评估:以印地语-英语为例
本文使用Montreal Forced Aligner评估印地语-英语代码混合语音的强制对齐,证明引导策略和代码混合训练数据相比单语替代方案,对齐精度提高了十倍。
Montreal Forced Aligner与2026年语音转文字对齐的现状
本文记录了Montreal Forced Aligner 3.0,一款广泛使用的开源强制对齐工具,在英语、日语和韩语上实现了最先进的性能,平均边界误差低于15毫秒。
参数对齐缓解多语言专家语言模型中的灾难性遗忘
本文研究了持续预训练过程中多语言专家语言模型面临的灾难性遗忘问题,并提出了五种参数对齐策略(硬层冻结、软正则化、事后权重还原和模型合并),以在32种训练语言中最小化语言习得成本的同时减轻遗忘。
多语言设计导向的调控:多语言稀疏自编码器与原则性层选择
本文介绍了一种基于原则的多语言语言调控方法,该方法使用在多语言数据上训练的稀疏自编码器(SAEs)以及一种基于多语言对齐与语言可分性交集的新型层选择规则,并在LLaMA-3.1-8B和Gemma-2-9B上针对机器翻译和跨语言摘要进行了评估。
PolyAlign: 条件化人类分布对齐
PolyAlign是一个分布感知的对齐框架,它将语言模型对齐到特定上下文的人类回复分布,而不是单一的全局风格,从而提升了双语环境下的自然性和忠实度。