基于梯度的语音到文本对齐方法,适用于任何ASR模型:从CTC到语音大语言模型
摘要
本文介绍了一种基于梯度的语音到文本对齐方法,适用于任何可微分的ASR模型,包括CTC、transducer、基于注意力的编码器-解码器以及语音大语言模型,无需训练或模型修改。
arXiv:2607.06831v1 Announce Type: new
摘要:语音到文本对齐是指在音频中找出每个单词的时间边界。某些模型直接提供这种对齐,而其他模型则不提供。连接主义时间分类(CTC)和transducer模型通过构造实现对齐,而基于注意力的编码器-解码器(AED)和语音大语言模型(LLM)则没有,它们的单词时间通常通过注意力权重读出。所有这些信号都位于编码器帧网格上,这限制了它们的时间精度。我们研究了一种通用的基于梯度的对齐方法,适用于任何可微分的ASR模型。我们取每个教师强制令牌对数概率相对于输入的梯度,将其简化为每帧显著性,并通过一次动态规划解码生成的矩阵为单词边界。该方法无需训练、无需模型修改、无需对齐头,适用于包括语音LLM在内的所有模型系列,并在输入网格上对齐,而不是在较粗的编码器网格上。我们在来自四个家族的十六个模型上进行了评估,包括朗读(TIMIT)和自发性(Buckeye)语音,每个模型都与自己的原生或基于注意力的对齐进行比较。我们发现,梯度为每个模型提供了可用的对齐,通常略逊于强大的原生对齐器,但在原生对齐较弱的情况下(如流式模型)表现更好,其主要缺点是为每个令牌进行一次反向传播的成本。
查看缓存全文
缓存时间: 2026/07/09 07:48
# 基于梯度的语音转文本对齐:从CTC到语音大语言模型
来源:https://arxiv.org/html/2607.06831
###### 摘要
语音转文本对齐是指为音频中每个单词找到时间边界。某些模型直接提供这种对齐,而其他模型则不提供。连接时序分类(CTC)和转导模型通过构造具有对齐特性,而基于注意力的编码器-解码器(AED)和语音大语言模型(LLM)则不具备,它们的单词时间通常从注意力权重中读取。所有这些信号都位于编码器帧网格上,这限制了它们的时间精度。我们研究了一种通用的*基于梯度的对齐*方法,适用于任何可微分的ASR模型。我们计算每个教师强制令牌对数概率相对于输入的梯度,将其降维为每帧显著性,并通过一次动态规划将得到的矩阵解码为单词边界。该方法无需训练、无需修改模型、无需对齐头,适用于所有模型家族(包括语音LLM),并且在输入网格上进行对齐,而不是在更粗糙的编码器网格上。我们在四个家族的十六个模型上,针对朗读语音(TIMIT)和自发音语音(Buckeye)进行了评估,每个模型都与其自身的原生对齐或基于注意力的对齐进行了比较。我们发现,梯度方法为每个模型都提供了可用的对齐,通常略逊于强大的原生对齐器,但在原生对齐较弱的地方(如流式模型)表现更好,其主要缺点是需要对每个令牌进行一次反向传播。
## I. 引言与相关工作
语音转文本对齐为每个转录的单词在音频中分配开始和结束时间。传统上,它通过找到高斯混合隐马尔可夫模型(GM-HMM)的最佳路径来生成,这仍然是朗读语音最准确的对齐器[13](https://arxiv.org/html/2607.06831#bib.bib62), [32](https://arxiv.org/html/2607.06831#bib.bib58), [20](https://arxiv.org/html/2607.06831#bib.bib56), [18](https://arxiv.org/html/2607.06831#bib.bib32), [35](https://arxiv.org/html/2607.06831#bib.bib41)。然而,当前的模型在自身提供的对齐方面有所不同[29](https://arxiv.org/html/2607.06831#bib.bib34):连接时序分类(CTC)[15](https://arxiv.org/html/2607.06831#bib.bib7), [18](https://arxiv.org/html/2607.06831#bib.bib32)和转导模型[16](https://arxiv.org/html/2607.06831#bib.bib63)通过构造具有对齐特性,而基于注意力的编码器-解码器(AED)[9](https://arxiv.org/html/2607.06831#bib.bib10), [7](https://arxiv.org/html/2607.06831#bib.bib11), [47](https://arxiv.org/html/2607.06831#bib.bib87)和语音大语言模型(LLM)[48](https://arxiv.org/html/2607.06831#bib.bib78), [10](https://arxiv.org/html/2607.06831#bib.bib79), [37](https://arxiv.org/html/2607.06831#bib.bib88)则不具备,它们的单词时间通常从注意力权重中读取。所有这些信号都位于20到80毫秒的编码器帧网格上,这限制了它们的时间精度。对于AED,从交叉注意力读取时间是既定做法:Whisper输出粗略的片段级时间戳令牌[33](https://arxiv.org/html/2607.06831#bib.bib52),单词级时间戳则通过解码器交叉注意力的动态时间规整(DTW)得到[6](https://arxiv.org/html/2607.06831#bib.bib51),微调可以使其更加精确[49](https://arxiv.org/html/2607.06831#bib.bib53),甚至可以通过无监督启发式选择对齐头,并使用字符级教师强制进行细化而无需任何训练[46](https://arxiv.org/html/2607.06831#bib.bib54)。语音LLM的自注意力也带有类似的对齐,用于约束文本转语音合成[43](https://arxiv.org/html/2607.06831#bib.bib49)并作为同声传译的策略[24](https://arxiv.org/html/2607.06831#bib.bib48);强制对齐也被单独作为一个经过训练的LLM任务[22](https://arxiv.org/html/2607.06831#bib.bib50)。
我们研究了一种通用的*基于梯度的对齐*方法,适用于任何可微分的语音识别模型。对于每个转录令牌,我们计算其教师强制对数概率相对于输入的梯度,将其降维为每帧显著性[40](https://arxiv.org/html/2607.06831#bib.bib64),并通过一次动态规划将得到的令牌-帧矩阵解码为单词边界(图1 (https://arxiv.org/html/2607.06831#S1.F1))。由于它使用相对于输入信号的梯度,因此在输入网格上进行对齐,而不是在更粗糙的编码器网格上,并且可以纠正编码器的时间偏移:编码器通常非常强大,以至于可以在时间上移动信号(例如,对于流式模型)甚至反转时间维度[36](https://arxiv.org/html/2607.06831#bib.bib46)¹¹,这会降低原生强制对齐的质量,而梯度应该仍然能提供有意义的对齐。它不需要训练,不需要修改模型,并且适用于所有模型家族。与基于注意力的对齐(首先需要找到哪个注意力头携带对齐信息,对于Whisper是手动挑选的,对于其他模型则未公开,因此我们必须在标记的开发集上选择它)不同,梯度使用一个规范信号,即令牌自身对数概率的显著性。在先前的工作中,相同的方法已应用于语音识别AED模型[36](https://arxiv.org/html/2607.06831#bib.bib46), [46](https://arxiv.org/html/2607.06831#bib.bib54)和机器翻译模型[11](https://arxiv.org/html/2607.06831#bib.bib55)。
¹¹ 可以说,对于CTC,时间维度反转不会发生。
本文并非主张梯度对齐是最佳对齐器。强大的原生对齐器通常仍然略胜一筹,而梯度的计算成本要高得多。我们更倾向于提供关于梯度对齐是什么、它在所有模型家族中的表现如何、以及它的优势和劣势的广泛而公平的分析。我们的贡献包括:
- • 我们展示了基于梯度的对齐适用于所有ASR模型家族:CTC(前缀分数)、转导模型(RNN-T和TDT,也通过前缀分数)、AED和语音LLM。
- • 改进了对齐路径评分,通过动态规划找到最佳对齐路径。Whisper和CrisperWhisper使用的交叉注意力动态时间规整(DTW)是其特例。我们的版本在注意力和梯度信号上都改进了该DTW。
- • 对于语音LLM,我们从其自注意力中读取对齐,这是编码器-解码器交叉注意力的类似物。
- • 在四个家族的十六个模型上,针对朗读语音(TIMIT)和自发音语音(Buckeye),每个模型都与其自身的原生或基于注意力的对齐进行了全面而公平的比较,包括标记化粒度、输入网格分辨率、识别模式对齐和计算成本。
- • 公开源代码以重现所有结果,包括整个流程。
参见图注
图1:后验\(\log\left(p_t(y=a_s \mid x_1^{T'})\right)_{s,t} \in \mathbb{R}^{S\times T}\),梯度分数\(\log\operatorname{softmax}_T(G) \in \mathbb{R}^{S\times T}\),以及对数自注意力权重(\(\mathbb{R}^{S\times T}\),此处均未进行能量加权),每个都带有单词边界,并与参考分割(白色为静音,蓝色为单词,带有单词边界)进行比较。
## II. 通过梯度进行对齐
我们可以计算目标标签\(a_s \in \mathcal{A}\)(标签词汇表)在标签位置\(s\)处,给定输入\(x_1^{T'}\)和历史标签\(a_1^{s-1} \in \mathcal{A}^{s-1}\)时的对数概率\(p(a_s \mid a_1^{s-1}, x_1^{T'})\)相对于输入帧\(x_t\)的梯度。转录\(a_1^S\)有\(S\)个标签,输入有\(T'\)帧;下面的显著性矩阵和对齐有\(T\)个时间帧:当梯度在输入处计算时,\(T = T'\);当在编码器层计算时,\(T\)是编码器帧的数量。比较这些梯度在时间帧\(t\)上的范数,将指示每个帧对于这个特定输出标签\(a_s\)的重要性。具体地,我们计算对数范数²²。
²² 我们发现对数范数比普通范数条件更好,并产生更好的结果。我们还测试了不同的\(p\)-范数,发现在大多数情况下\(p=2\)表现最佳。
\[G_{s,t} := \log\left\| \nabla_{x_t} \log p(a_s \mid a_1^{s-1}, x_1^{T'}) \right\|_p \in \mathbb{R}. \tag{1}\]
图1 (https://arxiv.org/html/2607.06831#S1.F1)中的矩阵\(\log\operatorname{softmax}_T G\)清晰地显示了对齐。
注意,对于AED模型或语音LLM,\(\log p(a_s \mid a_1^{s-1}, x_1^{T'})\)很容易计算(这里我们排除EOS标签),并且已在[36](https://arxiv.org/html/2607.06831#bib.bib46), [46](https://arxiv.org/html/2607.06831#bib.bib54)中以类似方式完成。对于CTC和转导模型,也可以使用前缀分数[17](https://arxiv.org/html/2607.06831#bib.bib18)来实现,这些分数可以通过动态规划高效计算。
为了利用这一点获得某种对齐,我们需要定义允许的对齐标签拓扑(将\(a_1^S\)映射到\(y_1^T\))以及如何对特定的对齐\(y_1^T\)进行评分,以便我们可以搜索得分最高的那个。
对于标签拓扑,我们将\(a_1^S\)映射到\(y_1^T\),其中\(\mathcal{Y} = \mathcal{A} \cup \{\epsilon\}\),允许每个真实标签在连续帧上重复,中间有\(\epsilon\)(空白/静音)标签。我们将其写成一个有限状态自动机,枚举状态为\(\mathcal{Y}_1^{2S+1} = (\epsilon, 1, \epsilon, 2, \dots, S, \epsilon)\),其\(S+1\)个空白状态位于第一个标签之前、相邻标签之间以及最后一个标签之后。拓扑通过允许哪些空白状态来固定,其余状态被禁止。我们的默认设置是*单词级*拓扑:仅在单词边界处允许空白(在第一个单词之前、最后一个单词之后以及相邻单词之间),禁止单词内部的空白,因为我们评估的是单词边界。*完整*的CTC式拓扑则允许所有空白(与CTC不同,我们不强制要求在两个相等标签\(a_s = a_{s+1}\)之间有一个\(\epsilon\)),而一种*无内部静音*的变体只保留前导和尾随空白,因此相邻令牌直接相连。我们使用标准的时间同步维特比搜索(如CTC中)解码所有拓扑,每步前进一帧,因此每个令牌至少跨越一帧。Whisper和CrisperWhisper则通过DTW对齐交叉注意力,这额外允许垂直转移(在帧内前进令牌),因此相邻令牌可能重叠最多一帧;在没有内部静音且不使用公式 (3) (https://arxiv.org/html/2607.06831#S2.E3)的对数的情况下,我们的解码器简化为该DTW,但不包括那些垂直转移(表VIII (https://arxiv.org/html/2607.06831#S2.T8))。我们搜索一个允许的状态序列\(r_1^T\),其中\(r_t \in \{1, \dots, 2S+1\}\),与\(a_1^S\)兼容,以最大化
\[\operatorname{GradScore}(r_1^T) = \sum_{t=1}^T \begin{cases}
G'_{Y_{r_t}, t}, & Y_{r_t} \neq \epsilon, \\
\beta_t, & Y_{r_t} = \epsilon,
\end{cases} \tag{2}\]
其中令牌分数\(G'\)和静音分数\(\beta_t\)定义如下。最佳\(r_1^T\)通过动态规划找到(图2 (https://arxiv.org/html/2607.06831#S2.F2)),并读出对齐\(y_1^T\),对于非空白状态有\(y_t = a_{Y_{r_t}}\),否则\(y_t = \epsilon\)。
图2:将显著性解码为对齐,针对两个单词\((a_1 a_2)(a_3)\)。动态规划在FSA状态\(\mathcal{Y}_1^{2S+1}\)(行)上运行时间同步维特比:每帧它要么停留在当前状态,要么前进一个状态(+1),或跳过一个空白。单词级拓扑将单词内空白(\(a_1\)和\(a_2\)之间)灰显,强制跳过那里,同时保留单词边界空白(状态5)。DTW反而允许垂直移动(在帧内前进令牌),因此相邻令牌可能重叠最多一帧。
令牌分数是经过时间对数softmax的(可选能量加权)显著性,
\[G'_{s,t} = \log \operatorname{softmax}_T (G + \rho \log E)_{s,t}, \tag{3}\]
其中\(\rho \ge 0\)是权重(默认\(\rho=0.5\);\(\rho=0\)禁用它),\(E_t \in [0,1]\)是帧网格上的平滑音频能量包络:从波形\(x\)形成窗口化均方根能量\(\tilde{E} = \sqrt{w * x^2}\),其中\(w\)是归一化的25毫秒汉宁窗(\(\sum_i w_i = 1\)),\(*\)是卷积,在帧中心\(c_t\)处采样,并除以其最大值进行归一化:\(E_t = \tilde{E}_{c_t} / \max_{t'} \tilde{E}_{c_t'}\)。能量权重抑制了梯度在静音帧中的虚假响应。
静音分数\(\beta_t\)包括了CTC的常数空白,但也包括一种基于令牌分数每帧统计信息的自校准空白。设\(\mu_t\)和\(\sigma_t\)是\(\{G'_{s,t}\}_s\)在标签\(s\)上的均值和标准差(在\(\rho=0\)处取值,因此空白根据原始显著性进行校准)。我们考虑
\[\beta_t = \begin{cases}
\gamma, & \text{(常数)} \\
\mu_t + \kappa \, \sigma_t, & \text{(z-分数)} \\
\mu_t - \lambda \, z(E_t) \, \sigma_t, & \text{(能量)}
\end{cases} \tag{4}\]
其中\(z(E_t) = (E_t - \bar{E}) / \operatorname{std}(E)\)是能量在\(T\)帧上的z-分数(\(\bar{E}\)和\(\operatorname{std}(E)\)是其均值和标准差),超参数为\(\gamma\)(常数水平)、\(\kappa\)和\(\lambda\)。能量空白是一种VAD风格的静音发射:在低能量帧中,\(z(E_t) < 0\)使\(\beta_t\)高于令牌均值,因此该帧进入空白;在语音帧中,\(\beta_t\)降至令牌分数以下。
表 I:每个模型的单词边界误差和准确率,梯度对齐与每个模型的原生或注意力对齐器对比,在TIMIT测试集和Buckeye数据集上,按家族分组。注意力和后验对齐器使用模型的原生子词单元;梯度用于AED和语音LLM时使用字符,否则使用原生子词(表IV (https://arxiv.org/html/2607.06831#S2.T4))。标星号(*)的Whisper-large-v3梯度行在最佳编码器深度处取值(编码器3/4,表X (https://arxiv.org/html/2607.06831#S2.T10))。
| 模型 | 对齐方法 | TIMIT | | Buckeye | |
| :--- | :--- | :--- | :--- | :--- | :--- |
| 类型 | 名称 | WBE[ms]↓ | ≤50ms[%]↑ | WBE[ms]↓ | ≤50ms[%]↑ |
| GM-HMM | MFA | 似然 | 19 | 92.3 | 92.3 | 32 | 90.0 | 90.0 |
| CTC | MMS-FA | 梯度 | 49 | 64.3 | 64.3 | 121 | 58.2 | 58.2 |
| | | 后验 | 37 | 71.5 | 71.5 | 46 | 69.9 | 69.9 |
| | XLS-R(音素) | 梯度 | 49 | 65.7 | 65.7 | 81 | 66.4 | 66.4 |
| | | 后验 | | | | | | |相似文章
对齐就是一切:面向通用音频-语言模型的无指令训练
本文介绍了一种无指令的纯对齐方法,用于构建大型音频-语言模型,该方法通过冻结LLM和音频编码器,仅在自生成数据上训练一个轻量级投影器,实现了与传统多阶段流程相比更少数据下的竞争性性能。
基于文本约束声学重评分的无需训练发音转录
本文提出一种无需训练的发音转录流程,通过集成词法资源和声学模型,实现低错误率和高效率,性能优于包括商用多模态LLMs在内的基线方法。
LoRA-GA$^2$: 低秩适应与多步梯度自适应对齐
本文介绍了LoRA-GA$^2$,这是一种微调算法,它利用多步梯度信息来提升大型语言模型的低秩适应性能,在基准测试中取得更好的结果,同时保持效率。
如何利用合成语音构建基于LLM的ASR系统?
本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。
基于SpeechLLM的流式语音转文本翻译
提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。