基于加权前瞻评分方法的流式ASR系统高效标点恢复
摘要
提出一种用于流式ASR标点恢复的非自回归评分方法,该方法保留输入转录,并在有限前瞻预算下优于基于提示和微调的基线。
arXiv:2606.05179v1 公告类型: 新
摘要: 标点恢复可提升ASR(自动语音识别)的可读性。然而,流式ASR需要在有限的未来上下文中进行在线决策。在流式ASR中,系统增量式地预测标点,这使得基于生成的方法在边界评估时容易出现延迟和对齐失败。本文提出一种非自回归评分方法(无自由形式生成),该方法保留输入转录并在每个词边界做出决策。我们的方法将标点插入假设与无插入基线在有限的K子词令牌前瞻下进行比较,并使用权重{\alpha}和验证校准阈值{\tau}(推理期间无参数更新)来校准决策。在IWSLT 2017上,我们的评分方法在无微调设置下(验证校准,K=2)实现了4类宏平均F1为0.893,在微调后(K=2)达到0.937,在相同前瞻预算下优于基于提示的基线(0.566)和微调的ELECTRA基线(0.913)。我们通过关于K的消融研究分析了前瞻预算的影响。
查看缓存全文
缓存时间: 2026/06/05 08:05
# 高效流式ASR系统的加权前瞻评分标点恢复方法
来源:https://arxiv.org/html/2606.05179
###### 摘要
标点恢复提高了ASR(自动语音识别)的可读性。然而,流式ASR需要在有限的未来上下文中做出在线决策。在流式ASR中,系统增量地预测标点,这使得基于生成的方法在逐边界评估下容易产生延迟和对齐失败。本文提出了一种非自回归评分方法(无需自由形式生成),该方法保留输入转录文本,并在每个词边界做出决策。我们的方法在有界 \(K\) 子词令牌前瞻下,将标点插入假设与无插入基线进行比较,并使用权重 \(\alpha\) 和验证校准阈值 \(\tau\)(推理期间不更新参数)对决策进行校准。在IWSLT 2017[1]上,我们的评分方法在无微调设置下(验证校准,\(K=2\))实现了0.893的四类宏F1,微调后(\(K=2\))达到0.937,在相同的前瞻预算下优于基于提示的基线(0.566)和微调的ELECTRA[2]基线(0.913)。我们通过对 \(K\) 的消融实验分析了前瞻预算的影响。
## I 引言
自动语音识别(ASR)已成为从语音助手[3,4]到设备端语音控制[5]等应用的基础组件。
尽管词错误率取得了显著进步,但许多ASR系统输出无标点的词序列,这降低了可读性,并使句子边界不明确,从而影响下游文本处理,如句子分割和翻译。因此标点恢复至关重要,但在流式设置中,系统必须在未来词到达之前在线决定标点;等待更多上下文可以提高准确性,但会增加延迟。
大型语言模型(LLM)可以通过提示LLM重新生成完整格式化的句子来恢复标点。然而,这种形式化与标准的标点恢复设置并不一致。在典型的标点恢复中,任务假设一个固定的输入转录文本,并在每个词边界预测一个标点标签。如图3所示,基于提示的生成可能会重写转录文本,而不是保留原始词序列。这会破坏与固定输入转录文本的边界对齐,即使整体含义相似。因此,在逐边界评估下,即使微小的编辑也会使生成输出与原始转录文本之间的对齐发生偏移,导致级联标签不匹配,并显著降低标点F1。此外,生成可能表现出格式化漂移,如重复的标点符号或缺少句子结束符号。在流式设置中,它还会导致高延迟,因为它需要在整个序列上进行自回归解码。为了解决这种不匹配,我们引入了一种非自回归评分方法(无需自由形式生成)用于流式标点恢复。所提出的方法不生成新句子,而是保留输入词序列,并通过比较无插入假设与标点插入假设(逗号、句号、问号)在每个词边界做出在线决策。用于逐边界决策的历史和有界未来上下文的正式定义在第III-A节中给出。
使用预训练的Llama-3.2-1B模型[6,7](无需微调),实验表明,在固定的 \(K\) 子词令牌前瞻下,假设评分在IWSLT 2017数据集上取得了强宏F1。本研究关注紧凑的1B参数LLM,以研究在流式约束下的有界前瞻标点评分,其中模型大小和有限的未来上下文是重要的考虑因素。虽然所提出的方法设计用于流式兼容推理,但系统级部署指标(如延迟和内存)留待未来工作。在IWSLT 2017上,我们的评分方法在无微调设置下(\(K=2\))实现了0.893的四类宏F1,微调后(\(K=2\))达到0.937,在相同的前瞻预算下优于基于提示的基线(0.566)和微调的ELECTRA基线(0.913)。
从部署角度来看,所提出的形式化提供了可预测的延迟预算:每个边界决策最多等待 \(K\) 个未来子词令牌,并只对一组固定动作进行评分。这带来了稳定的逐边界计算,并避免了自回归生成的变长解码。此外,由于转录文本从未被重写,逐边界评估保持良好定义,且在不同系统之间可直接比较。这些特性使该方法适用于实时字幕管道,其中运行时稳定性和对齐可靠性与原始F1同等重要。
我们的贡献如下。(1) 本文提出了一种非自回归、流式兼容的评分框架(无需自由形式生成),用于在有界 \(K\) 子词令牌前瞻下进行逐边界标点决策。(2) 基于评分的推理避免了提示驱动生成的转录文本漂移和对齐失败,并在IWSLT 2017上使用紧凑的1B参数LLM(无微调和微调)取得了强性能。数据和代码公开于:https://github.com/woomook0524/LLM-Scoring
## II 相关工作
### II-A 利用双向上下文的离线标点恢复
标点恢复已被广泛形式化为ASR转录文本上的序列标注问题,利用更广泛的上下文通常能提高预测准确性[8,9]。Tilk和Alumäe[10]引入了一个基于LSTM的语音转录标点恢复模型,表明建模更长的上下文依赖关系可以改进标点预测。他们后来提出了一种带注意力的双向循环模型[11],使模型能够更有效地同时利用左上下文和未来上下文。最近,预训练的双向Transformer编码器已成为标点预测的强骨干,例如Courtland等人[12]报告了由于并行计算带来的准确率提升和高效推理。基于BERT[13]的标注器也得到了广泛探索;例如,Makhija等人[14]将上下文BERT表示与BiLSTM-CRF分类器结合用于序列标注。一个反复出现的实际问题是类别不平衡,其中无标点标签占主导地位,Yi等人[15]使用焦点损失来强调更难的例子来解决这个问题。这些离线模型通常假设可以访问完整句子上下文,这促使了另一条明确约束未来上下文以实现流式部署的工作路线。
### II-B 在有界未来上下文下的流式/在线标点恢复
虽然离线标点标注器可以利用完整句子的双向上下文,但流式ASR施加了严格的延迟约束,限制了推理时可以使用的未来上下文量[16]。这激发了在线恢复方法,这些方法明确使用有界的未来窗口进行操作,并量化由此产生的准确率-延迟权衡。Polacek等人[17,18]提出了一个轻量级的纯文本标点和大小写恢复模块,专为实时字幕设计,并在一个小的固定未来上下文预算(即4词前瞻)下进行评估,以满足实时约束。他们的结果表明,仅使用一个未来词可能不足,而一个短前瞻(如4个词)已经可以恢复大部分离线性能,这表明有界未来上下文是流式部署中实用且有效的设计选择。这一工作路线支持我们的设置,即系统在固定前瞻预算下在线决定标点,并激励使用小的、可控的前瞻窗口来平衡标点准确率和流式延迟。
### II-C 基于LLM的标点恢复及生成相关问题
近年来,LLM被探索用于通过提示驱动的方式重新生成完整格式化的句子来实现标点恢复。然而,Zhong和Sun[19]观察到在这种设置下的几个实际问题:LLM倾向于重复使用相同的标点符号,可能改变输入文本令牌,并导致高计算成本。为了提高生成效率并减轻幻觉,Pang等人[20]提出了仅前向解码(FPOD)用于标点恢复。值得注意的是,他们的方法构建在一个通过参数高效微调(如LoRA)获得的任务适配Llama模型之上,并在解码期间保持微调模型冻结。相比之下,所提出的方法不需要微调:我们直接使用开箱即用的1B LLM纯粹作为评分函数,以保持输入词序列固定,并在有界前瞻预算下做出在线插入决策。
参见图注:图1:索引 \(i\) 处的决策边界;使用前缀 \(w_{1:i}\) 和 \(K\) 令牌前瞻 \(w_{i+1:i+K}\) 预测标点。
## III 所提方法:加权前瞻评分
我们将流式约束下的标点恢复视为有界前瞻假设检验。与自由形式生成不同,LLM被用作一个在小型候选集上的令牌级评分引擎,这保留了输入转录文本并降低了解码开销。
### III-A 问题形式化
在流式ASR场景中,输入以连续词序列的形式到达。我们的目标是在每个 \(w_i\) 和 \(w_{i+1}\) 之间的边界处,确定是否插入一个标点符号 \(a \in \mathcal{P} = \{\texttt{COMMA}, \texttt{PERIOD}, \texttt{QMARK}, \emptyset\}\)。我们将无插入动作记为 \(a = \emptyset\),对应于评估中的标签 O。
令 \(\mathbf{w} = [w_1, w_2, \ldots, w_T]\) 表示LLM子词令牌,\(i\) 索引边界位置。在边界 \(i\) 处,我们以令牌前缀 \(w_{1:i}\) 和 \(K\) 令牌前瞻 \(w_{i+1:i+K}\) 为条件(在靠近句子末尾且 \(i+K > T\) 时截断)。我们在每个句子边界处重置前缀(即每个新句子的索引从1重新开始)。
我们的目标是在给定 \((w_{1:i}, w_{i+1:i+K})\) 的情况下选择最优假设 \(\hat{a}_i \in \mathcal{P}\)。与提示驱动生成不同,所提出的方法纯粹将LLM用作一个封闭候选集上的评分器,这防止了转录文本漂移。
### III-B 理论依据
在每个词边界,该方法选择一个标点动作 \(a \in \mathcal{P}\),该动作在给定前缀的情况下最好地解释了有界未来后缀:
\[
\hat{a}_i = \operatorname{arg\,max}_{a \in \mathcal{P}} P(a \mid w_{1:i}, w_{i+1:i+K}) \tag{1}
\]
根据贝叶斯法则,后验概率可写为:
\[
P(a \mid w_{1:i}, w_{i+1:i+K}) = \frac{P(w_{i+1:i+K} \mid w_{1:i}, a) \, P(a \mid w_{1:i})}{P(w_{i+1:i+K} \mid w_{1:i})} \tag{2}
\]
其中 \(P(a \mid w_{1:i})\) 捕获局部标点偏好(先验),而 \(P(w_{i+1:i+K} \mid w_{1:i}, a)\) 衡量在插入 \(a\) 后,有界未来后缀的一致性(似然)。由于证据项 \(P(w_{i+1:i+K} \mid w_{1:i})\) 不依赖于 \(a\),最大化式(1)中的后验等价于最大化乘积 \(P(w_{i+1:i+K} \mid w_{1:i}, a) \, P(a \mid w_{1:i})\)。
贝叶斯分解启发了一个未加权的对数后验目标。在实践中,我们使用式(3)作为校准的替代目标,其中权重 \(\alpha\) 在验证集上调整,以在流式约束下平衡局部先验偏好和有界前瞻证据。
参见图注:图2:所提出的基于评分的有界前瞻标点恢复流水线的整体架构。在边界 \(i\) 处,前缀 \(w_{1:i}\) 和前瞻 \(w_{i+1:i+K}\) 被用于为每个动作 \(a \in \{\mathrm{COMMA}, \mathrm{PERIOD}, \mathrm{QMARK}, \emptyset\}\) 评分;然后一个阈值门输出最佳标点或无插入。图2总结了三个阶段:从固定转录文本构建上下文,对每个候选动作进行LLM评分,以及阈值化的逐边界输出选择。这个过程保留了原始转录文本,并为每个边界返回恰好一个动作。
**输入**:前缀 \(w_{1:i}\),前瞻子词令牌 \(w_{i+1:i+K}\)
**输出**:最优标点 \(\hat{a}_i\)
\(L_i(\emptyset) \leftarrow \log P(w_{i+1:i+K} \mid w_{1:i}, \emptyset)\)
\(S_i(\emptyset) \leftarrow \alpha \log P(\emptyset \mid w_{1:i}) + (1-\alpha) L_i(\emptyset)\)
\(a_i^* \leftarrow \emptyset\);
\(S_{\max} \leftarrow -\infty\)
**for** \(a \in \{\mathrm{COMMA}, \mathrm{PERIOD}, \mathrm{QMARK}\}\) **do**
\(L_i(a) \leftarrow \log P(w_{i+1:i+K} \mid w_{1:i}, a)\)
\(S_i(a) \leftarrow \alpha \log P(a \mid w_{1:i}) + (1-\alpha) L_i(a)\)
**if** \(S_i(a) > S_{\max}\) **then**
\(S_{\max} \leftarrow S_i(a)\);
\(a_i^* \leftarrow a\)
**end if**
**end for**
\(\Delta_i \leftarrow S_{\max} - S_i(\emptyset)\)
**if** \(\Delta_i > \tau\) **then**
\(\hat{a}_i \leftarrow a_i^*\)
**else**
\(\hat{a}_i \leftarrow \emptyset\)
**end if**
**return** \(\hat{a}_i\)
**算法1** 加权前瞻决策
### III-C 加权前瞻评分函数
在边界 \(i\) 处,令牌前缀为 \(w_{1:i}\),\(K\) 令牌前瞻为 \(w_{i+1:i+K}\)
\[
\begin{aligned}
S_i(a) &= \alpha \log P(a \mid w_{1:i}) \\
&\quad + (1-\alpha) \log P(w_{i+1:i+K} \mid w_{1:i}, a)
\end{aligned}
\tag{3}
\]
前瞻对数概率项在实际计算中通过对有界窗口 \(w_{i+1:i+K}\) 内的令牌对数似然求和(通过链式法则分解)得到。
这里,\(\alpha \in [0,1]\) 是一个评分权重系数,用于平衡局部先验偏好相似文章
基于图的噪声ASR音素错误纠正
提出G-SPIN,一个轻量级框架,结合音素图建模与上下文语言理解来纠正ASR错误。使用GNN生成音素合理的候选词元,MLM进行局部评分,LLM进行最终重新排序,所有操作均在推理时进行。
不要往回翻:面向流式对话摘要的缺失证据记忆
本文介绍了 ReMEMBER,一种面向流式对话摘要的缺失证据记忆框架,它从长历史中检索并精炼证据,以在固定记忆预算下解决当前窗口中的空白,并附带一个用于评估的基准。
基于LLM并行文本生成的低延迟实时音频游戏解说系统
本文介绍了一种低延迟实时音频游戏解说系统,该系统利用基于LLM的并行文本生成技术,将语句间的静默时间从9.6秒减少到0.3秒,与顺序基线相比显著改善了感知到的说话节奏。
DiffScore:超越自回归似然性的文本评估
本文介绍了 DiffScore,这是一个基于掩码大型扩散语言模型(Masked Large Diffusion Language Models)的文本评估框架,通过利用掩码重建来解决自回归评分中的位置偏差问题。
在英中语音到语音翻译中评估和保留词汇重音
一篇研究论文,提出了一种新的评估指标和重音感知系统,用于在英中语音到语音翻译中评估和保留词汇重音,实验表明在保持翻译质量的同时,其重音翻译能力显著优于现有方法。