Dual-Form ASR:面向中文语音识别的语义感知逆文本规范化

arXiv cs.CL 论文

摘要

本文提出Dual-Form ASR框架,通过配对监督和序列级目标,整合了口语形式自动语音识别与语义感知的书面形式逆文本规范化,从而提升中文语音识别任务的性能。

arXiv:2609.02901v1 Announce Type: new 摘要:现代自动语音识别(ASR)场景既需要口语形式的转录本以进行忠实转录,也需要可读的书面形式转录本并进行逆文本规范化(ITN)。然而,这些形式通常由级联模块产生,其中口语形式的ASR输出由单独的ITN组件重写,使得书面形式ASR-ITN易受识别错误影响,并将规范化与声学上下文建模解耦,尤其是对于语义依赖的数字表达。本文提出Dual-Form ASR(DF-ASR),一个框架,该框架通过配对口语形式和书面形式监督,将口语形式ASR能力扩展到语义感知的书面形式ITN,同时保留转录本形式之间的提示级选择。双形式监督通过大型语言模型(LLM)驱动的生成-判断工作流构建,训练通过ITN-MWER进一步增强,这是一种序列级目标,对规范化敏感区间的错误分配更高成本。我们还引入了决策感知的REQUIRE-ITN/\FORBID-ITN协议,分别度量必需的规范化和禁止区间的保留。在来自SpeechIO的人工标注中文子集上,DF-ASR持续优于开源ASR-ITN系统,与强闭源参考系统保持竞争力,并保留了口语形式和书面形式输出之间的可靠提示级控制。
查看原文
查看缓存全文

缓存时间: 2026/09/04 05:52

# 双形式ASR:面向中文语音识别的语义感知逆文本标准化
来源:https://arxiv.org/html/2609.02901
###### 摘要

现代自动语音识别(ASR)场景既需要忠实转录的口语形式转录本,也需要通过逆文本标准化(ITN)生成可读的书写形式转录本。然而,这些形式通常由级联模块生成,其中口语形式的ASR输出由单独的ITN组件重写,使得书写形式的ASR-ITN容易受识别错误影响,并将标准化与声学上下文建模解耦,尤其对语义依赖的数字表达式而言。本文提出了双形式ASR(DF-ASR)框架,该框架通过配对的口语形式与书写形式监督,将口语形式ASR能力扩展到语义感知的书写形式ITN,同时保留基于提示的转录形式选择。双形式监督通过大语言模型(LLM)驱动的生成-评判工作流构建,并通过ITN-MWER(一种对标准化敏感区间错误分配更高代价的序列级目标函数)进一步增强训练。我们还引入了决策感知的需标准化/禁标准化协议,分别评估所需标准化与受保护区间的保留情况。在SpeechIO的人工标注中文子集上,DF-ASR始终优于开源ASR-ITN系统,与强大的闭源系统竞争力相当,并保持口语形式与书写形式输出之间可靠的提示级控制能力。

## I 引言

大语言模型(LLMs)的最新进展[21 (https://arxiv.org/html/2609.02901#bib.bib6),6 (https://arxiv.org/html/2609.02901#bib.bib5),28 (https://arxiv.org/html/2609.02901#bib.bib1),27 (https://arxiv.org/html/2609.02901#bib.bib2),13 (https://arxiv.org/html/2609.02901#bib.bib7)]使得自动语音识别(ASR)系统能够生成信息丰富的转录本,而非逐字文本[31 (https://arxiv.org/html/2609.02901#bib.bib9),12 (https://arxiv.org/html/2609.02901#bib.bib10),8 (https://arxiv.org/html/2609.02901#bib.bib11),19 (https://arxiv.org/html/2609.02901#bib.bib12)]。在实际ASR部署中,可读的显示、字幕和会议记录通常需要经过逆文本标准化(ITN)的书写形式转录本,而语料库标注、语言分析和某些下游模块则需要忠实的口语形式转录。开放的中文ASR已提供了强大的口语形式识别基础,但将此能力扩展到书写形式的ASR-ITN仍然困难,因为ITN并非简单的数字替换:它依赖于表达式在上下文中的语义角色。

三个差距限制了可靠的开放中文ASR-ITN。首先,级联ITN缺乏联合优化。如图1 (https://arxiv.org/html/2609.02901#S1.F1)(a)所示,实际系统通常先识别语音,然后应用文本级ITN模块[10 (https://arxiv.org/html/2609.02901#bib.bib35),37 (https://arxiv.org/html/2609.02901#bib.bib34),2 (https://arxiv.org/html/2609.02901#bib.bib41),4 (https://arxiv.org/html/2609.02901#bib.bib39),5 (https://arxiv.org/html/2609.02901#bib.bib40),25 (https://arxiv.org/html/2609.02901#bib.bib37),26 (https://arxiv.org/html/2609.02901#bib.bib38),14 (https://arxiv.org/html/2609.02901#bib.bib42)]。标准化器仅观察识别的文本,因此ASR错误会传播到ITN阶段,且数字表达式的标准化决策无法与声学识别联合优化。

其次,书写形式的ASR-ITN是一种上下文敏感的语义决策,而非局部的格式化操作。相同的口语数字表达式根据其语义角色可能需要标准化或保留口语形式。例如,“ten to one”在表示比例时可能写为“10:1”,但在“it is ten to one that ...”(意为“很可能”)中则应保留口语形式。基于规则的刚性ITN系统难以处理此类情况,因为依赖上下文的例外情况难以扩展。因此,可靠的ASR-ITN需要基于周围语言上下文的、语义感知的标准化决策。

第三,评估必须衡量过度标准化,而不仅是所需标准化。一个激进地转换每个数字外观区间的系统可以提高普通量的可读性,但会损害应保留口语形式的语义受限表达式。因此,ASR-ITN需要一个联合评估所需区间是否标准化以及受保护区间是否保留的协议。

参考图注图1:ASR-ITN范式比较。(a) 级联ASR通过识别后应用单独的ITN模块,将口语形式识别与书写形式标准化解耦。(b) 双形式ASR联合训练一个基于提示的识别器,配对使用口语形式与书写形式目标,实现基于提示的转录形式选择。为解决这些差距,我们提出了双形式ASR(DF-ASR)框架,该框架将口语形式ASR能力扩展到语义感知的书写形式ITN。如图1 (https://arxiv.org/html/2609.02901#S1.F1)(b)所示,DF-ASR并非旨在替代口语形式ASR或从头重新学习声学识别。相反,口语形式目标保留忠实的识别行为,而书写形式目标则教导数字表达式何时应在书写形式转录中被标准化或保留。提示选择转录形式,语义解释决定书写形式模式下数字表达式的标准化策略。我们的贡献总结如下:

- •我们提出了双形式ASR(DF-ASR),一个基于提示的ASR-ITN框架,它将口语形式ASR能力扩展到语义感知的书写形式ITN,同时保留基于提示的口语形式与书写形式转录之间的选择能力。
- •我们通过LLM驱动的生成-评判工作流,从口语形式ASR语料库构建双形式监督,并使用ITN-MWER(一种ITN感知的目标函数,对标准化敏感区间的错误分配更高代价)进一步优化模型。
- •我们设计了一个决策感知的需标准化/禁标准化评估协议,并表明DF-ASR在需标准化指标上实现了4.64%的I-CER和94.85%的关键词F1,在禁标准化指标上获得了95.18%的禁标准化区间保留率(FSPR)。

## II 相关工作

### II-A 格式化与基于LLM的ASR

基于LLM的ASR将语音编码器与强大的文本解码器结合,并已扩展到上下文偏置[33 (https://arxiv.org/html/2609.02901#bib.bib17),9 (https://arxiv.org/html/2609.02901#bib.bib19)]、说话人感知识别[24 (https://arxiv.org/html/2609.02901#bib.bib20),34 (https://arxiv.org/html/2609.02901#bib.bib21)]、语码转换[36 (https://arxiv.org/html/2609.02901#bib.bib23),17 (https://arxiv.org/html/2609.02901#bib.bib24)]和多语言识别[3 (https://arxiv.org/html/2609.02901#bib.bib25),22 (https://arxiv.org/html/2609.02901#bib.bib27)]。这些研究表明,ASR正超越简单转录,朝着具有更丰富格式和上下文建模的语音语言生成发展[31 (https://arxiv.org/html/2609.02901#bib.bib9),8 (https://arxiv.org/html/2609.02901#bib.bib11),19 (https://arxiv.org/html/2609.02901#bib.bib12)]。

格式化转录也可以被隐式学习。Whisper预测原始的互联网转录文本,无需大量文本标准化,因此获得了正字法格式化能力,如标点、大小写和数字表达式标准化[23 (https://arxiv.org/html/2609.02901#bib.bib28)]。一些开源的基于LLM的ASR系统进一步提供提示接口,用于请求格式化或标准化的转录本[1 (https://arxiv.org/html/2609.02901#bib.bib4)]。然而,隐式格式化和提示诱导的标准化仅对口语形式转录与书写形式重写之间的边界提供弱控制。在没有两种输出形式的明确监督的情况下,ITN行为可能变得不稳定和不可靠,特别是当数字表达式需要上下文敏感的语义决策时。

### II-B 独立ITN与口转书转换

独立ITN通常被视为文本级的口转书转换。基于手工文法的规则系统和加权有限状态转换器(WFSTs)[37 (https://arxiv.org/html/2609.02901#bib.bib34),30 (https://arxiv.org/html/2609.02901#bib.bib36)]在覆盖的符号类别上是高效的,但难以维护开放域、依赖上下文的数字表达式。神经网络转换器,包括序列到序列模型[25 (https://arxiv.org/html/2609.02901#bib.bib37)]、复制或重写标记器[2 (https://arxiv.org/html/2609.02901#bib.bib41)]、流式转换器[10 (https://arxiv.org/html/2609.02901#bib.bib35),26 (https://arxiv.org/html/2609.02901#bib.bib38),14 (https://arxiv.org/html/2609.02901#bib.bib42)]以及解码器专用预训练语言模型[4 (https://arxiv.org/html/2609.02901#bib.bib39),5 (https://arxiv.org/html/2609.02901#bib.bib40)],减少了规则工程,但仍在识别之后操作。因此,识别错误已经发生,标准化决策无法与声学识别联合优化。由于标准化是条件呈现决策,而非数字检测后的通用操作,这些局限性促使我们采用双形式设置,同时包含忠实的口语形式和面向应用的书写形式目标。

### II-C LLM生成的监督与ITN评估

LLM生成的监督和LLM作为评判者的范式已被用于合成训练信号或提供可扩展的质量控制[29 (https://arxiv.org/html/2609.02901#bib.bib29),38 (https://arxiv.org/html/2609.02901#bib.bib31),18 (https://arxiv.org/html/2609.02901#bib.bib32)]。然而,对于ASR-ITN,目标并非开放式的指令跟随,而是受约束的口转书转换:书写形式目标应改变适当的数字区间,同时保留所有非ITN内容。

评估也需要反映这种受约束的决策。传统的ASR指标衡量整体转录质量,而独立的ITN指标则常强调所需数字区间是否被转换。它们没有隔离对成语、名称、近似量和其他受保护区间的有害过度标准化。因此,我们使用LLM生成和评判书写形式候选,并应用轻量级的合理性检查以排除明显无效的情况,然后分别评估所需标准化和禁标准化区间的保留。

## III 方法

DF-ASR将ASR-ITN表述为基于提示的双形式生成。给定语音x和提示p,模型估计Pθ(y∣x,p)。我们使用p^s表示口语形式ASR,p^w表示书写形式ASR-ITN。口语形式目标保留忠实的识别行为,而书写形式目标教导语义感知的ITN。提示选择转录形式,语义解释决定口语符号表达式在书写形式模式下应被标准化还是保留。

### III-A LLM驱动的生成-评判双形式监督

图2 (https://arxiv.org/html/2609.02901#S3.F2)说明了所提出的LLM驱动的生成-评判双形式监督工作流。从现有的ASR语料库(包含语音x_i和口语形式转录本y_i^s)开始,我们的目标是生成一个高置信度的书写形式对应本y_i^w。该工作流遵循LLM生成监督和LLM验证的一般思想,但不同于开放式的指令数据生成:源转录本是固定的,只有与ITN相关的局部区间预计会发生变化。LLM用于生成候选并评分配对质量,而轻量级的确定性合理性检查在训练前移除明显无效的输出。

首先,一个指南合成器将转录标准操作化为生成提示p_g和评判提示p_j,指定在书写形式条件下,标准化敏感表达式应如何重写或保留。书写形式生成器G是一个仅限文本的重写器,被提示仅修改与ITN相关的区间并提出候选:

ỹ_i^w = G(y_i^s; p_g)。 (1)

其次,一个配对质量验证器J是一个仅限文本的配对评分器,检查(y_i^s, ỹ_i^w)是否保留了原始语义,仅标准化了适当的区间,并避免了非局部重写:

s_i = J(y_i^s, ỹ_i^w; p_j)。 (2)

如果验证器得分超过阈值τ,则保留该配对。在最终确定保留集之前,我们应用轻量级确定性合理性检查以移除具有非ITN重写痕迹的候选。为简单起见,我们将接受的候选ỹ_i^w记为y_i^w,并将保留的三元组重新索引为:

𝒯 = {(x_i, y_i^s, y_i^w)}_{i=1}^{M_𝒯}, M_𝒯 = |𝒯|。 (3)

这种设计使工作流可审计:配对质量验证器提供可扩展的质量控制,并检查明显无效的样本。每个保留的示例贡献两个训练实例,(x_i, p^s, y_i^s)和(x_i, p^w, y_i^w),因此转录形式由提示指定。

参考图注图2:用于双形式监督的LLM驱动的生成-评判工作流。LLM生成器提出书写形式候选,LLM验证器对候选质量评分,轻量级确定性检查移除明显无效的或非ITN的重写痕迹。

### III-B 基于提示的ASR-ITN模型

如图3 (https://arxiv.org/html/2609.02901#S3.F3)所示,DF-ASR遵循基于LLM的ASR架构,包含语音编码器、适配器和LLM解码器。声学表示被投影到LLM嵌入空间,并与文本提示嵌入连接。然后,相同的模型根据提示生成口语形式或书写形式的转录本。

对于配对监督𝒯,双形式交叉熵(CE)目标函数为:

ℒ_CE = -∑_{i=1}^{M_𝒯} ∑_{b∈{s,w}} ∑_{t=1}^{|y_i^b|} log P_θ(y_{i,t}^b | y_{i,<t}^b, x_i, p^b)。 (4)

该目标函数防止模型在相同条件下将口语和书写格式视为带噪声的替代方案。相反,目标形式通过提示明确指定,允许共享的声学识别能力支持两种部署模式:忠实的口语形式转录和语义感知的书写形式ASR-ITN。

参考图注图3:使用双形式CE和ITN-MWER的DF-ASR训练。ITN-MWER添加了序列级反馈,强调数字值和单位,因为它们的错误可能比普通字符替换导致更大的语义损失。图中显示了4个候选以增加可读性;训练使用16个候选。

### III-C 用于数字信息损失的ITN-MWER

虽然双形式监督微调(SFT)建立了提示到形式的映射,但我们进一步通过序列级优化来精炼模型。标准的CE训练优化token级的似然,而传统的最小wor...

相似文章

FormalASR: 端到端中文口语到正式文本转换

arXiv cs.CL

FormalASR 提出了两个紧凑的端到端模型,可直接将中文口语转录为正式书面文本,显著降低错误率,并消除了对单独 LLM 后处理阶段的需求,实现了轻量级的设备端部署。

迈向类人交互式语音识别:基于智能体修正与语义评估

Hugging Face Daily Papers

本文介绍了 Agentic ASR,一种交互式语音识别框架,通过语义修正和基于推理的编辑,利用多轮优化来减少语义错误。同时,提出了一种新的句子级语义错误率指标以及一个用于基准测试的交互式模拟系统。