面向ASR错误校正的误差感知TF-IDF检索增强生成
摘要
本文提出了一种基于误差感知TF-IDF检索增强生成的框架,用于校正自动语音识别错误,在波斯语FLEURS数据集上取得了显著的准确率提升,且推理延迟几乎为零。
arXiv:2606.24915v1 公告类型:新
摘要:端到端自动语音识别系统经常幻觉罕见实体和领域特定术语,尤其是在低资源语言中。虽然检索增强生成框架可以通过大语言模型缓解这些错误,但当前架构面临重大挑战。它们要么依赖忽略语音识别错误的标准稀疏检索,要么使用引入高延迟的重型跨模态嵌入。本文提出了一种高效、纯词法的误差感知框架,旨在明确解决语音和循环幻觉。我们的方法集成了一个对称文本归一化模块与一种新颖的误差感知词频-逆文档频率算法。通过基于历史错误构建稀疏对角惩罚矩阵,检索器在数学上优先选择包含特定高风险识别错误的纠正文档。在FLEURS数据集的波斯语子集上评估,我们的方法将误差感知命中率从53.7%提高到90.9%。在端到端评估中,集成框架将最终词错误率从23.06%降至18.83%,实现了显著的准确率提升,且推理延迟几乎为零。
查看缓存全文
缓存时间: 2026/06/25 05:09
# 面向语音识别纠错的高效错误感知TF-IDF检索增强生成 来源:https://arxiv.org/html/2606.24915 Mohammad Aref Jafari\-Raddani(Mohammad Aref Jafari\-Raddani 任职于伊朗库姆科技大学计算机工程系,同时任职于伊朗伊斯法罕的 Asa Electronic Akhtaran 公司;电子邮箱:[email protected]) ###### 摘要 端到端自动语音识别系统经常在稀有实体和领域特定术语上出现幻觉,尤其是在低资源语言中。虽然检索增强生成框架可以利用大语言模型减轻这些错误,但当前架构面临重大挑战。它们要么依赖忽略语音误识别的标准稀疏检索,要么使用引入高延迟的重型跨模态嵌入。本文提出了一种高效、纯粹基于词汇的错误感知框架,旨在显式解决语音幻觉和循环幻觉问题。我们的方法将对称文本归一化模块与一种新颖的错误感知词频-逆文档频率算法相结合。通过基于历史错误构建稀疏对角惩罚矩阵,检索器在数学上优先包含特定高风险误识别的纠正性文档。在 FLEURS 数据集波斯语子集上的评估显示,我们的方法将错误感知命中率从 53.7% 提升至 90.9%。在端到端评估中,集成框架将最终词错误率从 23.06% 降至 18.83%,在近乎零推理延迟的情况下实现了显著的精度提升。 参见图注:图1:我们提出的知识库构建与推理框架整体架构。虽然与标准 ASR-RAG 范式 [1 (https://arxiv.org/html/2606.24915#bib.bib1)] 结构相似,但我们引入了两项计算开销为零的改进:通过对称文本归一化进行并行预处理,以及新颖的错误感知 TF-IDF 检索算法。这些改进在不增加推理延迟的情况下提升了检索性能。 ## I 引言 自动语音识别在人机交互中扮演着至关重要的角色,它提供了基础的语音到文本转录功能 [2 (https://arxiv.org/html/2606.24915#bib.bib2)]。近年来,端到端深度学习模型的出现彻底改变了 ASR [3 (https://arxiv.org/html/2606.24915#bib.bib3)]。然而,在低资源语言中,由于环境噪声 [4 (https://arxiv.org/html/2606.24915#bib.bib4)] 和各种口音 [5 (https://arxiv.org/html/2606.24915#bib.bib5)],性能显著下降。此外,在特定领域的实际应用中,这些模型始终难以识别稀有命名实体 [6 (https://arxiv.org/html/2606.24915#bib.bib6)]。 为了缓解这些限制,人们提出了多种后处理方法。随着大语言模型的发展,利用 LLM 进行 ASR 后纠错已成为一个主要研究领域,通常称为生成式纠错 [7 (https://arxiv.org/html/2606.24915#bib.bib7), 8 (https://arxiv.org/html/2606.24915#bib.bib8)]。例如,Ma 等人 [7 (https://arxiv.org/html/2606.24915#bib.bib7)] 展示了如何通过利用 LLM 进行纠错来降低 ASR 的错误率,而 Gu 等人 [9 (https://arxiv.org/html/2606.24915#bib.bib9)] 通过基于 LLM 的上下文拼写纠正提高了 ASR 准确率。尽管 LLM 具有深层的语言理解能力,但它们容易产生幻觉,尤其是在解决超出其预训练参数的未知或稀有命名实体时。为了解决这个问题,最近的研究探索了向 LLM 提供增强数据以实现更聚焦的生成式纠错。Pusateri 等人 [10 (https://arxiv.org/html/2606.24915#bib.bib10)] 使用实体的向量数据库和 LLM 来纠正命名实体错误。此外,Robatian 等人 [1 (https://arxiv.org/html/2606.24915#bib.bib1)] 引入了 GEC-RAG,它使用 ASR 预测和真实文本的 TF-IDF 向量数据库向 LLM 提供类似的错误及其纠正版本。 认识到标准词汇检索的局限性,最近的最先进方法已转向高度复杂的跨模态检索架构。例如,最近的进展采用有限标量量化来压缩大规模的上下文交叉注意力嵌入 [11 (https://arxiv.org/html/2606.24915#bib.bib11)],或利用语音与偏置对比学习在大规模上直接对齐声学和文本模态 [12 (https://arxiv.org/html/2606.24915#bib.bib12)]。此外,其他方法尝试通过构建精心设计的、领域特定的知识图谱来显式映射语音关系 [13 (https://arxiv.org/html/2606.24915#bib.bib13)]。尽管这些方法在检索准确率方面取得了显著改进,但它们在高资源假设下严格运行。它们需要与声学编码器的潜在空间深度集成,依赖大规模、完美对齐的语音-文本训练数据集,并且需要巨大的计算开销。 为了解决经典检索的高计算成本和局限性,特别是针对波斯语等低资源语言,我们提出了一种高效且准确的检索增强生成框架用于 ASR 纠错。我们的方法引入了两项关键创新:一种错误感知的 TF-IDF 检索算法和一个对称文本归一化模块。与依赖 N-best 重排序的方法不同,我们使用单一的 1-best ASR 假设,无需复杂的声学嵌入或知识图谱。通过集成我们的错误感知 TF-IDF 检索算法代替标准 TF-IDF,我们将词错误率从 21.95% 降至 18.83%,推理过程中仅增加了一次稀疏矩阵乘法。本文的主要贡献总结如下: - **对称文本归一化**:我们引入了一个稳健的预处理流程,对称地应用于外部知识库和在线推理查询。这减轻了形态学不匹配和 ASR 循环幻觉,保持了向量空间的数学完整性。 - **错误感知 TF-IDF 检索**:我们修改了标准 TF-IDF 公式,为频繁出现幻觉的 token 计算权重,有效迫使系统为 LLM [14 (https://arxiv.org/html/2606.24915#bib.bib14)] 检索有针对性的纠正上下文。 - **低资源数据上的实证验证**:通过使用 Whisper large-v3-turbo 和 Gemini 2.0 Flash 在波斯语 Google FLEURS 数据集上进行广泛评估,我们引入了错误感知命中率 (EA-HR) 指标,并展示了我们方法的每个部分如何影响相关错误 token [15 (https://arxiv.org/html/2606.24915#bib.bib15), 16 (https://arxiv.org/html/2606.24915#bib.bib16)] 的检索。 ## II 提出的方法 首先,如图 1 所示,我们的稳健归一化模块在知识库构建和在线推理流程中对称地应用于原始文本。这种对称应用确保了循环幻觉不会扭曲我们的概率向量空间。此外,通过标准化多拼写单词和格式变体(例如,将数字转换为一致的书面单词),我们防止了可能被系统误认为是 ASR 错误的 token 不匹配。 其次,我们用新颖的错误感知 TF-IDF 算法替换了标准 TF-IDF 检索器。标准检索器平等对待所有 token;然而,我们的方法动态地为正确识别的单词和被误解的 token 分配不同的权重,迫使系统检索那些显式解决 ASR 模型语音失败的文档。为了实现这一点,我们根据知识库真实文本和 ASR 预测之间的错误倾向计算一个稀疏对角权重矩阵 \(D_e\)。在推理过程中,这个稀疏矩阵只需与标准 TF-IDF 矩阵相乘,确保与基线版本相比没有显著的计算延迟。 在以下小节中,我们将详细讨论对称文本归一化和新的错误感知 TF-IDF 算法。 ### II-A 对称文本归一化 ASR 系统生成的文本输出通常包含标点符号伪影、零宽非连接符不一致和重复的幻觉 token。为了标准化信息检索模块的输入空间并使其对 LLM 清晰易用,我们对 ASR 假设和 RAG 知识库都应用了自定义文本处理器。首先,与之前针对波斯语作为低资源语言的研究一致,我们通过纠正空格和 ZWNJ 字符,并将所有数字转换为其标准化的波斯语格式来归一化 ASR 输出。消除这些 token 不匹配对错误感知检索过程有至关重要的影响,这将在下一节讨论。 其次,ASR 模型经常出现循环幻觉,当无法识别后续声学信号时,会无休止地重复前一个 token。在某些情况下,重复的单词完全是捏造的(例如,由于背景噪声而不断重复一个单词)。这会以两种方式严重降低 RAG ASR 纠错流程的性能。首先,它增加了不必要的 LLM token 成本和上下文混淆。其次,它严重扭曲了词频,使我们的 TF-IDF 向量空间高度不准确。为了解决这个问题,我们截断任何重复超过两次的 token 序列,将多余的 token 丢弃为幻觉。这个阈值可以根据目标语言和领域作为可调超参数。 ### II-B 错误感知 TF-IDF 检索 标准检索模型,如词频-逆文档频率,已在先前研究中用于衡量词汇相似度;然而,这些模型本质上平等对待所有 token。在基于 RAG 的 ASR 后处理中,检索的目标是为大语言模型提供显式证据以纠正转录错误。为了说明这一局限性,考虑一个包含十个 token 的 ASR 假设,其中两个是语音误识别。使用标准 TF-IDF,所有 token 都被平等对待。如果检索系统找到一个仅包含八个正确 token 的文档,尽管它对语言模型的两个错误没有提供任何纠正上下文,但它会产生高相似度得分。因此,我们必须给容易出错的词分配显著高于正确识别词的权重。为了解决这个问题,我们提出了一种错误感知的 TF-IDF 变体,它根据 token 的历史错误概率动态重新校准其权重。 我们基于经过对称文本归一化后的 ASR 预测及其相应的实际目标构建知识库。令 \(V\) 表示 ASR 预测的词汇表。对于每个词 \(t \in V\),我们通过将基线 ASR 转录与真实文本知识库进行比较来确定其“错误倾向”。具体来说,我们统计正确出现的次数 \(C(t)\),即 \(t\) 出现在该行的相应目标中,以及错误出现的次数 \(E(t)\),定义为 ASR 模型在 \(t\) 实际上并不存在于真实文本中时幻觉出 \(t\) 的实例数。 为了迫使检索系统聚焦于这些高风险 token(如同音词和命名实体),我们引入了一个动态权重乘数 \(W_{\text{error}}(t)\),计算如下: \[ W_{\text{error}}(t) = W_c + \left( \frac{E(t)}{E(t) + C(t)} \right) \times (W_e - W_c) \quad (1) \] 这里,\(W_c\) 和 \(W_e\) 是经验调整的超参数。\(W_c\) 为可靠识别的 token 设定基础权重,而 \(W_e\) 规定了应用于易错词的最大惩罚权重。在我们对 Google FLEURS 数据集的实验中,我们设置 \(W_c = 0.1\) 和 \(W_e = 2.0\)。因此,具有高历史幻觉率的 token 将显著主导向量表示,确保它们在文档检索中不会被忽略。 使用所有 \(t \in V\) 的 \(W_{\text{error}}(t)\),我们构建一个稀疏对角惩罚矩阵 \(D_e\)。在知识库向量化和 ASR 查询推理过程中,这个矩阵只需与标准 TF-IDF 矩阵相乘: \[ \text{EA-TF-IDF} = \text{TF-IDF} \times D_e \quad (2) \] 这种架构设计保证了两个关键的数学和计算优势。首先,它确保参考语料库和传入的推理查询被对称地投影到共享的错误感知潜在空间中,使得下游的余弦相似度计算在数学上合理。其次,由于 TF-IDF 和 \(D_e\) 都是高度稀疏的矩阵,这种乘法在推理过程中增加了接近零的计算延迟。这使得我们的框架能够有效避免其他检索器通常带来的巨大处理开销。 ## III 结果与实验 ### III-A 设置 考虑到波斯语是一种低资源语言,我们使用 Google FLEURS 数据集 [15 (https://arxiv.org/html/2606.24915#bib.bib15)] 的波斯语子集进行评估。包含 3,000 个样本的训练集用于构建 RAG 知识库,评估在包含 873 个样本的测试集上进行。对于 ASR,我们在 RTX 3090 上使用了 Whisper large-v3-turbo。此外,使用 Google Gemini 2.0 Flash-Lite 作为 LLM,以确保成本效益和低延迟。 在对波斯语的观察中,我们识别了与可选连接词和数字表示相关的错误。为防止这些固有的语言变体扭曲最终的误码率计算,我们标准化了评估文本。 为了隔离检索模块的性能,我们设计了错误感知命中率。令查询 \(t\) 在知识库中的 ASR 假设 token 集合为 \(W(t)\),其真实文本 token 集合为 \(G(t)\)。\(t\) 的幻觉错误 token \(E(t)\) 由相对补集定义: \[ E(t) = W(t) \setminus G(t) \quad (3) \] 对于由 ASR token 集合 \(Q_w\) 表示的推理查询,如果检索返回至少一个相关的幻觉 token,我们认为检索成功: \[ E \cap Q_w \neq \emptyset \quad (4) \] ### III-B 结果 表 I:离线检索评估 (EA-HR @ Top-3) #### III-B1 检索评估 首先,我们通过计算 EA-HR 来评估所提出的检索模块的性能。这将其与标准 TF-IDF 相比识别查询中确切错误 token 的能力隔离开来。我们在相同的波斯语 FLEURS 测试集的 Whisper ASR 输出上测试了两种向量化器。为了衡量对称文本归一化的影响,我们分别在有和没有这一预处理步骤的情况下评估了两种检索器。如表 I 所示,我们的错误感知 TF-IDF 在没有归一化的情况下达到了 83.0%,而标准 TF-IDF 为 53.0%。这表明集成错误惩罚显著改善了对相关错误 token 的检索。应用对称文本归一化进一步将标准 TF-IDF 的 EA-HR 提升至 53.7%,而我们的方法提升至 90.9%,突显了形态一致性的关键影响。 表 II:端到端 ASR 纠错性能 #### III-B2 端到端 ASR 纠错评估 上一节展示了
相似文章
迈向类人交互式语音识别:基于智能体修正与语义评估
本文介绍了 Agentic ASR,一种交互式语音识别框架,通过语义修正和基于推理的编辑,利用多轮优化来减少语义错误。同时,提出了一种新的句子级语义错误率指标以及一个用于基准测试的交互式模拟系统。
快速且忠实:长文档检索增强生成系统的实时验证
本文提出了一种用于检索增强生成的实时验证系统,可处理长达32K token的文档,通过自适应推理策略在延迟与验证覆盖之间取得平衡。其为构建可靠的RAG系统提供了实用指导。
SERC: 基于LDPC思想的语义纠错用于检索增强生成
提出SERC,一种受LDPC码启发的无需训练的方法,通过将生成过程视为噪声信道,并利用稀疏验证查询与外部证据对比,来纠正大语言模型中的幻觉。
基于图的噪声ASR音素错误纠正
提出G-SPIN,一个轻量级框架,结合音素图建模与上下文语言理解来纠正ASR错误。使用GNN生成音素合理的候选词元,MLM进行局部评分,LLM进行最终重新排序,所有操作均在推理时进行。
大型语言模型能否可靠地纠正低资源ASR中的错误?一项关于西弗里斯兰语的污染感知案例研究
本文研究了基于LLM的生成式错误修正(GER)在低资源西弗里斯兰语ASR中的应用,采用污染感知评估方法,使用私有数据集表明GPT-5.1将错误降低至低于oracle水平。