JSPG:基于语义-拼音-字形联合检索的中文上下文ASR动态字典过滤
摘要
本文提出JSPG,一种动态字典过滤框架,联合利用语义、拼音和字形特征提升中文上下文ASR的关键词检索准确率,解决同音错误导致语义检索性能下降的问题。
arXiv:2605.16896v1 公告类型:新论文
摘要:上下文自动语音识别(ASR)在处理大规模关键词字典时面临挑战,过多的不相关候选词会引入噪声,降低识别准确率。为解决此问题,动态过滤通常使用基础ASR模型生成初步假设,然后通过语义文本检索器获取一个精简的相关关键词子集。然而,这种方法在中文ASR中经常失败。基础模型常产生同音或近同音错误,这些错误保留了目标关键词的语音线索,但严重扭曲了其语义,使得标准的语义检索器失效。为此,我们提出了一种联合整合语义、拼音和字形特征的过滤框架(JSPG)。拼音能够基于语音相似性有效检索目标,而字形则提供互补的结构线索,以过滤掉中文中大量不相关的同音词。为了弥合字符级拼音/字形度量与序列级过滤之间的差距,我们引入了一种扩展的Smith-Waterman算法,用于计算N最佳假设序列与关键词之间的相似度分数。在Aishell-1和RWCS-NER数据集上的实验表明,JSPG显著优于单特征基线。此外,由JSPG引导的下游上下文ASR模型在关键词识别准确率上取得了显著提升。
查看缓存全文
缓存时间: 2026/05/19 06:36
# JSPG:基于语义-拼音-字形联合检索的中文上下文语音识别动态词典过滤 来源:https://arxiv.org/html/2605.16896 周士林,李正华††通讯作者 苏州大学计算机科学与技术学院,中国苏州 [email protected]; [email protected] ###### 摘要 上下文自动语音识别(ASR)在处理大规模关键词词典时面临挑战,过多的无关候选项会引入噪声,降低识别准确率。为了解决这个问题,动态过滤通常先使用基础ASR模型生成初步假设,然后通过语义文本检索器获取相关关键词的简洁子集。然而,这种方法在中文ASR中经常失效。基础模型常常产生同音或近音错误,这些错误保留了目标关键词的语音线索,但严重扭曲了其语义含义,使得标准语义检索器失效。为解决此问题,我们提出了一种联合语义、拼音和字形特征(JSPG)的过滤框架。拼音能有效基于语音相似度检索目标,而字形则提供互补的结构线索,以过滤掉中文中固有的众多无关同音字。为了弥合字符级拼音/字形度量与序列级过滤之间的差距,我们引入了一种扩展的Smith-Waterman算法,用于计算N-best假设序列与关键词之间的相似度分数。在Aishell-1和RWCS-NER数据集上的实验表明,JSPG显著优于单特征基线。此外,由JSPG引导的下游上下文ASR模型在关键词识别准确率上取得了显著提升。 JSPG: Dynamic Dictionary Filtering via Joint Semantic-Pinyin-Glyph Retrieval for Chinese Contextual ASR Shilin Zhou, Zhenghua Li††thanks:Corresponding authorSchool of Computer Science and Technology,Soochow University, Suzhou, [email protected]; [email protected] ## 1 引言 自动语音识别(ASR)系统在通用转录任务中取得了显著成功Radford et al. (2022 (https://arxiv.org/html/2605.16896#bib.bib18)); Bai et al. (2024 (https://arxiv.org/html/2605.16896#bib.bib2)); Omnilingual et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib13))。然而,准确识别上下文关键词(如技术术语和稀有实体)仍然是一个挑战。这些关键词在通用训练语料中出现频率低,导致模型难以有效转录Peters et al. (2018 (https://arxiv.org/html/2605.16896#bib.bib15)); Sudo et al. (2024b (https://arxiv.org/html/2605.16896#bib.bib22))。 为了解决这个问题,研究人员提出了上下文ASR任务Pundak et al. (2018 (https://arxiv.org/html/2605.16896#bib.bib16)); Alon et al. (2019 (https://arxiv.org/html/2605.16896#bib.bib1)); Zhou et al. (2024b (https://arxiv.org/html/2605.16896#bib.bib28)),它利用预定义的关键词词典来指导识别过程。当前方法在词典较小时取得了有希望的结果。然而,实验表明,随着词典规模增大,无关关键词的存在导致转录准确率显著下降Zhou et al. (2024b (https://arxiv.org/html/2605.16896#bib.bib28)); Sudo et al. (2024a (https://arxiv.org/html/2605.16896#bib.bib21)); Zhou and Li (2025 (https://arxiv.org/html/2605.16896#bib.bib26))。 假设:"买入弃权"(Buy Abstention) 基础ASR输出 语义混淆:"买入期权"(Buy Options) 输入语音 关键词词典 {...放弃, 期权, ...} 语义检索器 JSPG检索器 放弃 (Give Up) [语义匹配] 错误目标 期权 (Options) [语音匹配] 正确目标 图 1: 检索过程示意图。上路径:语义检索器被ASR错误“弃权 (Abstention)”误导,检索出“放弃 (Give Up)”。下路径:我们的JSPG检索器利用联合语义-拼音-字形特征正确检索出目标“期权 (Options)”。为了缓解大规模词典的负面影响,最近的研究探索了针对每个语音输入动态过滤词典,得到高相关性的关键词子集Mathur et al. (2024 (https://arxiv.org/html/2605.16896#bib.bib12)); Li et al. (2024a (https://arxiv.org/html/2605.16896#bib.bib10)); Chen et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib5)); Lei et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib9))。在典型的级联流水线中,基础ASR模型首先将语音输入转录为初步的N-best假设。然后,这些方法通常要么选择排名最高的假设作为查询,要么将所有假设拼接成一个查询序列。随后,查询和词典中的关键词被输入预训练的文本嵌入模型,该模型将它们转换为嵌入表示。最后,系统计算它们之间的余弦相似度分数,以选择得分最高的关键词作为过滤后的子集Xiao et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib24)); Dimitrios et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib7))。由于文本嵌入旨在编码输入的上下文含义,我们将这些方法称为语义检索器。 然而,仅依赖语义特征不足以在中文上下文ASR中实现精确的关键词过滤。由于ASR基于声学,且中文有大量同音字,ASR错误通常听起来与目标关键词相似,但含义完全不同。语义检索器会获取与错误转录语义相关但与实际目标完全无关的关键词。例如,如图1 (https://arxiv.org/html/2605.16896#S1.F1)所示,目标“期权”(Options)因同音混淆被误识别为“弃权”(Abstention)。因此,检索器根据“弃权”与“放弃”的高语义相似度,错误地获取了无关关键词“放弃”(Give Up)。 由于这些错误保留了与目标的语音相似性,我们可以利用这一线索进行检索。在中文中,拼音直接编码发音,使其成为语音匹配的自然度量。然而,许多不同的汉字共享完全相同的发音。因此,仅依赖拼音会引入大量噪声,因为它会检索出许多无关字符以及正确关键词。 幸运的是,汉字的字形特征为这种语音噪声提供了互补的解决方案。由于大多数汉字是形声字,ASR语音错误通常与目标关键词共享结构组件Tan et al. (2005 (https://arxiv.org/html/2605.16896#bib.bib23))。关键在于,虽然许多不同的字符共享完全相同的发音,但每个字符都有独特的字形结构。这种一对一特性产生了鲜明的区分信号,使系统能够轻松地将目标与拼音检索出的无关同音字区分开来。 在这项工作中,我们提出了JSPG,一种用于中文上下文ASR的联合语义-拼音-字形检索方法。JSPG整合了两种特征:来自预训练文本嵌入的全局语义分数,以捕捉广泛上下文Mathur et al. (2024 (https://arxiv.org/html/2605.16896#bib.bib12)); Lei et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib9)),以及融合了字符级拼音和字形相似度的统一拼音-字形分数Qiao et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib17)),以确保精确的局部匹配。由于拼音和字形度量本质上在字符级操作,我们引入了一种扩展的Smith-Waterman算法Smith et al. (1981 (https://arxiv.org/html/2605.16896#bib.bib19)),将其扩展为测量短关键词与较长、带噪声的ASR假设序列之间的序列级相似度。 我们在标准Aishell-1Bu et al. (2017 (https://arxiv.org/html/2605.16896#bib.bib3)); Chen et al. (2022 (https://arxiv.org/html/2605.16896#bib.bib4))和复杂、真实的RWCS-NER数据集Zhou et al. (2024a (https://arxiv.org/html/2605.16896#bib.bib27))上评估了JSPG。实验结果表明,JSPG显著优于仅依赖单一语义、拼音或字形特征的基线。消融研究进一步揭示,每个组件对系统都有独特贡献,其整合产生了最鲁棒的检索性能。此外,当上下文ASR模型由JSPG过滤的关键词引导时,它们在关键词识别准确率上取得了显著提升。 ## 2 相关工作 标准的上下文ASR方法在处理大规模词典时面临显著的扩展性瓶颈,因为大量无关候选项引入噪声,降低了识别准确率Zhou et al. (2024b (https://arxiv.org/html/2605.16896#bib.bib28)); Sudo et al. (2024a (https://arxiv.org/html/2605.16896#bib.bib21))。为了解决这个问题,最近的研究采用了动态词典过滤,即在将语音输入送入下游上下文ASR模型之前,为每个输入检索出简洁、高相关性的关键词子集。这种机制的现有实现通常分为两大类:基于文本的级联检索和基于音频的端到端检索。 ### 2.1 基于文本的级联检索 第一类,基于文本的级联检索,首先利用轻量级基础ASR模型将音频转录为初步假设或N-best列表。这些假设作为查询与关键词词典匹配。现有方法主要依赖密集文本嵌入来执行这种匹配。例如,Mathur et al. (2024 (https://arxiv.org/html/2605.16896#bib.bib12))使用BERTDevlin et al. (2019 (https://arxiv.org/html/2605.16896#bib.bib6)),而Xiao et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib24))使用MPNetSong et al. (2020 (https://arxiv.org/html/2605.16896#bib.bib20))来编码假设和关键词,基于语义相似度对候选项进行排名。这种范式的优势在于其免训练特性,可以直接应用强大的文本嵌入模型来捕捉丰富的语义知识。 虽然这些纯语义检索器在捕捉语义相似度方面有效,但它们容易受到语音识别错误的影响,而语音识别错误在中文中很普遍。由于基础ASR模型经常产生同音或近音错误,转录文本的含义通常与目标相差甚远,尽管听起来相似。因此,仅依赖语义嵌入的检索器会被这些文本错误误导,获取与错误转录语义相关但与实际语音无关的关键词。此类无关候选项无法提供准确的上下文,使得它们无法有效指导下游上下文ASR模型。这一局限性强调了仅依赖全局语义是不够的,有必要纳入其他特征,如语音和字形特征。 参见图注图 2: 提出的JSPG过滤框架概述。给定一个输入话语,基础ASR模型生成N-best假设,并通过语义、拼音和字形相似度与词典中的每个候选关键词进行比较。分数被合并以排序和检索出最相关的关键词,用于下游上下文ASR。 ### 2.2 基于音频的端到端检索 在基于文本的级联方法中,初步转录中的错误会传播到检索阶段。这可能导致无法检索到正确的关键词。为了避免对中间文本的依赖,基于音频的端到端检索直接利用输入语音来检索关键词。具体来说,这些方法使用语音编码器生成音频的嵌入,使用文本编码器生成关键词的嵌入。它们通过对比损失进行训练,以最大化输入语音与相关真实关键词之间的相似度分数Li et al. (2024b (https://arxiv.org/html/2605.16896#bib.bib11)); Gong et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib8))。虽然这种方法有效绕过了错误传播,但它通常需要在大量配对数据集上进行额外的训练,以对齐音频和文本表示,这使得它数据需求高且计算代价昂贵。 相比之下,我们提出的JSPG框架保持了级联范式,以直接利用LLMs复杂的语义能力,无需额外训练。关键在于,我们通过整合语音和字形特征来减轻转录错误的负面影响。 ### 2.3 中文中的字形和拼音特征 汉字的独特之处在于它们整合了语义、语音和结构Tan et al. (2005 (https://arxiv.org/html/2605.16896#bib.bib23))。具体来说,语音和结构属性通常分别通过拼音和字形特征来衡量。先前在中文拼写检查(CSC)和命名实体识别(NER)中的工作表明,整合这些特征对于解决歧义至关重要。 最近,Qiao et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib17))提出了一种基于语音和结构属性量化汉字相似度的方法。然而,它设计用于字符级比较,无法直接应用于我们的任务。核心挑战在于计算关键词与假设序列之间的相似度。通常,短关键词与较长假设之间存在显著的长度差异,并且假设序列通常包含识别错误。为了弥合这一差距,我们的JSPG方法将字符级相似度分数适配到改进的Smith-Waterman算法Smith et al. (1981 (https://arxiv.org/html/2605.16896#bib.bib19))中。这允许我们利用语音和字形线索来识别假设中的最佳匹配部分,并返回一个序列级相似度分数,用于辅助JSPG中的检索过程。 ## 3 我们的JSPG方法 #### 总体思路。 我们的目标是从包含大量关键词的词典中确定少量与输入语音真正相关的关键词。只有选定的少数关键词被提供给后续的上下文ASR模型。具体来说,我们遵循N-best假设范式Mathur et al. (2024 (https://arxiv.org/html/2605.16896#bib.bib12)); Dimitrios et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib7)),该范式包含两个步骤。首先,我们使用非上下文基础ASR模型获得N-best转录。其次,我们使用这N个转录从词典中获取K个最相关的关键词。先前的工作使用隐式基于嵌入的相似度来表示相关性,利用LLMs将每个转录和每个关键词编码为稠密向量。本工作的主要贡献是整合了基于发音和字形的显式字符相似度。我们遵循Qiao et al. (2025 (https://arxiv.org/html/2605.16896#bib.bib17))在中文拼写检查方面的最新工作,并借鉴了计算字符相似度的方法。为了计算转录与关键词之间的相关性,我们扩展了标准的Smith-Waterman算法Smith et al. (1981 (https://arxiv.org/html/2605.16896#bib.bib19)),以纳入
相似文章
基于图的噪声ASR音素错误纠正
提出G-SPIN,一个轻量级框架,结合音素图建模与上下文语言理解来纠正ASR错误。使用GNN生成音素合理的候选词元,MLM进行局部评分,LLM进行最终重新排序,所有操作均在推理时进行。
面向检索增强生成的查询自适应语义分块:一种结合上下文窗口扩展的动态策略
提出了一种面向检索增强生成的查询自适应语义分块方法,通过上下文窗口扩展动态调整分块边界,以提升检索精度。
GUIDE:通过语音和视觉共享ID编码的生成式无监督中文查询纠正
GUIDE 是一个用于中文查询纠正的生成式无监督框架,利用语音和视觉共享ID编码来约束纠正并适应不断变化的词汇,在实验和在线A/B测试中超越了基线。
指针增强的自回归生成专利权利要求与联合拓扑和内容解码
本文提出SPG,一种结构感知的专利生成方法,在自回归解码过程中通过指针头和偏好优化阶段联合预测权利要求拓扑和内容,在HUPD-DCG基准测试中显著提升了父链接恢复和先行词一致性。
GRASP:面向代理型RAG的粒度感知搜索策略
介绍GRASP,一种强化学习框架,训练智能体在多步推理中自适应地协调语义搜索、关键词搜索和段落读取,提高了多跳基准上的检索召回率和问答性能。