如何识别新词:上下文偏置方法与语音大语言模型的比较

arXiv cs.CL 论文

摘要

本文比较了上下文偏置方法和语音大语言模型在自动语音识别中识别罕见词和新词的表现,报告了在朗读语音和非朗读语音中词错误率的权衡。

arXiv:2608.05759v1 公告类型:新 摘要:识别新词和罕见词——命名实体、缩写、领域特定的特殊词汇,以及训练数据中稀缺的其他项目——仍然是自动语音识别(ASR)的关键挑战。我们比较了两种策略:上下文偏置方法(扩展ASR模型,使得在推理过程中可以提供单词列表)和语音大语言模型(LLM)(直接通过上下文提示)。我们基于Whisper评估了两种上下文偏置方法,并与三个语音大语言模型在朗读语音和非朗读语音上进行对比,报告了偏置、非偏置和总体词错误率(WER)。上下文偏置方法将偏置词错误率相对降低了最多88%,同时其他单词基本不受影响。语音大语言模型在朗读语音上表现优异,但在非朗读语音上的泛化能力较差,并且对干扰项数量和提示词顺序敏感。我们描述了由此产生的权衡,以指导方法选择。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:51

# 如何识别新词:上下文偏置方法与语音LLM的比较
来源:https://arxiv.org/html/2608.05759

###### 摘要

识别新词和罕见词——命名实体、缩略词、领域特定特殊词汇以及训练数据中稀缺的其他条目——仍然是自动语音识别(ASR)的一个关键挑战。我们比较了两种策略:上下文偏置方法(扩展ASR模型,使其在推理时能够提供单词列表)和直接使用上下文提示的语音大语言模型(LLM)。我们基于Whisper在朗读和非朗读语音上评估了两种上下文偏置方法,并与三种语音LLM进行比较,报告了偏置词、非偏置词和整体词错误率(WER)。上下文偏置方法将偏置词WER最多相对降低88%,同时基本不影响其他词。语音LLM在朗读语音上表现出色,但对非朗读语音的泛化能力较弱,并且对干扰项数量和提示词顺序敏感。我们总结了由此产生的权衡,以指导方法选择。

## I 引言

端到端ASR凭借transformer架构[29 (https://arxiv.org/html/2608.05759#bib.bib2),20 (https://arxiv.org/html/2608.05759#bib.bib3)]以及最近在数十万小时音频上使用弱监督训练的大型模型(如Whisper[22 (https://arxiv.org/html/2608.05759#bib.bib4)])而迅速发展。这些系统在各种条件下都实现了较低的词错误率,并已成为许多转写任务的默认选择。尽管如此,它们仍有一个长期存在的弱点:训练数据中罕见或不存在的词——命名实体、缩略词和领域特定术语——的识别可靠性远低于常见词。这个弱点影响重大,因为罕见词往往是话语中信息量最大的部分。人名、产品标识符或技术术语通常比周围的虚词承载更多含义,因此此类词上的错误会不成比例地降低转录文本的实用性。同时,由于这些词不常出现,其错误在整体WER中被稀释,即使最重要的词被系统性漏掉,整体WER仍可能保持较低。

有两种策略可以解决这个问题。第一种是上下文偏置方法,它通过一种机制扩展ASR模型,使其在推理时接受单词或短语列表,并让解码偏向这些词,而无需为每个新列表调整模型参数。第二种利用语音LLM,这是最近出现的一类模型,可以联合处理音频和文本提示:感兴趣的词——甚至是对上下文的自由形式描述——可以放入提示中,模型能够关注它们。上下文偏置方法提供了专用、可控的接口,而语音LLM则承诺更高的灵活性。

## II 相关工作

识别新词和罕见词的困难由来已久。一些工作使用浅融合[24 (https://arxiv.org/html/2608.05759#bib.bib15),30 (https://arxiv.org/html/2608.05759#bib.bib16),13 (https://arxiv.org/html/2608.05759#bib.bib17),10 (https://arxiv.org/html/2608.05759#bib.bib18),14 (https://arxiv.org/html/2608.05759#bib.bib19)]将统计语言模型或神经语言模型与端到端ASR模型相结合。由于偏置组件与声学模型分开训练,收益通常有限。另一方面,许多近期工作使用基于注意力的深度偏置[21 (https://arxiv.org/html/2608.05759#bib.bib20),2 (https://arxiv.org/html/2608.05759#bib.bib21),12 (https://arxiv.org/html/2608.05759#bib.bib22),11 (https://arxiv.org/html/2608.05759#bib.bib7),16 (https://arxiv.org/html/2608.05759#bib.bib1),7 (https://arxiv.org/html/2608.05759#bib.bib23),5 (https://arxiv.org/html/2608.05759#bib.bib24),9 (https://arxiv.org/html/2608.05759#bib.bib25),33 (https://arxiv.org/html/2608.05759#bib.bib26),26 (https://arxiv.org/html/2608.05759#bib.bib27),34 (https://arxiv.org/html/2608.05759#bib.bib28),31 (https://arxiv.org/html/2608.05759#bib.bib29),25 (https://arxiv.org/html/2608.05759#bib.bib8)]。其中一些仅使用文本上下文信息,另一些还包含发音信息。

最近,语音LLM被引入[3 (https://arxiv.org/html/2608.05759#bib.bib31),27 (https://arxiv.org/html/2608.05759#bib.bib30),8 (https://arxiv.org/html/2608.05759#bib.bib32)]。音频信号被编码,得到的表示被输入LLM。一些工作对语音LLM进行适配以包含上下文[15 (https://arxiv.org/html/2608.05759#bib.bib33),6 (https://arxiv.org/html/2608.05759#bib.bib34)]。最新的语音LLM[23 (https://arxiv.org/html/2608.05759#bib.bib5),32 (https://arxiv.org/html/2608.05759#bib.bib6),19 (https://arxiv.org/html/2608.05759#bib.bib9)]经过显式训练,能够使用提示中给出的上下文。与我们最接近的工作是[25 (https://arxiv.org/html/2608.05759#bib.bib8)],但他们没有研究大型语音LLM的干扰项数量效应,并且仅评估了朗读语音(LibriSpeech)。

在本文中,我们(1)对两种基于Whisper的上下文偏置方法与三种近期语音LLM(Qwen3-ASR、Qwen3-Omni、VibeVoice-ASR)在罕见词识别上进行了受控的直接比较,并报告了偏置词、非偏置词和整体WER指标;(2)在朗读(LibriSpeech)和非朗读(Earnings-21、Yodas)语音上进行评估,表明语音LLM在朗读语音上很强,但对非朗读语音的泛化能力较弱;(3)系统性地探测鲁棒性,量化对干扰项数量和提示中单词顺序的敏感性;(4)研究了一个过滤阶段,使用辅助语音LLM修剪偏置列表,展示它能恢复多少损失。(5)根据这些结果,我们总结了由此产生的权衡以指导方法选择:当有干净的单词列表可用时,专用上下文偏置方法仍然是更鲁棒的选择,而语音LLM提供了更灵活的接口,但代价是对提示敏感以及需要额外的过滤阶段。

## III 背景

下面我们总结所比较的两种上下文偏置方法。

自回归端到端ASR模型直接估计下一个token Y_tY\_\{t\} 在已解码序列 Y_0,...,Y_{t-1}Y\_\{0\},\\ldots,Y\_\{t\-1\} 和音频输入 XX 条件下的概率分布

P(Y_t|Y_0,...,Y_{t-1};X)P\(Y\_\{t\}\|Y\_\{0\},\\ldots,Y\_\{t\-1\};X\)	(1)

然后使用该模型寻找概率最高的词序列 Y^\hat\{Y\}

Y^\displaystyle\\hat\{Y\} = argmax_Y P(Y|X)\displaystyle=\\operatorname\*\{argmax\}\_\{Y\}P\(Y\|X\) = argmax_Y ∏_{t=1}^{T} P(Y_t|Y_0,...,Y_{t-1};X),\displaystyle=\\operatorname\*\{argmax\}\_\{Y\}\\prod\_\{t=1\}^\{T\}P\(Y\_\{t\}\|Y\_\{0\},\\ldots,Y\_\{t\-1\};X\),其中Y_0Y\_\{0\}是序列起始token。

我们使用基于transformer的编码器-解码器ASR模型。首先,Y_0,...,Y_{t-1}Y\_\{0\},\\ldots,Y\_\{t\-1\}被嵌入:

E=Emb(Y_0,...,Y_{t-1})∈R^{t×d},E=Emb\(Y\_\{0\},\\ldots,Y\_\{t\-1\}\)\\in\\mathbb\{R\}^\{t\\times d\},	(2)

其中d∈Nd\\in\\mathbb\{N\}。然后计算解码器输出:

O=Dec(H_X,E)∈R^{t×d},O=Dec\(H\_\{X\},E\)\\in\\mathbb\{R\}^\{t\\times d\},

其中H_X=Enc_Audio(X)H\_\{X\}=Enc\_\{Audio\}\(X\)是编码后的音频输入。最后应用输出层和softmax层:

α=Linear(O)∈R^{t×n_vocab},\\alpha=Linear\(O\)\\in\\mathbb\{R\}^\{t\\times n\_\{vocab\}\},p=Softmax(α)∈R^{t×n_vocab},p=Softmax\(\\alpha\)\\in\\mathbb\{R\}^\{t\\times n\_\{vocab\}\},	(3)

其中n_vocabn\_\{vocab\}是词汇表大小。

在此基础上,我们使用[11 (https://arxiv.org/html/2608.05759#bib.bib7)]的训练方案,结合[11 (https://arxiv.org/html/2608.05759#bib.bib7)](记为A)或[25 (https://arxiv.org/html/2608.05759#bib.bib8)](记为B)的架构,训练了两种上下文偏置模型。这些方法的工作原理如下:公式1 (https://arxiv.org/html/2608.05759#S3.E1)被替换为

P(Y_t|Y_0,...,Y_{t-1};X;Z),P\(Y\_\{t\}\|Y\_\{0\},\\ldots,Y\_\{t\-1\};X;Z\),其中ZZ是提供给模型的某种上下文。在我们的情况下,

Z=(Z_1,...,Z_L),L∈N,Z=\(Z\_\{1\},\\ldots,Z\_\{L\}\),L\\in\\mathbb\{N\},是一个称为上下文偏置列表的列表,每个Z_lZ\_\{l\}, l∈{1,...,L}l\\in\\\{1,\\ldots,L\\\},是模型偏向的词或短短语。

### III-A 上下文编码

两种模型都首先对上下文偏置列表中的每个条目进行编码和嵌入。结果记为

Z_l^{emb}=Emb(Tokenize(Z_l))。Z\_\{l\}^\{emb\}=Emb\(Tokenize\(Z\_\{l\}\)\)。

然后,对每个条目独立应用编码器,之后沿序列维度计算均值。这得到每个列表条目的一个向量,记为

Z_l^s=Avg(Enc(Z_l^{emb})),Z\_\{l\}^\{s\}=Avg\(Enc\(Z\_\{l\}^\{emb\}\)\),可解释为该列表条目的摘要向量。对于方法A,添加一个学习得到的虚拟向量Z_0^sZ\_\{0\}^\{s\},该向量在后续用于判断上下文偏置列表中没有相关信息的情况。

### III-B 上下文解码

方法A:基线模型的每个解码器层由自注意力层、交叉注意力层和逐位置前馈层组成。在每个交叉注意力层之后添加一个上下文注意力层,其第一步预测上下文偏置列表中相关信息的存在位置(关于如何训练该任务见下一段)。如果存在相关信息,则在第二步使用注意力提取它(见公式4 (https://arxiv.org/html/2608.05759#S3.E4)):设I^mI^\{m\}, m∈{1,...,M}m\\in\\\{1,\\ldots,M\\\}, M∈NM\\in\\mathbb\{N\},是第mm个上下文注意力层的输入。首先,I^mI^\{m\}作为查询,(Z_l^s)_{l=0,...,L}(Z\_\{l\}^\{s\}\)\_\{l=0,\\ldots,L\}作为键,计算相似度分数S^m=I^m·(Z_l^s)_{l=0,...,L}^TS^\{m\}=I^\{m\}\\cdot\(Z\_\{l\}^\{s\}\)\_\{l=0,\\ldots,L\}^\{T\}。然后,第mm个上下文注意力层的输出O^mO^\{m\}计算如下,其中n_t=argmax_{0≤l≤L} S_{t,l}^mn\_\{t\}=\\operatorname\*\{argmax\}\_\{0\\leq l\\leq L\}S\_\{t,l\}^\{m\}:

O_t^m=I_t^m+{Attn(q=I_t^m,k=Z_{n_t}^{emb},v=Z_{n_t}^{emb}),n_t>0,0,n_t=0.O\_\{t\}^\{m\}=I\_\{t\}^\{m\}\+\\begin\{cases\}Attn\(q=I\_\{t\}^\{m\},k=Z\_\{n\_\{t\}\}^\{emb\},v=Z\_\{n\_\{t\}\}^\{emb\}\),&\{n\_\{t\}\}\>0,\\\\ 0,&\{n\_\{t\}\}=0\.\\end\{cases\}	(4)

由于argmax的存在,每个token只使用最相关的上下文偏置列表条目,其优点是结果与不相关的条目无关。

方法B:对于这种方法,使用Z^sZ^\{s\}扩展解码器的词汇表。具体方法是扩展输出层(将最终解码器层的输出映射到词汇表)以及扩展嵌入层。

具体地,

α_Context=Linear_2(O)·Linear_3(Z^s)^T/d∈R^{t×L}。\\alpha\_\{Context\}=\\frac\{Linear\_\{2\}\(O\)\\cdot Linear\_\{3\}\(Z^\{s\}\)^\{T\}\}\{\\sqrt\{d\}\}\\in\\mathbb\{R\}^\{t\\times L\}。	(5)

被计算出来,并且公式3 (https://arxiv.org/html/2608.05759#S3.E3)中的α\\alpha被替换为

Concat(α,α_Context)∈R^{t×(n_vocab+L)}。Concat\(\\alpha,\\alpha\_\{Context\}\)\\in\\mathbb\{R\}^\{t\\times\(n\_\{vocab\}\+L\)\}。

此外,Y_0,...,Y_{t-1}Y\_\{0\},\\ldots,Y\_\{t\-1\}被替换为Y_0',...,Y_{t-1}'Y^\{\\prime\}\_\{0\},\\ldots,Y^\{\\prime\}\_\{t\-1\},其中Y_0',...,Y_{t-1}'Y^\{\\prime\}\_\{0\},\\ldots,Y^\{\\prime\}\_\{t\-1\}通过将Y_0,...,Y_{t-1}Y\_\{0\},\\ldots,Y\_\{t\-1\}中所有对应于上下文偏置列表条目Z_lZ\_\{l\}的子序列替换为动态token v_lv\_\{l\}来计算。最后,公式2 (https://arxiv.org/html/2608.05759#S3.E2)中的EE被替换为

E'=Emb(Y_0',...,Y_{t-1}'),E^\{\\prime\}=Emb\(Y^\{\\prime\}\_\{0\},\\ldots,Y^\{\\prime\}\_\{t\-1\}\),其中动态token v_lv\_\{l\}由Linear_4(Z_l^s)Linear\_\{4\}\(Z\_\{l\}^\{s\}\)嵌入,其余token使用EmbEmb嵌入。

### III-C 训练

在模型训练期间,每一步的上下文偏置列表ZZ从对应批次的标签中采样。

因此,对于每个token Y_tY\_\{t\},上下文偏置列表中该token的真实条目G_t∈{0,...,L}G\_\{t\}\\in\\\{0,\\ldots,L\\\}是已知的,其中G_t=0G\_\{t\}=0表示该token在上下文偏置列表中没有可用信息。对于模型A,损失lossloss由两个交叉熵部分组成。第一项对序列的下一个token Y_tY\_\{t\}进行分类,第二项引导网络关注相关的上下文偏置列表条目:

loss=\\displaystyle loss=1/T ∑_{t=1}^{T} CE(f_θ(Y_0,...,Y_{t-1};X;Z),Y_t)\\displaystyle\\ \\frac\{1\}\{T\}\\sum\_\{t=1\}^\{T\}CE\(f\_\{\\theta\}\(Y\_\{0\},\\ldots,Y\_\{t\-1\};X;Z\),Y\_\{t\}\) \+ λ/(MT) ∑_{m=1}^{M} ∑_{t=1}^{T} CE(S_t^m,G_t),\\displaystyle\+\\frac\{\\lambda\}\{MT\}\\sum\_\{m=1\}^\{M\}\\sum\_\{t=1\}^\{T\}CE\(S\_\{t\}^\{m\},G\_\{t\}\),其中f_θ(Y_0,...,Y_{t-1};X;Z)f\_\{\\theta\}\(Y\_\{0\},\\ldots,Y\_\{t\-1\};X;Z\)是网络输出,CECE是交叉熵损失函数,λ>0\\lambda\>0是超参数。

对于模型B,只有上述第一个lossloss项存在。

具体来说,我们使用批量大小为16,每个批次中每条话语平均采样三个上下文偏置列表条目。然后从其他批次采样的干扰项将上下文偏置列表填充到长度200。

## IV 实验

### IV-A 模型

我们将在第III节 (https://arxiv.org/html/2608.05759#S3)中解释的两种上下文偏置方法与三种语音LLM进行比较:Qwen3-ASR[23 (https://arxiv.org/html/2608.05759#bib.bib5)](1.7B,记为C)、Qwen3-Omni[32 (https://arxiv.org/html/2608.05759#bib.bib6)](30B,记为D)和VibeVoice-ASR[19 (https://arxiv.org/html/2608.05759#bib.bib9)](9B,记为E)。

我们使用Whisper[22 (https://arxiv.org/html/2608.05759#bib.bib4)](whisper-large-v2)作为两种上下文偏置方法的基线ASR模型。上下文偏置列表使用Whisper分词器/Whisper嵌入进行分词/嵌入,上下文使用mBART-50编码器[28 (https://arxiv.org/html/2608.05759#bib.bib10)]进行编码。我们在Common Voice[1 (https://arxiv.org/html/2608.05759#bib.bib11)]上训练了两种上下文偏置模型,只适配了mBART-50编码器和上下文注意力层(如果存在)的新增参数。

Qwen3-ASR在监督微调阶段使用“上下文偏置数据”进行训练。“[...] 模型学会利用系统提示中的上下文token作为背景知识,允许用户获得定制化的ASR结果”[23 (https://arxiv.org/html/2608.05759#bib.bib5)]。Qwen3-Omni被宣传为“一种单一多模态模型,首次在文本、图像、音频和视频上保持最先进的性能,且相对于单模态模型没有任何退化”[32 (https://arxiv.org/html/2608.05759#bib.bib6)]。使用VibeVoice-ASR时,用户可以“提供定制化上下文——从热词列表到背景描述——显著增强模型识别领域特定术语的能力”[19 (https://arxiv.org/html/2608.05759#bib.bib9)]。

在解码测试集时(见第IV-B节 (https://arxiv.org/html/2608.05759#S4.SS2)),上下文偏置列表/提示包含当前正在解码的话语所属于的罕见词。可选地,我们从测试集的其他罕见词中随机添加至多250个干扰项,和/或移除相关上下文。上下文偏置方法对于上下文偏置列表的顺序不敏感。但语音LLM并非如此。我们发现它们对上下文偏置列表中的词在提示中的放置顺序敏感。特别是,如果一个词位于提示的开头,语音LLM的表现更好。

相似文章

上下文归因如何处理模型已知的知识

arXiv cs.CL

本文介绍了一个评估协议,包含四个新指标和一个基准数据集,用于评估LLM的上下文归因方法,并表明当上下文与训练数据重叠时这些方法会失败。