重新审视现代端到端语音识别中语言模型困惑度与ASR词错误率之间的关系
摘要
本文重新审视了在现代端到端ASR系统中语言模型困惑度与ASR词错误率之间的经典关系,发现虽然外部语言模型仍然能提升WER,但对数-对数线性关系仍然成立,但受到编码器-解码器模型中内部语言建模的影响。
arXiv:2607.05612v1 公告类型:新
摘要:语言模型(LM)困惑度(PPL)历史上一直被用作自动语音识别(ASR)词错误率(WER)的代理指标,以往研究报告称在对数-对数空间中两者大致呈线性关系。现代端到端ASR系统对这一假设提出了挑战,因为它们已经包含内部语言建模能力,通常在没有外部语言模型的情况下进行评估,并且现在可以通过不同的识别策略与神经语言模型和大语言模型(LLM)相结合。本文重新审视了现代ASR系统中PPL与WER之间的关系。我们研究外部LM是否仍然能改进当前端到端ASR系统、PPL-WER关系在对数-对数空间中是否保持线性、编码器上下文长度如何影响这一关系,以及LLM困惑度如何符合标准神经LM观察到的趋势。我们进一步研究了基于注意力机制的编码器-解码器系统中的内部语言建模(ILM),并表明ILM减法会改变观察到的PPL-WER关系,这表明在解释外部LM质量的影响时必须考虑解码器的内部LM。
查看缓存全文
缓存时间: 2026/07/08 04:41
# 重新审视语言模型困惑度与端到端现代语音识别词错误率之间的关系
来源:https://arxiv.org/html/2607.05612
Mohammad Zeineldeen12, Albert Zeyer12, Haoran Zhang2, Robin Schmitt12, Ralf Schlüter12, Hermann Ney12
###### 摘要
语言模型 \(LM\) 的困惑度 \(PPL\) 历来被用作自动语音识别 \(ASR\) 词错误率 \(WER\) 的代理指标,先前的研究报告了在对数-对数空间中近似线性的关系。现代端到端 ASR 系统对这一假设提出了挑战,因为它们已经包含了内部语言建模能力,通常在无外部语言模型的情况下进行评估,并且现在可以通过不同的识别策略与神经语言模型和大语言模型 \(LLMs\) 结合。本文重新审视了现代 ASR 系统中 PPL 与 WER 之间的关系。我们研究了外部语言模型是否仍然能改进当前的端到端 ASR 系统,PPL-WER 关系在对数-对数空间中是否保持线性,编码器上下文长度如何影响这一关系,以及 LLM 的困惑度如何符合标准神经 LM 观察到的趋势。我们进一步研究了基于注意力的编码器-解码器系统中的内部语言建模 \(ILM\),并表明 ILM 减法改变了所观察到的 PPL-WER 关系,这表明在解释外部 LM 质量的影响时必须考虑解码器的内部语言模型。
## I引言与相关工作
语言模型 \(LMs\) 长期以来一直是自动语音识别 \(ASR\) 的核心。困惑度 \(PPL\) 通常用作内在的 LM 指标,其起源可追溯到它被引入作为语音任务难度的度量\[12 (https://arxiv.org/html/2607.05612#bib.bib1)\]。然而,ASR 性能是通过词错误率 \(WER\) 来衡量的,它还取决于声学模型、解码策略、剪枝和标度调优。因此,较低的 LM 困惑度并不自动转化为较低的 WER。早期的研究,主要使用 n-gram LMs\[15 (https://arxiv.org/html/2607.05612#bib.bib21)\],报告了在多个 ASR 任务中困惑度与 WER 之间存在相关性的实验证据\[3 (https://arxiv.org/html/2607.05612#bib.bib3),14 (https://arxiv.org/html/2607.05612#bib.bib2),8 (https://arxiv.org/html/2607.05612#bib.bib20)\]。文献\[14 (https://arxiv.org/html/2607.05612#bib.bib2)\]的工作系统地研究了这个问题,发现 WER 和 PPL 在对数-对数空间中近似线性相关。后来在\[11 (https://arxiv.org/html/2607.05612#bib.bib14)\]中针对 Quaero 和 LibriSpeech dev-clean 上的混合 ASR 模型也观察到了相同的对数-对数线性关系,这些模型使用了 n-gram 和长短期记忆 \(LSTM\) LMs\[24 (https://arxiv.org/html/2607.05612#bib.bib22)\]。这一观察结果影响深远,因为它表明通过幂律关系,相对的 PPL 改进可以转化为预期的 WER 改进。
大规模 ASR 研究也支持更强的外部 LM。文献\[2 (https://arxiv.org/html/2607.05612#bib.bib4)\]的研究表明,增加 LM 规模并使用大规模文本语料库可以带来一致的 WER 降低。后续工作将 LM 集成扩展到神经 LM 和端到端 ASR。浅融合在束搜索期间将外部 LM 与 ASR 模型结合\[13 (https://arxiv.org/html/2607.05612#bib.bib8)\],而冷融合则在训练期间整合预训练的 LM\[23 (https://arxiv.org/html/2607.05612#bib.bib9)\]。文献\[25 (https://arxiv.org/html/2607.05612#bib.bib10)\]针对基于注意力的编码器-解码器 \(AED\) ASR 比较了几种集成策略,发现浅融合是一种在多种条件下强大的简单首次解码方法。神经 Transformer LMs\[26 (https://arxiv.org/html/2607.05612#bib.bib27)\]也已成功应用于混合和端到端 ASR,包括格栅重打分和浅融合\[10 (https://arxiv.org/html/2607.05612#bib.bib11)\]。
现代端到端 ASR 系统使得 PPL-WER 关系变得不那么直接。在连接时序分类 \(CTC\)\[5 (https://arxiv.org/html/2607.05612#bib.bib5)\]、循环神经网络传感器 \(RNN-T\)\[6 (https://arxiv.org/html/2607.05612#bib.bib6)\]和 AED\[1 (https://arxiv.org/html/2607.05612#bib.bib7)\]系统中,声学和语言建模组件不再像经典混合 ASR 中那样清晰分离。特别是 AED 和传感器解码器,从配对的语音-文本训练数据中学习内部语言模型。此外,\[28 (https://arxiv.org/html/2607.05612#bib.bib18)\]表明 CTC 编码器也学习了一个内部语言模型,这可能会影响外部 LM 在跨领域任务上的收益。这种内部 LM 可以在识别过程中与外部 LM 交互,并可能导致领域先验不匹配。因此,内部 LM 估计和减法被提出来改善外部 LM 的集成\[29 (https://arxiv.org/html/2607.05612#bib.bib12),30 (https://arxiv.org/html/2607.05612#bib.bib19),28 (https://arxiv.org/html/2607.05612#bib.bib18)\]。这些方法表明,外部 LM 的观察收益不仅取决于外部 LM 的 PPL,还取决于 ASR 系统内部语言模型的强度。
最近的 ASR 工作通常报告无外部 LM 的贪心识别或束搜索,因为对于强效的端到端模型,LM 的增益可能很小,而无 LM 识别更简单、更快。这使得不清楚外部神经 LM 是否仍然提供有意义的增益,以及 PPL 是否能预测这些增益。随着大语言模型 \(LLMs\) 的出现,这个问题变得更加重要,LLMs 可用于重打分、提示、纠正或单遍搜索集成,但也引发了推理成本和词汇不匹配等问题。最近的工作\[9 (https://arxiv.org/html/2607.05612#bib.bib13)\]通过应用延迟评分和重新分词的单遍识别中的 LLM 分数解决了其中一些问题,并显示了对 CTC 和基于注意力的基线的改进。然而,这类工作通常不分析 LLM 的 PPL 如何适应经典的 PPL-WER 关系。
这促使我们对现代 ASR 的 PPL-WER 关系进行系统性重新审视。在这项工作中,我们研究了以下问题:
- •外部神经 LM 是否仍然能改进现代端到端 ASR 相对于无 LM 基线?
- •LM 困惑度与 ASR WER 之间的关系在对数-对数空间中是否仍然近似线性?
- •对于 AED 系统,内部 LM 减法如何影响困惑度- WER 关系的强度和形状?
- •编码器上下文长度如何影响外部 LM 的绝对增益以及困惑度与 WER 之间的相关性?
- •LLM 的困惑度如何符合标准神经 LM 观察到的 PPL-WER 关系,并且当用作外部 LM 时,LLMs 是否遵循相同的趋势?
我们针对不同的 ASR 架构、编码器上下文设置、识别模式和 LM 家族来解决这些问题。
## II问题表述
### II-A困惑度与 WER
令a1Sa\_\{1\}^\{S\}表示标签输出序列,不包括特殊的句子开始 \(BOS\) 和句子结束 \(EOS\) 符号。对于自回归 LM,我们使用a0=⟨bos⟩a\_\{0\}=\\langle\\mathrm\{bos\}\\rangle和aS\+1=⟨eos⟩a\_\{S\+1\}=\\langle\\mathrm\{eos\}\\rangle来扩展序列。困惑度计算为
PPL=exp\(−1S\+1∑s=1S\+1logp\(as∣a0s−1\)\),\\mathrm\{PPL\}=\\exp\\left\(\-\\frac\{1\}\{S\+1\}\\sum\_\{s=1\}^\{S\+1\}\\log p\(a\_\{s\}\\mid a\_\{0\}^\{s\-1\}\)\\right\),其中最后的预测是 EOS 标签。标签asa\_\{s\}可以表示单词、单字符或子词标记\[22 (https://arxiv.org/html/2607.05612#bib.bib15),17 (https://arxiv.org/html/2607.05612#bib.bib16)\]。只有当评分标签单位、归一化(例如,区分大小写与不区分大小写)和评估文本固定时,PPL 值才可直接比较。在所有 LM 共享相同 10k SentencePiece \(SPM\) 词汇表\[17 (https://arxiv.org/html/2607.05612#bib.bib16)\]的实验中,我们报告子词级别的 PPL。当比较具有不同分词方法的 LM 时,例如具有不同词汇表的 LLMs,我们转而报告单词级别的 PPL,以使困惑度跨模型可比。
感兴趣的 ASR 指标是 WER。遵循先前的工作,我们在对数-对数空间中研究 LM 困惑度与 WER 之间的关系:
log\(WER\)=α⋅log\(PPL\)\+β。\\log\(\\mathrm\{WER\}\)=\\alpha\\cdot\\log\(\\mathrm\{PPL\}\)\+\\beta。\(1\)斜率α\\alpha衡量 WER 对 PPL 相对变化的敏感程度,而偏移β\\beta捕捉识别设置相关的偏移。例如,如果该关系局部成立,则将 PPL 降低因子rr会使 WER 改变约因子rαr^\{\\alpha\}。
### II-B回归协议
对于每个 ASR 条件,我们使用在同一识别设置下评估的 LM 变体拟合方程1 (https://arxiv.org/html/2607.05612#S2.E1)。当散点图显示斜率有明显变化时,我们还拟合一个具有固定分裂点的分段关系,并报告两个区域的斜率。
## IIIASR 与 LM 集成
### III-ACTC ASR
对于输入声学序列x1Tx\_\{1\}^\{T\}和输出标签序列a1Sa\_\{1\}^\{S\},CTC 通过对所有折叠到a1Sa\_\{1\}^\{S\}的帧级对齐y1Ty\_\{1\}^\{T\}求和来建模后验概率。与自回归 LM 和 AED 解码器不同,CTC 不使用 EOS 标签;其帧级标签集反而包括空白标签。
pCTC\(a1S∣x1T\)=∑y1T∈B−1\(a1S\)∏t=1Tp\(yt∣x1T\)。p\_\{\\mathrm\{CTC\}\}\(a\_\{1\}^\{S\}\\mid x\_\{1\}^\{T\}\)=\\sum\_\{y\_\{1\}^\{T\}\\in\\mathcal\{B\}^\{\-1\}\(a\_\{1\}^\{S\}\)\}\\prod\_\{t=1\}^\{T\}p\(y\_\{t\}\\mid x\_\{1\}^\{T\}\)。模型通过最小化−logpCTC\(a1S∣x1T\)\-\\log p\_\{\\mathrm\{CTC\}\}\(a\_\{1\}^\{S\}\\mid x\_\{1\}^\{T\}\)来训练。在识别中,我们通过最佳对齐分数来近似 CTC 对齐的和。无外部 LM 时,这给出
a^1S^=argmaxa1S\{maxy1T∈B−1\(a1S\)∑t=1Tlogp\(yt∣x1T\)\}。\\hat\{a\}\_\{1\}^\{\\hat\{S\}\}=\\arg\\max\_\{a\_\{1\}^\{S\}\}\\bigg\\\{\\max\_\{y\_\{1\}^\{T\}\\in\\mathcal\{B\}^\{\-1\}\(a\_\{1\}^\{S\}\)\}\\sum\_\{t=1\}^\{T\}\\log p\(y\_\{t\}\\mid x\_\{1\}^\{T\}\)\\bigg\\\}使用外部 LM 时,我们采用帧同步解码,使用帧级 CTC 标签和序列级 LM 分数的对数线性评分:
a^1S^=argmaxa1S\{\\displaystyle\\hat\{a\}\_\{1\}^\{\\hat\{S\}\}=\\arg\\max\_\{a\_\{1\}^\{S\}\}\\Bigg\\\{maxy1T∈B−1\(a1S\)∑t=1T\[logp\(yt∣x1T\)\\displaystyle\\max\_\{y\_\{1\}^\{T\}\\in\\mathcal\{B\}^\{\-1\}\(a\_\{1\}^\{S\}\)\}\\sum\_\{t=1\}^\{T\}\\Big\[\\log p\(y\_\{t\}\\mid x\_\{1\}^\{T\}\)−μlogpprior\(yt\)\]\+λlogpLM\(a1S\)\}\\displaystyle\\quad\-\\mu\\log p\_\{\\mathrm\{prior\}\}\(y\_\{t\}\)\\Big\]\+\\lambda\\log p\_\{\\mathrm\{LM\}\}\(a\_\{1\}^\{S\}\)\\Bigg\\\}其中λ\\lambda是 LM 标度,μ\\mu是帧级先验标度。仅当非空白标签被发射时才推进 LM 状态;空白标签不会获得 LM 分数。LM 历史使用 BOS 标记a0a\_\{0\}进行初始化。帧级 CTC 先验通过在训练数据上使用 softmax 平均方法计算的后验来估计:pprior\(y\)=1∑nTn∑n∑t=1Tnp\(yt=y∣xn,1Tn\),p\_\{\\mathrm\{prior\}\}\(y\)=\\frac\{1\}\{\\sum\_\{n\}T\_\{n\}\}\\sum\_\{n\}\\sum\_\{t=1\}^\{T\_\{n\}\}p\(y\_\{t\}=y\\mid x\_\{n,1\}^\{T\_\{n\}\}\),其中nn索引训练话语。
### III-BAED ASR
基于注意力的编码器-解码器 \(AED\) 模型直接将输出后验分解为
pAED\(a1S∣x1T\)=∏s=1S\+1p\(as∣a0s−1,x1T\),p\_\{\\mathrm\{AED\}\}\(a\_\{1\}^\{S\}\\mid x\_\{1\}^\{T\}\)=\\prod\_\{s=1\}^\{S\+1\}p\(a\_\{s\}\\mid a\_\{0\}^\{s\-1\},x\_\{1\}^\{T\}\),其中a0=⟨bos⟩a\_\{0\}=\\langle\\mathrm\{bos\}\\rangle且aS\+1=⟨eos⟩a\_\{S\+1\}=\\langle\\mathrm\{eos\}\\rangle。编码器将声学序列映射到隐藏表示,自回归解码器在给定先前标记和编码器上下文的情况下预测每个输出标记。模型通过最小化参考序列的负对数似然(包括 EOS 标签)来训练。
使用外部 LM 时,AED 识别使用对数线性评分
a^1S^=argmaxa1S\[\\displaystyle\\hat\{a\}\_\{1\}^\{\\hat\{S\}\}=\\arg\\max\_\{a\_\{1\}^\{S\}\}\\big\[logpAED\(a1S∣x1T\)\+λlogpLM\(a1S\)\\displaystyle\\log p\_\{\\mathrm\{AED\}\}\(a\_\{1\}^\{S\}\\mid x\_\{1\}^\{T\}\)\+\\lambda\\log p\_\{\\mathrm\{LM\}\}\(a\_\{1\}^\{S\}\)−γlogpILM\(a1S\)\],\\displaystyle\-\\gamma\\log p\_\{\\mathrm\{ILM\}\}\(a\_\{1\}^\{S\}\)\\big\],其中pILMp\_\{\\mathrm\{ILM\}\}表示 AED 解码器内部语言模型的估计,γ\\gamma是 ILM 减法标度。在 ILM 实验中,我们比较γ=0\\gamma=0的解码与使用 Mini-LSTM ILM 估计\[29 (https://arxiv.org/html/2607.05612#bib.bib12)\]调优 ILM 减法的解码。这里,序列级 LM 概率使用相同的 BOS 和 EOS 约定进行分解:pLM\(a1S\)=∏s=1S\+1pLM\(as∣a0s−1\)p\_\{\\mathrm\{LM\}\}\(a\_\{1\}^\{S\}\)=\\prod\_\{s=1\}^\{S\+1\}p\_\{\\mathrm\{LM\}\}\(a\_\{s\}\\mid a\_\{0\}^\{s\-1\}\)。
## IV实验设置
### IV-A语料库
我们评估了两个 ASR 任务,它们在说话风格、领域覆盖率和外部 LM 文本数量上有所不同。
LibriSpeech。对于阅读英语语音,我们使用 LibriSpeech 960 小时语料库\[19 (https://arxiv.org/html/2607.05612#bib.bib23)\],并在标准 dev/test clean/other 集上报告结果,主要集中在 dev-other 和 test-other。LibriSpeech LM 语料库包含大约 8 亿个运行词,比声学转录中的 1000 万个词多出大约 80 倍。
AppTek 西班牙语。对于自发性西班牙语语音,我们使用内部 AppTek 混合带宽任务,包含 8 kHz 和 16 kHz 数据。它包含约 12k 小时的语音、1.2 亿个转录词和 7 亿个外部 LM 训练词。我们报告了多个内部测试集的平均 WER,涵盖开放领域语音和对话呼叫中心领域。识别标度在匹配的开发集上调优。文本转换为小写并去除标点符号。
LibriSpeech 的外部文本/转录文本比率远大于 AppTek 西班牙语,约为 80 比 6。这对于解释 PPL-WER 斜率很重要,因为它影响外部 LM 在 ASR 训练转录之外提供多少额外信息。
### IV-BASR 系统
我们的 LibriSpeech CTC ASR 模型使用 16 层 Conformer 编码器\[7 (https://arxiv.org/html/2607.05612#bib.bib24)\],维度 1024,并在第 4、10 和 16 层之上使用 CTC 辅助损失(4.06 亿参数)。对于 AED 模型,我们使用 12 层 Conformer 编码器,带有 LSTM 解码器,维度 1024(1.3 亿参数)。对于 AppTek 西班牙语,CTC ASR 模型使用 20 层 Conformer 编码器,维度 896(4.38 亿参数)。所有模型均在 LibriSpeech 上训练 100 个 epoch,在 AppTek 西班牙语上训练 8 个 epoch,使用 AdamW 优化器\[18 (https://arxiv.org/html/2607.05612#bib.bib25)\]。对于 LibriSpeech 和 AppTek 西班牙语,ASR 系统使用 10k SPM 子词标签单元,并应用在线速度扰动\[16 (https://arxiv.org/html/2607.05612#bib.bib26)\]和 SpecAugment\[20 (https://arxiv.org/html/2607.05612#bib.bib17)\]。
### IV-C语言模型
我们改变 LM 架构和大小以获得广泛的 PPL 范围。除非另有说明,LM 使用与相应 ASR 系统相同的 10k SPM 词汇表和文本归一化。
对于 LibriSpeech,我们在 LibriSpeech LM 语料库上训练 Transformer LMs\[26 (https://arxiv.org/html/2607.05612#bib.bib27)\],层数从 2 到 96,维度从 128 到 1280。最强的识别 LM 有 32 层,维度 1024,约 4.22 亿参数。
对于 AppTek 西班牙语,我们训练 Transformer、LSTM 和 n-gram SPM LMs。LSTM 变体使用 2 或 4 层和维度相似文章
大型语言模型能否可靠地纠正低资源ASR中的错误?一项关于西弗里斯兰语的污染感知案例研究
本文研究了基于LLM的生成式错误修正(GER)在低资源西弗里斯兰语ASR中的应用,采用污染感知评估方法,使用私有数据集表明GPT-5.1将错误降低至低于oracle水平。
生成式 vs. 编码器大语言模型用于ASR评估:一项比较研究
这项比较研究评估了基于编码器和解码器的大语言模型在自动语音识别(ASR)评估中的应用,发现编码器指标如BERTScore和SemDist具有很强的竞争力,而生成式模型增强了假设比较和可解释性。
论词汇性在大语言模型中的持续影响
本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。
大型语言模型中的类人回指消解
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。
超越WER:带口音对话式ASR中的实体和不流畅性召回率
本文提出一个用于带口音对话式ASR的三阶段流水线,以提高实体和不流畅性的召回率,实现80-85%的实体召回率,并且用更少的参数优于基线系统。