COALA:通过对比正则化器和偏置分数估计实现的鲁棒上下文语音增强语言建模用于ASR
摘要
COALA是一个鲁棒的上下文偏置框架,用于自动语音识别(ASR),它利用对比正则化器和偏置分数估计来提升从大规模偏置列表中识别领域特定实体的准确性。在LibriSpeech上的实验表明其持续表现出色。
arXiv:2607.08117v1 公告类型:新
摘要:上下文偏置旨在将外部知识集成到自动语音识别(ASR)系统中,以准确识别领域特定的实体。在本文中,我们提出了COALA(利用偏置评分的上下文感知ASR),这是一个鲁棒的框架,旨在增强在复杂多实体场景下的语音增强语言模型(SLM)。考虑到SLM固有的上下文窗口限制,从大规模偏置列表中识别相关的目标实体对于有效识别至关重要。为此,COALA将SLM的潜在表示映射到一个专门的判别空间,以量化音频片段与候选实体之间的匹配强度。此外,我们解决了先前研究中处理多目标话语(即多个罕见词同时出现)时的训练崩溃问题。在LibriSpeech基准上的实验结果表明,COALA在各种偏置列表规模下始终实现了优越的上下文偏置性能。
查看缓存全文
缓存时间: 2026/07/10 06:12
# COALA: 基于对比正则化器和偏置评分估计的鲁棒上下文感知语音增强语言模型用于ASR
**来源:** https://arxiv.org/html/2607.08117
郭 言 洛 陈
###### 摘要
上下文偏置旨在将外部知识集成到自动语音识别(ASR)系统中,以准确识别领域特定的实体。在本文中,我们提出COALA¹¹¹本研究的源代码和实验设置可在https://github.com/Guo0911/COALA获取。(COntextualized ASR Leveraging biAsing scoring),一个稳健的框架,旨在增强复杂多实体场景下的语音增强语言模型(SLM)。考虑到SLM固有的上下文窗口限制,从大规模偏置列表中识别相关的目标实体对于有效识别至关重要。为此,COALA将SLM的潜在表示映射到一个专门的判别空间,以量化音频片段与候选实体之间的匹配强度。此外,我们解决了先前研究在处理多目标话语(即多个罕见词同时出现)时出现的训练崩溃问题。在LibriSpeech基准上的实验结果表明,COALA在不同规模的偏置列表下均能持续实现优越的上下文偏置性能。
###### 关键词:语音识别、上下文偏置、偏置评分、对比学习
## 1. 引言
受其单一架构和简化训练流程的驱动,端到端(E2E)自动语音识别(ASR)系统[graves2006connectionist, graves2012sequence, bahdanau2015neural, tang2023hybrid]在学术界和工业界都获得了广泛关注。最近,随着大型语言模型(LLM)在自然语言处理领域取得显著成功,ASR领域的研究开始转向利用LLM进行语音识别和音频推理任务。通过语音编码器和语言模型的协同作用,语音增强语言模型(SLM)成为ASR[chu2023qwen, tang2023salmonn, chu2024qwen2, lam2025prepending, hu2024wavllm]的一个有前景的范式。然而,SLM在处理不常见的、领域特定的实体(如联系人姓名、专有名词和其他命名实体)时仍然存在困难。因此,上下文偏置技术被广泛研究,以将外部知识集成到ASR系统中,引导ASR假设向准确识别目标实体方向倾斜,并对现代语音应用产生深远影响。
现有的上下文偏置文献大致可分为两个活跃的研究方向,即推理时偏置和训练时偏置,区分依据是外部知识集成的阶段。推理时偏置方法,如浅融合[mohri2002weighted, zhao2019shallow]和即时重打分[williams2018contextual, huang2025neuralmodelcontextualbiasing],通常从精心整理的知识数据集中构建n-gram有限状态转换器(FST),然后在解码阶段利用这些FST选择性地偏置搜索空间并动态提升目标实体的发射概率,通常由特定前缀(例如‘call’或‘play’)触发。另一方面,训练时偏置方法,如基于注意力的偏置适配器[sathyendra2022contextual, jayanthi2023retrieve]和基于trie树的指针生成器[sun2022minimising, sun2024graph],通过位置感知注意力或神经捷径进行训练,使声学特征与上下文信息对齐,从而有效地内化识别能力,以E2E方式优先考虑来自自定义偏置列表的目标实体。
参见图注
图1:LibriSpeech语料库中按目标实体数量划分的话语分布。
尽管推理时和训练时偏置技术取得了进展,但将这些方法无缝集成到不断发展的SLM架构中仍然是一个艰巨的挑战。随着偏置列表规模的扩大,由于固有的上下文窗口限制和过量干扰实体的干扰,SLM的性能往往会大幅下降。受最近在训练判别性评分器进行实体过滤方面的进展启发,我们提出了COALA(COntextualized ASR Leveraging biAsing scoring),一种专门为SLM量身定制的新型上下文偏置框架。COALA通过将SLM的潜在表示映射到一个专门的判别空间,来量化声学特征与目标实体之间的匹配强度。这种方法有效地利用了SLM的强大能力,同时独立于标准语言模型词汇分布。为了进一步增强我们框架的稳健性,我们引入了两个精炼的目标函数:多正例判别损失(MPD-Loss)和解耦逐点判别损失(DPD-Loss)。这些函数解决了判别损失的一个关键限制,即判别损失通常难以处理多目标训练数据(其中多个罕见词在同一话语中共现),或者需要辅助对数损失才能收敛。通过解决梯度冲突并在多实体数据上实现稳定训练,我们提出的损失函数有效地利用了所用数据集中存在的复杂数据的显著部分(如图1 (https://arxiv.org/html/2607.08117#S1.F1) 所示)。
## 2. 方法
参见图注
图2:(a) 提出的COALA框架用于偏置评分,包含冻结的主干网络以及可训练的LoRA模块和判别投影器。(b) 采样和评分过程,其中正例 \(E^+\) 和负例 \(E^-\) 实体被分配匹配强度分数 \(S\)。(c) 目标函数比较:判别损失表现出正例间竞争,而多正例判别损失(MPD-Loss)和解耦逐点判别损失(DPD-Loss)分别通过局部解耦和逐点解耦系统地解决了梯度冲突。
### 2.1 偏置评分
如图2 (https://arxiv.org/html/2607.08117#S2.F2) (a) 所示,我们将通过音频编码器块从输入音频中提取的声学特征定义为 \(X\),将对应的真实转录定义为 \(Y\)。对于每个话语,构建一个偏置列表 \(E = \{e_0, e_1, e_2, \dots, e_M\}\),包含 \(M+1\) 个实体。在此列表中,\(e_0\) 是一个特殊标记,表示为 `<>`,表示该话语中不存在任何实体。偏置列表 \(E\) 包含一组正例实体 \(E^+ \subseteq Y\) 和负例实体 \(E^- \nsubseteq Y\)。具体来说,如果列表中没有实体出现在真实转录 \(Y\) 中,则 `<>` 标记作为唯一的正例实体(\(E^+ = \{e_0\}\));否则,它被视为负例实体。每个候选实体 \(e_i\) 被表示为一个标记序列 \(e_i = \{e_{i1}, e_{i2}, \dots, e_{iL_i}\}\),其中 \(L_i\) 表示序列长度。为了确定匹配程度,实体嵌入与音频标记和指令嵌入一起被馈送到主干LM中。我们通过计算标记级匹配强度的长度归一化,来计算序列级判别分数 \(s_i\),确保不同长度实体之间的公平比较:
\[
s_i = \frac{1}{L_i} \sum_{j=1}^{L_i} f(h_{ij}) \in \mathbb{R},
\]
其中 \(h_{ij}\) 是从主干LM中提取的对应于实体 \(e_i\) 的第 \(j\) 个标记的最后一个隐藏状态。评分函数 \(f(\cdot)\) 实现为一个判别投影器,它是一个多层感知器(MLP),旨在将潜在表示映射到专门的判别空间:
\[
f(h_{ij}) = W_2 \cdot \text{ReLU}(W_1 \cdot h_{ij} + b_1) + b_2,
\]
其中 \(\text{ReLU}(\cdot)\) 是激活函数。\(W_1 \in \mathbb{R}^{D' \times D}\) 和 \(b_1 \in \mathbb{R}^{D'}\) 表示第一线性层的权重和偏置,而 \(W_2 \in \mathbb{R}^{1 \times D'}\) 和 \(b_2 \in \mathbb{R}\) 表示第二层的权重和偏置。这种基于MLP的评分机制允许模型量化声学特征与目标实体之间的匹配强度,独立于标准语言模型词汇分布。
### 2.2 优化目标函数
在先前的研究[huang2025neuralmodelcontextualbiasing]中,使用判别损失训练神经网络,以确保正例和负例实体的匹配强度清晰可区分。为了保持数值稳定性,应用softmax函数对分数 \(S = \{s_0, s_1, s_2, \dots, s_M\}\) 进行归一化。判别损失正式定义为:
\[
\mathcal{L}_{disc} = -\frac{1}{|E^+|} \sum_{i \in E^+} \log \frac{\exp(s_i)}{\sum_{j \in E} \exp(s_j)}.
\]
如图2 (https://arxiv.org/html/2607.08117#S2.F2) (c) 所示,尽管判别损失在单目标任务中有效地分离了实体,但其全局归一化在正例实体之间引入了无意的竞争。具体来说,当偏置列表包含多个正例实体时,增加一个正例实体的分数 \(s_i\) 会强制抑制 \(E^+\) 中其他实体的归一化值,导致梯度冲突和次优收敛。为了解决这个问题,我们提出了多正例判别损失(MPD-Loss),它将每个正例实体与负例实体集 \(E^-\) 独立进行对比:
\[
\mathcal{L}_{MPD} = -\frac{1}{|E^+|} \sum_{i \in E^+} \log \frac{\exp(s_i)}{\exp(s_i) + \sum_{j \in E^-} \exp(s_j)}.
\]
通过将softmax归一化局部化到单个正例实体和负例实体集,MPD-Loss消除了正例实体之间的互斥性,允许模型同时将多个正例实体拉向声学锚点 \(X\) 而不会相互干扰。然而,MPD-Loss虽然减轻了正例实体之间的竞争,但它仍然是一个相对排序目标,其中正例实体的优化与负例分布内在地耦合。在这种公式下,模型关注的是确保正例实体的分数足够高于负例实体,而不是校准其绝对幅度。为了进一步解耦这些交互并提供更稳健的判别信号,我们提出了解耦逐点判别损失(DPD-Loss),定义如下:
\[
\mathcal{L}_{DPD} = \mathcal{P}(E^+) + \mathcal{N}(E^-),
\]
其中 \(\mathcal{P}(\cdot)\) 和 \(\mathcal{N}(\cdot)\) 利用sigmoid函数 \(\sigma(\cdot)\) 来优化输入偏置列表的绝对匹配强度:
\[
\mathcal{P}(E) = -\frac{1}{|E|} \sum_{i \in E} \log (\sigma(s_i)),
\]
\[
\mathcal{N}(E) = -\frac{1}{|E|} \sum_{j \in E} \log (1 - \sigma(s_j)).
\]
如图2 (https://arxiv.org/html/2607.08117#S2.F2) (c) 所示,DPD-Loss将每个实体视为一个独立的二分类任务。通过采用这种逐点方法,DPD-Loss消除了基于softmax的目标中固有的正负梯度之间的残余梯度耦合。这种从相对排序到绝对判别的转变使模型能够学习更稳定、定义更清晰的决策边界。
## 3. 实验
### 3.1 数据集
我们在LibriSpeech语料库[librispeech2015]上评估我们提出的方法,遵循先前研究[le2021contextualized]建立的上下文偏置实验设置。在该设置中,5K个高频词被识别为常用词,而剩余的209.2K个低频词被归类为罕见词。对于每个话语,我们构建大小为 \(N = \{500, 1000, 5000\}\) 的偏置列表。每个列表包含话语中出现的所有罕见词作为正例实体,并补充随机采样的未出现在话语中的罕见词作为负例实体。模型在完整的960小时训练集上训练,并使用dev-clean作为验证集来选择最佳模型。
### 3.2 评估指标
为了评估ASR和偏置评分的性能,我们使用词错误率(WER)和召回率作为主要指标。具体来说,WER被分解为无偏WER(U-WER)和有偏WER(B-WER),分别表示常用词和偏置词的错误率。对于评分任务,我们报告两种召回率的变体:Recall@X和Recall#X。Recall@X表示实现每个话语 \(X\%\) 召回率所需的平均最高评分实体数量。相反,Recall#X表示在为每个话语选择前 \(X\) 个最高评分实体时实现的召回率。
### 3.3 基线方法
除了与判别损失进行比较外,我们还将我们的方法与两种代表性的基于提示的基线方法进行了比较:CTC-Filter[yang2024ctc]和知识提示(K-Prompt)[zhang2023knowledgepromptforwhisper]。前者利用粗略的CTC解码结果来过滤并将相关实体纳入SLM提示中。后者采用多遍策略,对初始ASR转录与知识库进行模糊匹配,以生成实体特定的提示用于第二遍解码。
### 3.4 实现细节
我们称为COALA的语音增强语言模型(SLM)框架集成了预训练的Whisper-large-v2编码器[whisper2023robust](640M参数)和HuggingFaceTB/SmolLM2-135M-Instruct²²²https://huggingface.co/HuggingFaceTB/SmolLM2-135M-Instruct作为主干LM,总共777M参数,以在轻量级设置下评估COALA。为了增强声学接地性,在音频适配器之后集成了一个专门的CTC模块。该模块生成帧级对齐,这些对齐被投影到主干LM嵌入空间中作为音频标记,作为指令调优解码器的前缀。内部实验表明,这种集成通过提供更精确的声学-语义对齐,显著提高了转录的鲁棒性。实验在24GB RTX 3090 GPU上进行。模型训练分两个阶段进行:
- **阶段1(ASR训练)**:我们从头开始联合训练音频适配器和CTC模块,同时通过LoRA对主干LM进行微调,训练10个周期,批次大小为4。为了防止过度依赖偏置信息,提示通过从10个实体的集合中采样最多5个正例实体来构建。优化采用CTC损失和交叉熵损失的组合,权重分别设置为0.3和1.0。
- **阶段2(评分训练)**:所有先前训练的参数被冻结。训练新初始化的判别投影器和主干LM内的额外LoRA模块,训练7个周期,批次大小为1。此阶段使用 \(M=120\) 个实体的候选列表。值得注意的是,虽然基线判别损失也使用此列表,但我们提出的方法旨在解决其局限性。相似文章
用于鲁棒代码切换语音识别的基于LLM生成的近失对比训练
提出了一种POI感知的对比训练框架,利用LLM生成的近失假设来增强ASR在代码切换区域的鲁棒性,在两个基准测试上实现了一致的错误率降低。
语音识别中的Convex低资源口音鲁棒语言检测
本文介绍了CLD,一种基于凸优化的轻量级语言检测头(用于ASR),在不到100个训练样本下实现97-98%的准确率,同时将计算成本降低13倍,解决了5种语言和24种子方言的口音和方言鲁棒性问题。
MoDiCoL:面向鲁棒语音识别的模块化诊断持续学习数据集
本文介绍了 MoDiCoL,一个用于鲁棒语音识别的模块化诊断持续学习数据集,能够对语言内容、说话人特征和声学环境进行受控分析,并提出了一个持续学习课程,以研究鲁棒性是如何获取、迁移和遗忘的。
LaSR:基于潜在推理的上下文感知语音识别
LaSR提出了一种针对上下文感知语音识别的潜在推理训练范式,围绕声学特征对齐思维链监督,以在无额外延迟的情况下提高术语识别能力,在Fun-Audio-Chat上优于标准微调。
自巩固语言模型:从上下文中持续整合知识
本文介绍了自巩固语言模型(SCoL),这是一种利用元强化学习将当前上下文写入模型权重以实现持续知识整合的框架。实验表明,在问答任务和长上下文巩固任务中,该方法在知识获取和保留方面均优于基线方法。