StreamHear: 用于半监督流式语音识别的域自适应伪标签技术

arXiv cs.CL 论文

摘要

StreamHear是一个半监督流水线,它通过在有标签数据上微调教师模型、为无标签数据生成伪标签、并在混合数据上微调学生模型,来适应域偏移音频的流式语音识别,并引入一个重新对齐步骤以改善词定位。

arXiv:2608.13717v1 公告类型:新 摘要:流式自动语音识别(ASR)在域偏移目标音频上表现不佳,其中有标签的域内数据准备成本高昂,而无标签音频则十分丰富。我们提出StreamHear,一个半监督流水线,它适应一个预训练的流式学生模型,通过在有标签训练集上微调一个离线转录器教师模型,在无标签部分生成伪标签,并在混合数据上微调学生模型。我们进一步引入一个先验正则化的动态规划重新对齐步骤,该步骤使用ASR假设锚点来固定块级词定位。在涵盖金融通话、准备好的朗读语音和电话质量对话的四个数据集上,StreamHear始终优于有监督的学生微调,并缩小了与离线教师模型的差距。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:44

# StreamHear:面向流式语音识别的领域自适应伪标签方法
来源:https://arxiv.org/html/2608.13717

###### 摘要

流式自动语音识别(ASR)在面对领域偏移的目标音频时性能会下降,其主要原因是标注的领域内数据准备成本高昂,而无标签音频却十分丰富。我们提出StreamHear,这是一种半监督流程,通过在标注训练集上微调一个离线转录器教师模型来适应预训练的流式学生模型,然后在无标签部分生成伪标签,最后在混合数据上微调学生模型。我们进一步引入了一个带有先验正则化的动态规划重对齐步骤,该步骤利用ASR假设锚点来修正基于块级别的词语位置。在涵盖金融电话、朗读语音和电话质量对话的四个数据集上,StreamHear持续优于有监督的学生微调方法,并缩小了与离线教师模型的性能差距。

###### 关键词:

自动语音识别,半监督学习,伪标签,领域适应,缓存感知流式处理。

††地址:美国第一资本金融公司 (Capital One)
[email protected]

## 1 引言

预训练的流式自动语音识别(ASR)模型,例如基于缓存感知的FastConformer-RNN-T [17],能够为实时应用提供低延迟的转录服务。然而,在面对领域偏移的目标音频,如财报电话会议、国际英语和电话质量的客户服务对话时,其性能仍然欠佳,难以处理实体密集的词汇表、带口音的发音以及窄带声学环境。领域内微调是自然的解决方案,但在块粒度上准备标注的领域内音频成本很高,而无标签的领域内音频却大量存在。

半监督伪标签方法填补了这一空白,并在ASR领域得到了广泛研究,从基础的迭代自训练 [9, 24, 14],到教师-学生动量方法 [6]、使用检查点平均教师模型的动态伪标签缓存 [22],以及基于音频感知大语言模型(LLMs)的校正器 [19, 16]。尽管设计各异,这些方法共享一个共同主线:迭代优化、指数移动平均(EMA)教师模型,或辅助神经网络机制以提升伪标签质量。然而,对于缓存感知的流式ASR,一种更简单的、使用固定的、领域适应后的离线教师模型的方案尚未被报道。

在本文中,我们提出StreamHear,一种用于将缓存感知流式ASR适配到目标领域的半监督流程,其贡献有三。第一,StreamHear流程在标注的领域内训练集上微调离线转录器教师模型,在无标签部分生成伪标签,然后在混合数据上微调流式学生模型,整个过程只需单次执行,无需迭代或辅助机制。第二,我们引入了一个带有先验正则化的动态规划重对齐步骤,该步骤利用ASR假设锚点,重新分配训练数据中跨越块边界的词语,以修正连接时序分类(CTC)分段 [13] 遗留的残余位置错误。第三,我们在四个数据集上的实证研究表明,StreamHear持续优于有监督的学生微调方法,并缩小了与离线教师模型的差距,消融实验证实了其在延迟和上下文配置下的鲁棒性。

## 2 相关工作

ASR的伪标签技术起源于早期的自训练工作 [9, 3],并通过IPL [24] 和slimIPL [14] 被形式化为迭代流程。后续方法通过持续跟踪学生的EMA教师模型(MPL [6])、使用检查点平均教师模型的动态伪标签缓存 [22]、基于置信度和不确定性的过滤 [8, 10, 11]、带数据过滤的增量重训练 [2],以及基于源音频条件的音频感知LLM校正器 [19, 16] 来提升标签质量。与本文最相关的先前工作是将伪标签应用于流式学生:使用大型离线教师和小型流式学生的迭代带噪学生训练 [7],以及从Whisper知识蒸馏到从头训练的流式Transformer-转录器 [23]。两者都未针对缓存感知流式架构 [17],这种架构在块之间传递激活缓存并消除了训练-推理的差距。在这些方法中,教师模型要么在训练过程中更新,要么辅以神经网络机制,而流式场景则通过迭代带噪学生训练或从头蒸馏来服务。与这些范式不同,StreamHear使用固定的、领域适应后的离线转录器作为其教师模型,将其单轮生成的伪标签与标注训练集混合,对学生模型进行单次微调,从而无需迭代或辅助机制即可适配预训练的缓存感知流式转录器。

## 3 方法

我们提出的StreamHear框架包含三个顺序学习阶段,并预先进行一个块级别的数据准备步骤。我们将离线教师ASR模型记为 $M_T$,缓存感知流式学生ASR模型记为 $M_S$。给定一个标注的领域内训练集 $D_L=\{(x_l,y_l)\}$ 和一个无标签的领域内集 $D_U=\{x_u\}$,该流程按顺序执行教师微调、伪标签生成和学生微调,总结于算法1中。与迭代式伪标签框架不同,StreamHear每个阶段仅执行一次,并产生一个可部署的流式检查点。

**算法1:StreamHear:面向流式ASR的伪标签**
1:**模型**:离线教师 $M_T$,流式学生 $M_S$
2:**数据**:标注集 $D_L=\{(x_l,y_l)\}$,无标签集 $D_U=\{x_u\}$
3:// 教师微调
4:在 $D_L$ 上微调 $M_T$
5:// 伪标签生成
6:$D_U' \leftarrow \{(x_u, M_T(x_u)) \mid x_u \in D_U\}$
7:// 可选置信度过滤
8:保留按教师对数似然排名的 $D_U'$ 中前 $K$%
9:// 学生微调
10:在 $D_L \cup D_U'$ 上微调 $M_S$
11:**返回** $M_S$

**教师微调**。离线教师 $M_T$,一个全上下文转录器,在标注训练集 $D_L$ 上使用标准转录器损失进行微调。此阶段使教师模型适应目标音频分布,从而提高其随后生成的伪标签质量。

**伪标签生成**。微调后的教师模型使用贪心解码对无标签部分 $D_U$ 进行一次转录,生成伪标签块 $D_U'=\{(x_u,y_u')\}$,其中 $y_u'=M_T(x_u)$。可选地,可以根据序列平均的教师对数似然对伪标签进行过滤,保留排名前 $K$% 的样本。

**学生微调**。缓存感知流式学生 $M_S$ 在混合数据清单 $D_L \cup D_U'$ 上使用标准 RNN-T 损失进行微调。

**块级别数据准备**。缓存感知流式训练要求每个块仅包含在其时间区间内说出的词。我们使用语音活动检测(VAD)对完整长度的录音进行分段,并通过在自监督声学模型上应用 CTC 分段 [13] 来计算词级时间戳。这种基线方法在非语音标签和VAD边界附近会留下残余的位置漂移。为了修复这些错误,我们引入了一个带有先验正则化的动态规划(DP)重对齐步骤,总结于算法2中。我们将真实转录和每块ASR假设展平为两个词流,每个词标记其所属的块索引。然后,我们运行 Needleman-Wunsch 对齐,该对齐通过词匹配奖励、跳过成本,以及对配对词之间块索引位移的先验惩罚进行评分。匹配的真实词继承其假设伙伴的块;未匹配的词保留其CTC分段的块,并通过两轮扫描将它们约束为单调顺序。

**算法2:动态规划重对齐**
1:**输入**:每块真实文本和ASR假设,匹配奖励 $r$,不匹配成本 $c_m$,跳过成本 $c_g, c_h$,先验权重 $\lambda$
2:**输出**:更新的词-块分配
3:将真实词连接为 $(w_1,\dots,w_N)$,假设词连接为 $(h_1,\dots,h_M)$,并标记每个词的所属块索引 $c_i^{gt}$,$c_j^{hyp}$
4:初始化 $dp[0,0]=0$,对于 $i=1..N$,$dp[i,0]= -i \cdot c_g$;对于 $j=1..M$,$dp[0,j]= -j \cdot c_h$
5:对于 $i=1..N$ 和 $j=1..M$,将 $dp[i,j]$ 设置为以下路径中的最优值:对角线 $dp[i-1,j-1] + s_{ij} - \lambda |c_j^{hyp} - c_i^{gt}|$(若 $w_i \approx h_j$,则 $s_{ij}=r$,否则 $s_{ij}=-c_m$);垂直 $dp[i-1,j] - c_g$;水平 $dp[i,j-1] - c_h$
6:从 $(N,M)$ 回溯:匹配的 $w_i$ 继承 $c_j^{hyp}$;未匹配的 $w_i$ 保留 $c_i^{gt}$
7:两轮扫描将未匹配的词约束为单调块顺序

## 4 实验

本节描述数据集及其块级别准备、训练和推理设置、与预训练和微调基线的主要词错误率(WER)比较,以及五个消融实验,探究对齐校正、伪标签池规模、上下文敏感性、按延迟重训练和流式学生架构。

### 4.1 数据集

我们在三个公开英语语料库和一个专有的呼叫中心数据集上进行评估。
*   **Earnings-21** [4] 包含来自九个金融部门的44个季度财报电话会议,具有实体密集的转录。
*   **Earnings-22** [5] 包含125个英语财报电话会议,源自全球七大英语地区的公司;四个主要为非英语音频的文件在准备时被排除,剩余121个有效文件。
*   **SPGISpeech** [18] 是一个大规模的专业转录的金融电话会议音频语料库(包含叙述性演讲和自发性问答);我们使用其公开发布的小型子集,并按 [16] 的比例(10%标注训练集,30%无标签集,10%验证集,10%测试集)在会话级别进一步降采样。
*   **BankCall** 是一个专有的、由人工标注的155个立体声银行客户服务电话集(通道1为客户,通道2为客服代表);无标签池是从同一领域单独收集的原始音频中抽取的275个额外电话,占30%的子样本。

表1列出了每个划分的小时总数。

**表1:实验中所用数据集的详细统计,报告了每个划分分割的总时长(小时)和平均话语长度(秒)。**

**表2:所有数据集上的词错误率(WER,%)比较。我们报告了在标注测试集和无标签集上,5个随机种子的均值和标准差(下标)。BankCall仅报告标注测试集(无标签池无转录)。粗体表示每列的最佳流式学生结果。**

对于长形式的 Earnings-21 和 Earnings-22,我们将原始录音标准化为 16 kHz,将非语音标注统一为标签,并通过 pyannote-3.0 [1] 的 VAD 分段、使用 Parakeet-CTC-0.6B [21] 的 CTC 分段强制对齐以及算法2(以 Whisper-Large-v3 [20] 为假设锚点)的 DP 重对齐步骤生成块级别训练数据。VAD 确保每个块都在 Whisper 的 30 秒上下文窗口内,以便锚点能完整覆盖它。更长的音频可以使用音频 LLM(如 Voxtral-Mini-3B [15])进行锚定,该模型可以在更长的上下文中对多个窗口的输入进行批量处理。SPGISpeech 的话语已从源 parquet 文件中预先分块,因此准备工作简化为按 ReHear [16] 比例进行会话级别划分。对于 BankCall,人工标注已提供包含说话人通道和时间戳的块级别片段,因此标注部分无需进行 VAD 或强制对齐;数字掩码删除由三个现成 ASR 模型(Whisper-Large-v3、Voxtral-Mini-3B、Parakeet-TDT-0.6B-v3)的严格多数投票填充,并经过人工审核;标注划分按呼叫原因分层。BankCall 的无标签部分仅通过 VAD 进行分割。在所有数据集中,具有空转录的块被丢弃,并在源文件或会话级别强制执行划分。

### 4.2 实验设置

**模型**。离线教师是 Parakeet-TDT-0.6B-v3 [21],一个具有 token-and-duration 解码的 0.6B 参数 FastConformer 转录器。主要流式学生是 Nemotron-Speech-Streaming-EN-0.6B [17],一个 0.6B 的缓存感知 FastConformer-RNN-T,使用多延迟右上下文(RC)采样进行训练;除非另有说明,我们在推理时设置 RC=1(80ms 块加上 80ms 右上下文前瞻,算法延迟为 160ms)。学生选择消融实验还评估了 Nemotron-3.5-ASR-Streaming-0.6B,这是一个具有 LC=56 和英语语言 ID 条件的多语言变体。

**训练**。所有微调运行共享相同的配置:AdamW 优化器,学习率 $2 \times 10^{-4}$,betas [0.9, 0.98],权重衰减 $10^{-3}$;余弦学习率调度,预热占比 10%,最小学习率 $10^{-6}$;训练 10 个 epoch;bf16 精度;SpecAugment(2个频率掩码 × 10个时间掩码)。流式学生的有效批大小为 64(4 个 A100-SXM-40GB GPU,每 GPU 批大小为 4,梯度累积为 4);教师微调在处理 Earnings 长度块时使用每 GPU 批大小为 2,梯度累积为 8,以适应 RNN-T 联合网络;Nemotron-3.5 将每 GPU 批大小降至 1,梯度累积...

相似文章

StreamAlign: 流式文本对齐语音分词

arXiv cs.CL

StreamAlign 是一个流式文本对齐语音分词框架,能够实现语音-文本联合建模的实时处理,降低延迟,并在语音识别和口语建模任务上达到最先进的性能。

LaSR:基于潜在推理的上下文感知语音识别

arXiv cs.CL

LaSR提出了一种针对上下文感知语音识别的潜在推理训练范式,围绕声学特征对齐思维链监督,以在无额外延迟的情况下提高术语识别能力,在Fun-Audio-Chat上优于标准微调。