用语义锚定语音:面向低资源语言自动语音识别的多模态适配器机制

arXiv cs.CL 论文

摘要

本文提出SAMA-ASR——一种多模态适配器,通过利用翻译提供的语义锚点和语音的声学锚点,改进低资源语言的自动语音识别。在台湾闽南语和客家话上的实验证明其性能优于基线方法。

arXiv:2608.29239v1 公告类型:新 摘要:低资源语音识别仍然面临挑战,因为稀缺的转录文本为目标端生成提供的监督证据有限。为解决这一问题,我们提出SAMA-ASR——一种轻量级适配器机制,通过辅助翻译提供的语义锚点和语音的声学锚点增强解码器;原则上,该机制可应用于类似的编码器-解码器多任务语音模型。通过跨模态适配,SAMA-ASR基于翻译导出的语义嵌入和语音嵌入来调节解码器状态,在标记预测前结合句级语义与语音依据的证据。在评估阶段,这些语义锚点可由上游的语音到文本翻译器自动生成,而无需提供作为基准的完整翻译。在两个各30小时的数据集上的实验涵盖了低资源汉语变体——台湾闽南语和客家话,结果表明SAMA-ASR在声学基线、先前基于提示的基线和仅基于语义的翻译引导基线基础上均有改进,并且在实际自动语义锚点设置中仍然有效;翻译器容量分析显示,紧凑型语音到文本模型能够生成有用的语义锚点。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:19

# 以语义锚定语音:一种用于低资源语言自动语音识别的多模态适配器机制  
来源:https://ar.org/html/2608.29239  
程亦杨  
隶属机构:台湾师范大学,台湾  
王健钧  
隶属机构:台湾师范大学,台湾  
李泓欣  
隶属机构:台湾师范大学,台湾  
王信闵  
隶属机构:中央研究院,台湾  
陈柏林  
隶属机构:台湾师范大学,台湾  
\*同等贡献 通讯作者  

###### 摘要  
低资源语音识别之所以仍然困难,是因为稀缺的转录文本为目标端生成提供的监督证据有限。为填补这一差距,我们提出了 SAMA-ASR,这是一种轻量级的适配器机制,通过来自辅助翻译的语义锚点和来自语音的声学锚点来增强解码器;原则上,该机制可应用于类似的编码器-解码器多任务语音模型。通过跨模态适配,SAMA-ASR 在标记预测之前,将解码器状态条件化于由翻译导出的语义嵌入和一个语音嵌入,从而将语句级含义与基于语音的证据相结合。在评估时,这些语义锚点可由上游语音到文本翻译器自动生成,而无需作为预言机翻译提供。在涵盖低资源汉语变体台湾闽南语和客家话的两个 30 小时数据集上的实验表明,SAMA-ASR 相较于基于声学的、先前基于提示的以及仅基于语义的翻译引导基线有所改进,并且在实际自动语义锚点设置中仍然有效;翻译器容量分析表明,紧凑的语音翻译模型可以产生有用的语义锚点。

## 1 引言  
自动语音识别旨在将声学语音信号转录为准确的文本序列。尽管现代编码器-解码器架构已显著推动了 ASR 的发展(Watanabe et al., 2017),但对许多低资源语言和方言的稳健识别仍然是一个主要差距,因为标注语音数据稀缺(Cheng et al., 2025; Yang et al., 2025; Li and Niehues, 2026)。在编码器端,多语言语音预训练可以通过转移共享的音系表示来部分缓解声学数据的稀缺性(Conneau et al., 2021; Bapna et al., 2022)。然而,当只有少量目标语言转录文本可用时,解码器在目标变体的词汇选择、书写规范、常见结构和意义兼容的续接方面获得的监督证据有限。为了解决这个问题,我们提出了面向 ASR 的语义感知多模态适配器(SAMA-ASR),这是一种轻量级的解码器端模块,利用两个互补信号来调节 ASR 解码:来自辅助翻译编码的语义锚点和来自语音信号的声学锚点。具体来说,SAMA-ASR 允许解码器隐藏状态在每个模块同时查询由翻译导出的语义嵌入和一个语音嵌入,因此局部的标记决策使用语句级含义,同时仍与声学证据保持关联。这条显式的声学路径起到基础约束的作用:当语义锚点存在噪声或不完整时,它能抑制语义上合理但缺乏声学支持的续接。

使用翻译作为语义锚点是实用的,因为这种主导或标准语言文本出现在各种低资源语音场景中,通常是在目标变体转录文本不可用时(Xiao et al., 2023; Plüss et al., 2023; Zanon Boito et al., 2022)。从实现角度来看,SAMA-ASR 保持预训练的主干模型冻结,并且作为一种适配器,原则上可以附加到其他端到端编码器-解码器 ASR 架构上。这种语义锚定设计对于自回归解码也很有用:语义锚点在生成前提供,在部分假设变得可靠之前提供全局意义上下文,并减少了对错误累积的暴露(Bengio et al., 2015; Arora et al., 2022)。

为了在没有预言机翻译的情况下进行实际推理,我们引入了一个上游语音到文本翻译模型来自动生成语义锚点。实验表明,一个紧凑的 Whisper Small ST 模型已经能带来明显的增益;与 SAMA-ASR 使用的冻结的 Whisper Medium ASR 主干(7.69 亿参数)相比,这个 2.44 亿参数的语义锚点生成器使新增的模型成本保持在适度水平。最接近此设置的是,先前的翻译引导 ASR 使用普通话辅助翻译改进了台湾闽南语 ASR,但其假设提供了预言机翻译,并且缺乏显式的声学锚点路径(Yang et al., 2026)。

总之,本研究的主要贡献有四点:  
- • **低资源 ASR 的语义锚定公式化**:我们将极度低资源的编码器-解码器 ASR 重新定义为目标端生成问题,并确定配对的语音-翻译数据作为提高解码器决策的实用监督源,尤其是在目标语言转录文本稀缺时。  
- • **轻量级多模态适配器架构**:我们介绍了 SAMA-ASR,这是一种解码器端适配器,允许自回归状态同时关注由翻译导出的语义锚点和一个显式的声学锚点,在保持基于语音的转录和冻结预训练主干模型的同时,改进了语义条件化。  
- • **现实的非预言机推理流程**:我们研究了利用上游 ST 模型自动生成语义锚点,表明 SAMA-ASR 在测试时不需要预言机翻译,并且紧凑的翻译器可以以适度的额外成本提供有用的锚点。  
- • **跨数据集验证和辅助语言分析**:我们在两个低资源汉语目标变体(台湾闽南语和客家话)上验证了 SAMA-ASR,并提供了跨数据规模、翻译器容量、辅助语言和多语言锚点组成的分析,以阐明语义锚定在何时有帮助。

## 2 相关工作  
### 2.1 低资源 ASR  
数据稀缺仍然是资源匮乏 ASR 的主要瓶颈,包括方言环境(Besacier et al., 2014; Cheng et al., 2025; Yang et al., 2025)。标准的缓解策略包括声学增强(例如,速度扰动和 SpecAugment(Ko et al., 2015; Park et al., 2019))以及从松散对齐的媒体或有声读物源构建资源(Chen et al., 2020; Yeroyan and Karpov, 2024)。这种资源构建流程降低了标注成本,但字幕或长文本对齐可能引入标签和分割噪声。另一个互补方向是围绕特定目标语言的语言特性或资源设计 ASR 算法,例如声调感知建模、字符集适配或特定于语言的迁移策略(Coto-Solano, 2022; Getman et al., 2024; Peng et al., 2026)。这些特定语言的研究表明,目标语言专业知识可能很有价值,但它们的假设可能无法原封不动地转移到具有不同音系、文字、书写规范或相关语言资源的语言上。相比之下,SAMA-ASR 不依赖于手工的语言特征或单一的目标语言:我们的实验表明,在台湾闽南语和客家话上均有一致的增益,并且我们的辅助语言分析进一步表明,当锚点质量和组成有利时,语义锚点在不同的翻译语言中可能仍然有用。

#### 联合 ASR-ST 和参数高效适配。  
联合 ASR-ST 模型通过联合优化的解码器和跨任务信息交换,利用识别与翻译之间的互补性(Le et al., 2020)。另外,Meta-Adapter 和 LoRA-Whisper 通过参数高效适配改进了低资源或多语言 ASR(Hou et al., 2021; Song et al., 2024)。SAMA-ASR 与这些方向互补:它不是联合优化 ASR 和 ST 目标,而是保持主干模型冻结,并将由翻译导出的语义证据和由语音导出的声学证据注入解码器,同时它与 LoRA 的结合表明,语义-声学锚定可以进一步补充参数高效适配。

![图注:图 1:SAMA-ASR 框架概览。雪花标记冻结模块,火焰标记可训练模块。自动翻译由 ST 生成,由 mBERT 编码,并通过门控交叉注意力与冻结的 Whisper 语音嵌入融合。MT 仅在可选的多语言诊断设置中使用。](#)

### 2.2 文本引导 ASR  
上下文偏置通过在识别过程中注入目标语言先验或短语级约束来增强 ASR 解码器(Zhao et al., 2019; Le et al., 2021; Sun et al., 2023)。这些上下文偏置方法在已知领域时有效,但它们通常需要预定义的短语列表、目标语言文本或特定于任务的偏置词典,使其不太适合开放领域的低资源 ASR。基于 LLM 的 ASR 进一步带来了推理和指令遵循能力(Chen et al., 2024; Hsu et al., 2025),但需要十亿参数级的解码或融合成本。与我们工作最接近的是,TG-ASR 使用翻译嵌入用于台湾闽南语 ASR(Yang et al., 2026),但它假设在推理时翻译是可用的。相反,SAMA-ASR 针对的是更通用的设置:该方法在测试时不需要预定义的领域、短语列表或预言机翻译,因为语义锚点可以由百万参数级的 ST 模型自动生成。SAMA-ASR 然后将这些锚点用作语句级的语义指导,同时添加显式的声学基础路径,因此解码器决策仍然与语音信号挂钩,而不是仅依赖翻译指导。

#### 蒸馏 vs. 锚定。  
文本引导的语音蒸馏在训练期间将预训练文本或语言模型教师的语言知识转移到 ASR 模型中(Choi and Park, 2022; Hentschel et al., 2024)。根据具体方法,教师信号可能是潜在表示对齐或语言模型标记概率目标,但它被用作训练时的监督信号,而不是推理时的输入。相比之下,SAMA-ASR 将翻译文本用作运行时语义锚点,并通过解码器端适配器模块在解码过程中将其与声学锚点相结合。

#### 多源文本融合。  
SAMA-ASR 也不同于用于同声传译的源文本辅助 ASR,后者在语音编码器之外使用辅助源语言文本编码器(Taniguchi et al., 2022)。那种设置假设在识别时源文本是可用的,而我们的实际设置必须首先从语音生成辅助翻译。

#### 跨模态适配器设计。  
SAMA-ASR 的参数高效设计遵循与 Flamingo 风格门控交叉注意力适配器和 Whisper-Flamingo 相同的大类(Alayrac et al., 2022; Rouditchenko et al., 2024),而其多模态基础动机与音视频 ASR 融合工作相关(Sterpu et al., 2018; Ma et al., 2021)。然而,SAMA-ASR 并非融合视觉线索与语音,而是将语义文本锚点与声学特征流融合,以分离意义级指导和表面形式基础。由于 SAMA-ASR 关注来自 mBERT 的标记级语义嵌入(Devlin et al., 2019),它保留了局部的翻译结构,而不是仅依赖于句子级的语义向量,如 LaBSE(Feng et al., 2022)。

## 3 方法论  
我们将 SAMA-ASR 作为一种轻量级解码器端适配器机制呈现,用于利用语义和声学锚点增强低资源 ASR。核心思想是:稀缺的目标语言转录文本使得解码器的下一个标记分布难以可靠估计,因此 SAMA-ASR 将解码器状态条件化于由翻译导出的语义嵌入和一个语音嵌入,使用语义嵌入提供语句级含义,使用语音嵌入在翻译存在噪声或不完整时保持解码的基础。在推理时,语义锚点由上游的语音到文本翻译模型自动生成,因此部署不需要预言机翻译。在我们的实现中,Whisper 作为 ASR 主干,mBERT 作为语义文本编码器,尽管这种基于适配器的锚定机制原则上可以附加到其他编码器-解码器 ASR 架构上。我们首先形式化这个概率框架,然后描述语义锚点生成以及 SAMA-ASR 架构及其训练目标。

### 3.1 问题框架与目标  
给定一个语音语句 \(\mathbf{X}\) 和目标转录文本 \(\mathbf{y} = (y_1, \dots, y_N)\),长度为 \(N\),一个标准的自回归 ASR 解码器建模 \(p_\theta(\mathbf{y} \mid \mathbf{X}) = \prod_{i=1}^N p_\theta(y_i \mid y_{<i}, \mathbf{X})\)。在低资源设置下,由于缺乏足够的目标语言转录文本,这个概率估计是困难的。SAMA-ASR 通过引入语义锚点 \(\mathcal{A} = \{\mathbf{a}_1, \dots, \mathbf{a}_M\}\)(来自辅助翻译)和声学锚点(来自语音信号)来解决这个问题,其中解码器在每个时间步 \(i\) 计算 \(p_{\theta,\psi}(y_i \mid y_{<i}, \mathbf{X}, \mathcal{A})\),这里 \(\theta\) 是预训练主干参数,\(\psi\) 是适配器参数。

### 3.2 语义锚点生成  
在我们的设置中,我们假设对于低资源目标语言 \(L_t\),存在一个辅助高资源语言 \(L_a\)(例如,普通话用于台湾闽南语/客家话)。我们使用一个预训练的语音到文本翻译模型(例如,Whisper ST)将输入语音 \(\mathbf{X}\) 翻译成辅助语言文本序列 \(\mathbf{t}_a = (t_1^a, \dots, t_M^a)\),这被视为语义锚点的来源。在更一般的多语言设置中,我们可以有多个辅助翻译 \(\mathcal{T} = \{\mathbf{t}_1, \dots, \mathbf{t}_L\}\);我们在附录 E 中评估了这种扩展。然后,一个冻结的 mBERT 编码器将每个辅助翻译转换为标记级的语义嵌入 \(\mathbf{E}_{1:L}\)(Devlin et al., 2019)。预言机翻译设置使用相同的 mBERT 编码策略,但直接使用真实的辅助翻译。

相似文章

迈向类人交互式语音识别:基于智能体修正与语义评估

Hugging Face Daily Papers

本文介绍了 Agentic ASR,一种交互式语音识别框架,通过语义修正和基于推理的编辑,利用多轮优化来减少语义错误。同时,提出了一种新的句子级语义错误率指标以及一个用于基准测试的交互式模拟系统。

语义运动锚点:弥合共语手势中的运动与意义

arXiv cs.CL

本文提出语义运动锚点,即共语手势检索与合成中手势运动的自然语言抽象。该方法将3D手势离散化为身体-手部运动基元,并将其与转录文本对齐,在文本到手势检索和生成中的用户偏好方面取得了显著提升。