LaSR:基于潜在推理的上下文感知语音识别
摘要
LaSR提出了一种针对上下文感知语音识别的潜在推理训练范式,围绕声学特征对齐思维链监督,以在无额外延迟的情况下提高术语识别能力,在Fun-Audio-Chat上优于标准微调。
arXiv:2606.00507v1 Announce Type: new
摘要:近期语音大语言模型(Speech LLMs)的进展显著提升了口语理解和推理能力。然而,其上下文感知能力有限,难以有效执行反映说话者意图和话题上下文的语音识别。在本文中,我们提出了LaSR(潜在语音推理),一种新颖的训练范式,其特点是通过利用潜在推理过程实现上下文感知的推理轨迹。LaSR不生成显式的中间令牌,而是围绕目标词语的声学特征区域对齐思维链(CoT)监督,并引入潜在推理阶段以进行上下文信息基础和转录转换。此外,为有效基准测试专门词汇的上下文识别,我们提出了Spoken Darwin-Science,一个专注于学术术语的大规模语料库。在Fun-Audio-Chat上的初步实验表明,LaSR显著提高了术语识别能力,且未引入额外延迟,并持续优于标准监督微调基线。我们的研究结果凸显了潜在推理在构建高效、上下文感知的语音助手方面的潜力。
查看缓存全文
缓存时间: 2026/06/02 15:37
# LaSR:基于潜在推理的上下文感知语音识别
来源:https://arxiv.org/html/2606.00507
何阳刘¹,²,子阳程¹,²,佳怡黄¹,文阳肖¹,荣华吴²,群山顾²,燕峰王¹,宇王¹†
¹上海交通大学,²蚂蚁集团
\{liuheyang,muye12,hjy\-sjtu,onesheep,wangyanfeng622,yuwangsjtu\}@sjtu\.edu\.cn
\{r\.wu, guqunshan\.gqs\}@antgroup\.com
###### 摘要
近来语音大语言模型(Speech LLMs)的进展显著增强了口语理解与推理能力。然而,其上下文感知能力仍有限,难以有效反映说话人意图和话题上下文的语音识别。本文提出LaSR(Latent Speech Reasoning),一种新的训练范式,其核心是一种利用潜在推理过程的上下文感知推理轨迹。LaSR并非生成显式的中间令牌,而是将思维链(CoT)监督对齐到目标单词的声学特征区域附近,并引入潜在推理阶段用于上下文信息锚定和转录过渡。此外,为了有效评估专业词汇的上下文识别,我们提出了Spoken Darwin-Science,一个专注于学术术语的大规模语料库。在Fun-Audio-Chat上的初步实验表明,LaSR在不引入额外延迟的情况下显著提升了术语识别能力,并一致优于标准监督微调基线。我们的研究结果凸显了潜在推理在构建高效、上下文感知的语音助手方面的潜力。
# LaSR:基于潜在推理的上下文感知语音识别
何阳刘¹,²,子阳程¹,²,佳怡黄¹,文阳肖¹,荣华吴²,群山顾²,燕峰王¹,宇王¹†
¹上海交通大学,²蚂蚁集团
\{liuheyang,muye12,hjy\-sjtu,onesheep,wangyanfeng622,yuwangsjtu\}@sjtu\.edu\.cn
\{r\.wu, guqunshan\.gqs\}@antgroup\.com
††footnotetext:†通讯作者
## 1 引言
近期语音大语言模型(Speech LLMs)的进展在口语理解与生成方面展现出令人瞩目的能力 (Wang et al., 2025; Team et al., 2025; Xu et al., 2025b)。这些模型能够捕捉音频中的长距离依赖、利用上下文线索,并对复杂语音输入进行推理。然而,现有模型的性能受到内在限制的约束。一方面,直接采用思维链(CoT)技术常导致稳定性有限,甚至可能降低通用智能 (Li et al., 2025; Xu et al., 2025b; Wu et al., 2025; Comanici et al., 2025)。另一方面,显式生成中间推理步骤会引入巨大的计算开销和延迟,这在实时转录和对话中不可接受,会对用户体验产生负面影响。因此,有必要在无额外计算延迟的同时,实现语音大语言模型的上下文推理能力增强。
参考图标题图1:上下文ASR能够感知上下文并进行合理的转录。作为语音对话的前提,自动语音识别(ASR)在促进后续意图理解和响应生成中起着关键作用。如图1所示,上下文ASR(CASR)专注于准确识别罕见或专业术语,同时利用局部音频线索和更广泛的语义上下文,因此是语音大语言模型上下文推理的合理任务 (Sun et al., 2021; Liu et al., 2024; Deng et al., 2026)。以往的研究主要在通用语料库上评估,其中常见词汇和高频表达占主导,通常只需扩大训练量即可提高转录准确率。本文中,我们构建了Spoken Darwin-Science,一个大规模的合成语料库,包含广泛的术语,以及来自在线资源的相应真实世界语音评估集。从主流的ASR模型和语音大语言模型来看,我们证明了使用高质量合成数据的监督微调(SFT)可以有效提升模型对真实录音的泛化能力。在此基础上,我们提出LaSR(Latent Speech Reasoning),一种适用于语音模型的训练方案,它利用CoT在不增加延迟的情况下增强上下文推理能力,从而改善对困难术语的识别。LaSR通过在目标术语附近添加CoT监督连同语音输入来调节潜在推理过程,解决了CoT输出对模型转录的负面影响,并超越了标准SFT基线。
具体来说,LaSR不同于以往的方法——即从多步显式CoT开始,然后逐步替换为潜在推理过程。它提出将关键的上下文推理过程与目标术语的声学特征输入对齐,并在显式推理阶段前后执行潜在推理。通过CoT和转录的监督,语音大语言模型实现了更好的感知和改进的上下文识别。我们的主要贡献如下:
- • 我们为语音大语言模型的上下文推理能力构建了一个具有挑战性的套件。该模型旨在通过分析先前上下文来增强学术术语的识别。
- • 我们提出了LaSR,一种训练策略,将中间推理监督和潜在推理阶段注入音频输入令牌,使语音大语言模型能够在没有显式CoT输出的情况下捕捉上下文依赖和推理线索。
- • 大量实验表明,LaSR成功利用了CoT推理轨迹和模型固有的潜在推理,并验证了其相对于标准SFT的有效性。
## 2 相关工作
### 2.1 语音大语言模型
语音大语言模型利用大型语言模型的强大智能和推理能力来处理和生成口语。早期工作集中在通过专有编码器和解码器实现语音交互,以GLM-4-Voice (Zeng et al., 2024) 为代表,它用离散语音令牌扩展了词汇表;以及Qwen2.5-Omni (Xu et al., 2025a),采用了思维者-说话者架构。后续工作沿着多个方向展开。例如,Step-Audio R系列 (Tian et al., 2025; Zhang et al., 2026) 强调增强推理能力和对声学信息的接地,而Fun-Audio-Chat (Team et al., 2025) 则专注于对齐语音令牌与文本令牌之间的分辨率,以提高多模态一致性和计算效率。MiMo-Audio (Zhang et al., 2025) 探索大规模扩展训练数据以改善跨不同语音场景的泛化能力。这些努力共同表明,语音大语言模型构成了一个重要的研究领域,并逐步朝着更通用、更高效的范式演进,统一了语音理解、推理和生成。
### 2.2 思维链提示与潜在推理
推理能力的增强是LLM进步的一个关键特征。早期方法通过显式提供中间推理步骤来改进模型推理,以CoT提示为代表 (Wei et al., 2022)。通过暴露于结构化解决方案轨迹,这些方法已在算术、逻辑和常识推理基准上显示出性能提升 (Yue et al., 2024; Ye et al., 2025)。最近,潜在推理无需显式中间输出而受到越来越多的关注。COCONUT (Hao et al., 2024) 将推理过程分解为固定数量的步骤,逐步移除前面位置的显式CoT步骤,替换为隐藏状态的自回归传播,从而提供更宽的波束搜索解码空间。CODI (Shen et al., 2025) 引入了自蒸馏,将带有显式CoT的模型作为教师,潜在推理模型作为学生,对齐它们生成响应的分布。压缩显式CoT是另一种方法。CoLaRT (Tan et al., 2026) 以不同比例采样压缩后的CoT令牌,而Token Assorted (Su et al., 2025) 使用外部的VQ-VAE获取潜在CoT令牌用于直接模型训练。尽管这些努力是在文本模态中进行的,但它们对语音大语言模型的效果尚未得到充分验证。
### 2.3 上下文ASR
CASR要求模型感知说话人的上下文并对偏置列表进行有利的转录。传统的非LLM ASR模型主要采用两种方法:基于加权有限状态转换器(WFST)的偏置词概率增强 (Zhao et al., 2019),以及显式添加偏置编码器以向模型注入相关词汇 (Pundak et al., 2018)。基于LLM的初步尝试使用了额外的热词提示,将固定大小的偏置列表显式注入LLM骨干网 (Yang et al., 2024)。这些方法都需要偏置列表(热词),无论是基于训练词频还是模拟用户定义,忽略了LLM感知和推理上下文的能力。在 (Deng et al., 2026) 中,CoT-ASR被提出,通过首先生成分析推理来产生更高质量的转录。这充分利用了LLM的生成推理能力,并且可以脱离固定偏置列表,但额外的CoT输出导致解码延迟过大,无法支持实时转录。相比之下,LaSR提出以流式方式影响潜在思考过程,从而在无额外延迟的情况下提高模型的上下文感知能力和罕见词转录。
参考图标题图2:Spoken Darwin-Science 20%子集的数据集统计。(a): 不同学科的实例分布;(b) 不同学科的不同术语分布;(c) 实例的时长分布;(d) 带有时间戳和CoT标注的实例示例。
## 3 Spoken Darwin-Science
在本节中,我们介绍实验中提出的语料库,包括设计原则、主要特征、构建过程和统计信息。
### 3.1 数据原则
以往关于CASR的工作通常依赖于通用对话语料库(例如,LibriSpeech、GigaSpeech (Panayotov et al., 2015; Chen et al., 2021)),并通过从这些语料库中选择低频词来构建测试集以评估上下文依赖识别 (Sun et al., 2021; Cui et al., 2025)。然而,近期语音模型特别是语音大语言模型的扩展削弱了其有效性:训练中大量高质量的对话数据减少了罕见词的稀疏性,使得这些测试集不再具有挑战性。为了解决这一限制,我们聚焦于包含学术术语的科学领域。这些科学命名实体高度专业化,通常需要模型同时利用局部声学线索和更广泛的上下文信息才能准确转录。因此,该数据集直接反映了语音大语言模型的上下文推理能力。
| 学科 | 术语示例 |
|------|----------|
| 计算机科学 | biqubits, chainwork |
| 工程学 | suffusion, rhizotron |
| 人文社科 | floristry, chieftaincies |
| 医学 | flavonolignans, phosphatide |
| 生物学 | abacopterin, dysmorphogenesis |
| 化学 | phenyltrimethoxysilane, pentanethiol |
| 数学 | polynomiography, contactomorphic |
| 物理学 | graviscalars, nonpolarizing |
| STEM(其他) | nakhlites, equatorwards |
表1:Spoken Darwin-Science不同学科的术语示例。
### 3.2 数据构建
#### 3.2.1 术语定义
术语代表高度专业化的词汇,在日常对话中很少出现,但在语义理解和学术对话中起着至关重要的作用。我们参考了GigaSpeech-XL训练集中的词汇并计算了词频 (Chen et al., 2021)。GigaSpeech是一个超过10,000小时转录文本的大规模语音数据集,主要来源于YouTube、播客和有声读物,且大多数为日常词汇。我们将出现次数少于10次的词定义为术语,并通过人工验证确认。
#### 3.2.2 训练集
我们选择来自不同学科的学术论文作为初始来源。具体来说,语料库来源于Darwin-Science (Qin et al., 2026),这是一个经过多阶段文本清洗的高质量论文集合,涵盖九个科学领域,包括生物学、化学、人文社科等。我们移除了开头和结尾的固定长度字符,仅保留正文,并使用NLTK (Bird, 2006) 将其分割为句子。仅当句子包含上述定义的术语时才保留该句子。同一术语最多保留五个句子,优先选择仅包含单个术语的句子。最终语料库包含从与440B令牌相关的文本中筛选出的270万条实例。对于语音合成,我们使用Qwen3-TTS-1.7B (Hu et al., 2026),并从CV3-Eval (Du et al., 2025) 和seed-tts-eval (Anastassiou et al., 2024) 中选择DNSMOS Pro (Cumlin et al., 2024) 高于3的语音片段作为语音提示,以确保合成语音的质量。在我们的实验中,Qwen3-TTS表现出强大的泛化能力,能够基于单词的正字法组成和通用发音规则有效地将单词转换为语音。这对于合成科学术语尤为有利,这些术语通常由多个常见语音单元组成,并且经常形成复合词。这种系统化的结构使得即使对于从未见过的术语也能实现准确而自然的发音。我们构建语料库中的术语示例如表1所示,更详细的流程总结于附录A中。相似文章
倾听潜在状态:大型音频语言模型中通过隐藏状态交互的自我纠正语音识别
本文介绍了Hybrid Search,一种通过利用ASR-LLM和基础LLM之间的隐藏状态交互来增强大型音频语言模型中自动语音识别的方法,用于针对性token纠正,其性能超越了全局LLM纠正策略。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。
LaTER:通过潜在探索与显式验证实现高效的测试时推理
本文介绍了 LaTER,一种两阶段推理范式,它将潜在探索与显式思维链(Chain-of-Thought)验证相结合,从而在保持准确率的同时,降低大型语言模型的标记使用量并提升效率。
自适应潜在智能体推理
本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。