倾听潜在状态:大型音频语言模型中通过隐藏状态交互的自我纠正语音识别
摘要
本文介绍了Hybrid Search,一种通过利用ASR-LLM和基础LLM之间的隐藏状态交互来增强大型音频语言模型中自动语音识别的方法,用于针对性token纠正,其性能超越了全局LLM纠正策略。
arXiv:2609.02940v1 公告类型:新
摘要:近期,自动语音识别(ASR)系统越来越多地集成大型语言模型(LLMs)以利用其语义知识,方式包括外部的对数概率融合或内部的热启动初始化。然而,如何有效结合这两种策略仍有待深入探索。本研究通过利用其自身预适应的基础LLM来优化基于热启动初始化的LLM ASR模型,重点在于保留基础LLM的LoRA适配设置。为此,我们提出了Hybrid Search,一种基于两个观察的针对性纠正策略。首先,表征基于LLM的ASR隐藏状态与基础LLM隐藏状态之间关系的交互特征,提供了关于token语义依赖程度的有用信号。其次,选择性地对高语义依赖的token进行细化,其性能提升远超简单的全局LLM纠正方法,包括重新评分和后期融合。我们的分析表明,即使通过热启动初始化进行了语义知识转移,基于LLM的ASR模型仍可利用其基础LLM进一步提升推理时性能。
查看缓存全文
缓存时间: 2026/09/04 05:53
# 倾听潜在状态:通过隐藏状态交互实现大型音频语言模型中的自校正语音识别 来源:https://arxiv.org/html/2609.02940 朝翰·霍克·杨††感谢:在NVIDIA完成工作 所属机构:NVIDIA 邮箱:[[email protected]](mailto:) 渡边伸二‡ 黄怡豪 卡洛斯·布索‡‡ 卡内基梅隆大学 所属机构:台湾大学 ###### 摘要 近期自动语音识别系统越来越多地集成大型语言模型以利用其语义知识,方式包括外部对数概率融合或内部热初始化。然而,如何有效结合这两种策略仍有待探索。本工作通过利用基于LLM的ASR模型自身的预适应基础LLM,对热初始化模型进行优化,重点研究LoRA适配设置下保留基础LLM的场景。为此,我们提出**混合搜索**——一种基于两项观察设计的定向纠正策略:第一,表征ASR-LLM隐藏状态与基础LLM隐藏状态交互关系的特征,能为token的语义依赖程度提供信息性信号;第二,选择性修正高语义依赖token可显著提升ASR性能,远超朴素的全局LLM纠正方法(如重打分与后期融合)。分析表明,即使通过热初始化完成语义知识迁移后,ASR-LLM仍能利用其基础LLM在推理阶段进一步优化性能。 演示地址:https://huggingface.co/spaces/Splend1dchan/Listen-To-The-Latent ## 1 引言 近期拥有数十亿参数、基于数十万至数百万小时音频训练的ASR模型,在多种场景下展现出卓越性能(Radford等人,2023;Puvvada等人,2024;Peng等人,2023、2024)。然而,ASR模型与大语言模型之间仍存在显著数据鸿沟。例如,Whisper-large-v3仅在约500万小时语音上训练,对应文本标注约数百亿文本标记(OpenAI,2023)。该数据规模比现代LLM训练所用数万亿标记小数个数量级。这种差异导致语义差距:LLM具有比ASR模型更丰富的语义表征和更广泛的世界知识。因此,利用LLM为提升ASR性能提供了有前景的方向(Ma等人,2023),尤其对依赖语义上下文的词汇(如命名实体和罕见词)效果显著。 **图1**:ASR-LLM自校正框架。(a) 第3节:从ASR-LLM与LLM隐藏状态交互中提取特征;(b) 第4节:通过门控机制决定是否整合LLM对数概率进行预测。 现有方法通常通过两种主要方式协调LLM与ASR系统:一是将整个系统视为“单一模型”(Hsu等人,2025a;Mittal等人,2024;Hori等人,2025),通过对数概率级后期融合融入LLM语言信息;二是强调LLM在ASR中的智能体角色(Yang等人,2023;Chen等人,2023;Radhakrishnan等人,2023;Wan等人,2026),利用其指令跟随能力优化ASR假设。然而这些方法本质上依赖对较弱ASR模型输出的修正,而非提升模型基础识别能力。 为利用LLM在ASR中的优势,研究者探索将LLM与ASR主干直接集成,本文统称为ASR-LLM。如Phi-4-Multimodal、SALM和Qwen3-ASR(Abouelenin等人,2025;Chen等人,2024b;Shi等人,2026)等ASR-LLM通常基于预训练LLM初始化(Abouelenin等人,2025;Shoeybi等人,2019;Granite团队,2024),将预训练LLM主干与语音编码器结合,在大规模语音-语言语料库上联合训练。这种构建方式能达到与从头训练的ASR系统及事后LLM纠正方法相竞争甚至更优的性能(Srivastav等人,2025)。该性能模式表明,通过热初始化实现的LLM语义知识迁移比事后纠正更有效。 尽管ASR-LLM表现优异,但这些模型如何利用集成LLM中编码的语义和语言知识仍不明确。先前工作利用输出分布或不确定性信号提升解码真实性(Chang等人,2025;Hsu等人,2025b;Yang等人,2026)。超越输出层信号,层级表征分析长期表明不同层级编码互补信息(Peters等人,2018)。近期研究将跨层变化解释为潜在轨迹(Wang等人,2025;Chen等人,2025;Chuang等人,2024),为改进解码提供有用信号。例如,潜在轨迹连续层级间的聚合角度与幅度特征已被证明可区分正确与错误推理样本(Wang等人,2025)。 本研究扩展先前工作,分析LoRA适配ASR-LLM隐藏状态与其原始基础LLM隐藏状态的几何关系。分析显示,这些隐藏状态间的**余弦相似度**和**相对幅度**为识别高语义依赖token提供了信息性信号。基于此观察,我们解决核心问题:能否在推理时重用原始基础LLM作为外部指导来进一步优化ASR-LLM?我们提出**混合搜索**——一种解码算法,先通过隐藏状态交互识别特征位于高语义依赖区域的token,再对这些token应用定向LLM纠正(如图1所示)。在本研究设定下,混合搜索具备完全**自校正**特性(Grill等人,2020;Chou等人,2025),无需额外参数或进一步训练。 本文当前评估聚焦ASR,将混合搜索在不同计算预算下评估为类束搜索解码策略(Hsu等人,2025a)和测试时缩放方法(Snell等人,2024)。更广泛而言,该框架可扩展至任务适配模型保留原始基础LLM访问权的其他任务或条件,如语音翻译和音频理解(Hsu等人,2025b;Lin等人,2026)。ASR实验结果显示,混合搜索在保持与束搜索相当词错误率的同时,相比贪婪搜索、束搜索及朴素LLM集成方法(如重打分与后期融合)显著提升命名实体识别性能。这表明即使通过热初始化完成语义知识迁移,ASR-LLM仍能利用原始基础LLM在推理阶段进一步提升性能。 ## 2 背景 **基于LLM的ASR**。先前工作为跨架构和训练范式的热初始化LLM-ASR奠定基础,包括全微调系统(Shi等人,2026)和参数高效适配模型(Abouelenin等人,2025;Saon等人,2025;NVIDIA,2025;Chen等人,2024b)。这些ASR-LLM被证明比从头训练模型(Puvvada等人,2024;Radford等人,2023;Peng等人,2023)及其LLM纠正变体(Hsu等人,2025a;Chen等人,2023;Lin等人,2025;Wan等人,2026)在标准ASR基准上更有效(Srivastav等人,2025)。本研究通过Phi-4-Multimodal的代表性案例研究LoRA-ASR-LLM的自校正,并以Granite-4.0-1B-Speech验证其通用性。两个模型均保留功能性完整的LLM主干,支持LLM路径的直接隔离。111 Phi-4-Multimodal主干为Phi-4-Mini;Granite-4.0-1B-Speech主干为Granite-4.0-1B-Base。此外,两个模型已使用大量语音数据(10万至230万小时)开发ASR能力,使得进一步数据扩展对解决语义知识迁移缺陷的吸引力降低。 **语音识别中的命名实体**。命名实体和领域特定罕见词常在ASR中承担不成比例的上下文重要性,推动了其识别的大量研究(Chen等人,2023)。先前工作探索领域专用语言模型(Liu等人,221)和显式领域标签(Liao等人,2023)以提升识别性能。其他方法在ASR系统中训练嵌入式命名实体识别模块(Ayache等人,2025)。互补地,SpeechIQ(Wan等人,2025)通过计算基于LLM的相似性评分解决词错误率对语义重要识别错误权重不足的问题(Liu等人,2024;Jiang等人,2024)。沿此方向,本文除报告词错误率外,还报告命名实体错误率以更好表征LLM纠正引入的语义增益。 ## 3 隐藏状态交互揭示token语义依赖 ### 3.1 隐藏状态交互提取 **形式化**。具有L层的ASR-LLM模型可表示为有序子模块的复合: f = f_head ∘ f_L ∘ ⋯ ∘ f_l ⋯ ∘ f_1 ∘ f_emb (1) 其中嵌入模块f_emb将输入token转换为d维嵌入。中间层{f_l}_{l=1}^L依次变换这些表征,分类头f_head将最终隐藏状态映射至词表空间V以生成输出预测。我们将隐藏状态定义为分类头前各层表征的集合。为简化,将嵌入层f_emb记为f_0。给定输入token序列I,定义token位置i处的隐藏状态向量h_l^i为部分复合f_l ∘ ⋯ ∘ f_1 ∘ f_0(I)^i的输出。随后跨层聚合这些向量获得位置i的层级隐藏状态: H^i = [(h_0^i)^⊤; ⋯; (h_L^i)^⊤] ∈ ℝ^{(L+1)×d} (2) 本研究设定中,模型运行于语音-文本模式,隐藏状态随输入模态变化。以H_{ASR-LLM}表示ASR-LLM在给定步骤进行ASR解码时产生的隐藏状态,以H_{LLM}表示基础LLM在对应纯文本输入上运行获得的隐藏状态: H_{ASR-LLM} = f(I_{<i}; A; {φ_{LLM}, φ_{LoRA}}) (3) H_{LLM} = f(I_{<i}; {φ_{LLM}}) (4) 其中H_{ASR-LLM}同时基于音频编码器输出A和已解码上下文加提示I_{<i},在活跃的ASR-LLM参数{φ_{LLM}, φ_{LoRA}}下计算;而H_{LLM}仅使用基础LLM参数φ_{LLM}在纯文本上下文I_{<i}上运行获得。为分析隐藏状态交互,将每条语音条件轨迹H_{ASR-LLM}与在相同文本上下文I_{<i}下计算的纯文本对应轨迹H_{LLM}配对。 **(a) 特征角度与幅度的层级平均与标准差** 中间特征:f_{inter}(i) = (1/3) Σ_{l∈Top3_{10≤l≤28}(f)} f(l,i), f∈{AngleFeat, MagFeat} 单token词 | 多token词 | 起始token | 延续token(s) 后期层特征:f_{late}(i) = f(31,i), f∈{AngleFeat, MagFeat} 单token词 | 多token词 | 起始token | 延续token(s) 非命名实体token | 命名实体token **(b) 高斯分布**
相似文章
LaSR:基于潜在推理的上下文感知语音识别
LaSR提出了一种针对上下文感知语音识别的潜在推理训练范式,围绕声学特征对齐思维链监督,以在无额外延迟的情况下提高术语识别能力,在Fun-Audio-Chat上优于标准微调。
Latent-IM:用于语音LLM的潜在交互管理
介绍了Latent-IM,一个从冻结的语音LLM中恢复交互管理的框架,利用基于激活的选择和引导来进行会话动作。相比未引导的主干模型,它将端到端动作准确率提升了12.5个百分点。
LLMs悄悄纠正非裔美国人英语:通过激活操控审计和缓解方言偏见
本文审计并缓解大型语言模型中的方言偏见,显示它们系统性地偏好标准美式英语而非非裔美国人英语。作者引入了激活操控,一种无需训练的方法,在保持流畅性的同时显著减少偏见,并发布了迄今为止最大的真实AAE平行语料库。
如何利用合成语音构建基于LLM的ASR系统?
本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。
大型语言模型能否可靠地纠正低资源ASR中的错误?一项关于西弗里斯兰语的污染感知案例研究
本文研究了基于LLM的生成式错误修正(GER)在低资源西弗里斯兰语ASR中的应用,采用污染感知评估方法,使用私有数据集表明GPT-5.1将错误降低至低于oracle水平。