面向大型音频语言模型的连续音频思考
摘要
该论文引入了连续音频思考(CoAT)框架,为大型音频语言模型配备了一个连续的潜在工作空间,用于在生成文本响应之前组织声学信息,从而在音频推理、理解和转录任务中提升性能,且不增加额外的解码成本。
arXiv:2606.18273v1 公告类型:交叉
摘要:大型音频语言模型(LALMs)在从语音转录到音乐分析等多种音频理解任务中展现出了令人印象深刻的能力。然而,由于LALMs通常被训练为生成与文本对齐的响应,它们的隐藏状态逐渐被塑造用于文本生成,而非保留声学信息。因此,音频所承载的多样化声学内容,如语音细节、韵律、声音事件、情感和音高等,在过程中丢失,难以在响应中利用。我们引入了连续音频思考(CoAT),这是一个框架,通过来自音频专家的知识蒸馏,为音频语言模型配备了一个连续的潜在工作空间,用于在响应生成之前组织声学信息。在思考空间中,模型在生成响应时可以利用专家蒸馏提供的丰富声学信息。此外,所提出的连续思考块可以在单个预填充中处理,因此CoAT不需要额外的自回归解码成本。在三个LALMs(Qwen2-Audio、Qwen2.5-Omni-7B和Audio Flamingo~3)上,涵盖音频推理、音频理解、音乐分类、语音情感和语音转录的广泛基准测试套件中的性能提升证明了CoAT的有效性。进一步的分析证实,辅助监督从思考位置传播到模型的文本响应。
查看缓存全文
缓存时间: 2026/06/18 05:44
# 用于大型音频语言模型的连续音频思考 来源:https://arxiv.org/html/2606.18273 Gyojin Han Dong\-Jae Lee∗Changho Choi∗Jongsuk Kim∗Junmo Kim 韩国科学技术院(KAIST) \{hangj0820, jhtwosun, ccho4702, jskpop, junmo\.kim\}@kaist\.ac\.kr ###### 摘要 大型音频语言模型(LALMs)在从语音转录到音乐分析等多种音频理解任务中展现了令人印象深刻的能力。然而,由于LALMs通常被训练生成与文本对齐的响应,其隐藏状态会逐步塑形为文本生成服务,而非用于保留声学信息。因此,音频所承载的多样声学内容(如语音细节、韵律、声音事件、情感和音高)会在这一过程中丢失,难以在响应中加以利用。我们引入了连续音频思考(CoAT),这是一种框架,为音频语言模型配备了一个连续的潜在工作空间,用于在响应生成前组织声学信息,并通过来自音频专家的知识蒸馏进行引导。在思考空间内,模型在生成响应时可以充分利用专家蒸馏提供的丰富声学信息。此外,所提出的连续思考块可以在单次预填充中处理,因此CoAT相较于基线模型不会增加额外的自回归解码成本。在三个LALMs(Qwen2-Audio、Qwen2.5-Omni-7B和Audio Flamingo 3)上,针对涵盖音频推理、音频理解、音乐分类、语音情感和语音转录的广泛基准测试套件,性能提升证明了CoAT的有效性。进一步分析证实,辅助监督信息从思考位置传播到模型的文本响应。 ## 1 引言 大型音频语言模型(LALMs)[9 (https://arxiv.org/html/2606.18273#bib.bib2),55 (https://arxiv.org/html/2606.18273#bib.bib3),19 (https://arxiv.org/html/2606.18273#bib.bib7),49 (https://arxiv.org/html/2606.18273#bib.bib4)] 已通过语言成为理解语音、环境声音、音乐及其他声学信号的自然接口。这些模型将音频编码器与经过训练以自回归生成文本响应的语言模型相结合。这种设计在口语对话和音频问答方面取得了显著进展,但也引入了一个根本性的监督不匹配:输入包含丰富的帧级声学结构,而训练目标仅通过稀疏的响应标记提供信号。音频编码器之上的层次被鼓励仅保留对预测下一个文本标记立即可用的信息,导致许多细粒度的声学线索缺乏监督或被丢弃。这种不匹配在音频方面尤为明显,因为音频承载了许多转录本身无法传达的特性,包括语音细节、说话者情感、背景场景、韵律和音乐结构。一种可能的解决方案是让模型将中间思考过程言语化,就像离散文本思维链提示[54 (https://arxiv.org/html/2606.18273#bib.bib15),29 (https://arxiv.org/html/2606.18273#bib.bib16),52 (https://arxiv.org/html/2606.18273#bib.bib17)]那样,在给出答案前用自然语言描述音频内容(例如,“一个高音调的男人在说话”或“第一个音符是C”)。然而,许多声学属性无法在不丢失细粒度时间和频谱细节的情况下被序列化为自然语言。针对这些属性的忠实自然语言理由很难大规模获得,即使获得,将低层声学证据压缩为文本也会引入不必要的瓶颈。 参见图注图 1:音频语言模型中的思考范式。(a) 基础音频语言模型直接从音频和指令标记解码响应。(b) 离散思考在答案前自回归生成文本思考标记。(c) 连续音频思考(我们的方法)在单次预填充中处理一个固定长度的连续思考标记块,让模型在与音频对齐的潜在空间中思考,没有自回归成本。这些局限性促使我们提出一种新的思考形式,它保留并重新组织声学信息本身,而不是将其言语化。为了满足这一需求,这种思考需要在连续的潜在位置展开,保持独立于文本,并且不受自然语言理由的监督。它还应作为一个工作空间,语言模型在其中维护、对齐和转换声学信息,然后再进行响应生成。为此,我们提出了连续音频思考(CoAT),这是一种辅助监督框架,为音频语言模型配备了一个潜在工作空间。CoAT在用户输入和助手响应之间放置了一个思考块,模型在该块中组织声学信息后再生成回复。该思考块通过来自多种音频专家(涵盖重建、语音内容[41 (https://arxiv.org/html/2606.18273#bib.bib39)]、声音事件[30 (https://arxiv.org/html/2606.18273#bib.bib27)]、副语言特征[35 (https://arxiv.org/html/2606.18273#bib.bib30)]和音高[3 (https://arxiv.org/html/2606.18273#bib.bib32)])的知识蒸馏进行引导,提供了文本监督单独无法提供的互补声学维度。CoAT无需架构更改即可与现有LALMs集成。此外,CoAT不需要文本理由或特定任务的解码格式,并且可以从少量音频数据中学习。在推理时,思考块在单次预填充中被处理,如图1 (https://arxiv.org/html/2606.18273#S1.F1)所示,不增加基线的自回归解码成本。我们在三个LALMs(Qwen2-Audio[9 (https://arxiv.org/html/2606.18273#bib.bib2)]、Qwen2.5-Omni-7B[55 (https://arxiv.org/html/2606.18273#bib.bib3)]和Audio Flamingo 3[19 (https://arxiv.org/html/2606.18273#bib.bib7)])上实例化CoAT,并在多种音频理解和推理基准上进行评估。CoAT在所有骨干网络上均取得一致提升,并以显著更低的每样本延迟优于文本思维链。进一步分析证实,辅助监督信息从思考位置传播到模型的文本响应。我们将贡献总结如下: - •我们提出了LALMs的连续思考范式,使模型能够在潜在空间中组织声学信息,无需言语化或自回归解码。 - •我们提出了一个多专家蒸馏目标,将思考状态锚定在互补的声学维度上,提供文本监督单独无法提供的信号。 - •我们在三个LALMs上评估CoAT,并表明它持续提升音频理解和推理能力,同时延迟低于文本思维链,分析表明监督信息从思考位置传播到模型的文本响应。 ## 2 相关工作 ##### 音频语言模型。越来越多的大家族语言模型已被改编以原生处理音频和文本[10 (https://arxiv.org/html/2606.18273#bib.bib1),9 (https://arxiv.org/html/2606.18273#bib.bib2),55 (https://arxiv.org/html/2606.18273#bib.bib3),31 (https://arxiv.org/html/2606.18273#bib.bib5),15 (https://arxiv.org/html/2606.18273#bib.bib6),19 (https://arxiv.org/html/2606.18273#bib.bib7),49 (https://arxiv.org/html/2606.18273#bib.bib4),20 (https://arxiv.org/html/2606.18273#bib.bib14),13 (https://arxiv.org/html/2606.18273#bib.bib10),16 (https://arxiv.org/html/2606.18273#bib.bib11),47 (https://arxiv.org/html/2606.18273#bib.bib12),33 (https://arxiv.org/html/2606.18273#bib.bib13),60 (https://arxiv.org/html/2606.18273#bib.bib8),22 (https://arxiv.org/html/2606.18273#bib.bib9)]。一种常见架构将预训练的音频编码器(通常是音频-文本对齐的Whisper[44 (https://arxiv.org/html/2606.18273#bib.bib68)]编码器)通过轻量级投影层连接到语言模型,将音频作为软标记嵌入流暴露给解码器[49 (https://arxiv.org/html/2606.18273#bib.bib4),31 (https://arxiv.org/html/2606.18273#bib.bib5),15 (https://arxiv.org/html/2606.18273#bib.bib6),19 (https://arxiv.org/html/2606.18273#bib.bib7),20 (https://arxiv.org/html/2606.18273#bib.bib14),13 (https://arxiv.org/html/2606.18273#bib.bib10),16 (https://arxiv.org/html/2606.18273#bib.bib11)]。另一条路线是端到端训练单一多模态模型,使音频、视觉和文本共享统一的标记空间[55 (https://arxiv.org/html/2606.18273#bib.bib3),60 (https://arxiv.org/html/2606.18273#bib.bib8),22 (https://arxiv.org/html/2606.18273#bib.bib9)]。在这两种情况下,音频能力通常通过监督微调获得,使用音频、指令和目标响应的三元组,有时结构化为多阶段课程,先对齐音频编码器,再指令调优语言模型[19 (https://arxiv.org/html/2606.18273#bib.bib7),55 (https://arxiv.org/html/2606.18273#bib.bib3)]。 ##### 连续和潜在思考。思维链提示[54 (https://arxiv.org/html/2606.18273#bib.bib15),29 (https://arxiv.org/html/2606.18273#bib.bib16),52 (https://arxiv.org/html/2606.18273#bib.bib17)]展示了语言标记中显式的逐步轨迹改善了大语言模型的推理行为。后续工作研究了推理是否必须保持在离散标记空间:Coconut[23 (https://arxiv.org/html/2606.18273#bib.bib20)]用循环回模型的连续嵌入替换文本链,Quiet-STaR[59 (https://arxiv.org/html/2606.18273#bib.bib19)]学习隐式思考并根据下一个标记可能性评分。一个相关线索通过循环变换器和隐式思维链公式将内部循环和深度视为显式推理资源[17 (https://arxiv.org/html/2606.18273#bib.bib21),12 (https://arxiv.org/html/2606.18273#bib.bib22)]。一个并行的线索将连续推理扩展到文本之外:视觉思维链[43 (https://arxiv.org/html/2606.18273#bib.bib38)]引入了连续视觉标记,使视觉语言模型能够在与视觉对齐的潜在空间中推理,但它仍为每个任务自回归生成额外标记,并与显式文本推理配对,未充分解决标记逐级推理的推理成本限制。 ##### 用于多种任务的音频编码器。已经开发了广泛的音频编码器,每种捕捉信号的不同方面。语音理解由自监督语音模型支持,这些模型从原始波形中学习语言单元[24 (https://arxiv.org/html/2606.18273#bib.bib23),2 (https://arxiv.org/html/2606.18273#bib.bib24),6 (https://arxiv.org/html/2606.18273#bib.bib25),41 (https://arxiv.org/html/2606.18273#bib.bib39)]。通用声音事件分析基于分类器和在广泛声学分类上预训练的掩码模型[30 (https://arxiv.org/html/2606.18273#bib.bib27),7 (https://arxiv.org/html/2606.18273#bib.bib26),26 (https://arxiv.org/html/2606.18273#bib.bib28),8 (https://arxiv.org/html/2606.18273#bib.bib29)]。音乐理解由专用于音调和节奏结构的编码器处理[57 (https://arxiv.org/html/2606.18273#bib.bib31),3 (https://arxiv.org/html/2606.18273#bib.bib32)],而副语言分析依赖于在情感语音上训练的自监督模型[35 (https://arxiv.org/html/2606.18273#bib.bib30)]。神经音频编解码器提供了一种互补表示,将波形压缩为紧凑的潜在序列,原始信号可从该序列解码[58 (https://arxiv.org/html/2606.18273#bib.bib33),11 (https://arxiv.org/html/2606.18273#bib.bib34),62 (https://arxiv.org/html/2606.18273#bib.bib35)]。我们将这些互补编码器收集到一个位置,并在训练时联合利用它们,使音频语言模型能够连续思考,将分散的任务特定表示转化为单一的音频感知推理基板。 ## 3 方法 参见图注图 2:CoAT架构。一个连续音频思考块通过每个任务的投影头受到五个音频专家的监督,涵盖音频特征重建、语音表示、声音事件检测、副语言特征和音高。投影头将共享隐藏状态解码为与专家对齐的预测,仅用于训练。在本节中,我们提出连续音频思考(CoAT),这是一种允许LALMs在生成文本响应之前以潜在形式保留和组织声学内容的方法。CoAT在音频输入和助手响应之间插入一系列连续潜在位置,并通过针对多个音频专家的蒸馏来监督这些位置的隐藏状态。因此,思考块作为一个锚定在互补声学维度上的工作空间,文本监督单独无法提供这些维度。我们首先形式化音频语言模型接口(§3.1 (https://arxiv.org/html/2606.18273#S3.SS1)),然后介绍思考块(§3.2 (https://arxiv.org/html/2606.18273#S3.SS2))、专家蒸馏(§3.3 (https://arxiv.org/html/2606.18273#S3.SS3))和分阶段训练计划(§3.4 (https://arxiv.org/html/2606.18273#S3.SS4))。所提方法的整体流程如图2 (https://arxiv.org/html/2606.18273#S3.F2)所示。 ### 3.1 大型音频语言模型 在描述方法之前,我们简要概述LALMs的工作原理。我们考虑一个由LLM解码器 \( f_L \) 和音频编码器 \( f_A \) 组成的音频语言模型。编码器 \( f_A \) 将原始音频波形 \( a \) 编码为长度为 \( L_a \) 的音频标记嵌入序列 \( \mathbf{x}_A \in \mathbb{R}^{L_a \times d} \),采样率为 \( r_s \),其中 \( d \) 是 \( f_L \) 的隐藏大小。输入序列由系统提示和用户提示组成,\( \mathbf{x} = [\mathbf{x}^{\text{sys}}, \mathbf{x}^{\text{usr}}] \),其中用户提示本身包含音频标记嵌入后跟文本提示,\( \mathbf{x}^{\text{usr}} = [\mathbf{x}_A, \mathbf{x}_{\text{txt}}] \)。模型使用交叉熵损失 \( \mathcal{L}_{\text{CE}}(\mathbf{x}) = -\sum_{t \in I(\mathbf{x})} \log p_{f_L}(x_t \mid \mathbf{x}_{<t}) \) 进行下一个标记预测训练,其中 \( I(\mathbf{x}) \) 是响应标记 \( x \) 的位置集。 ##### 3.2 连续音频思考块 我们引入三个特殊标记 \( \tau_s = \texttt{<|audio\_think\_start|>} \), \( \tau_p = \texttt{<|audio\_think|>} \), \( \tau_e = \texttt{<|audio\_think\_end|>} \),作为音频思考块的边界和内容位置。给定包含长度为 \( L_a \) 的音频片段的输入,相应的思考块通过为每个音频标记放置一个 \( \tau_p \),并由边界标记框定来构建:\( \mathbf{b}(L_a) = [\tau_s, \underbrace{\tau_p, \ldots, \tau_p}_{L_a}, \tau_e] \)。 该块 \( \mathbf{b}(L_a) \) 被附加到输入序列,\( \tilde{\mathbf{x}} = [\mathbf{x}^{\text{sys}}, \mathbf{x}^{\text{usr}}, \mathbf{b}(L_a)] \),并由解码器 \( f_L \) 处理。我们收集 \( \tau_p \) 位置的最终层隐藏状态 \( \mathbf{H}_{\text{think}} \in \mathbb{R}^{L_a \times d} \)。在训练时,公式 (1) 中的交叉熵仅在响应位置计算;思考块位置不参与文本标记预测,而是被专门监督...相似文章
连续音频语言模型
本文介绍了连续音频语言模型(CALM),该模型使用连续帧而非离散token生成音频,以提升语音和音乐生成的保真度并降低计算成本。
GigaChat Audio: 时间感知的大型音频语言模型
本文介绍了 GigaChat Audio,一个时间感知的大型音频语言模型,能够对长达120分钟的音频回答问题并给出明确的时间戳,使用交错周期性时间标记和合成监督。该模型在基准测试中实现了强时间定位准确性,作者已发布模型权重和数据集。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
CopT: 用于通用与智能体推理的连续空间对比在线思考
CopT为大型语言模型引入了一种对比性在线思考框架,首先生成草稿答案,然后通过对比验证和动态思考来提高准确性并减少token消耗。在数学、代码和智能体推理任务上,准确率最高提升23%,token使用量最多降低57%。
统一音频智能,且不牺牲文本智能
这篇论文介绍了Audex,这是NVIDIA推出的统一音频-文本大语言模型,在多种音频和语音任务上实现了最先进的性能,同时保持了强大的文本推理能力,且没有出现退化。