从输入端最小化模态差距:您的语音大语言模型可以成为具备韵律感知能力的文本大语言模型
摘要
提出了 TextPro-SLM,一种通过处理口语输入使其类似于具备韵律感知能力的文本来最小化模态差距的语音大语言模型,以少量的训练数据实现了强大的副语言理解能力。
arXiv:2605.05927v1 公告类型:新论文
摘要:语音大语言模型(SLM)通常基于文本大语言模型(TLM)的检查点构建,但仍存在显著的模态差距。以往的工作主要通过使语音生成更类似于文本来从输出端缩小这一差距,但差距依然存在。我们认为,关键瓶颈在于输入端。我们提出了 TextPro-SLM,这是一种使口语输入更贴近具备韵律感知能力的文本大语言模型输入的 SLM。TextPro-SLM 结合了 WhisperPro(一种统一的语音编码器,可生成同步的文本 token 和韵律嵌入)与一个经过训练的 LLM 骨干网络,该骨干网络在学习副语言理解能力的同时,保留了原始 TLM 的语义能力。实验表明,在 3B 和 7B 两种规模下,TextPro-SLM 在所有领先的 SLM 中实现了最低的模态差距,同时在副语言理解任务上也表现出色。这些提升仅需约 1,000 小时的 LLM 训练音频,表明从输入端缩小模态差距既有效又节省数据。
查看缓存全文
缓存时间: 2026/05/08 06:47
# 从输入端最小化模态差距:你的语音大语言模型可以成为一个感知韵律的文本大语言模型
来源: https://arxiv.org/html/2605.05927
Wenqian Cui${}^1$, Xiao-Hui Li${}^2$, Daxin Tan${}^2$, Qiyong Zheng${}^1$, Irwin King${}^2$
${}^1$香港中文大学, ${}^2$华为技术有限公司
###### 摘要
语音大语言模型(Speech Large Language Models, SLMs)通常是在文本大语言模型(Text Large Language Model, TLM)的检查点(checkpoints)基础上构建的,但它们仍然面临着巨大的模态差距。先前的工作主要试图通过使语音生成更像文本来从输出端缩小这一差距,但差距依然存在。我们认为,剩余的关键瓶颈在于输入端。我们提出了 TextPro-SLM,一种 SLM,它使口语输入更接近于感知韵律的文本 LLM 的输入。TextPro-SLM 结合了 WhisperPro(一种统一的语音编码器,能够产生同步的文本 token 和韵律嵌入)以及一个经过训练的 LLM 骨干,该骨干在保留原始 TLM 语义能力的同时学习副语言理解。实验表明,TextPro-SLM 在 3B 和 7B 规模下实现了现有领先 SLM 中最低的模态差距,同时在副语言理解任务上也表现出强劲的整体性能。这些提升仅使用了约 1,000 小时的 LLM 训练音频数据,表明从输入端缩小模态差距既有效又具备数据效率。
## 1 引言
语音大语言模型(Speech LLMs, SLMs)近年来受到了广泛研究,旨在实现无缝的基于语音的交互\[19\](https://arxiv.org/html/2605.05927#bib.bib1),\[26\](https://arxiv.org/html/2605.05927#bib.bib2),\[21\](https://arxiv.org/html/2605.05927#bib.bib4),\[20\](https://arxiv.org/html/2605.05927#bib.bib5)。大多数 SLM 是通过从文本大语言模型(TLM)检查点继续训练来构建的\[1\](https://arxiv.org/html/2605.05927#bib.bib6),\[52\](https://arxiv.org/html/2605.05927#bib.bib7),\[2\](https://arxiv.org/html/2605.05927#bib.bib8),\[54\](https://arxiv.org/html/2605.05927#bib.bib10),\[55\](https://arxiv.org/html/2605.05927#bib.bib11),\[28\](https://arxiv.org/html/2605.05927#bib.bib9),目的是将 TLM 强大的推理和语言理解能力扩展到语音输入和输出。然而,尽管共享同一个骨干网络,一个主要挑战仍然存在:**模态差距**——基于语音的问答(QA)性能通常仍然明显低于底层 TLM 的基于文本的 QA 性能,这限制了 SLM 的实际可用性。例如,先前的研究\[17\](https://arxiv.org/html/2605.05927#bib.bib13)报告称,GLM-4-Voice\[67\](https://arxiv.org/html/2605.05927#bib.bib12)在几个 QA 基准测试上的性能下降高达 20%。
大多数现有研究试图从**输出端**来弥合模态差距。早期的 SLM 使用 LLM 骨干仅生成语音 token,从而实现完全端到端的语音交互\[41\](https://arxiv.org/html/2605.05927#bib.bib16),\[30\](https://arxiv.org/html/2605.05927#bib.bib14),\[47\](https://arxiv.org/html/2605.05927#bib.bib15)。后来的工作通过让 LLM 首先生成中间文本 token,然后再发出语音 token 来提高性能\[68\](https://arxiv.org/html/2605.05927#bib.bib17),\[60\](https://arxiv.org/html/2605.05927#bib.bib3),\[67\](https://arxiv.org/html/2605.05927#bib.bib12),\[43\](https://arxiv.org/html/2605.05927#bib.bib19)。最近的方法进一步通过“思考者-说话者”(thinker-talker)架构将文本生成与语音合成解耦,其中 LLM 骨干仅生成文本 token,而独立的说话者模块根据思考者的隐藏状态生成语音\[27\](https://arxiv.org/html/2605.05927#bib.bib20),\[12\](https://arxiv.org/html/2605.05927#bib.bib21),\[58\](https://arxiv.org/html/2605.05927#bib.bib22),\[62\](https://arxiv.org/html/2605.05927#bib.bib23),\[61\](https://arxiv.org/html/2605.05927#bib.bib24)。
这一进展路线揭示了一个清晰的模式:生成过程越接近 TLM 的交互范式,生成的 SLM 表现往往越好。尽管如此,即使有这些进步,模态差距也并未消除。
**图 1**: 左:先前 SLM 与我们方法使用的架构设计比较。右:不同方法的模态差距与音频训练数据量比较。
这一观察表明,剩余的瓶颈可能主要在于**输入端**。在现代思考者-说话者设计中,输出端已经类似于 TLM。更根本的困难是,与 TLM 不同,SLM 必须直接从语音表征中推断语言内容和副语言线索,而这些表征通常未能以 LLM 可以充分利用的形式呈现\[59\](https://arxiv.org/html/2605.05927#bib.bib37),\[70\](https://arxiv.org/html/2605.05927#bib.bib67)。
受此观点启发,我们提出通过使语音 LLM 的行为尽可能接近**感知韵律的文本 LLM**,从输入端最小化模态差距。核心理念很简单:如果现代 SLM 的输出端已经在向文本式生成收敛,那么输入端也应该为骨干网络提供一种既兼容 TLM 又保留韵律的表征。我们不再纯粹将语音视为必须压缩为单一潜在流的声学信号,而是明确分离并保留口语输入的两个互补方面:**说了什么**(what is said)和**怎么说**(how it is said)。
为了实现这一点,我们提出了 TextPro-SLM,它由两个关键组件组成:
1. **语音编码器**。我们引入了 WhisperPro,一种基于 Whisper 的统一语音编码器,它产生两种输出:捕捉话语内容的文本 token 和编码副语言信息(如说话风格、情绪和说话者音色)的**韵律嵌入**(Prosody embeddings)。WhisperPro 被训练以支持准确的转录和丰富的韵律表征学习,因此下游 LLM 接收到更丰富且更兼容 TLM 的输入语音视图。
2. **LLM 骨干**。我们通过两个耦合的目标训练 LLM 骨干:保留原始 TLM 的语义能力并学习理解副语言。具体来说,我们通过知识蒸馏保留底层 TLM 的语义智能,同时在副语言理解任务上联合优化模型。这样,语言含义和副语言信息都可以传播通过模型,产生一个端到端的 SLM,它在保持语义强大的同时也能解读话语的韵律。
**图 1** (https://arxiv.org/html/2605.05927#S1.F1) 比较了 TextPro-SLM 的架构设计与先前的解决方案。实验结果表明,我们的方法不仅在与比较的方法中实现了最低的模态差距,而且在副语言理解任务上也取得了具有竞争力的性能,同时保持了极高的**数据效率**,LLM 训练仅需约 1,000 小时的音频数据。我们将这种效率归因于我们的设计比先前的 SLM 架构更接近底层 TLM 的原始运行状态,使得从文本到语音的适应更加直接且不那么依赖大量数据。总体而言,我们的结果表明,通往更强语音 LLM 的有效途径是将其转变为感知韵律的文本 LLM。
## 2 相关工作
### 2.1 语音大语言模型
SLMs 旨在实现无缝的语音对话交互\[19\](https://arxiv.org/html/2605.05927#bib.bib1)。典型的 SLM 由三个主要组件组成:1)将输入波形转换为语音表征的语音编码器,通常是连续语音嵌入\[62\](https://arxiv.org/html/2605.05927#bib.bib23),\[61\](https://arxiv.org/html/2605.05927#bib.bib24)或离散语音 token\[4\](https://arxiv.org/html/2605.05927#bib.bib25),\[15\](https://arxiv.org/html/2605.05927#bib.bib26),\[34\](https://arxiv.org/html/2605.05927#bib.bib27);2)处理这些表征并生成输出的 LLM 骨干,输出可能是文本 token\[61\](https://arxiv.org/html/2605.05927#bib.bib24)、语音 token\[30\](https://arxiv.org/html/2605.05927#bib.bib14)或两者皆有\[67\](https://arxiv.org/html/2605.05927#bib.bib12);以及 3)将模型输出合成为语音响应的语音解码器。
早期的 SLM 仅在语音数据上进行训练,通常将语音表示为完全离散的 token\[41\](https://arxiv.org/html/2605.05927#bib.bib16)。后来的工作表明,利用预训练的 TLM 作为骨干可以在语音任务上带来显著更强的性能\[30\](https://arxiv.org/html/2605.05927#bib.bib14)。自此,从 TLM 检查点构建 SLM 已成为标准做法,大量研究集中在利用自动语音识别(ASR)、文本到语音合成(TTS)或交错语音-文本训练数据\[47\](https://arxiv.org/html/2605.05927#bib.bib15),\[67\](https://arxiv.org/html/2605.05927#bib.bib12),\[22\](https://arxiv.org/html/2605.05927#bib.bib28)进行显式的语音-文本对齐。
根据提供给 LLM 的语音输入形式,最近的 SLM 可以大致分为两种架构范式:
1. **离散模型**:语音编码器产生离散语音 token,LLM 直接消耗这些 token 以生成文本 token、语音 token 或两者\[67\](https://arxiv.org/html/2605.05927#bib.bib12),\[43\](https://arxiv.org/html/2605.05927#bib.bib19)。
2. **连续模型**:语音编码器产生连续嵌入,然后通过投影器模块映射到 LLM 嵌入空间。此类模型通常采用思考者-说话者架构,其中思考者生成文本 token,独立的说话者根据思考者的隐藏状态生成语音\[62\](https://arxiv.org/html/2605.05927#bib.bib23),\[61\](https://arxiv.org/html/2605.05927#bib.bib24)。
我们的方法与这两种范式都不同,因为它向 LLM 提供文本 token 以及韵律嵌入,而不是让它从单一语音表征中推断语义和韵律信息。这种设计更好地保留了底层 TLM 的运行状态,有助于有效减少文本-语音模态差距。
### 2.2 文本-语音模态差距
如第 1 节 (https://arxiv.org/html/2605.05927#S1) 所述,最近的 SLM 架构主要通过改进输出端来缩小模态差距。在此,我们回顾明确研究这一差距以及试图减少它的现有工作,然后阐明我们的方法有何不同。
一些研究专注于理解差距本身。Hsu 等人\[33\](https://arxiv.org/html/2605.05927#bib.bib34)将其归因于较长的语音序列和语音中语义信息的稀疏性。Xiang 等人\[59\](https://arxiv.org/html/2605.05927#bib.bib37)在表征层面分析了这一差距,并表明语音和文本表征在方向上相似但在幅度上不同。其他研究旨在减少差距,主要通过改进训练。SALAD\[17\](https://arxiv.org/html/2605.05927#bib.bib13)和 Wang 等人\[57\](https://arxiv.org/html/2605.05927#bib.bib30)使用 Kullback-Leibler (KL) 散度将对语音输入的学生输出与对文本输入的教师输出对齐。X-OPD\[9\](https://arxiv.org/html/2605.05927#bib.bib35)和 CORD\[35\](https://arxiv.org/html/2605.05927#bib.bib31)通过策略蒸馏扩展了这一路线,而 Yang 等人\[64\](https://arxiv.org/html/2605.05927#bib.bib29)进行了更细粒度的逐层蒸馏。另一系列工作针对在语音数据上持续训练时的灾难性遗忘:DeepOmni\[51\](https://arxiv.org/html/2605.05927#bib.bib32)使用混合专家(Mixture-of-Experts)架构\[45\](https://arxiv.org/html/2605.05927#bib.bib39)来分离文本和语音专家,而 Hsiao 等人\[32\](https://arxiv.org/html/2605.05927#bib.bib33)指出经验回放是最有效的持续学习策略\[65\](https://arxiv.org/html/2605.05927#bib.bib40)。
然而,这些方法主要改进了优化和训练稳定性,而不是交互范式本身,我们认为后者是模态差距更根本的来源。
**图 2**: WhisperPro 和 TextPro-SLM 的模型架构。
## 3 方法论
我们最小化模态差距的方法有两个核心组件。第 3.1 节 (https://arxiv.org/html/2605.05927#S3.SS1) 介绍了我们的语音编码器 WhisperPro,第 3.2 节 (https://arxiv.org/html/2605.05927#S3.SS2) 介绍了感知韵律的 LLM 骨干。
### 3.1 WhisperPro:一种编码一切的 ASR 语音编码器
我们设计了一个既输出准确转录又输出丰富韵律嵌入的语音编码器。 broadly 来说,构建此类模型有三种方法:从 ASR 模型开始并添加副语言建模;从诸如神经音频编解码器等富含韵律的模型开始并添加转录能力;或者从头训练一个新模型以实现这两个目标。我们采用第一种策略,原因有二。首先,先前的研究表明,SLM 更多地依赖语义信息,而不是细粒度的声学细节\[7\](https://arxiv.org/html/2605.05927#bib.bib68),\[36\](https://arxiv.org/html/2605.05927#bib.bib73)。其次,强大的 ASR 模型通常在比编解码器模型大得多的数据集上进行训练。例如,Whisper-large-v3\[50\](https://arxiv.org/html/2605.05927#bib.bib41) 是在 680,000 小时的音频上训练的,而竞争性编解码器模型如 WavTokenizer\[38\](https://arxiv.org/html/2605.05927#bib.bib42) 仅需少至 585 小时的数据。因此,从强大的 ASR 骨干开始非常适合下游 LLM,并且需要显著更少的训练数据。
在实践中,我们选择 Whisper-large-v3\[50\](https://arxiv.org/html/2605.05927#bib.bib41),因为它具有强大的转录性能以及在多样化声学条件下的鲁棒性。这项任务的主要挑战在于,ASR 模型被训练为优先考虑词汇内容,而非韵律。为了将副语言信息注入表征空间,我们借用了编解码器模型背后的核心理念:通过重建保留声学细节。具体而言,我们使用 Whisper 作为编码器来产生文本 token 和对齐 token 的韵律嵌入,并附加一个额外的解码器,从这两个输出重建输入语音。这种设计鼓励编码器状态不仅保留说了什么,还保留怎么说。
**图 2** (https://arxiv.org/html/2605.05927#S2.F2) 说明了 WhisperPro 的整体架构。
**架构**。WhisperPro 的架构由两个模块组成:Whisper-large-v3 和 mel 重建器。设输入话语为波形 $\mathbf{x} \in \mathbb{R}^T$。我们首先遵循 Whisper 的标准预处理管道以获得 log-mel 频谱图 $\mathbf{M} \in \mathbb{R}^{F \times L}$。Whisper-large-v3 然后将 $\mathbf{M}$ 映射到转录和韵律嵌入。具体而言,Whisper 自回归地产生文本 token 序列 $\mathbf{y} = \mathrm{Whisper}(\mathbf{M}) = (y_1, \dots, y_N)$。
(1)
Whisper-large-v3 包含 32 层 Transformer 编码器和 32 层 Transformer 解码器。我们从第 16 层 Whisper 解码器中获取每个文本 token 的隐藏状态,作为 token 对齐的韵律嵌入,表示为 $\mathbf{P} = \mathrm{WhisperDec}^{(16)}(\mathbf{M}, \mathbf{y}) = (p_1, \dots, p_N) \in \mathbb{R}^{N \times d}$。
(2)
因为这些状态与生成的文本 token 对齐,WhisperPro 将语音表示为两个同步流,$\{(y_i,相似文章
你在说我的语言吗?关于多模态大语言模型中的口语遵循问题
本文解决了多模态大语言模型在ASR中的口语遵循问题,提出了一种软提示方法和新颖的度量标准来量化语言违规。它评估了三种缓解策略——零样本提示、监督微调和思维链推理——在多种语言上的效果,以提高转录保真度。
释放全双工语音模型中LLM的能力
提出Listen-Write-Speak (LWS),一种文本优先的三通道范式,允许单个自回归LLM持续监听、书写可见文本并实时说话,实现无需架构修改的全双工语音交互。
层次化声学-语义建模:全双工SLM的模态分离与语义一致性
本文介绍了Lychee-FD,一种原生端到端全双工口语语言模型,通过层次化参数分离策略缓解模态干扰,在语音智能和交互流畅性方面取得了显著提升。
基于SpeechLLM的流式语音转文本翻译
提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。
面向多模态情感分析的语义对齐结构抽象
本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。