对齐就是一切:面向通用音频-语言模型的无指令训练

arXiv cs.CL 论文

摘要

本文介绍了一种无指令的纯对齐方法,用于构建大型音频-语言模型,该方法通过冻结LLM和音频编码器,仅在自生成数据上训练一个轻量级投影器,实现了与传统多阶段流程相比更少数据下的竞争性性能。

arXiv:2608.18132v1 公告类型:新 摘要:多模态大型语言模型(MLLMs)通常通过多阶段流程构建,包括跨模态对齐、监督微调(SFT)和偏好优化。该流程假设将LLM适应到新模态需要大量的任务特定监督。然而,预训练的LLM已经具备强大的推理和指令跟随能力。随着LLM的快速发展,一个重要问题仍然存在:我们能否以最小的干预高效地将这些能力转移到新模态,并且仅通过对齐就足以构建多模态模型?我们引入了一种无指令的纯对齐大型音频-语言模型(LALM),该模型完全冻结音频编码器和LLM,仅学习一个轻量级投影器。借鉴AzeroS [1]的见解,我们在自生成数据构建的(音频,响应)对上进行训练,其中LLM将标题扩展为自由形式的响应,无需显式任务指令。在MMAU、MMAR、MMSU和MMAU-Pro上,我们的方法使用显著更少的数据匹配或超越了经过大量后处理的基线。通过保持LLM冻结,我们的模型保留了其原生的指令跟随能力,并可以无缝移植到不同模型世代。我们的结果表明,竞争性的MLLM仅通过对齐即可涌现,将多模态扩展简化为一个轻量级的投影器训练问题,该问题可泛化到不同模态,并快速适应每个新的LLM版本。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:05

# 对齐即所需:面向通用音频-语言模型的无指令训练

来源:https://arxiv.org/html/2608.18132

###### 摘要
多模态大型语言模型(MLLMs)通常通过包含跨模态对齐、监督微调(SFT)和偏好优化的多阶段流程构建。该流程假设,将LLM适配到新模态需要大量针对特定任务的监督。然而,预训练的LLM已经具备强大的推理和指令遵循能力。随着LLM的快速发展,一个重要问题仍然存在:我们能否以最小干预高效地将这些能力迁移到新的模态?仅通过对齐是否足以构建多模态模型?

我们引入了一种**无指令、仅对齐**的大型音频-语言模型(LALM),该模型保持音频编码器和LLM完全冻结,仅学习一个轻量级投影器。借鉴AZeroS[72]的思路,我们在**自生成数据构建**的(音频,响应)对上进行训练,其中LLM在没有明确任务指令的情况下将描述扩展为自由形式的响应。在MMAU、MMAR、MMSU和MMAU-Pro等基准测试中,我们的方法使用远少于传统方法的数据量,匹配甚至超越了经过大量后训练的基线模型。通过保持LLM冻结,我们的模型保留了其原生的指令遵循能力,并且可以无缝适配到不同的模型代际。我们的结果表明,仅通过对齐就能产生具有竞争力的MLLM,将多模态扩展简化为一个轻量级的投影器训练问题,该问题可跨模态泛化,并能快速适应每一个新发布的LLM。

## 1 引言
(请参见标题)
**图1:流程概览。** 左侧:自生成数据构建。虚线分隔了两种视角:左边是真实聆听过程,即人类听到音频并作出响应;右边是我们的生成替代方案。我们不收集人类响应,而是将配对的描述输入冻结的LLM,同样无需任何指令,得到响应 \(r = g(c)\)。因此,描述充当了音频的**语义替代物**,而响应 \(r\) 成为训练目标。右侧:无指令、仅对齐的训练。音频 \(x\) 通过冻结的编码器和可训练的投影器,进入同一个冻结的LLM,同样无需指令。此处的LLM与左侧使用的LLM相同。这种一致性确保了 \(r\) 与该LLM在给定描述替代物时可能产生的响应一致。因此,针对 \(r\) 使用交叉熵训练投影器,可以将音频表示与LLM自身的、基于描述的条件响应分布对齐,而不是与外部标注对齐。

在大规模文本语料库上预训练的大型语言模型(LLMs)已经展现出强大的推理、指令遵循和泛化能力。指令微调进一步将这些模型转变为一个*通用解码器*:一个能够以零样本方式遵循任意文本指令的单一模型。现代多模态大型语言模型(MLLMs)通过一种常见架构将此能力扩展到非文本模态:一个预训练的模态编码器、一个可学习的投影器和一个预训练的LLM。训练通常包括三个阶段:(1)跨模态对齐,(2)监督微调(SFT),和(3)偏好优化。大型音频-语言模型(LALMs)遵循相同的配方,从早期系统到涵盖语音、音乐和环境声音的近期大规模模型皆是如此。

在当前实践中,大部分性能提升归功于SFT和偏好优化,而跨模态对齐主要被视为一个初始化阶段。然而,这些后续阶段通过使LLM适应后训练的指令分布来提高任务性能。随着模型逐渐变得专门针对特定任务的监督,其原始的通用解码行为可能会逐渐削弱。此外,每一代新的LLM都需要在新骨干网上重新运行昂贵的后训练流程。这引出了一个简单的问题:*仅通过对齐是否足够?* 如果预训练的编码器已经捕获了音频信息,并且预训练的LLM已经知道如何遵循指令,那么多模态训练或许可以简化为高效连接两者,而不是重新训练任何一方。

在本文中,我们表明仅通过对齐确实足以构建具有竞争力的LALMs。我们的方法保持音频编码器和LLM完全冻结,仅训练一个轻量级的投影器。遵循Shao等人提出的**无指令**范式,我们在训练中完全移除了任务指令,迫使投影器直接将音频表示与LLM的潜在语义空间对齐。为了支持这种训练设置,我们基于Shao等人的**自生成数据构建**框架,将其从语音扩展到通用音频。我们不手动设计问答对或指令模板,而是将描述视为音频的**语义替代物**,并使用LLM自动将其扩展为自由形式的响应。生成的流程是全自动的,无需人工编写的指令、任务分类法或人工整理的监督。

我们的研究得出三个主要发现。首先,无指令、仅对齐的训练泛化能力出奇地好,在MMAU、MMAR、MMSU和MMAU-Pro上匹配甚至超越了经过大量后训练的LALMs,同时使用了远少于它们的数据量。其次,由于LLM本身保持冻结,其预训练的指令遵循能力得以保留,这使其在开源LALMs的MMAU-Pro指令遵循子集上取得了最先进的性能。第三,可达性能受编码器信息量和LLM能力的共同制约。扩展对齐数据主要有益于需要更丰富开放式推理的任务,而一旦编码器的局限性占据主导,闭集识别性能会很快饱和。饱和点本身取决于数据覆盖范围和多样性,它们决定了对齐在多大程度上接近这个理论界限。通过测试不同的编码器,在每个基准测试上表现最佳的模型始终与编码器预训练期间所强调的能力相关。而通过测试不同的LLMs,该方法在匹配生成器条件下能够清晰地跨模型代际迁移。最后,我们证实了我们的方法并不严格依赖于每个样本的密集合成描述;相反,当在多样化的数据集上聚合时,简单的开源描述就足够了。

##### 贡献
首先,我们提出了一种**无指令、仅对齐**的LALM,它在MMAU、MMAR、MMSU和MMAU-Pro上使用远少于传统方法的数据量,匹配甚至超越了经过大量后训练的基线模型。其次,我们证明了具有竞争力的多模态指令遵循能力可以从冻结的编码器和冻结的LLMs中涌现,无需SFT或偏好优化。第三,我们将Shao等人提出的**自生成数据构建**框架从语音扩展到通用音频,实现了一个无需人工整理的问答对、任务模板或指令分类法的全自动训练流程。第四,我们提供了广泛的编码器和LLM消融实验,表明性能受编码器表示和LLM能力的共同制约,而非仅仅取决于数据扩展。我们已发布代码、数据集和模型权重,以支持未来对仅对齐音频-语言建模的研究。

## 2 相关工作
### 2.1 多模态对齐与指令微调
多模态大型语言模型(MLLMs)的发展建立了一个强大的两阶段范式:初始模态对齐,随后是特定任务的指令微调(TSIT)。近期的方法通过基于人类反馈的强化学习(RLHF)与人类意图对齐模型响应,而直接偏好优化(DPO)提供了一种更直接的替代方案。该范式已被广泛应用于音频领域,以构建大型音频-语言模型(LALMs)。早期的工作,如Qwen-Audio和Qwen2-Audio,利用分层标签或自然语言提示来统一ASR、声音事件检测和音乐分析等多样任务。类似地,SALMONN和WavLLM采用双编码器架构和大规模TSIT数据集,以在预定义的音频任务上实现具有竞争力的性能。然而,这些模型往往表现出一种**指令诱导的偏差**,即它们过拟合于训练提示和任务格式的分布,导致其响应反映了特定的模板,而非底层的输入信号。在音频领域,这种偏差常常表现为倾向于默认进行ASR风格的转录,即使是对于非语音输入。

为了克服TSIT的局限性,近期研究转向利用预训练LLMs固有的泛化能力,而不是依赖于显式的特定任务监督。AudioChatLLaMA通过强制LLM在不同模态间保持一致的响应来对齐语音和文本,而BLSP通过基于续写的目标实现了类似的对齐。为了纳入更丰富的声学信息,DeSTA2和DeSTA2.5引入了基于描述的训练,其中冻结的LLM通过结合转录和副语言元数据来生成合成目标。基于这一方向,Shao等人在语音领域形式化了一种无指令训练范式,以减轻模板依赖性。

### 2.2 音频表示学习
音频表示学习旨在构建能够支持多种音频理解任务的通用模型,大致可分为三种范式。特定任务的监督学习为音频事件分类、语音识别和说话人识别产生了强大的编码器,但固有地受限于预定义的标签空间。自监督学习(SSL)通过利用大规模无标签数据提高了泛化能力,尽管大多数模型仍然专用于特定领域。音频-语言预训练(ALP)通过将音频与文本对齐来学习更丰富的语义特征,通常采用对比或生成目标。然而,现有方法往往受限于有限的任务覆盖范围和较弱的描述监督。近期的工作通过扩展到全频谱音频和改进描述质量来解决这些问题,例如CaptionStew,它涵盖了语音、音乐和环境声音,以及由描述生成器提供的详细自然语言描述标注。

在本工作中,我们在五个来自这些不同范式的冻结编码器上评估了我们的无指令、仅对齐训练。这确保了我们的发现对于不同表示空间固有的多样化归纳偏差是稳健的。

## 3 方法
### 3.1 动机与问题设定
预训练的LLM已经能够遵循任意的文本指令。因此,将其适配到新模态并非关于教授新任务;而是关于呈现LLM已经能够解释的、特定于模态的输入。标准的MLLM流程间接地追求这一目标,在(多模态信号,指令,响应)三元组上端到端地训练整个系统。针对特定指令的优化会将编码器塑造成任务相关的特征,并更新LLM的参数,从而侵蚀了其开始时就具备的**通用解码器**行为。由此产生的系统能力范围受限于指令语料库,而非组件本身。

在本文中,我们保持编码器和LLM都冻结,仅训练一个投影器,将音频映射到LLM的输入嵌入空间。编码器的音频表示和LLM的指令遵循能力已经学好;投影器的任务是将它们连接起来,而不是重新训练任何一方。我们使用

相似文章

EchoDistill: 对齐噪声到干净的自蒸馏用于鲁棒音频大语言模型

arXiv cs.CL

EchoDistill 是一种基于对齐的噪声到干净的自蒸馏框架,通过使用冻结的干净音频教师模型,利用组相对策略优化 (GRPO) 指导学生模型,从而提高音频大语言模型 (ALLMs) 在现实噪声下的鲁棒性。实验表明,在强噪声下,该方法显著提升了语义可靠性和任务性能,且无需额外推理成本。

我们的对齐研究方法

OpenAI Blog

OpenAI 阐述了他们的对齐研究方法,强调了强化学习从人类反馈 (RLHF) 作为他们用于对齐已部署语言模型(如 InstructGPT)的主要技术。他们讨论了以最少计算量实现相比大 100 倍模型的显著偏好,但承认当前的局限性,并提出了一项长期战略,即利用 AI 系统来加速人类无法单独实现的对齐研究。

LOPA:通过潜在序数原型对齐提升口语评估

arXiv cs.CL

本文介绍了LOPA,一个轻量级口语评估框架,它利用潜在序数原型对齐和语义锚定层路由(基于冻结的Whisper编码器),在不进行LLM微调的情况下,实现了与十亿参数模型相当的性能。