解锁语音-文本组合能力:无需指令微调的指令跟随语音语言模型
摘要
本文提出SpeechCombine,一种无需任何指令微调的指令跟随语音语言模型,仅通过语音预训练和一种权重组合策略,将文本大语言模型的能力迁移到语音领域。
arXiv:2607.02214v1 公告类型:新
摘要:语音语言模型(SLM)的指令微调比基于文本的大语言模型(LLM)要困难得多,因为它除了需要支持文本LLM已有的指令外,还需要学习新的模态以及大量语音特定的指令。现有的SLM训练方法大多通过合成大规模语音预训练和指令微调数据集来复制文本LLM的训练范式。然而,这种策略难以扩展,因为语音序列比文本序列长得多。在本文中,我们提出SpeechCombine,一种无需任何指令微调的指令跟随语音语言模型,仅需在3万小时数据上进行一轮语音预训练。我们从文本LLM基础模型开始,对语音话语进行持续预训练,得到语音适配模型,然后将其权重与文本LLM指令微调版本与基础版本之间的权重差直接结合。我们的结果表明,这种简单的组合策略不仅保留了原始文本LLM的知识和能力,而且有效地将其迁移到语音领域。这些发现为SLM训练提供了新的方向,避免了对大规模语音数据的依赖。
查看缓存全文
缓存时间: 2026/07/03 05:42
# 遵循指令的语音语言模型,无需指令微调 来源:https://arxiv.org/html/2607.02214 ## 解锁语音-文本组合能力:无需指令微调的指令遵循语音语言模型 ###### 摘要 语音语言模型(SLM)的指令微调比基于文本的大语言模型(LLM)困难得多,因为除了文本LLM已支持的指令外,SLM还需要学习新的模态和大量语音特有的指令。现有的SLM训练方法大多复制文本LLM的训练范式,通过合成大规模语音预训练和指令微调数据集来实现。然而,这种策略难以扩展,因为语音序列远长于文本序列。在本文中,我们提出**SpeechCombine**,一种无需任何指令微调、仅通过30k小时数据的一轮语音预训练即可训练的指令遵循语音语言模型。从文本LLM基础模型出发,我们对语音话语进行连续预训练得到语音适配模型,然后将其权重与文本LLM的指令微调版本和基础版本之间的权重差异直接结合。我们的结果表明,这种简单的组合策略不仅保留了原始文本LLM的知识和能力,还将其有效迁移到语音领域。这些发现为SLM训练指明了新方向,避免了对大规模语音数据的依赖。 机器学习,ICML ## 1 引言 大语言模型(LLM)的最新进展极大推动了语音语言模型(SLM)的发展。与文本LLM一样,SLM的关键能力之一是遵循**指令**。然而,与文本LLM不同,SLM必须处理更广泛的指令。具体而言,SLM指令可分为三类: - **文本导向指令**:包括标准文本LLM已能遵循的指令,如问答(QA)、推理和文章生成。关键区别在于,对于SLM,输入指令可以通过文本或语音传达,模型的响应也可以使用任一模态生成。 - **语音理解指令**:包括从输入语音话语中查询信息的指令,尤其是副语言属性(如情感或重音)。对于这些指令,输入必须包含语音,而输出可以是语音或文本。 - **语音生成指令**:包括需要在特定约束(如情感或重读词)下生成语音话语的指令。对于此类指令,输入要求可以通过语音或文本表达,但输出必须是语音。 总之,SLM中的指令遵循比文本LLM引入了两个额外的复杂层面。首先,SLM必须以新模态遵循与文本LLM相同的指令。其次,SLM必须处理文本LLM无法处理的、全新的语音特有指令。因此,SLM的指令微调远比文本LLM困难。 为了对SLM进行指令微调,现有方法大多复制文本LLM的训练流水线(Ding等人,2025)。通常,SLM首先在大规模语音语料上使用下一个词元预测目标进行预训练,然后在包含各种语音指令的数据集上通过监督微调(SFT)和/或强化学习(RL)进行微调(Ghosh等人,2026)。在其他范式中,仅执行语音指令微调(Zhang等人,2023)。训练数据集通常包含来自真实语音和/或从原本用于文本LLM训练的文本数据集中合成的语音的离散语音词元。 然而,这种范式受到**数据膨胀**问题的严重制约。例如,句子“How are you”在文本形式中不超过5个词元,而相应的语音话语通常持续约1秒,扩展到约60-200个语音词元(Wang等人,2025b),相对于文本增加了约20倍。¹ 这种膨胀使得扩展SLM训练的有效数据集大小变得极为困难。因此,与文本LLM训练相比,SLM训练必须用远少有效数据解决更困难的问题,这可能导致知识获取和指令遵循能力的妥协。更重要的是,尽管SLM训练通常从文本LLM初始化,但后续在大量语音词元上的训练可能导致严重的**灾难性遗忘**。结果,SLM训练的大部分精力用于重新学习原始文本LLM中的知识和技能,且通常以更难学习的语音表示进行。如果能更好地保留文本LLM的知识和能力,SLM训练就无需以如此大的规模进行。 一些努力(Wang等人,2024)试图通过冻结文本LLM并仅训练语音输入和输出的适配器来解决这个问题。然而,由此产生的SLM只能支持文本导向指令,而无法处理其他与语音相关的指令。总之,现有SLM训练范式在保留文本LLM知识和能力与获取新的语音特有技能之间存在固有权衡。这自然引出一个问题:**是否有可能同时实现这两个目标,从而构建更强大的SLM?** 在本文中,我们提出**SpeechCombine**,一个在所有三类指令上都具有强大指令遵循能力的SLM,其训练过程出奇地简单:无需迭代训练轮次,仅在30k小时语音数据上使用标准下一个词元预测目标进行**一轮预训练**。SpeechCombine背后的核心思想是直接将文本LLM的指令遵循能力迁移到新模态和新技能,受近期模型合并进展的启发(Huang等人,2024)。图1说明了基本思想。给定一个文本LLM基础模型及其指令微调版本,我们首先计算它们的参数差异,记为Δθinst(蓝色箭头),可解释为编码指令遵循能力的方向。再次从基础模型出发,我们对语音数据进行连续预训练,得到第二个权重差异Δθspeech(黑色箭头),捕捉语音模态知识。最后,通过将Δθinst移植到语音适配模型上(红色箭头)构建SpeechCombine,基于指令遵循能力可以泛化到语音领域的假设。本质上,我们的方法在参数空间中结合了语音适配方向Δθspeech和指令遵循方向Δθinst,因此得名SpeechCombine。 图1:SpeechCombine在权重空间中的示意图。 我们的实验表明,这种组合释放出惊人的组合效应,使模型能够遵循所有三类指令。遵循语音理解和生成指令的能力尤其引人注目,因为无论是Δθspeech还是Δθinst在训练中都没有接触过这些指令。此外,我们发现这种组合策略还将文本LLM的其他能力(如*长思考能力*)迁移到语音领域。这些发现为SLM训练开辟了新的可能性,摆脱当今世界中低效数据堆积的不必要磨难。 ## 2 相关工作 **语音语言模型**。SLM主要分为两类:原生多模态模型和模块对齐模型。原生多模态模型(Défossez等人,2024;Xie和Wu,2024;Chen等人,2025;Ding等人,2025;Zeng等人,2024;Geng等人,2025;Wu等人,2025;Xu等人,2025a;Ghosh等人,2026)采用大语言模型(LLM)作为核心推理主干,并通过音频编码器和语音解码器扩展至语音领域。相比之下,模块对齐模型(Shao等人,2025;Lu等人,2025;Wang等人,2024;Fathullah等人,2024;Kang等人,2024;Wang等人,2025a)冻结主干LLM,同时训练模态适配器以赋予LLM音频能力。这些方法要么需要大规模训练,要么局限于文本相关指令。现有方法通常依赖大规模音频指令微调数据,在规模上往往代价高昂。我们旨在弥合这一差距。 **表现性语音合成**。近期表现性TTS正从基于标签的控制转向开放词汇、自然语言指令来引导副语言属性。HiStyle(Zhang等人,2025)通过层次化风格预测器改进文本到风格的对齐,而ParaStyleTTS(Lou等人,2025)增强了无需参考音频的鲁棒副语言控制。OV-InstructTTS(Ren等人,2026)和FlexiVoice(Chen等人,2026)进一步强化了表现性/零样本场景下的指令遵循,后者利用偏好优化来解耦内容、音色和风格。超越单话语层面,DeepDubbing(Dai等人,2025)使用上下文InstructTTS实现一致的有声书叙述。 **语音词元化器**。语音词元化器可分为**离散**或**连续**词元化。近期离散词元化器强调低比特率和增强特征分解:TaDiCodec(Wang等人,2025b)采用文本感知扩散方法进行超低速率建模,而LongCat-Audio-Codec(Zhao等人,2025)提供了一个面向实际SLM的流式友好词元化器-反词元化器解决方案。为改进生成质量,DSA-Tokenizer(Zhao等人)通过层次化融合解耦语义和声学特征。或者,ProsodyLM(Qian等人,2025)将语音表示为转录文本并附加显式的词级韵律词元。近期一些工作(Yang等人,2025b;He等人,2025;Li等人,2025)探索**连续词元化**,旨在绕过量化固有的信息损失。 **模型合并**。模型合并旨在通过结合模型权重,在单一参数空间内整合多种能力。早期工作如Task Arithmetic(Ilharco等人,2022)和Model Soups(Wortsman等人,2022)表明,微调模型的简单线性组合可以产生鲁棒的多任务性能。后续研究包括Chat Vector(Huang等人,2024)、BILLY(Pai等人,2025)和Preference Vector(Liang等人,2025),进一步表明任务特定或对齐特定的行为可以表示为权重差异向量,并无需额外训练即可在模型间迁移。模型合并也被探索为缓解多模态适应中灾难性遗忘的策略(Chen等人,2025;Sokar等人,2025;Yu和Ananiadou,2025)。Fun-Audio-Chat(Chen等人,2025)在语音SLM中采用了模型合并思想,但未使用文本LLM基础模型,而研究表明基础模型能为模型合并提供更鲁棒的基础(Anonymous,2025)。 ## 3 方法 在本节中,我们描述SpeechCombine的训练方式。我们的目标是保留文本LLM的知识和指令遵循能力,同时教导模型遵循与语音相关的指令。 ### 3.1 SpeechCombine框架 图2:SpeechCombine框架和推理流水线。 图2展示了SpeechCombine的总体框架。语音输入首先由编码器模块转换为离散语音词元,然后输入LLM。LLM生成的输出(也以语音词元形式)随后由解码器转换回语音。本文中,我们仅专注于训练LLM模块。编码器和解码器使用预训练的开源系统实例化(第3.5节),并在训练过程中保持冻结。 第1节和图1已简要介绍了LLM模块的权重组合框架。此处,我们给出更正式的描述。令θbase和θinst分别表示文本LLM基础模型和指令模型的参数。从**基础模型**出发,我们在语音语料上进行连续预训练,得到参数θspeech。然后,我们在参数空间中定义两个方向: Δθinst = θinst - θbase, Δθspeech = θspeech - θbase. Δθinst和Δθspeech包含互补的能力:Δθinst编码指令遵循行为但不包含任何语音知识,而Δθspeech捕捉语音模态知识但缺乏遵循指
相似文章
重新思考语音-LLM集成用于ASR:通过交错实现有效的联合语音-文本训练
本文提出联合语音-文本交错预训练(JSTIP),这是一种预训练策略,通过构建词级和段级交错的语音-文本序列来提高ASR实体准确率并缩小语音与文本之间的模态差距,在领域自适应和零样本语音问答上展示了有竞争力的性能。
作为X,做Y:指令调优的LLM中角色与任务的结合方式
本文研究了指令调优的LLM如何在残差流中结合角色和任务规范,发现在答案形成阶段,这种结合近似可加,使得替换时KL散度极小,但该可加机制并不能解释完整的多token生成过程。
从输入端最小化模态差距:您的语音大语言模型可以成为具备韵律感知能力的文本大语言模型
提出了 TextPro-SLM,一种通过处理口语输入使其类似于具备韵律感知能力的文本来最小化模态差距的语音大语言模型,以少量的训练数据实现了强大的副语言理解能力。
无需训练的多概念LoRA组合:基于提示感知权重
本文提出了 W-Switch 和 W-Composite 两种无需训练的方法,用于在文本到图像生成中组合多个 LoRA 模块,通过基于提示感知的重要性加权来减少概念干扰。该方法在 ComposLoRA 测试平台上进行评估,在视觉质量和身份保持方面均持续优于现有最先进方法。
利用自监督指南提升视觉指令调优
本文提出通过将自监督任务表达为自然语言指令,增强多模态语言模型中的视觉指令调优,从而在不增加架构或标注的情况下提升以视觉为中心的推理能力。通过将经典的自监督预文本任务(如旋转预测、颜色匹配和跨视角对应)重构为图像-指令-响应对,该方法仅需在训练数据中注入3%-10%的视觉化指令,便能在多个基准测试中实现一致的性能提升。