跨模态技能注入研究:场景、方法与超参数
摘要
本文系统研究了跨模态技能注入,将领域专家大语言模型融入视觉语言模型以激发新兴多模态能力。评估了不同场景(指令遵循、跨语言、数学推理)、融合方法(TA、DARE等)及超参数,发现TA和DARE在除数学推理外表现良好。
查看缓存全文
缓存时间: 2026/05/20 08:25
# 探究跨模态技能注入:场景、方法及超参数 Zhiyu Xu1, Lean Wang1, Yuanxin Liu1, Lei Li3, Hao Zhou2, Fandong Meng2, Jie Zhou2, Xu Sun1 1多媒体信息处理国家重点实验室,计算机学院,北京大学 2WeChat AI,腾讯公司,中国 3香港大学 [email protected], [email protected], [email protected], [email protected], {tuxzhou, fandongmeng, withtomzhou}@tencent.com [email protected] ###### 摘要 视觉-语言模型(VLMs)在多模态通用理解方面展现了卓越的能力,但在高效获取不断演进的领域特定技能方面仍面临挑战。传统的增强VLM能力的方法,如监督微调(SFT),需要大量数据集构建和大量计算资源。模型合并作为一种高效的替代方案应运而生,它能够将大语言模型(LLMs)的领域专业知识迁移到VLMs,而无需额外训练数据或显著的计算开销。与主要聚合现有能力的同质LLM合并不同,跨模态技能注入旨在通过将领域专家LLM集成到VLM中,诱导出新的跨模态能力。然而,现有研究缺乏对跨模态技能注入的适用性和方法的系统分析。本研究从三个方面探究跨模态技能注入:场景、方法和超参数。在场景方面,我们发现跨模态技能注入通常能很好地处理指令跟踪和跨语言场景,但在数学推理方面仍存在困难。在方法方面,我们发现经典方法如TA和DARE在合并方法中始终表现更优。我们还对这些经典方法关键依赖的超参数调优进行了系统且定量的分析。 # 探究跨模态技能注入:场景、方法及超参数 Zhiyu Xu1, Lean Wang1, Yuanxin Liu1, Lei Li3, Hao Zhou2, Fandong Meng2, Jie Zhou2, Xu Sun1 1多媒体信息处理国家重点实验室,计算机学院,北京大学 2WeChat AI,腾讯公司,中国 3香港大学 [email protected], [email protected], [email protected], [email protected], {tuxzhou, fandongmeng, withtomzhou}@tencent.com [email protected] ## 1 引言 视觉-语言模型(VLMs)因其联合处理和理解视觉与文本信息的能力而受到越来越多的关注(Alayracet al. 2022 (https://arxiv.org/html/2605.19523#bib.bib12);Li et al. 2023b (https://arxiv.org/html/2605.19523#bib.bib11);Liu et al. 2024a (https://arxiv.org/html/2605.19523#bib.bib10))。尽管通用的表现很强,VLMs在专门任务上仍然受限,例如视觉数学推理和多语言理解(Lu et al. 2024a (https://arxiv.org/html/2605.19523#bib.bib13);Zhang et al. 2024a (https://arxiv.org/html/2605.19523#bib.bib17))。在专门的多模态数据集上进行微调虽然是增强领域特定能力的常见策略,但面临显著挑战(Guo et al. 2025 (https://arxiv.org/html/2605.19523#bib.bib41);Srinivasan et al. 2021 (https://arxiv.org/html/2605.19523#bib.bib42))。首先,微调VLMs需要大量的计算资源。尽管参数高效微调(PEFT)方法(如LoRA和QLoRA)已有效缓解了计算成本(Hu et al. 2022 (https://arxiv.org/html/2605.19523#bib.bib8);Dettmers et al. 2023 (https://arxiv.org/html/2605.19523#bib.bib9)),但获取足够的高质量训练数据仍然是持续的瓶颈。专门任务的高质量视觉数据集非常稀缺,因此需要费力地构建平衡的数据集,同时考虑数据混合比例和领域覆盖等因素(Li et al. 2025b (https://arxiv.org/html/2605.19523#bib.bib40))。模型合并为将专家能力整合到VLMs中提供了一种有前途的替代方案,无需广泛的数据集构建或额外的重新训练(Ilharco et al. 2023 (https://arxiv.org/html/2605.19523#bib.bib24);Yadav et al. 2023 (https://arxiv.org/html/2605.19523#bib.bib23);Yu et al. 2024 (https://arxiv.org/html/2605.19523#bib.bib22))。然而,为同质模型开发的合并指南可能不适用于跨模态技能注入。首先,跨模态技能注入是非对称的:它不是对称地组合对等模型,而是将领域专家LLM集成到VLM主干中。其次,同质合并通常旨在聚合现有专业知识,而跨模态技能注入则侧重于使新的跨模态能力得以涌现。例如,将数学专家与VLM合并可能会产生视觉数学推理能力,如解决几何问题,而这是两个模型之前都不具备的。尽管跨模态技能注入潜力巨大,但尚未得到充分探索。为了建立跨模态技能注入的全面指南,我们从三个主要方面系统地研究了将专家LLM能力迁移到VLMs:场景、方法和超参数。  图1:我们工作的概述,探究了跨模态技能注入的三个维度:场景(语言能力、数学、指令跟踪)、方法(经典合并、数据感知合并、无调优合并)和超参数。我们的发现表明,经典方法始终优于替代方法,语言和指令跟踪能力比数学推理更容易迁移,我们还提供了超参数优化景观的定量分析。 对于场景,我们研究了三种不同的设置:语言能力、数学推理和指令跟踪。我们在六个基准测试上的广泛实验表明,VLMs能够成功地从专家LLM继承语言能力和指令跟踪场景中的专门能力。然而,我们观察到迁移数学推理比迁移语言或指令跟踪能力更具挑战性。对于方法,我们评估了三类模型合并方法。我们的结果表明,经典合并方法始终产生更优的性能。某些无调优方法也展现出令人惊讶的有竞争力性能;例如,NaNSi et al. (2025 (https://arxiv.org/html/2605.19523#bib.bib26)) 取得了第二好的整体结果。对于超参数,由于超参数调优对于经典方法至关重要,并且构成了其主要实际成本,我们进行了超参数景观的全面分析。搜索空间维度低但呈现轻微的多峰性。我们的分析确定GP-BO(Jones et al. 1998 (https://arxiv.org/html/2605.19523#bib.bib63))为最有效的优化器,而局部定向搜索方法虽然在性能上有竞争力,但更容易陷入局部最优。我们的主要贡献如下: - 场景分析。我们系统地研究了跨模态技能注入的三个代表性场景:语言能力、数学推理和指令跟踪,为哪些场景更适合跨模态技能迁移提供了见解。 - 方法比较。我们对来自三个类别(经典、数据感知和无调优)的九种合并方法在六个基准测试上进行了全面评估,提供了基于可用资源的实际方法选择指南。 - 超参数分析。我们提供了经典合并方法中超参数优化景观的定量分析,比较了不同优化策略的有效性。 ## 2 预备知识 ### 2.1 模型合并方法 模型合并与任务向量(Ilharco et al. 2023 (https://arxiv.org/html/2605.19523#bib.bib24))的概念密切相关,它将微调引起的参数变化视为参数空间中的一个向量,可以编码任务特定的行为。形式上,任务向量 \(\tau\) 定义为微调后的专家LLM参数(\(\theta_{\text{finetuned}}\))与基座模型参数(\(\theta_{\text{base}}\))之差: \[ \tau = \theta_{\text{finetuned}} - \theta_{\text{base}} \tag{1} \] 任务算术通过将这些任务向量的线性组合添加到基座模型来构建合并模型: \[ \theta_{\text{merged}} = \theta_{\text{base}} + \sum_{i=1}^{n} \lambda_i \tau_i \tag{2} \] 其中 \(n\) 表示被合并的模型数量,\(\lambda_i\) 表示第 \(i\) 个任务向量的合并系数。 ##### 经典合并。线性组合任务向量以产生多技能模型的方法被称为任务算术(TA)(Ilharco et al. 2023 (https://arxiv.org/html/2605.19523#bib.bib24))。在本文中,我们称该方法及其变体(如TIES(Yadav et al. 2023 (https://arxiv.org/html/2605.19523#bib.bib23))和DARE(Yu et al. 2024 (https://arxiv.org/html/2605.19523#bib.bib22)))为经典合并,其特点是将任务向量(或其变体)与可调的合并系数相结合。除了模型系数,一些变体(Davari and Belilovsky 2024 (https://arxiv.org/html/2605.19523#bib.bib31);Deep et al. 2024 (https://arxiv.org/html/2605.19523#bib.bib32);Goddard et al. 2024 (https://arxiv.org/html/2605.19523#bib.bib33))引入了密度超参数来控制任务向量的稀疏性。例如,TIES-Merging(Yadav et al. 2023 (https://arxiv.org/html/2605.19523#bib.bib23))剪枝低幅度的更新并解决符号冲突,而DARE(Yu et al. 2024 (https://arxiv.org/html/2605.19523#bib.bib22))采用随机稀疏化后缩放。这些经典合并方法通常依赖在域内验证数据上的超参数调优来识别最优合并系数,以及在有些情况下的密度参数。最近的工作在两个方面改进了经典合并。 ##### 数据感知合并。这类工作利用来自每个模型能力领域的训练数据来优化合并过程。例如,Fisher Merging(Matena and Raffel 2022 (https://arxiv.org/html/2605.19523#bib.bib20))根据从经验Fisher信息中估计的任务特定重要性对参数进行加权,而RegMean(Jin et al. 2023 (https://arxiv.org/html/2605.19523#bib.bib21))通过闭式线性回归减少不同模型在各层中间表示的差异。直观上,通过引入辅助训练数据,这些方法利用了更丰富的信息,应该会产生更好的性能。然而,如我们在第3节(https://arxiv.org/html/2605.19523#S3)中所示,对于跨模态技能注入,数据感知方法带来的实证增益通常很小,这表明在跨模态场景中,从业者可以安全地放弃数据收集的开销而不会牺牲太多性能。 ##### 无调优合并。无调优方法直接从模型参数中推导出合并配方,避免了超参数调优和外部数据需求。一类工作通过子空间操作转换任务向量。WU(Cheng et al. 2025 (https://arxiv.org/html/2605.19523#bib.bib27))利用了线性层中任务向量大致 spanning 相应输入子空间的观察,并在该子空间中进行合并。TSV(Gargiulo et al. 2024 (https://arxiv.org/html/2605.19523#bib.bib28))从任务矩阵的SVD构建逐层低秩子空间,并在合并前对奇异方向进行去相关。另一类工作直接估计合并系数。MetaGPT(Zhou et al. 2024 (https://arxiv.org/html/2605.19523#bib.bib25))在局部线性和近似任务向量正交的假设下推导出闭式缩放系数,而NaNSi et al. (2025 (https://arxiv.org/html/2605.19523#bib.bib26)) 从参数逆范数估计系数。总体而言,这些方法是即插即用的,在数据访问受限或调优预算紧张时很有吸引力。 ### 2.2 跨模态技能注入 类似于LLM合并,可以将专家LLM合并到VLM的语言编码器主干中,以迁移专门能力,我们称之为跨模态技能注入。形式上,我们将跨模态技能注入定义如下:给定一个VLM,记为 \(\mathcal{M}_{vlm} = (\mathcal{E}_v, \mathcal{L}_{base})\),其中 \(\mathcal{E}_v\) 是视觉编码器,\(\mathcal{L}_{base}\) 是LLM主干,我们的目标是通过整合一个领域专家LLM \(\mathcal{L}_{exp}\),在不修改 \(\mathcal{E}_v\) 或对 \(\mathcal{M}_{vlm}\) 进行完全微调的情况下,赋予 \(\mathcal{M}_{vlm}\) 领域特定的专家能力。具体来说,我们旨在构建一个合并模型 \(\mathcal{M}_{merged} = (\mathcal{E}_v, f(\mathcal{L}_{base}, \mathcal{L}_{exp}))\),其中 \(f(\cdot)\) 表示融合主干和专家LLM参数的合并算法。 跨模态技能注入继承了LLM合并的核心优势:最小的训练开销、快速的领域特化、以及对大规模数据集的独立性。然而,它在功能不对称性方面与传统的同模态LLM合并有本质区别。在跨模态技能注入中,VLM提供视觉基础,而专家LLM贡献专门能力。传统的LLM合并则是组合具有类似角色的对等模型,主要目的是在共享模态内聚合和保留能力。跨模态技能注入不仅仅是结合现有技能,而是寻求诱发两个父模型单独都不具备的能力。这种能力是涌现的,因为注入的文本专业知识必须在视觉输入下可用,而不是停留在纯文本侧的能力。与同模态合并不同,后者组合的能力仍保留在单个表示空间内,跨模态技能注入需要视觉理解与文本专业知识之间的交互通过合并过程本身产生,从而产生跨模态能力。 由于跨模态技能注入旨在诱导仅通过专家知识与视觉理解之间的交互才能出现的能力,它面临超越传统同模态LLM合并的挑战。在诸如图像、法律文档分析和科学图形理解等专门视觉领域,用于验证的配对图像-文本数据通常稀缺或收集成本高昂,这对超参数调优施加了更严格的约束。此外,旨在协调对等模型之间冲突的合并方法在此设置中可能效果较差,因为LLM和VLM扮演非对称角色,而非在共享模态内贡献相当的能力。 ## 3 跨模态技能注入的场景与方法 | 方法 | CMMMU | JMMMU | MathVista(math) | MathVerse | MIA-Bench | WildVision | Avg | |------|-------|-------|-----------------|-----------|-----------|------------|-----| | Mistral LLaMA | Mistral LLaMA | Mistral LLaMA | Qwen2 Idefics2 | Qwen2 Idefics2 | | | | | TA | 25.0↑ | 2.4 | 42.1↑ | | | | | (注:表格内容不完整,原输入截断。按照原样保留,仅翻译表头顶部文字。但原文后面有完整表格吗?输入中只有 `TA25\.0↑\\uparrow2\.442\.1↑\\u`,可能被截断。我们只输出可见部分。) (由于输入在表格处中断,我们仅翻译可见文本。注意保持格式。)
相似文章
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
SkillLens:面向成本高效型大模型智能体的自适应多粒度技能复用
本文提出了 SkillLens,这是一种用于大模型智能体自适应多粒度技能复用的分层框架,在基准任务中展示了更高的准确性和成本效益。
技能自我对弈(Skill Self-Play):通过协同进化技能推动大语言模型能力前沿
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。
DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution
The paper introduces DIVE, a diversity-driven framework that enables frozen LLMs to self-improve by evolving persistent natural-language skills from task experience and verifier feedback, without parameter updates. It outperforms existing methods on math and logical reasoning tasks and transfers across model scales.