SiGMA: 面向多模态持续指令微调的符号引导合并与适应
摘要
SiGMA 提出了在训练阶段的符号引导自适应微调以及在推理阶段的符号引导合并,以减轻多模态持续指令微调中的负面干扰,在 UCIT 和 DCL 基准测试上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/07/24 05:04
# SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning 来源: https://arxiv.org/html/2607.20511 机构: Seoul National University 邮箱: [email protected], [email protected] ###### 摘要 多模态持续指令微调(MCIT)对于使多模态大语言模型(MLLMs)适应不断演变的下游任务序列至关重要。先前的方法大多采用专家混合(Mixture-of-Experts)或扩展-合并(expansion–merge)方法,主要关注灾难性遗忘,但在推理过程中仍然遭受负干扰,即新学习的更新会覆盖有用的先前知识并降低整体性能。为了解决这一问题,我们提出了SiGMA(符号导向合并与适应,Sign-Guided Merging and Adaptation),一个简单而有效的框架,通过两个组件来减轻负干扰:训练期间的符号导向自适应微调和推理期间的符号导向合并。符号导向自适应微调减少了与先前知识的冲突,以最小的漂移学习当前任务,减轻了严重遗忘。符号导向合并进一步通过选择性缩放显著参数来保留和放大有用的任务特定知识,从而改善整合。在UCIT和DCL基准上的实验表明,SiGMA显著减少了负干扰,并超越了最先进的MCIT方法。我们的代码可在SiGMA获取(https://github.com/pgh2874/SiGMA-Multimodal-Continaul-Instruction-Tuning)。 ## 1 引言 近年来,多模态大语言模型(MLLMs)[liu2023visual, chen2024internvl, achiam2023gpt, liu2024improved]因其强大的指令跟随能力和有效的视觉-语言对齐而备受关注,在多种任务上取得了令人瞩目的性能[lumathvista, tang2023vistext, li2024monkey]。MLLMs通常经历预训练后接指令微调的训练过程:预训练学习视觉-文本对齐的表示,而指令微调使模型能够遵循用户指令生成响应。这种训练使得模型对未见指令具备零样本能力。然而,这种零样本能力往往无法满足特定领域的需求,因此需要额外的指令微调来使MLLMs适应下游任务。 多模态持续指令微调(MCIT)[guo-etal-2025-hide, zeng2025modalprompt, wang2023orthogonal, chen2024coin, huai2025cl]使MLLMs能够在保留已学知识的同时持续获取新知识。MCIT中一个关键的挑战是灾难性遗忘[mccloskey1989catastrophic],即学习新任务会显著降低对先前学习任务的性能。在MLLMs的背景下,灾难性遗忘可表现为先前习得的表示知识丢失,以及指令跟随能力下降。结果,模型可能生成内容不正确的响应,并无法遵循用户指定的约束。 传统的MCIT方法通常依赖LoRA[hu2022lora]来使MLLMs适应新任务,同时保留已学知识。大多数先前的工作通过专家混合(MoE)[chen2024coin, huai2025cl]或扩展-合并策略[guo-etal-2025-hide, wang2023orthogonal]来缓解灾难性遗忘。MoE将学到的知识分布到多个专家以减少遗忘,而扩展-合并策略则为每个任务训练一个任务特定的LoRA,训练后冻结,并在推理时合并已学习的LoRA以整合任务特定知识。如图1所示,尽管这些方法在缓解遗忘方面有效,但两者仍易受负干扰的影响[aljundi2019online],其中新学到的知识可能覆盖早期知识,并在整个持续学习过程中降低综合性能。因此,除了防止灾难性遗忘之外,减轻负干扰对于稳健的MCIT至关重要。  基于此,我们提出了SiGMA(符号导向合并与适应)框架,它结合了两种简单而有效的策略:训练期间的符号导向自适应微调和推理期间的符号导向合并。SiGMA的核心思想是基于参数的符号模式将LoRA权重解耦为通用(任务不变)和特定(任务变化)子空间。根据我们的经验观察,跨任务共享相同符号的参数可视为通用子空间,而符号不同的参数则可视为特定子空间。在训练期间,符号导向自适应微调减少与已学知识的冲突,通过利用预训练MLLM和历史通用子空间来适应当前LoRA权重,鼓励以最小漂移进行任务学习。在推理时,符号导向合并通过从特定子空间中选择显著参数并对其进行缩放以增强有用的任务特定知识,从而整合多个LoRA权重。通过这种双重策略,SiGMA通过显式处理负干扰来减轻持续指令微调过程中的性能下降。由于负干扰发生在合并已学权重的过程中,仅仅保持先前知识完整无缺无法解决这种干扰。如图1所示,所提出的SiGMA在有效保留先前习得表示知识的同时,在减轻因负干扰导致的性能下降方面取得了显著改进。 最后,我们的贡献总结如下: - • 我们提出了SiGMA,一个简单而有效的符号解耦框架,旨在减轻持续指令微调中的负干扰。据我们所知,这是首个在持续指令微调中引入基于符号的权重解耦思想的工作。 - • 在训练期间,符号导向自适应微调通过将当前LoRA权重适应到通用子空间来减少知识冲突,以最小的先验知识漂移获取新表示。 - • 在推理时,符号导向合并选择性地放大特定子空间中的关键参数,以保留其有用知识,同时减少负干扰的影响。 - • SiGMA在UCIT(未见持续指令微调)[guo-etal-2025-hide]和DCL(领域持续学习)[zhao2025mllm]基准上达到了最先进的结果,并通过广泛的消融研究和深入分析实验进一步验证了其有效性。 ## 2 相关工作 #### 2.0.1 多模态大语言模型。 指令微调对于使大语言模型[touvron2023llama, Jiang2023Mistral7]与不同情境下的人类意图对齐至关重要。最近的视觉指令微调[liu2023visual, liu2024improved]通过结合视觉和文本输入进行视觉-语言推理,将这一能力扩展到了多模态大语言模型(MLLMs)[dai2023instructblip, Qwen-VL, zhu2023minigpt]。然而,大多数MLLMs是以离线且静态的方式训练的。这阻止了MLLMs适应现实世界任务的非平稳性质和不断演化的用户需求。在这项工作中,我们研究多模态持续指令微调,旨在持续提升MLLMs的指令跟随能力,同时避免顺序适应中出现的严重遗忘。 #### 2.0.2 多模态持续指令微调。 多模态持续指令微调(MCIT)要求MLLMs在连续任务中持续遵循指令,同时保留先前学到的指令跟随能力。先前的MCIT方法主要依赖专家混合[jacobs1991adaptive, shazeer2017outrageously]或扩展-合并策略来适应新任务并保留旧任务:CoIN[chen2024coin]引入了包含八个数据集的MCIT基准,并提出了MoE-LoRA来缓解灾难性遗忘。CL-MoE[huai2025cl]采用双动量MoE来路由全局和局部专家。O-LoRA[wang2023orthogonal]利用正交子空间学习和正交损失。HiDE-LLaVA[guo-etal-2025-hide]采用任务特定扩展与任务通用融合。尽管现有方法可以缓解严重遗忘,但它们忽略了推理时整合过程中的负干扰,其中新学到的更新可能覆盖有用的先验知识。所提出的SiGMA旨在通过推理时的符号导向合并来减轻负干扰,并通过训练期间的符号导向自适应微调来缓解严重的参数漂移。  ## 3 方法论:SiGMA 我们首先形式化多模态持续指令微调(MCIT)问题,并介绍基础的LoRA流程(§3.1)。然后分析负干扰,它可以以符号冲突参数的形式被观察到(§3.2)。受此启发,我们引入基于符号的权重解耦,即SiGMA的核心机制(§3.3)。基于此,我们详细说明符号导向自适应微调,它利用先前学到的权重有效地使模型适应当前任务(§3.4)。最后,我们提出符号导向LoRA合并策略,它选择性地掩码和放大重要参数,以保留任务特定知识,同时最小化负干扰(§3.5)。图2显示了所提出的SiGMA的整体框架。 ### 3.1 预备知识 MCIT旨在从连续的数据流中学习,同时缓解灾难性遗忘。我们考虑一个由参数θ参数化的预训练MLLM,需要从T个任务的序列中学习。每个任务t∈{1,...,T}由数据集D_t = {(x_vis^t,i, x_ins^t,i, x_ans^t,i)}_(i=1)^(N_t)定义,其中N_t表示图像-文本配对样本的数量,x_vis, x_ins, x_ans分别表示输入图像、指令和答案的token。给定一个图像-文本输入对和目标答案(长度为L),模型以自回归方式预测下一个token,使用标准目标函数: L_t = -∑_(l=1)^L log p(x_ans^l | x_vis^t, x_ins^t, x_ans^<l; θ_t) 其中θ_t是在任务t上微调后的模型参数。在持续学习设置中,每个数据集D_t只能按顺序访问一次,并且必须在任务t结束时丢弃。为了防止灾难性遗忘,现有的MCIT方法通常使用LoRA,它冻结预训练权重并学习可训练的秩分解矩阵。具体来说,对于预训练的权重矩阵W_θ ∈ ℝ^(d×k),LoRA将其更新ΔW表示为两个低秩矩阵B和A的乘积:ΔW = BA,其中B ∈ ℝ^(d×r), A ∈ ℝ^(r×k),且r远小于min(d,k)。因此,前向计算变为h = W_θ x + αΔW x,其中α是缩放因子。为了简单起见,在下文中我们用ΔW_t表示任务t训练后的LoRA权重。 ### 3.2 通过符号分析发现负干扰 负干扰发生在多个任务的新知识相互冲突并抑制有用先前知识时。为了分析这种干扰,我们研究了不同任务LoRA权重的符号模式。给定任务i和j的LoRA权重ΔW_i和ΔW_j,我们计算每个参数的符号一致性:sign(ΔW_i) = sign(ΔW_j)或sign(ΔW_i) ≠ sign(ΔW_j)。我们假设参数跨任务符号一致(共享相同符号)表示适用于多个任务的通用知识,而符号冲突(不同符号)表示任务特定知识。当合并具有冲突符号的权重时,方向相反的更新可能相互抵消,导致干扰和性能下降。基于这种直觉,我们提出将LoRA权重分离为两个子空间:通用子空间(跨任务符号一致)和特定子空间(符号冲突)。我们在附录中提供了支持此假设的实证分析。 ### 3.3 基于符号的权重解耦 基于上述动机,我们为每个任务t引入符号引导的权重解耦。对于任务t,我们定义通用子空间ΔW_t^g和特定子空间ΔW_t^s。我们使用前一个任务的权重ΔW_(t-1)作为参考来识别符号模式。对于任务t(t≥2),我们计算二元符号掩码M_t^g ∈ {0,1}^(d×k),其中如果sign(ΔW_t) = sign(ΔW_(t-1))则M_t^g的元素为1,否则为0。类似地,特定子空间的掩码M_t^s = 1 - M_t^g。然后,我们将解耦的权重定义为: ΔW_t^g = ΔW_t ⊙ M_t^g, ΔW_t^s = ΔW_t ⊙ M_t^s 其中⊙表示逐元素乘法。 ### 3.4 符号导向自适应微调 在训练任务t期间,我们使用符号导向自适应微调来从先前的任务中传递通用知识,同时适应特定任务的新知识。具体来说,我们使用任务1(作为锚点)的通用子空间和任务t-1的通用子空间来初始化当前任务的部分权重。设ΔW_1^g为锚点任务的通用子空间。在任务t的训练开始时,我们将LoRA权重ΔW_t初始化为: ΔW_t^(init) = ΔW_(t-1)^g + η · ΔW_1^g 其中η是一个缩放因子,用于控制先验知识的影响。然后,我们使用标准LoRA训练来优化ΔW_t,但添加了一个正则化项,以惩罚与锚点通用子空间的显著偏离。损失函数为: L_t = L_CE + β · ||ΔW_t - ΔW_1^g||_F^2 其中L_CE是交叉熵语言建模损失,β是正则化系数,||·||_F表示Frobenius范数。这鼓励模型在融入新任务知识的同时,保持通用知识不变。 ### 3.5 符号导向LoRA合并 在推理时,我们合并所有已训练的LoRA权重,以整合多个任务的知识。我们提出符号导向合并,它选择性地从特定子空间中缩放显著参数,以增强有用知识,同时抑制干扰。给定任务k(k≥2)的特定子空间ΔW_k^s,我们根据其与锚点权重的相对幅度计算一个缩放因子。对于每个参数,如果其绝对值大于锚点权重的λ倍,则将其视为显著参数。形式化地: ΔW_k^s = ΔW_k ⊙ M_k_s^hat, 其中 M_k_s^hat = M_k^s ∧ 𝕀(|ΔW_k| > λ|ΔW_1|) 这里λ是一个温度因子,M_k_s^hat是选择的二元掩码。然后,我们将所有训练的LoRA权重与预训练权重W_θ统一。最终的权重合并变为: W' = W_θ + ΔW_1 + ∑_(k=2)^t (ΔW_k^g + d_k ΔW_k^s) 其中d_k是任务k的缩放系数。总之,我们在任务特定权重中识别显著参数,并根据它们相对于锚点权重的特定程度进行缩放。通过抑制不重要权重的整合,同时放大关键任务特定权重,所提出的合并策略有效地最小化了权重整合过程中的干扰。我们在附录中总结了SiGMA的完整算法。 表1: 在UCIT(上)和DCL(下)基准上,与近期方法在Last、Avg. All和Forgetting指标上的比较。最佳和第二佳结果分别用粗体和下划线标出。 ## 4 实验 我们证明SiGMA能有效减轻负干扰,从而在各种基准上提升MCIT的性能。 ### 4.1 实验设置 #### 4.1.1 MCIT基准。 我们在两个基准上评估SiGMA:(1) UCIT(未见持续指令微调)[guo-etal-2025-hide]包含六个指令微调数据集:ImageNet-R[hendrycks2021many], ArixivQA[li2024multimodal], Vizwiz[gurari2018vizwiz], IconQA[lu2021iconqa], CLEVR-math[lindstrom2022clevr], 和Flicker30k[plummer2015flickr30k]。这些数据集因其对LLaVA的零样本性能较弱而被选中,并经过筛选以避免与LLaVA的预训练数据重叠,从而最小化信息泄露。(2) DCL(领域持续学习)[zhao2025mllm]可以测试模型在多个领域上顺序训练的性能,包括遥感[lobry2020rsvqa]、医学[he2020pathvqa]、自动驾驶[sima2024drivelm]、科学[kembhavi2016diagram, guo2025sciverse, chang2022mapqa, kembhavi2017you]和金融[wang2023finvis, zhao2025mllm]。DCL基准中的严重领域偏移通常会导致强烈的跨领域干扰和显著的遗忘。 #### 4.1.2 评估指标。 遵循标准的持续学习评估协议[wang2022learning, guo-etal-2025-hide],我们报告Last、Average和Forgets来评估性能。(1) Last是在最终任务训练后对每个先前见过任务测量的准确率。(2) Average以两种形式报告:Avg. All是所有任务最后准确率的平均值,Avg. Each是在最后一个任务之后立即评估的平均准确率。(3) Forgets是每个任务准确率的平均下降,定义为其训练后立即的准确率与其在最终任务后的最终准确率之间的差值。简而言之,Avg. All、Avg. Each和Forgets分别反映了持续学习中的整体知识保留、学习新任务的能力以及灾难性遗忘的程度。 #### 4.1.3 实现细节。 我们在所有实验中使用LLaVA-v1.5-7B[liu2024improved]作为骨干模型。遵循LLaVA的LoRA微调设置,我们将LoRA插入语言模型的线性层,低秩设为16。我们将所提出的符号导向自适应微调应用于除用于下一个token生成的最终输出层之外的所有层。对于符号导向LoRA合并,我们设置温度λ=0.8。我们在UCIT和DCL基准上为所有方法设置批量大小为32和8。所有实验在RTX A6000 GPU上运行。 ### 4.2 主要结果 我们将SiGMA与最先进的基于LoRA的持续指令微调基线进行比较,如LoRA-FT[hu2022lora]、O-LoRA[wang2023orthogonal]、MoE LoRA[chen2024coin]、CL-MoE[huai2025cl]、Hide-LLaVA[guo-etal-2025-hide]和DISCO[guo2025federated],在UCIT和DCL基准上。如表1所示,SiGMA取得了最佳的Avg. All和F目标。
相似文章
利用自监督指南提升视觉指令调优
本文提出通过将自监督任务表达为自然语言指令,增强多模态语言模型中的视觉指令调优,从而在不增加架构或标注的情况下提升以视觉为中心的推理能力。通过将经典的自监督预文本任务(如旋转预测、颜色匹配和跨视角对应)重构为图像-指令-响应对,该方法仅需在训练数据中注入3%-10%的视觉化指令,便能在多个基准测试中实现一致的性能提升。
统一多模态模型的语义生成微调
介绍了语义生成微调(SGT),一种利用图像分割作为生成代理来对齐统一多模态模型中的视觉理解和生成任务的范式,从而提升理解能力和生成保真度。
去中心化指令微调:冲突感知拆分与权重合并
MERIT 引入了冲突感知拆分和权重合并,用于去中心化指令微调,实现了无需跨分区梯度同步的性能提升。
SemiAdapt-Instruct: Extensible Instruction Tuning via Latent Domain-Specialised Adapters
SemiAdapt-Instruct proposes a modular framework that discovers latent instruction domains, trains per-domain LoRA adapters in parallel, and routes among them without extra parameters, enabling extensible instruction tuning where new domains require only single-adapter updates instead of full retraining.
MIITA:内存诱导的推理时自适应——用于小语言模型的持续学习
MIITA是一个内存诱导的推理时自适应框架,专为小语言模型的持续学习设计。它存储修正方向原型,并在推理时应用门控隐藏状态自适应,从而在不更新主干参数的情况下缓解灾难性遗忘。