模态解耦的在线递归编辑
摘要
提出M-ORE,一种模态解耦的在线递归编辑器,用于多模态大语言模型的终身适应,解决跨模态冲突和编辑间干扰,且每次编辑开销恒定。
arXiv:2605.20273v1 Announce Type: new
摘要:多模态大语言模型的在线模型编辑需要在严格的计算和内存预算下吸收一系列修正。然而,为纯文本LLM开发的编辑器在多模态大语言模型上往往表现不佳:视觉主导的激活会扭曲形成更新的统计数据,导致跨模态冲突,而顺序写入在共享编辑空间中变得纠缠,加剧了长时程干扰,导致编辑间干扰。为了解决这些问题,我们提出了M-ORE,一种用于多模态大语言模型终身适应的模态解耦在线递归编辑器。M-ORE源自统一邻近投影公式,并采用Sherman-Morrison递归实现闭式更新,从而保持每次编辑开销恒定。它维护文本栈和视觉投影器的模块级局部性统计,以避免视觉主导的更新塑造,并通过Sherman-Morrison递归在固定的正交低秩编辑子空间中进行持续更新,以减轻长时程干扰。在多个多模态大语言模型主干和在线编辑基准上的实验表明,我们的M-ORE方法在可靠性、通用性和局部性上持续优于强基线,同时实现了良好的质量-效率权衡。我们的代码公开在 https://github.com/lab-klc/M-ORE。
查看缓存全文
缓存时间: 2026/05/21 06:21
# 模态解耦的在线递归编辑 来源:https://arxiv.org/html/2605.20273 ###### 摘要 多模态大语言模型(MLLMs)的在线模型编辑需要在严格的计算和存储预算下吸收持续的修正流。然而,为纯文本LLM开发的编辑器在应用于MLLM时通常会退化:视觉主导的激活会扭曲用于形成更新的统计数据,导致**跨模态冲突**,而顺序写入会在共享的编辑空间中纠缠并放大长期间隔干扰,导致**编辑间干扰**。为了解决这些问题,我们提出了M-ORE,一种用于终身MLLM自适应的模态解耦在线递归编辑器。M-ORE源自统一的近端投影公式,并采用Sherman-Morrison递归实现了封闭形式的更新,保证了每编辑恒定的开销。它维护文本栈和视觉投影器的模块级局部性统计数据,以避免视觉主导的更新塑造,并通过Sherman-Morrison递归在固定的正交低秩编辑子空间中执行持续更新,以减轻长期间隔干扰。在多个MLLM骨干和在线编辑基准上的实验表明,我们的M-ORE方法在强基线之上持续提高了可靠性、通用性和局部性,同时实现了有利的质量-效率缩放。我们的代码公开在https://github.com/lab-klc/M-ORE。 机器学习,ICML
## 1 引言
大型语言模型(LLMs)已成为自然语言处理的基础(Touvron等,2023 (https://arxiv.org/html/2605.20273#bib.bib1);Zhao等,2023 (https://arxiv.org/html/2605.20273#bib.bib2))。最近的多模态大语言模型(MLLMs)通过视觉感知扩展了LLMs,并在视觉-语言任务上取得了强劲性能(Lin等,2024 (https://arxiv.org/html/2605.20273#bib.bib3);Zhu等,2026 (https://arxiv.org/html/2605.20273#bib.bib54);Liang等,2026 (https://arxiv.org/html/2605.20273#bib.bib55);Shi等,2026 (https://arxiv.org/html/2605.20273#bib.bib56);Lu等,2026 (https://arxiv.org/html/2605.20273#bib.bib57))。然而,它们的知识编码在参数中,因此在训练后保持静态,随着现实世界事实的演变,可靠性降低(Jiang等,2026 (https://arxiv.org/html/2605.20273#bib.bib58))。由于完全重新训练成本高昂,*模型编辑*通过以最小的参数变化更新知识,同时保留通用能力,提供了一种高效的替代方案(Meng等,2022 (https://arxiv.org/html/2605.20273#bib.bib6);Fang等,2025 (https://arxiv.org/html/2605.20273#bib.bib7))。参考图注 图1:M-ORE概览及其与现有在线MLLM编辑范式的对比。M-ORE解耦了视觉/文本更新,并在固定的正交低秩空间中执行持续写入。
最近模型编辑的研究主要集中于纯LLMs,并取得了显著成功(Mitchell等,2022a (https://arxiv.org/html/2605.20273#bib.bib18),b (https://arxiv.org/html/2605.20273#bib.bib11);Fang等,2025 (https://arxiv.org/html/2605.20273#bib.bib7))。然而,直接将面向文本的编辑器应用于MLLM通常是无效的:视觉模态及其与文本的耦合引入了明显的模态差异(Shi等,2025 (https://arxiv.org/html/2605.20273#bib.bib12);Chen等,2025b (https://arxiv.org/html/2605.20273#bib.bib5))。主流方法(例如,ROME和AlphaEdit (Meng等,2022 (https://arxiv.org/html/2605.20273#bib.bib6); Fang等,2025 (https://arxiv.org/html/2605.20273#bib.bib7)))通常优化一个全局目标,并隐含地假设输入表示具有相对同质的统计特性;然而在MLLMs中,视觉表示通常表现出更高的能量,从而主导了协方差的估计并引发**跨模态冲突**。此外,实际系统需要在下游修正流中进行**在线**编辑(Cao等,2026 (https://arxiv.org/html/2605.20273#bib.bib13)),其中参数修改方法会积累**编辑间干扰**并漂移(Li和Chu,2024 (https://arxiv.org/html/2605.20273#bib.bib15)),而参数保留方法则导致编辑增长的计算或存储(Chen等,2025a (https://arxiv.org/html/2605.20273#bib.bib14))。因此,现有的MLLM编辑器很少能同时解决这两种失败模式,同时保持**恒定开销**的在线更新。
为了弥补这一差距,我们首先进行试点分析以诊断上述失败模式。我们观察到,**跨模态冲突**主要源于不同模态之间梯度能量尺度的不匹配和**统计异质性**,而**编辑间干扰**源于新引入的编辑与先前注入的编辑之间在共享参数空间中表示能力的竞争,导致**权重纠缠**。图1 (https://arxiv.org/html/2605.20273#S1.F1) 总结了我们的高层设计,并与先前范式进行了对比。在前述分析的驱动下,我们提出了模态解耦在线递归编辑(M-ORE),一种新颖的恒定开销框架,用于MLLMs的终身自适应。M-ORE为不同的编辑模块(文本层 vs. 视觉投影器)维护单独的局部性统计数据,以防止**跨模态冲突**,并在固定的**正交**低秩子空间中,通过基于**Sherman-Morrison**的封闭形式递归执行持续写入。这种设计通过在固定编辑子空间中对高频使用的坐标自适应地抑制更新,从而减少长距离**编辑间纠缠**,实现高效的在线更新。在代表性MLLM骨干和在线多模态编辑基准上的实验表明,M-ORE在严格的O(1)每编辑开销下,实现了比强基线更好的稳定性-可塑性权衡。我们的主要贡献总结如下:
- • 我们识别了在在线设置中将基于LLM的编辑器应用于MLLM时的两个关键失败模式:由模态尺度不匹配引起的**跨模态冲突**和由纠缠的顺序更新引起的**编辑间干扰**(第3节 (https://arxiv.org/html/2605.20273#S3))。
- • 我们提出了M-ORE,一种模态解耦编辑器,在固定的正交低秩写入空间中采用基于Sherman–Morrison的封闭形式递归,实现了恒定开销的在线编辑(第4节 (https://arxiv.org/html/2605.20273#S4))。
- • 我们在多个MLLM骨干和基准上进行了广泛的在线编辑实验,表明与强基线相比,M-ORE持续改善了稳定性-可塑性权衡,并实现了质量-效率缩放(第5节 (https://arxiv.org/html/2605.20273#S5))。
## 2 相关工作
### 2.1 模型编辑
##### LLM的模型编辑。 LLM编辑方法通常分为*参数修改*和*参数保留*范式(Dai等,2022 (https://arxiv.org/html/2605.20273#bib.bib21); Sinitsin等,2020 (https://arxiv.org/html/2605.20273#bib.bib22); Zhang等,2024 (https://arxiv.org/html/2605.20273#bib.bib26); Huang等,2023 (https://arxiv.org/html/2605.20273#bib.bib23))。参数修改编辑器直接更新内部权重,包括 (i) *定位-然后-编辑*方法,如ROME (Meng等,2022 (https://arxiv.org/html/2605.20273#bib.bib6)) 和MEMIT (Meng等,2023 (https://arxiv.org/html/2605.20273#bib.bib16)),它们定位承载知识的组件并应用封闭形式的低秩更新;AlphaEdit (Fang等,2025 (https://arxiv.org/html/2605.20273#bib.bib7)) 添加了零空间约束,DeltaEdit (Cao等,2026 (https://arxiv.org/html/2605.20273#bib.bib13)) 分析了长距离错误累积;以及 (ii) *元学习*编辑器,如KE (De Cao等,2021 (https://arxiv.org/html/2605.20273#bib.bib17)) 和MEND (Mitchell等,2022a (https://arxiv.org/html/2605.20273#bib.bib18)),它们训练超网络从梯度或错误信号预测编辑更新。参数保留方法避免更改骨干,而是使用检索/上下文提示(例如,IKE (Zheng等,2023 (https://arxiv.org/html/2605.20273#bib.bib37)))或轻量级辅助模型/模块(例如,SERAC (Mitchell等,2022b (https://arxiv.org/html/2605.20273#bib.bib11)), GRACE (Hartvigsen等,2023 (https://arxiv.org/html/2605.20273#bib.bib19)))在局部覆盖行为。虽然这些技术对纯文本设置有效,但在多模态领域中,视觉输入引入大量异质性和噪声时,它们通常会退化(Chen等,2025b (https://arxiv.org/html/2605.20273#bib.bib5); Yu等,2024 (https://arxiv.org/html/2605.20273#bib.bib24))。
##### MLLM的模型编辑。 编辑MLLM仍是一个新兴领域(Cheng等,2023 (https://arxiv.org/html/2605.20273#bib.bib4))。早期研究主要将基于LLM的编辑器适应到多模态基准(He等,2024 (https://arxiv.org/html/2605.20273#bib.bib25); Zhang等,2024 (https://arxiv.org/html/2605.20273#bib.bib26));MMEdit系统地评估了这种适应,并表明简单迁移在处理耦合的视觉-语言表示时存在困难(Cheng等,2023 (https://arxiv.org/html/2605.20273#bib.bib4))。最近的方法开始融入多模态特定的设计:VisEdit (Chen等,2025b (https://arxiv.org/html/2605.20273#bib.bib5)) 使用归因识别并修改关键的视觉单元;DualEdit (Shi等,2025 (https://arxiv.org/html/2605.20273#bib.bib12)) 引入门控双分支编辑;LiveEdit (Chen等,2025a (https://arxiv.org/html/2605.20273#bib.bib14)) 通过专家组合针对终身编辑。然而,现有方法通常会招致编辑增长的检索/组合成本或在顺序权重更新下积累干扰,一个能在严格在线约束下同时缓解**跨模态冲突**和**编辑间干扰**的原则性框架仍然未被充分探索(Yao等,2023 (https://arxiv.org/html/2605.20273#bib.bib27); Gu等,2024 (https://arxiv.org/html/2605.20273#bib.bib28))。
### 2.2 在线编辑
##### LLM的在线编辑。 在线(或顺序)编辑将单步修正扩展到持续的更新流,要求模型随时间解决可塑性-稳定性困境(Mitchell等,2022b (https://arxiv.org/html/2605.20273#bib.bib11); Jiang等,2025 (https://arxiv.org/html/2605.20273#bib.bib29))。在纯文本LLM中,基于检索的方法(Chen等,2024 (https://arxiv.org/html/2605.20273#bib.bib33))通过将编辑存储在外部记忆中来缓解灾难性遗忘,但会招致随编辑数量线性增长的推理延迟(Wang等,2024b (https://arxiv.org/html/2605.20273#bib.bib30))。定位-然后-编辑方法(Meng等,2022 (https://arxiv.org/html/2605.20273#bib.bib6))计算上高效,但在顺序设置中通常会严重退化。参考图注 图2:由模态不匹配引起的跨模态冲突(BLIP2-OPT)。左图:对数方差密度显示视觉特征比文本激活具有更高能量。右图:归因分析显示视觉主导的贡献,意味着共享的全局统计将更新偏向视觉子空间并削弱文本保留。其他MLLM的结果见附录B.1 (https://arxiv.org/html/2605.20273#A2.SS1)。
##### MLLM的在线编辑。 相比之下,MLLM的在线编辑仍然未被充分探索(Chen等,2025a (https://arxiv.org/html/2605.20273#bib.bib14)),并面临由模态异质性引入的额外挑战(Cheng等,2023 (https://arxiv.org/html/2605.20273#bib.bib4); Chen等,2025b (https://arxiv.org/html/2605.20273#bib.bib5); Shi等,2025 (https://arxiv.org/html/2605.20273#bib.bib12))。当前的解决方案主要依赖*参数保留*。例如,LiveEdit (Chen等,2025a (https://arxiv.org/html/2605.20273#bib.bib14)) 提出了一种混合专家框架,为每个样本生成编辑特定的LoRA专家,并在推理时路由查询。然而,这些方法会随着编辑数量的增加招致大量的内存开销(Shi等,2025 (https://arxiv.org/html/2605.20273#bib.bib12); Thede等,2025 (https://arxiv.org/html/2605.20273#bib.bib34))。关键的是,MLLM的*参数修改*在线编辑仍然在很大程度上未被探索(Li等,2025 (https://arxiv.org/html/2605.20273#bib.bib36); Zhang等,2025 (https://arxiv.org/html/2605.20273#bib.bib31); Deng等,2025 (https://arxiv.org/html/2605.20273#bib.bib32))。
## 3 在线顺序编辑分析
### 3.1 预备知识
##### 多模态语言模型。 我们考虑一个具有视觉编码器Ev、投影器P和LLM M的MLLM f_θ。给定(x^v, x^q),其中x_t^v是视觉输入,x_t^q是文本查询,模型从嵌入H = [P(Ev(x^v)), Embed(x^q)]自回归预测p(y | x^v, x^q)。对于变压器层l,我们采用标准残差分解(Meng等,2022 (https://arxiv.org/html/2605.20273#bib.bib6); Fang等,2025 (https://arxiv.org/html/2605.20273#bib.bib7)):
h^l = h^{l-1} + a^l + m^l, m^l = W_out^l σ(W_in^l γ(h^{l-1} + a^l)), (1)
其中a^l和m^l表示注意力和FFN输出,γ(·)是LayerNorm,σ(·)是非线性函数。遵循FFN键值观点(Geva等,2021 (https://arxiv.org/html/2605.20273#bib.bib20)),我们定义
k^l ≜ σ(W_in^l γ(h^{l-1} + a^l)), v^l ≜ m^l = W_out^l k^l. (2)
许多参数修改编辑器通过更新W_out^l来重写知识;在清晰的情况下我们将其记为W。
##### MLLM中的在线编辑。 我们研究MLLM f_θ的在线编辑,该模型将多模态输入x = (x^v, x^q) ∈ X映射到文本的自回归输出分布。遵循FFN键值观点,我们考虑*参数修改*编辑,即更新选定的FFN输出矩阵W,同时保持其余参数固定,即θ = (θ_0, W),其中θ_0被冻结。在步骤t,编辑请求是一个目标对e_t = (x_t^e, y_t^e),使得y_t^e ≠ f_{(θ_0, W_{t-1})}(x_t^e)。编辑器ME产生一个具有有界每编辑成本的加法更新:
ΔW_t = ME(f_{(θ_0, W_{t-1})}, x_t^e, y_t^e), W_t = W_{t-1} + ΔW_t, (3)
因此f_{θ_t} = f_{(θ_0, W_t)}且W_t = W_0 + ∑_{i=1}^t ΔW_i。一个成功的在线编辑器应满足三个标准(Cheng等,2023 (https://arxiv.org/html/2605.20273#bib.bib4); Chen等,2025a (https://arxiv.org/html/2605.20273#bib.bib14)):*可靠性*(对编辑请求正确),*通用性*(在语义等效的文本/视觉变体上成立),以及*局部性*(对无关输入的副作用最小)。我们通过f_{θ_t}和f_{θ_{t-1}}在无关集Ut上的分布偏移来量化局部性。相似文章
配对时正确,拆分时错误:解耦与编辑多模态大语言模型中的模态特定神经元
本文识别并解决了多模态大语言模型中的“编辑解耦失败”问题,即通过多模态输入进行知识更新后,当查询变为单模态时更新效果无法泛化。作者提出DECODE方法,用于解耦并定位模态特定神经元,从而实现更有效的知识编辑。
HoReN:用于大规模序列模型编辑的归一化Hopfield检索
本文介绍了HoReN,这是一种参数保留的模型编辑方法,使用归一化Hopfield检索来处理对大型语言模型的大规模序列更新。它解决了知识积累和路由挑战的问题,在50,000次序列编辑上展示了稳定的性能,而先前的方法在这种情况下性能会退化。
MACS: 面向高效多模态MoE推理的模态感知容量缩放
MACS是一个无需训练的推理框架,通过引入熵加权负载和动态模态自适应容量机制,减轻多模态MoE MLLMs在专家并行中的落后效应。
CORE:面向冲突的通用多模态篡改检测推理
提出了CORE框架,赋予多模态大语言模型显式的冲突捕获能力,以实现可泛化的篡改检测,能够通过少量或零样本适应未见过的篡改类型。
LoMo: 局部模态替换以实现更深层的视觉-语言融合
LoMo 提出了一种数据整理方法,将单模态提示重新表述为交错的多模态序列,以改善视觉-语言模型中的跨模态表示对齐,在多个基准测试上取得了持续的性能提升。