NeuPAT:面向语言保持多模态大语言模型的神经元感知可塑性分配调优

arXiv cs.CL 论文

摘要

NeuPAT 是一个轻量级、架构无关的框架,在多模态指令微调过程中分配神经元级别的更新约束,以保持多模态大语言模型(MLLM)的语言能力,可恢复普通微调所导致的语言退化中的 94.5%。

arXiv:2608.08107v1 公告类型:新 摘要:大型语言模型(LLM)的多模态扩展赋予了新的感知能力,但往往会损害预训练阶段获得的语言智能。在本工作中,我们从内部适应动力学的角度研究该现象,并发现预训练 LLM 中的神经元在多模态学习过程中表现出异质的可塑性:部分神经元对保持语言能力至关重要,而其他神经元则对多模态知识更具适应性。基于这一发现,我们提出了 NeuPAT(Neuron-aware Plasticity Allocation Tuning,神经元感知的可塑性分配调优),一个轻量级且架构无关的框架,在多模态指令微调期间分配神经元级的更新约束。NeuPAT 通过一个小规模的探测阶段来估计神经元的适应模式,选择性地保护对语言敏感的神经元,同时通过更具可塑性的神经元促进多模态适应。在多种不同 LLM 系列上的实验表明,NeuPAT 在 11 个语言基准上恢复了普通微调所导致的 94.5\% 的语言能力退化,同时保持了相当的多模态性能,为能力保持的多模态扩展提供了一种有效方法。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:07

# NeuPAT:面向语言保持多模态大语言模型的神经元感知可塑性分配调优

来源:https://arxiv.org/html/2608.08107
Jiayue Jin1,2,Jingwei Zhang2,5,Chen Wang2,6,Jing Liu2,3,4,Longteng Guo2,3,4\*

1复旦大学智能机器人与先进制造学院
2中关村学院, 3中国科学院自动化研究所
4中国科学院大学人工智能学院
5天津大学, 6南开大学
通讯作者:longteng\.guo@nlpr\.ia\.ac\.cn (https://arxiv.org/html/2608.08107v1/mailto:[email protected])

###### 摘要

大语言模型(LLM)的多模态扩展带来了新的感知能力,但往往会损害其在预训练阶段获得的语言智能。在本研究中,我们从内部适应动力学的角度探究了这一现象,并发现在多模态学习过程中,预训练LLM中的神经元表现出异质的可塑性:部分神经元对保持语言能力至关重要,而另一些则更适应多模态知识。基于这一发现,我们提出了 NeuPAT(Neuron-aware Plasticity Allocation Tuning,神经元感知可塑性分配调优),这是一种轻量级且与架构无关的框架,可在多模态指令调优过程中分配逐神经元的更新约束。NeuPAT 使用一个小规模的探测阶段来估计神经元的适应模式,并选择性地保护对语言敏感的神经元,同时通过更具可塑性的神经元促进多模态适应。跨多种LLM家族的实验表明,NeuPAT 在11个语言基准上恢复了普通调优所导致的语言能力退化中的94.5%,同时保持了相当的多模态性能,为保持能力的多模态扩展提供了一种有效方法。

NeuPAT:面向语言保持多模态大语言模型的神经元感知可塑性分配调优

Jiayue Jin1,2, Jingwei Zhang2,5, Chen Wang2,6, Jing Liu2,3,4, Longteng Guo2,3,4\*1复旦大学智能机器人与先进制造学院2中关村学院,3中国科学院自动化研究所4中国科学院大学人工智能学院5天津大学,6南开大学通讯作者:longteng\.guo@nlpr\.ia\.ac\.cn (https://arxiv.org/html/2608.08107v1/mailto:[email protected])

参见图注图1:视觉指令调优后的纯文本能力退化与恢复。\(a\) 使用多模态指令数据将LLM扩展为MLLM可能导致语言遗忘。\(b\) 普通调优会降低代表性纯文本基准的性能,而 NeuPAT 则恢复了大部分丢失的能力。分数按每个基准上原始LLM的性能进行归一化。

## 1 引言

大语言模型(LLM)通过大规模文本预训练展示了强大的语言理解、推理、知识获取和代码生成能力Brown等人\(2020 (https://arxiv.org/html/2608.08107#bib.bib14)\);Chowdhery等人\(2023 (https://arxiv.org/html/2608.08107#bib.bib15)\);Achiam等人\(2023 (https://arxiv.org/html/2608.08107#bib.bib16)\);Touvron等人\(2023 (https://arxiv.org/html/2608.08107#bib.bib17)\)。将这些模型扩展到文本之外推动了大语言模型(MLLM)的快速发展Liu等人\(2023b (https://arxiv.org/html/2608.08107#bib.bib1)\);Dai等人\(2023 (https://arxiv.org/html/2608.08107#bib.bib2)\);Wang等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib3)\);Bai等人\(2025 (https://arxiv.org/html/2608.08107#bib.bib4)\);Li等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib5)\);Team等人\(2025 (https://arxiv.org/html/2608.08107#bib.bib8)\);Wang等人\(2025b (https://arxiv.org/html/2608.08107#bib.bib9)\)。一种主流范式将预训练的LLM保留为推理骨干,通过投影模块将其与特定模态的编码器连接,并进行多模态指令调优以将新模态与语言空间对齐Liu等人\(2023b (https://arxiv.org/html/2608.08107#bib.bib1)\);Dai等人\(2023 (https://arxiv.org/html/2608.08107#bib.bib2)\)。该范式在视觉问答和推理等多模态任务上实现了强劲的性能Liu等人\(2024c (https://arxiv.org/html/2608.08107#bib.bib61)\);Yue等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib62)\);Chen等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib63)\)。

理想情况下,多模态扩展应代表能力的演进:模型在获取新的多模态理解的同时,保持预训练期间积累的语言智能。这种保持至关重要,因为现代MLLM仍然是基于语言的系统,语言能力为推理、知识组织和多模态泛化提供了基础。

然而,这种理想的保持并不总能实现。如图1 (https://arxiv.org/html/2608.08107#S0.F1)所示,多模态指令调优经常导致语言推理基准上的显著性能下降,在关键语言评估中平均性能下降约39.8%。这表明多模态扩展并非纯粹的加法;将预训练骨干适配到多模态分布可能会干扰现有的语言表征,并覆盖对基于语言的推理至关重要的能力。因此,一个重要的问题出现了:我们如何在扩展LLM能力边界、引入新模态的同时,保持构成多模态智能基础的语言智能?

最近的研究探索了在多模态扩展过程中缓解语言能力退化的策略。现有解决方案主要依赖外部干预,包括纯文本数据回放Lu等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib12)\);Bai等人\(2025 (https://arxiv.org/html/2608.08107#bib.bib4)\)、架构修改Zhang等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib10)\);Wang等人\(2025a (https://arxiv.org/html/2608.08107#bib.bib22)\);Lu等人\(2025 (https://arxiv.org/html/2608.08107#bib.bib23)\)以及训练后的模型融合Ratzlaff等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib11)\);Yu和Ananiadou \(2025 (https://arxiv.org/html/2608.08107#bib.bib24)\);Wang等人\(2026 (https://arxiv.org/html/2608.08107#bib.bib25)\);Li等人\(2025 (https://arxiv.org/html/2608.08107#bib.bib26)\)。文本回放通过额外的语言监督保留了预训练能力,但需要额外数据和仔细的目标平衡。基于架构的方法将多模态适应与语言骨干隔离,但代价是定制化设计和增加的复杂性。模型融合在训练后结合原始LLM和适配后的MLLM,但可能在语言保持和多模态适应之间引入权衡。更重要的是,这些方法依赖辅助干预,而不是直接调节多模态学习期间的骨干适应。

在本研究中,我们从内部适应动力学的角度重新审视多模态扩展。我们研究了预训练LLM中是否包含可以在多模态学习期间选择性调节的异质适应能力。我们的关键见解是,预训练骨干内的神经元表现出不同的适应模式:有些对保持语言智能更为关键,而另一些则为吸收新的多模态知识提供了更大的灵活性。因此,在多模态调优期间统一更新所有神经元可能会不必要地破坏语言关键表征,同时未能充分利用模型的内在可塑性。

基于这一见解,我们提出了 NeuPAT(Neuron-aware Plasticity Allocation Tuning,神经元感知可塑性分配调优),一种用于多模态扩展的神经元级能力保持调优框架。NeuPAT引入了一个轻量级探测阶段,使用少量诊断样本估计逐神经元的适应特征,无需引入额外训练数据或修改模型架构。基于这些测量,NeuPAT在多模态指令调优期间动态分配更新约束:对语言能力保持敏感的神经元受到保护,避免过度适应,而具有更大多模态可塑性的神经元则被鼓励获取新知识。通过调节内部适应动力学,NeuPAT实现了从LLM到MLLM的能力保持扩展。

如图1 (https://arxiv.org/html/2608.08107#S0.F1)所示,NeuPAT显著减少了多模态扩展过程中的语言能力退化,在4个语言推理基准上恢复了90.0%的丢失性能。跨6个LLM、11个语言基准和5个多模态基准的实验表明,NeuPAT在模型家族和规模上均能稳定泛化,提供了一种高效且与架构无关的解决方案,用于在多模态扩展期间保持语言智能。

我们的贡献总结如下:

- •我们揭示了多模态扩展过程中LLM骨干内的异质适应动力学,表明不同神经元表现出与语言保持和多模态学习相关的不同适应模式。
- •我们提出了 NeuPAT,一种神经元感知的可塑性分配框架,能够实现高效且与架构无关的多模态扩展,同时保持语言智能。
- •大量实验表明,NeuPAT 在多样的LLM家族和模型规模下持续保持语言智能,同时维持相当的多模态性能,实现了从LLM到MLLM的可扩展能力扩展。

参见图注图2:LLM多模态扩展期间的神经元模态偏好与重要性。\(a\) 原始的文本和视觉关联重要性分数,显示了神经元间异质的模态关联。\(b\) 逐层模态偏好Pl,u=vl,u−tl,uP\_\{l,u\}=v\_\{l,u\}\-t\_\{l,u\},层内神经元按偏好排序。\(c\) 在相同排序下的总体重要性Il,u=\(vl,u\+tl,u\)/2I\_\{l,u\}=\(v\_\{l,u\}\+t\_\{l,u\}\)/2,显示了具有相似偏好的神经元之间存在不同的重要性水平。这些结果揭示了预训练骨干中异质的可塑性模式,为多模态适应期间的神经元感知可塑性分配提供了动机。

## 2 相关工作

### 2\.1 多模态大语言模型

MLLM通常采用编码器-连接器-LLM架构,通过交叉注意力、Q-Former或轻量级投影模块将视觉特征映射到语言空间Alayrac等人\(2022 (https://arxiv.org/html/2608.08107#bib.bib27)\);Li等人\(2023a (https://arxiv.org/html/2608.08107#bib.bib28)\);Dai等人\(2023 (https://arxiv.org/html/2608.08107#bib.bib2)\);Zhu等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib29)\);Liu等人\(2023b (https://arxiv.org/html/2608.08107#bib.bib1),2024a (https://arxiv.org/html/2608.08107#bib.bib30)\)。最近的模型,包括Qwen-VL系列、DeepSeek-VL、InternVL3和LLaVA-OneVision,通过更强的编码器、更大的语料库和先进的后训练改善了多模态感知和推理能力Bai等人\(2023 (https://arxiv.org/html/2608.08107#bib.bib31)\);Wang等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib3)\);Bai等人\(2025 (https://arxiv.org/html/2608.08107#bib.bib4)\);Lu等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib12)\);Wang等人\(2025b (https://arxiv.org/html/2608.08107#bib.bib9)\);Zhu等人\(2025 (https://arxiv.org/html/2608.08107#bib.bib7)\);Li等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib5)\)。尽管取得了这些进展,大多数MLLM仍然通过图像-文本对齐和视觉指令调优来适配预训练的LLM骨干,这可能降低其语言能力,这也激发了我们的研究。

### 2\.2 缓解遗忘的方法

一种常见解决方案是混合文本纯数据和多模态数据Lu等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib12)\);Bai等人\(2023 (https://arxiv.org/html/2608.08107#bib.bib31)\);Wang等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib3)\);Bai等人\(2025 (https://arxiv.org/html/2608.08107#bib.bib4)\),但这增加了训练成本并需要仔细调整比例。现有的替代方案应用通用的参数高效或持续学习方法Hu等人\(2022 (https://arxiv.org/html/2608.08107#bib.bib13)\);Kirkpatrick等人\(2017 (https://arxiv.org/html/2608.08107#bib.bib21)\),修改架构Zhang等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib10)\);Wang等人\(2025a (https://arxiv.org/html/2608.08107#bib.bib22)\);Lu等人\(2025 (https://arxiv.org/html/2608.08107#bib.bib23)\),或者将适配后的模型与原始LLM融合Ratzlaff等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib11)\);Yu和Ananiadou \(2025 (https://arxiv.org/html/2608.08107#bib.bib24)\);Wang等人\(2026 (https://arxiv.org/html/2608.08107#bib.bib25)\);Li等人\(2025 (https://arxiv.org/html/2608.08107#bib.bib26)\)。相比之下,NeuPAT利用神经元模态偏好,在多模态学习期间保持语言能力,而无需文本回放、架构更改或事后融合。

参见图注图3:NeuPAT 概览。NeuPAT通过轻量级模态探测识别神经元适应角色,并在多模态调优期间施加角色特定的更新约束,在获取多模态能力的同时保持语言智能。

## 3 神经元级模态偏好分析

为了实现保持能力的多模态扩展,我们首先分析预训练LLM骨干中的不同神经元如何响应文本和视觉输入。我们的目标是研究骨干在多模态适应过程中是否包含异质的可塑性模式。如果没有这种认识,统一更新策略(如全局冻结或正则化骨干)可能保持语言能力,但会不必要地限制模型获取新多模态知识的能力。

### 3\.1 模态关联神经元重要性估计

对于Transformer层ll,我们使用uu索引一个神经元,对应一个中间隐藏维度及其相关的输入侧和输出侧参数切片。设hl,u\(xt\)h\_\{l,u\}\(x\_\{t\}\)表示神经元u在标记位置t处的激活,并设Wl,uoutW^\{\mathrm\{out\}\}\_\{l,u\}表示其输出侧参数切片,该切片将神经元的响应写回残差流。

我们分别构建轻量级的纯文本和视觉探测集,DT\\mathcal\{D\}\_\{T\}和DV\\mathcal\{D\}\_\{V\}。受激活感知重要性估计的启发Sun等人\(2024 (https://arxiv.org/html/2608.08107#bib.bib36)\),我们定义神经元u在探测集D\\mathcal\{D\}下的模态关联重要性分数为

sl,u\(D\)=‖Wl,uout‖F⋅RMSx∈D,t∈V\(x\)\(‖hl,u\(xt\)‖2\),\\begin\{split\}s\_\{l,u\}\(\\mathcal\{D\}\)=\{\}&\\left\\\|W^\{\mathrm\{out\}\}\_\{l,u\}\\right\\\|\_\{F\}\\\\ &\\cdot\\mathrm\{RMS\}\_\{x\\in\\mathcal\{D\},\\,t\\in\\mathcal\{V\}\(x\)\}\\left\(\\left\\\|h\_\{l,u\}\(x\_\{t\}\)\\right\\\|\_\{2\}\\right\),\\end\{split\}\(1\)其中V\(x\)\\mathcal\{V\}\(x\)表示有效的非填充标记位置。该分数同时考虑了神经元激活强度和其输出贡献,为特定输入模态下的神经元重要性提供了一个代理指标。

我们计算视觉关联和语言关联的重要性分数如下:

sl,uV=sl,u\(DV\), sl,uT=sl,u\(DT\)。s^\{V\}\_\{l,u\}=s\_\{l,u\}\(\\mathcal\{D\}\_\{V\}\),\\qquad s^\{T\}\_\{l,u\}=s\_\{l,u\}\(\\mathcal\{D\}\_\{T\}\)。\(2\)
为便于层内可视化和比较,分数被归一化为

vl,

相似文章

MNAFT:用于图像翻译的多模态大语言模型模态神经元感知微调

Hugging Face Daily Papers

论文页面 - MNAFT:用于图像翻译的多模态大语言模型模态神经元感知微调 来源:[https://huggingface.co/papers/2604.16943](https://huggingface.co/papers/2604.16943) 发布日期:4月18日 · 提交者 [https://huggingface.co/liboaccn](https://huggingface.co/liboaccn) [![](https://cdn-avatars.huggingface.co/v1/production/uploads/6582c482f3006507ea10302a/KbgSsq0FnbMngBcWPhIXi.jpeg)](https://huggingface.co/liboaccn) [Bo Li](https://huggingface.co/liboaccn)

基于对比对搜索的靶向神经元调控

Hugging Face Daily Papers

对比神经元归因(CNA)识别出一组稀疏的MLP神经元,这些神经元能够区分有害提示和良性提示,从而在指令微调的大语言模型中实现有效的行为引导,同时不会降低输出质量。该方法在越狱基准测试上将拒绝率降低了50%以上,同时保持了流畅性。