从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
摘要
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
arXiv:2606.26196v1 Announce Type: new
摘要:多模态大语言模型(MLLMs)近期在统一视觉-语言理解与推理方面取得了显著进展,尤其是随着OpenAI的O系列和DeepSeek的R系列等模型的推出,推动了向感知中心智能的范式转变。然而,目前仍缺乏从真正统一的视觉-语言视角——即将视觉和语言视为不可分割的模态——来审视感知的系统性综述。现有综述往往零散,分别聚焦于视觉或语言,很少捕捉感知作为集成能力的跨模态演进。为填补这一空白,我们首次提出了MLLMs中统一视觉-语言感知的系统性综述。具体来说,我们(1)将MLLM感知形式化为一种与人类先天感知类似的、内在统一的视觉-语言能力,(2)引入一个五阶段分类法,追溯MLLM感知的范式演进,并综述每个阶段的代表性方法和里程碑,(3)识别开放挑战,并勾勒出通向真正通用、统一的多模态智能的有前景的研究方向。我们希望我们的研究能为通往人工通用智能(AGI)的道路提供基础理解和可操作的路线图,以促进进一步创新。
查看缓存全文
缓存时间: 2026/06/26 05:14
# 从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述 来源:https://arxiv.org/html/2606.26196 ###### 摘要 多模态大语言模型(MLLMs)近期在统一视觉-语言理解与推理方面取得了显著进展,特别是在OpenAI的O系列和DeepSeek的R系列模型发布之后,推动了向感知中心智能的范式转变。然而,目前仍缺乏从真正统一的视觉-语言视角来审视感知的系统性综述——即把视觉和语言视为不可分割的模态。现有综述往往碎片化,分别聚焦于视觉或语言,很少能捕捉到感知作为一种跨模态整合能力的演进过程。为填补这一空白,我们首次对MLLMs中统一的视觉-语言感知进行了系统性综述。具体而言,我们:(1) 将MLLM感知形式化为一种与人类先天感知类似的内在、统一的视觉-语言能力;(2) 引入一个五阶段分类法,追溯MLLM感知的范式演进,并调研每个阶段的代表性方法和里程碑;(3) 识别当前挑战,并勾勒出通往真正通用、统一的多模态智能的有前景的研究方向。我们希望本研究能为通向通用人工智能(AGI)的道路提供基础理解和可行的路线图,以促进进一步的创新。 ###### 关键词: 多模态大语言模型, 感知, 视觉-语言模型, 统一框架 ††期刊: Information Fusion \affiliation[label1] organization=四川大学计算机学院, addressline=成都市一环路南一段24号, city=成都, postcode=610065, state=四川, country=中国 \affiliation[label2] organization=北京大学深圳研究生院电子与计算机工程学院, addressline=丽水路2199号, city=深圳, postcode=518055, state=广东, country=中国 \affiliation[label3] organization=人工智能研究院(TeleAI), 中国电信及西北工业大学, addressline=友谊西路127号, city=西安, postcode=710072, state=陕西, country=中国 ## 1 引言 *“语义知识将感官的嘈杂转化为意义的交响曲。”* — *Matthew A. Lambon Ralph* 近年来,多模态大语言模型(MLLMs)¹已从纯文本处理范式演变为统一的视觉-语言理解与推理,显著推动了诸如图像描述[156 (https://arxiv.org/html/2606.26196#bib.bib245), 13 (https://arxiv.org/html/2606.26196#bib.bib246)]、视觉定位[194 (https://arxiv.org/html/2606.26196#bib.bib201), 71 (https://arxiv.org/html/2606.26196#bib.bib64)]和多模态问答[96 (https://arxiv.org/html/2606.26196#bib.bib194), 109 (https://arxiv.org/html/2606.26196#bib.bib248)]等跨模态任务。MLLMs的感知能力——从原始视觉信号中提取、定位并推理结构化语义信息的能力——是视觉-语言理解与推理的基石。它支撑着从经典计算机视觉基准[194 (https://arxiv.org/html/2606.26196#bib.bib201), 88 (https://arxiv.org/html/2606.26196#bib.bib202)]到开放式、以人为中心的任务[175 (https://arxiv.org/html/2606.26196#bib.bib86), 17 (https://arxiv.org/html/2606.26196#bib.bib199)]的各种应用。这种感知能力使MLLMs能够以类似人类的方式看到、理解并与多模态信息交互[124 (https://arxiv.org/html/2606.26196#bib.bib249)]。 尽管MLLMs取得了显著进步并快速演进,但仍缺乏从感知视角系统审视这些发展的综述。现有综述通常各自为政,要么聚焦于以视觉为中心[130 (https://arxiv.org/html/2606.26196#bib.bib207), 138 (https://arxiv.org/html/2606.26196#bib.bib206)],要么聚焦于以语言为中心[166 (https://arxiv.org/html/2606.26196#bib.bib208), 21 (https://arxiv.org/html/2606.26196#bib.bib209)]的任务,未能将感知视为统一的视觉-语言能力。这种碎片化的视角忽视了MLLMs中视觉-语言感知的范式级转变,阻碍了对它们全部潜力的整体理解,并凸显了对一种整合的、以感知为核心的综述的需求。 为填补这一空白,我们的综述首次对MLLMs中视觉-语言感知的演进进行了深入且结构化的分析。我们明确了本次综述的范围,概述了其组织结构,并总结了主要贡献,旨在为未来统一视觉-语言感知的研究提供路线图。 ### 1.1 范围与定义 本节定义了我们综述的范围,重点关注MLLMs如何响应自然语言查询,在特定区域或实例层级上感知图像。具体而言,满足以下条件的方法属于我们的调研范围: 1. 输入至少包含一幅自然的2D图像或视频片段。 2. 核心挑战在于提取或区分视觉证据(对象、区域、属性、关系),而非纯粹的符号或数学推理。 3. 解决问题需要在自然语言引导下正确感知特定区域或实例(例如,指代表达理解、视觉定位、区域级问答)。 自然地,我们*明确排除*三类工作:(1) 主要由逻辑或符号推理而非感知处理驱动的任务(例如,数学问题求解[27 (https://arxiv.org/html/2606.26196#bib.bib203)]);(2) 针对垂直领域高度专业化应用的方法(例如,机器人视觉-语言控制[150 (https://arxiv.org/html/2606.26196#bib.bib204)]);(3) 仅通过全局架构扩展(例如,增加输入分辨率[42 (https://arxiv.org/html/2606.26196#bib.bib210)]或模型参数量[91 (https://arxiv.org/html/2606.26196#bib.bib211)])而无需引入增强局部感知机制带来的收益的方法。 ### 1.2 论文组织结构 我们将感知能力的演进划分为五个阶段:从结构驱动的模块化优化(第一阶段和第二阶段),到动态感知范式(第三阶段),再到融合指令、自适应性和强化学习的统一框架(第四阶段A和第四阶段B),并为下一代多模态智能提供了展望。为直观概览,我们综述的组织框架如图2 (https://arxiv.org/html/2606.26196#S2.F2)所示。具体而言,本文其余部分组织如下:第2节(预备知识)介绍了我们的五阶段分类法,并将我们统一的感知重点与先前特定任务的综述进行了对比。第3节(第一阶段:编码器中心优化)回顾了通过区域感知模块和集成感知子网络来增强局部感知的早期努力。第4节(第二阶段:解码器中心优化)探讨了辅助解码如何通过辅助解码器、多解码器架构和专用解码策略将感知从区域级提升到像素级。第5节(第三阶段:通过自适应处理实现动态感知)探索了自适应、上下文驱动的感知,涉及外部工具调度、以LLM为中心的路由以及用于感知任务的代码即策略。第6节(第四阶段A:用于感知增强的无架构策略)深入探讨了两种非架构方法:基于指令的策略和基于强化学习的策略。第7节(第四阶段B:迈向统一感知)提供了一种前瞻性视角,探讨指令、自适应性和RL的融合,内容包括为何统一至关重要、融合的迹象以及迈向新一代感知中心智能体。最后,第8节总结了我们的主要发现,并概述了未来研究方向。 ### 1.3 主要贡献 1. **首次系统性综述**:据我们所知,这是首次将MLLMs中的视觉-语言感知作为一种内在的统一能力进行系统分析的综述,为未来研究提供了切实可行的路线图。 2. **范式分类与全面回顾**:我们提出了MLLM感知中范式演进的五阶段分类法,并全面回顾了每一阶段的代表性工作,突出了其关键创新。 3. **新兴挑战与未来方向**:我们深入讨论了当前面临的挑战,并概述了感知中心多模态智能未来发展的有前景方向。 ## 2 预备知识 ### 2.1 分类法 在本节中,我们介绍了五阶段分类法,用以刻画MLLMs中感知能力的演进轨迹。该框架旨在捕捉从结构——针对性的、架构驱动的增强——到协同的范式转变,即感知从整合、自适应和统一的策略中涌现。 我们的分类法始于编码器中心、结构驱动的方法,这些方法针对特定场景(如视觉问答中的简单图像理解任务)而开发,感知的提升要么通过增强视觉编码器的内部结构,要么通过修改模型架构将编码器视为一个集成的感知子网络。然后,它过渡到解码器中心策略,通过采用专门的解码设计来进一步推进细粒度感知,将模型的感知能力从区域级理解提升到像素级理解。第三阶段是动态感知,关注上下文感知和自适应处理,使模型能够灵活地与图像进行多次交互,以获取更丰富、更全面的信息。最新的进展代表了两个不同但相关的方向:无架构策略,专注于在不显式更改架构的情况下优化特定任务的感知;以及统一感知框架,强调模型通过整合指令、自适应性和强化学习,在复杂的开放式场景中运行的能力。尽管侧重点不同,但这两个方向——与早期阶段一样——继续将推进局部感知能力作为核心主题。 重要的是,我们的分类法不应被视为严格的线性递进。许多阶段实际上是相互交织的,之间存在大量重叠和相互影响。我们根据每个代表作对MLLMs中感知演进的主要贡献对其进行分类,而非按时间顺序,以更好地反映该领域的概念图景和研究焦点。为了提供清晰直观的概述,我们在图1 (https://arxiv.org/html/2606.26196#S2.F1)中展示了这五个阶段及其相互关系。 见图注 图1:增强多模态大语言模型感知能力的演进范式概览。箭头表示演进的总体轨迹,从结构修改到协同驱动的整合。 ### 2.2 与相关工作的差异 近期的综述已从多个角度回顾了多模态大语言模型,包括架构、评估、感知和推理。我们的工作与这些努力最为相关,但在*范围和组织视角*上有所不同。简而言之,它们可以归为以下几类: 1. **关于MLLMs演进的全方位综述**:Liang等人[86 (https://arxiv.org/html/2606.26196#bib.bib16)]提供了MLLMs的全面指南,审视了它们的架构、应用和影响,涵盖了训练方法、架构组件以及在各领域的实际应用等主题。Caffagni等人[5 (https://arxiv.org/html/2606.26196#bib.bib18)]回顾了MLLM发展的早期阶段,分析了它们的架构选择、多模态对齐策略和训练技术。类似地,Zhang等人[208 (https://arxiv.org/html/2606.26196#bib.bib19)]回顾了MLLMs随时间的演进,聚焦于选定模型在主流基准上的性能,并总结了关键训练方法。这些综述从广泛、时间导向的视角描绘了MLLMs的整体演进。相比之下,我们的工作将范围限定在更窄的视觉-语言感知问题上,特别关注自然语言引导下的区域或实例级理解。 2. **特定任务综述**:Sapkota等人[130 (https://arxiv.org/html/2606.26196#bib.bib207)]对MLLMs中的目标检测进行了深入回顾,分析了这些模型如何利用自然语言和视觉特征来执行目标定位和类别识别,并将它们的适应性和效率与传统深度检测器进行了比较。Shen等人[138 (https://arxiv.org/html/2606.26196#bib.bib206)]聚焦于图像和视频的推理分割,总结了跨不同领域的现有方法、基准和应用。这些综述都集中在特定的视觉任务上,尽管具有说明性,但未能捕捉到感知模块在统一视觉-语言范式下如何向协同改进演进。 3. **思维链与数学推理综述**:Wang等人[162 (https://arxiv.org/html/2606.26196#bib.bib276)]提出了多模态思维链(MCoT)推理的综述,澄清了定义,总结了相关的MCoT方法,并按应用场景进行了组织。Chen等人[21 (https://arxiv.org/html/2606.26196#bib.bib209)]聚焦于推理型LLM的长思维链,提出了一种区分长CoT和短CoT的分类法,分析了过度思考和测试时缩放等现象,并讨论了包括多模态扩展在内的未来方向。这些工作以推理为主要组织轴,很大程度上将视觉信号视为上下文输入,而我们的综述则聚焦于视觉-语言感知本身的演进。Zhou等人[227 (https://arxiv.org/html/2606.26196#bib.bib30)]将视觉-语言交互式推理解构为:一个基础的感知层,用于准确的视觉信息提取和细粒度对齐;以及一个高阶认知层,在此感知基础上进行主动、多步、目标导向的推理。在此两层框架指导下,他们的综述分析了两层的瓶颈和方法,主要关注交互式观察-思考-验证循环中视觉输入与逻辑推理之间的层级关系。相比之下,我们的综述采用了一种演进的、以感知为中心的视角:我们专注于感知架构本身的范式转变,追溯从模块化、结构驱动的设计到统一集成的轨迹。 --- ¹ 在本文中,“MLLM”作为一个统一术语,涵盖了大语言模型(LLMs)、大型视觉-语言模型(LVLMs)和多模态LLMs。我们关注的是它们统一的视觉-语言感知能力。
相似文章
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
视觉的代价:在单一范式中实现可信的多模态推理
本文挑战了当前视觉语言模型忠实地融合多模态数据的假设,提出了一种基于信息论的 Modality Translation Protocol,并引入了新指标(Toll、Curse、Fallacy of Seeing)来评估可信度,而非传统的多模态增益。
超越文本主导:理解全模态大语言模型的模态偏好
# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa
多模态大语言模型安全格局的演变:新兴威胁与防护措施综述
一篇综述论文,系统分析了多模态大语言模型不断演变的安全格局,涵盖了对抗性攻击、数据投毒、越狱和幻觉等新兴威胁,并回顾了更新后的安全策略。