视觉为何无法成为通用桥梁:在多语言MLLMs中纠正模态异步性
摘要
本文在多语言MLLMs中识别出Ghost Anchor现象,即视觉信号在早期对齐阶段未被充分利用,并提出ANCHOR训练框架以提升视觉语义涌现和跨语言性能。
查看缓存全文
缓存时间: 2026/08/18 10:01
# 为何视觉模态难以充当通用桥梁:纠正多语言多模态大语言模型中的模态异步性 来源:https://arxiv.org/html/2608.15085 Yihang Du单位:香港中文大学(深圳)单位:深圳河套研究院Zhengzhao Lai单位:香港中文大学(深圳)Siyu Li单位:香港中文大学(深圳)Yan Hu单位:香港中文大学(深圳)单位:国家健康数据研究院(深圳)[email protected],[email protected],[email protected]单位:同等贡献,通讯作者 ###### 摘要 多模态大语言模型(MLLMs)在非英语视觉推理中表现出显著性能下降,尽管其纯文本骨干网络具备强大的多语言能力。纯文本模型的机制性证据表明,非英语输入会通过以英语为中心的潜在空间进行路由,但这种现象对多模态模型的潜在影响尚未被探索。通过逐层机制分析,我们识别出**幽灵锚点**现象:一种时间模态异步性——语言表征在早期层中大量收敛至英语语义流形,而视觉语义化仍不成熟。因此,视觉信号在物理上存在,但在早期对齐窗口期间影响有限。为此,我们提出**ANCHOR**训练框架,采用主动视觉锚定(PVA)来加速早期视觉语义涌现,并鼓励视觉表征引导语言翻译。机制干预表明,ANCHOR增加了视觉信号在早期翻译中的影响力。此外,在xMMMU、MaXM和CVQA上的实验显示,ANCHOR在微调和零样本语言上均提升了标准基线的整体性能。 ## 1 引言 多模态大语言模型(MLLMs)通过将大语言模型与视觉感知相结合,显著推动了视觉-语言理解的发展25 (https://arxiv.org/html/2608.15085#bib.bib20);2 (https://arxiv.org/html/2608.15085#bib.bib14)。然而,尽管MLLMs在英语方面表现出色,实现跨多种语言的公平理解仍然是一个根本性挑战30 (https://arxiv.org/html/2608.15085#bib.bib3);17 (https://arxiv.org/html/2608.15085#bib.bib9)。实证评估揭示,在非英语环境中存在显著的性能下降,表明当前的多模态对齐仍然高度依赖英语,未能将视觉概念置于真正的语言无关空间中34 (https://arxiv.org/html/2608.15085#bib.bib23);5 (https://arxiv.org/html/2608.15085#bib.bib18)。 一种普遍的直觉将这种差异归因于数据稀缺,这激发了策划大规模多语言多模态数据集的努力7 (https://arxiv.org/html/2608.15085#bib.bib2);30 (https://arxiv.org/html/2608.15085#bib.bib3)。然而,这种以数据为中心的方法成本高昂,且忽略了内部表征机制。新兴共识认识到,MLLMs内部会发展出一个共享的语义空间,多种语言在此汇聚31 (https://arxiv.org/html/2608.15085#bib.bib30)。理想情况下,异构输入应通过同步的跨模态交互收敛至一个语言中立的语义空间。然而,在当前的MLLMs中,由于以语言为中心的架构和不平衡的预训练数据,这个共享空间往往在实证上表现为英语主导29 (https://arxiv.org/html/2608.15085#bib.bib4)。在这种实证观察到的几何结构中,植根于物理现实的视觉信号应作为主动锚点,跨越语言边界表征信息12 (https://arxiv.org/html/2608.15085#bib.bib1);15 (https://arxiv.org/html/2608.15085#bib.bib5);35 (https://arxiv.org/html/2608.15085#bib.bib6)。 参见图片说明图 1:幽灵锚点现象。(a)理想的同步跨模态对齐。(b)模态异步性的现实:在早期层中,快速的语言翻译绕过了延迟的视觉语义涌现。然而,实证现实远非这种同步理想。尽管视觉作为通用锚点在理论上具有前景,但视觉信号对跨语言对齐的辅助作用有限:即使在视觉接地本应有助于理解的理论情况下,非英语语言仍持续表现出系统性缺陷4 (https://arxiv.org/html/2608.15085#bib.bib28);33 (https://arxiv.org/html/2608.15085#bib.bib29)。这种脱节引发了一个关键问题:**为何视觉模态未能充当预期的桥梁?** 我们假设答案在于Transformer架构的时间动力学。通过严格的逐层机制分析,我们揭示了深刻的**模态异步性**:语言表征在早期层中大量收敛至英语语义流形,而视觉接地在网络更深的层次才达到语义成熟。如图1所示,这种早期语言收敛出现的时间远早于视觉语义可用之时。因此,语言流被迫在没有视觉指导的情况下“盲目”映射到英语空间。 模态异步性造成了我们称之为**幽灵锚点**的现象:视觉模态在计算中物理存在,但在关键的早期对齐阶段语义上不可见。因此,模型默认采用视觉无关的翻译路径,这从根本上降低了其非英语视觉推理性能。 为纠正这种异步性,我们提出**ANCHOR**训练框架,旨在同步双流收敛。通过主动视觉锚定(PVA)加速视觉语义涌现,ANCHOR鼓励视觉信号尽早接地并影响语言翻译过程。在xMMMU30 (https://arxiv.org/html/2608.15085#bib.bib3)、MaXM5 (https://arxiv.org/html/2608.15085#bib.bib18)和CVQA18 (https://arxiv.org/html/2608.15085#bib.bib17)等基准测试上的实验表明,我们的方法提升了跨语言视觉性能。 本工作的主要贡献如下: - • 我们系统研究了多语言MLLMs的内部动态,并形式化了**幽灵锚点**现象,其中**模态异步性**导致视觉信号在早期对齐阶段语义上不可及。 - • 我们通过逐层分析和对照干预提供了机制性证据,表明在早期对齐窗口期内,视觉信息对语言翻译轨迹的因果影响微乎其微。 - • 基于这些见解,我们提出了**ANCHOR**训练框架,该框架通过主动视觉锚定(PVA)加速视觉语义涌现来纠正异步性,PVA利用外部视觉基础模型显式监督早期层的视觉表征。 ## 2 相关工作 ##### 跨语言对齐的机制视角 跨语言对齐主要在纯文本多语言模型中被研究,其中语义等价的表达在隐层空间中逐渐汇聚并支持迁移31 (https://arxiv.org/html/2608.15085#bib.bib30);34 (https://arxiv.org/html/2608.15085#bib.bib23)。使用逻辑探针(logit-lens)和因果追踪(causal-tracing)风格的探测,机制分析进一步表明,许多多语言LLM通过以英语为中心的内部表征空间处理非英语输入,其中非英语token在被映射到目标输出之前被隐式翻译为英语语义枢纽28 (https://arxiv.org/html/2608.15085#bib.bib32);19 (https://arxiv.org/html/2608.15085#bib.bib11);31 (https://arxiv.org/html/2608.15085#bib.bib30)。同时,强大的全局对齐可能会损害语言特定能力,尤其是对于低资源或远距离语言8 (https://arxiv.org/html/2608.15085#bib.bib31)。这种张力目前几乎完全在没有视觉的情况下进行分析,尚不清楚视觉信号如何在MLLMs内部重塑(或未能重塑)跨语言对齐29 (https://arxiv.org/html/2608.15085#bib.bib4);24 (https://arxiv.org/html/2608.15085#bib.bib8)。我们的工作填补了这一空白,将机制分析扩展到多模态设置,并表明当模态异步性延迟了关键对齐窗口期间的视觉语义涌现时,视觉信号可能恰好会失败。 ##### 多语言大视觉语言模型 早期的多语言视觉-语言模型如M3P15 (https://arxiv.org/html/2608.15085#bib.bib5)、UC235 (https://arxiv.org/html/2608.15085#bib.bib6)以及相关的BERT时代框架11 (https://arxiv.org/html/2608.15085#bib.bib7)在预训练期间显式优化跨语言和跨模态目标。在大语言模型时代,主流的多语言MLLMs更多依赖规模优先的流程,期望通过大量的翻译或合成指令混合数据来隐式诱导多语言视觉能力30 (https://arxiv.org/html/2608.15085#bib.bib3);7 (https://arxiv.org/html/2608.15085#bib.bib2)。这种以数据为中心的策略提升了基准性能,但标注成本高,并且对如何内部对齐多语言文本和视觉语义的控制有限。更有针对性的方法添加了对齐模块或目标,包括mBLIP9 (https://arxiv.org/html/2608.15085#bib.bib33)、LRM-LLaVA12 (https://arxiv.org/html/2608.15085#bib.bib1)和M2-VLP1 (https://arxiv.org/html/2608.15085#bib.bib34)。然而,它们的监督主要应用于输出或全局分布层面,而非在关键对齐阶段显式约束逐层的跨模态交互。相比之下,我们的方法始于模态异步性的机制诊断,并直接针对关键的逐层交互窗口。 ## 3 揭示模态异步性:机制分析 视觉信号在多语言MLLMs中是否真的作为语言无关的锚点?为回答这个问题,我们系统研究了多语言文本和视觉信号的独立演化轨迹,以及它们在模型内部表征中如何相互作用。 ##### 英语语义流形 为了进行联合推理,MLLMs固有地将异构输入(例如,多语言文本和视觉信号)投影到一个共享的表征空间23 (https://arxiv.org/html/2608.15085#bib.bib24)。在推理期间,来自不同语言31 (https://arxiv.org/html/2608.15085#bib.bib30);32 (https://arxiv.org/html/2608.15085#bib.bib12)和跨模态视觉输入29 (https://arxiv.org/html/2608.15085#bib.bib4);27 (https://arxiv.org/html/2608.15085#bib.bib13)的表征逐渐收敛到一个统一的几何结构中。受当代MLLMs以语言为中心的架构20 (https://arxiv.org/html/2608.15085#bib.bib21);21 (https://arxiv.org/html/2608.15085#bib.bib22)和不平衡预训练数据的驱动,这个共享枢纽在实践中表现为一个以英语主导的空间19 (https://arxiv.org/html/2608.15085#bib.bib11);34 (https://arxiv.org/html/2608.15085#bib.bib23)。因此,我们形式化**英语语义流形**(\(\mathcal{S}_{en}\))为目标坐标系,其中中间隐藏状态 \(h_l\) 在各层中逐渐收敛:\(h_l \xrightarrow{\text{layers}} h^{*} \in \mathcal{S}_{en}\)。 ##### 多语言与模态收敛的动力学。 令 \(\mathcal{S}_{src}\) 表示源语言表征空间,\(\mathcal{S}_{vis}\) 表示视觉token占据的初始感知空间。在这个统一框架内,递推式 \(h_l = f_l(h_{l-1})\) 追踪了向英语语义流形的增量轨迹,其中 \(h_l\) 表示第 \(l\) 层的隐藏状态。我们使用 \(F_l = f_l \circ \cdots \circ f_1\) 表示通过第 \(l\) 层的累积变换。两个流都显示出向 \(\mathcal{S}_{en}\) 的收敛,但遵循不同的轨迹:假设语言流在 \(F_l\) 下经历从 \(\mathcal{S}_{src}\) 到 \(\mathcal{S}_{en}\) 的隐式转换,而视觉流则经历从 \(\mathcal{S}_{vis}\) 到 \(\mathcal{S}_{en}\) 的视觉语义化。 关键在于,要使MLLM执行真正的多模态推理,文本流的隐式翻译理论上应扎根于视觉上下文。由于Transformer架构通过逐层自注意力聚合信息,这种扎根取决于两条路径之间的**时间协调**。如果视觉token在发生翻译的特定层窗口内尚未实现视觉语义化,语言流可能会默认为纯基于文本的转换。这种机制异步性将导致视觉证据被绕过,这可能解释了在多语言环境中观察到的推理失败。在下一节中,我们实证测量这两个过程的确切逐层时序,以检验这种异步性假设。 ### 3.1 模态异步性:早期翻译,延迟语义化 参见图片说明图 2:模态异步性。(a-b)文本流中的逐层英语相似度(\(\text{Sim}_{en}\))和英语翻译比率(\(R_{ET}\))。(c)视觉流中的视觉接地分数(\(S_{VG}\))。阴影区域表示平均标准误(SEM)。为研究这些路径是否同步演化,我们在受控输入条件下提取中间隐藏状态 \(h_l\),其中视觉token与多语言文本描述配对。所有实验细节和指标定义可在附录A中找到。我们使用三个互补指标监控双流收敛。所有词汇级别的投影均采用**逻辑探针**技术16 (https://arxiv.org/html/2608.15085#bib.bib15),该技术通过预训练的反嵌入矩阵将中间隐藏状态映射到词汇表上的概率分布。 - • **文本流:** 我们使用**英语相似度**(\(\text{Sim}_{en}\))和**英语翻译比率**(\(R_{ET}\))分别追踪向 \(\mathcal{S}_{en}\) 的连续几何旋转和离散词汇过渡。具体来说,\(\text{Sim}_{en}\) 测量源序列和英语参考序列的平均隐藏状态之间的余弦相似度。\(R_{ET}\) 通过逻辑探针从每个文本token中提取top-k个解码词,并测量由零样本语言分类器分类为英语的比例。 - • **视觉流:** 我们直接使用**视觉接地分数**(\(S_{VG}\))探测视觉语义化过程,通过逻辑探针追踪视觉token何时解码为真值物体标签。 ##### 发现1:早期语言翻译。 \(\text{Sim}_{en}\) 和 \(R_{ET}\) 都揭示了在最初几层内的快速语言收敛。如图2(a-b)所示,源语言表示高效地向英语表示旋转,并早在第1-5层就解码为英语词汇。这表明,在轨迹的最早期阶段,英语主导的语言转变就已强烈可检测。 ##### 发现2:延迟的视觉语义化。 相比之下,视觉语义出现较晚。图2(
相似文章
超越英语:揭示视觉-语言-动作模型中的多语言差距
本文首次系统研究了视觉-语言-动作(VLA)模型中的多语言指令跟随问题,揭示了当模型基于英语训练时,在其他语言上的性能显著下降。作者提出了多语言主成分对齐(MPCA)方法来缩小多语言性能差距。
Vision-Language Models are Fragile Multilingual Associators
This paper introduces M2BIND, a benchmark to evaluate whether vision-language models maintain stable visual-linguistic associations across languages. It finds that binding is not language-invariant, with cross-family and cross-script settings causing significant performance collapse and weaker internal causal binding.
当视觉为声音代言
本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。