哪个来源更可靠?视觉语言模型中的任务依赖性

arXiv cs.CL 论文

摘要

本文研究视觉语言模型在图像或文本模态退化时如何调整对两者依赖的机制,揭示了任务依赖性行为,并引入了一个新的冲突基准用于评估。

arXiv:2608.17205v1 公告类型:新 摘要:视觉语言模型(VLMs)结合图像和文本,但当两者冲突且其中一个更难读取时,模型如何调整其对它们的依赖尚不清楚。我们通过一个受控设置研究这种模态重新分配:我们退化图像或文本在四个可读性级别上,同时保持另一个干净,并跟踪模型偏好如何变化。我们从GSM8K和SVAMP构建冲突,通过将一个算术问题的渲染图像与另一个问题的文本配对,因此两个来源支持不同的答案。我们还引入了ChartQA-Conflict,这是一个包含229个图表-报告冲突的经过人工审查的基准,具有匹配的图表和表格图像表示。我们使用生成的答案和长度归一化的条件对数似然边际评估了六个开放权重VLMs。在GSM8K和SVAMP上,六个模型中有五个更强烈地偏离退化文本而非退化图像。在ChartQA-Conflict上,所有六个似然评分模型表现出相反的模式,更强烈地偏离退化的视觉来源。这种反转在校准单模态精度损失后以及用普通表格图像替换图表后仍然存在。两个前沿API模型,GPT-5.6-Luna和Gemini-3.5-Flash,在行为上复制了ChartQA-Conflict反转,其中GPT-5.6-Luna也匹配算术方向。这些结果表明,VLMs中的模态依赖不是固定的,而是跨任务、证据结构、模型和评估设置而变化。源代码可在https://github.com/Ro-netizen004/multimodal-arbitration-artifact获取。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:52

# 哪种来源胜出?视觉-语言模型中的任务依赖性依赖  
来源:https://arxiv.org/html/2608.17205  

Rodela Ghosh  
Aviral Gupta¹  
¹ 脚注标记:1  
隶属:南佛罗里达大学  
邮箱:[aviralgupta@usf\.edu](mailto:)  

Guangjing Wang  
隶属:南佛罗里达大学  
邮箱:[guangjingwang@usf\.edu](mailto:)  

###### 摘要  
视觉-语言模型(VLMs)结合图像与文本,但当两者冲突且一方变得更难读取时,模型如何转移其对两者的依赖尚不明确。我们通过受控设置研究了这种*模态再分配*现象:在四个可读性等级上对图像或文本进行降质处理,同时保持另一模态清晰,并追踪模型偏好的变化。我们通过配对GSM8K和SVAMP中渲染的算术问题图像与另一问题的文本(使两个来源支持不同答案)来构建冲突。我们还引入了ChartQA-Conflict,这是一个包含229个图表-报告冲突的人工审核基准,其中图表与表格图像表示相匹配。我们使用生成答案和长度归一化的条件对数似然差对六个开源权重VLMs进行了评估。在GSM8K和SVAMP上,六个模型中有五个对降质文本的依赖减少程度大于对降质图像的依赖减少程度。而在ChartQA-Conflict上,所有六个基于似然评分的模型表现出相反的模式,对降质视觉来源的依赖减少程度更强。这种反转在针对单模态精度损失进行校准以及将图表替换为普通表格图像后依然存在。两个前沿API模型GPT-5.6-Luna和Gemini-3.5-Flash在行为上复现了ChartQA-Conflict的反转现象,其中GPT-5.6-Luna在算术方向上也表现出相似的依赖模式。这些结果表明,VLMs中的模态依赖性并非固定不变,而是随任务、证据结构、模型和评估设置的不同而变化。源代码可在https://github.com/Ro-netizen004/multimodal-arbitration-artifact获取。  

## 1 引言  
人类会整合多感官线索,并在线索冲突时降低对噪声更大来源的权重⁸ (https://arxiv.org/html/2608.17205#bib.bib15);⁹ (https://arxiv.org/html/2608.17205#bib.bib16)。视觉-语言模型(VLMs)同样整合视觉与文本输入,但尚不清楚当其中一个变得不太可靠时,它们是否适当地重新校准对每个模态的依赖。  

模型输入:  
您被提供了描述一个数学问题的两个来源。来源A是附带的图像。来源B是下方的文本。请逐步解决问题,并以####结束。  
来源A — 附带的图像  
请参见说明文字  
来源B — 文本  
一件长袍需要2卷蓝色纤维和一半量的白色纤维。总共需要多少卷?  

图1:VLM被提示基于两个独立的信息来源解决问题。来源A是图像,渲染一个问题;来源B是*不同*问题的文本。  

先前研究表明,当基于文本的问题以图像形式展示而非以纯文本提供时,VLMs的性能更差³⁵ (https://arxiv.org/html/2608.17205#bib.bib4);³⁴ (https://arxiv.org/html/2608.17205#bib.bib5);¹⁹ (https://arxiv.org/html/2608.17205#bib.bib6)。这种性能差距部分归因于在恢复内容后进行推理之前从图像中提取信息的额外挑战³⁰ (https://arxiv.org/html/2608.17205#bib.bib7)。然而,现有评估通常单独测试视觉和文本输入,无法确定当两者同时呈现但提供冲突证据时,模型依赖哪个模态。  

在本文中,我们提出:当一个来源变得更难读取时,VLM是否会将其依赖转向另一个?无论我们降质图像还是文本,转移的量是否相同?非对称的转移将表明模态重加权不仅取决于降质水平,还取决于哪个模态被降质以及模型在特定任务中的评估方式。  

为了回答这个问题,我们构建了多个评估数据集。  
(i) 我们使用GSM8K⁵ (https://arxiv.org/html/2608.17205#bib.bib1)和SVAMP²⁵ (https://arxiv.org/html/2608.17205#bib.bib17)算术数据集创建受控的图像-文本冲突。具体而言,我们将一个算术问题从纯文本渲染成图片。然后,我们将一个问题的渲染图像与另一个问题的文本配对,使两个来源支持不同的答案,如图1所示 (https://arxiv.org/html/2608.17205#S1.F1)。我们定义了四个可读性等级,然后将图像或文本降质到不同的可读性等级,同时保持另一个来源清晰。为避免暗示主要模态,我们将输入称为来源A和来源B,并在条目间平衡这些标签。  
(ii) 我们进一步从ChartQA²⁰ (https://arxiv.org/html/2608.17205#bib.bib3)构建ChartQA-Conflict,将每个图表与支持冲突答案的文本报告配对。该数据集测试了观察到的模态依赖模式是否能推广到渲染文本图像之外。  

我们在三个基准测试的受控图像-文本冲突中评估了六个开源权重VLMs。实验揭示了一种任务依赖的不对称性:在算术基准测试(GSM8K和SVAMP)上,六个模型中有五个对降质文本的依赖减少程度大于对降质图像的依赖减少程度。相比之下,在ChartQA-Conflict上,所有六个基于似然评分的模型对降质视觉来源的依赖减少程度更强。这种反转在针对单模态精度损失进行校准以及将图表替换为普通表格图像后依然存在,表明VLMs并不表现出对文本或视觉的固定偏好。两个前沿API模型GPT-5.6-Luna和Gemini-3.5-Flash在行为上复现了ChartQA-Conflict的反转现象,表明这种模式不仅限于开源权重模型。相反,模态再分配取决于任务、证据结构、模型,并在较小程度上取决于提示框架。  

总之,我们的贡献如下:  
- • 一个新的问题表述和基于冲突的评估数据集。我们引入了*模态再分配*问题:当视觉和文本来源冲突且其中一个变得更难读取时,VLMs如何在两者间重新分配其依赖。我们从GSM8K和SVAMP构建了受控冲突,并引入了ChartQA-Conflict,这是一个包含229个图表-报告冲突的人工审核基准,其中图表与表格图像表示相匹配。  
- • 用于衡量来源依赖的受控框架。我们在四个可读性等级上对视觉或文本来源进行降质,同时保持另一个来源清晰,平衡来源标签,并使用生成答案和长度归一化的条件对数似然差来量化偏好。这种设计使得能够对每个降质模态的依赖转移强度进行条目内比较。  
- • 模态再分配是场景依赖而非固定不变的证据。在算术冲突中,五个模型对降质文本的依赖减少更强,而在ChartQA-Conflict上,所有六个CLL评分模型显示出相反的模式。这种反转在针对单模态精度损失进行校准以及将图表替换为表格图像后依然存在,并且被两个前沿API模型(GPT-5.6-Luna和Gemini-3.5-Flash)在行为上复现,表明VLM的依赖取决于任务、证据结构和模型,而不是反映对文本或视觉的普遍偏好。  

## 2 相关工作  
##### VLM模态依赖偏好。  
VLMs在问题以图像形式呈现而非原生文本时往往表现不佳³⁵ (https://arxiv.org/html/2608.17205#bib.bib4);³⁴ (https://arxiv.org/html/2608.17205#bib.bib5);¹⁹ (https://arxiv.org/html/2608.17205#bib.bib6)。然而,这些研究比较的是不同输入格式下的性能,而非考察当视觉和文本来源提供冲突答案时模型遵循哪个模态。更广泛地说,有文献指出VLMs对视觉信息使用不足,并默认依赖文本线索¹³ (https://arxiv.org/html/2608.17205#bib.bib8)。然而,¹² (https://arxiv.org/html/2608.17205#bib.bib9)将图像与矛盾的标题配对,并表明在固定冲突水平下,来源偏好是系统性的、模型依赖的,并反映在内部表示中。²³ (https://arxiv.org/html/2608.17205#bib.bib21)使用基于logit的分析和因果干预研究了视觉证据与模型存储知识之间的冲突。SimpleOCR²⁶ (https://arxiv.org/html/2608.17205#bib.bib20)也将问题渲染为图像以研究模态利用差距。然而,SimpleOCR使用渲染是为了提高视觉阅读能力,而非引发跨模态冲突。我们的研究在三个方面扩展了这条工作线。首先,我们研究了多步推理任务中的冲突,而非简单的物体识别任务。其次,我们在四个可读性等级上让图像或文本变得更难读取,并追踪模型在相同条目上偏好如何变化。第三,我们使用平衡的来源A/B标签,使任何来源都不被框定为主要输入。  

##### 冲突输入的属性。  
先前研究改变了冲突证据的属性。一些研究降质文本信息⁶ (https://arxiv.org/html/2608.17205#bib.bib10)。其他研究改变推理难度或不确定性²⁷ (https://arxiv.org/html/2608.17205#bib.bib11);³⁷ (https://arxiv.org/html/2608.17205#bib.bib13)。进一步的研究询问,当答案遵循文本时,视觉证据是否在内部被表示²² (https://arxiv.org/html/2608.17205#bib.bib12),以及思维链痕迹是否看起来视觉上基于图像而实际上却遵循文本²⁸ (https://arxiv.org/html/2608.17205#bib.bib14)。这些研究都只操作了一个来源。我们则在条目匹配的降质臂中对图像和文本进行降质,降质等级在名义上对齐,并比较在每种情况下来源偏好如何变化。我们不假设两个降质等级同等严重,我们设计了一个二次分析,使用测量到的单模态精度下降来调整严重性。  

CMC-Bench³ (https://arxiv.org/html/2608.17205#bib.bib18)使用ChartQA和MMMU³⁶ (https://arxiv.org/html/2608.17205#bib.bib29)创建图像-文本冲突,但改变冲突类型以评估准确性和弃权²¹ (https://arxiv.org/html/2608.17205#bib.bib19)。相比之下,我们保持每个冲突固定,分别对每个来源在四个等级上进行降质,并使用生成答案和长度归一化的似然差在条目内衡量来源偏好的变化。  

冲突构建 | 降质一个来源 | 结果度量  
视觉来源 | aIa\_\{I\} 渲染的问题或图表 | 生成的选择:它产生哪个答案  
文本来源 | aTa\_\{T\} 问题文本或报告 | CLL差:长度归一化的对数似然  
降质视觉 → 文本保持清晰 | ⋅\\cdot 4个等级  
降质文本 → 视觉保持清晰 | ⋅\\cdot 4个等级  
角色中立提示 | 视觉和文本来源标记为来源A / B,在条目间平衡  

两种设置:  
图像 + 文本问题(GSM8K, SVAMP)  
图表 + 报告(ChartQA-Conflict)  

图2:实验逻辑。我们将一个问题的渲染图像与另一个问题的文本配对,使两个来源支持不同的答案(aIa\_\{I\} 与 aTa\_\{T\})。角色中立的提示将其标记为来源A/B,在条目间平衡。从清晰的配对开始,我们在保持另一个来源清晰的情况下,对每个来源分别进行四个可读性等级的降质,并使用生成的选择和长度归一化的CLL偏好差来评分每个试验。  

## 3 方法论  
在本节中,我们评估当模型的一个模态变得更难读取时,模型如何在图像和文本之间重新分配其依赖,这被称为*来源再分配*。如图2所示 (https://arxiv.org/html/2608.17205#S2.F2),流程在两种冲突设置中相同。在这两种设置中,模型都接收一个支持不同答案的图像和文本。我们在保持另一个模态清晰的情况下,对一个模态进行四个可读性等级的降质。然后,我们使用生成答案和长度归一化的CLL差(§3.3 (https://arxiv.org/html/2608.17205#S3.SS3))来衡量来源偏好。对于每个模型,我们比较当图像降质时与当文本降质时,偏好转移是否更强烈。  

两种设置在冲突构建方式上有所不同。在GSM8K和SVAMP上的*渲染文本冲突*中,图像和文本包含自然语言表达的不同算术问题。在ChartQA-Conflict上的*自然视觉冲突*中,两个来源都处理同一个问题,但图表和附带的报告支持不同的答案。相同的降质、测量和比较程序(§3.3 (https://arxiv.org/html/2608.17205#S3.SS3))适用于两种设置。  

### 3.1 模型  
我们评估了六个覆盖四个系列和2–8B参数的开源权重VLMs:Qwen2-VL-2B³¹ (https://arxiv.org/html/2608.17205#bib.bib22)、Qwen2.5-VL-7B² (https://arxiv.org/html/2608.17205#bib.bib23)、LLaVA-1.6-Mistral-7B¹⁷ (https://arxiv.org/html/2608.17205#bib.bib27);¹⁸ (https://arxiv.org/html/2608.17205#bib.bib28)、LLaVA-OneVision-7B¹⁵ (https://arxiv.org/html/2608.17205#bib.bib24)、Idefics3-8B¹⁴ (https://arxiv.org/html/2608.17205#bib.bib25)和Phi-3.5-Vision-4B¹ (https://arxiv.org/html/2608.17205#bib.bib26)。所有六个模型都使用条件对数似然进行评估。生成答案评估也对所有六个进行,尽管Phi-3.5-Vision在ChartQA-Conflict上产生的可决定响应太少,无法进行可靠的行为分析。第七个模型InternVL2-8B⁴ (https://arxiv.org/html/2608.17205#bib.bib2)以及两个前沿API模型GPT-5.6-Luna和Gemini-3.5-Flash缺少CLL差所需的续写评分接口,仅用于行为(生成答案)证据,将单独报告(§4.6 (https://arxiv.org/html/2608.17205#S4.SS6),附录D (https://arxiv.org/html/2608.17205#A4))。模型在无量化情况下加载,并在支持的情况下使用bfloat16解码。完整软件版本见附录A (https://arxiv.org/html/2608.17205#A1)。  

### 3.2 数据集构建  
#### 3.2.1 渲染图像冲突  
我们将一个基于自然语言的数学问题的渲染图像与不同问题的原生文本配对。由于两个问题支持不同的答案,模型的响应表明它遵循哪个来源。具体来说,图像问题\(i\)与文本问题\((i+1) \bmod N\)配对,其中\(N\)是基准测试问题的数量。等价地,文本问题\(i\)与图像问题\((i-1) \bmod N\)配对。图1 (https://arxiv.org/html/2608.17205#S1.F1)展示了一个示例,其中响应\(a_{I}=18\)是遵循图像,\(a_{T}=3\)是遵循文本。对于奇数索引的条目,来源A/B标签互换,因此没有哪个模态总是来源A。我们排除了两个问题答案相同的配对,以避免混淆后续的偏好分析。图像使用DejaVu Sans渲染为900像素宽的PNG文件,白底黑字。每个图像包含与其原生文本版本相同的信息,因此仅输入格式不同。我们还在仅文本和仅图像条件下分别评估了每个问题。  

#### 3.2.2 自然视觉冲突  
##### 构建。  
每个ChartQA-Conflict条目将一个原生图表(支持答案\(a_{I}\))与一个附带的文本报告配对,该报告为同一问题的不同答案\(a_{T}\)提供了反事实证据(图5 (https://arxiv.org/html/2608.17205#A9.F5));与渲染图像设置(§3.2.1 (https://arxiv.org/html/2608.17205#S3.SS2.SSS1))不同,图表具有原生视觉结构(柱状、轴、……

相似文章

看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础

arXiv cs.CL

本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。

视觉语言模型真的能进行视觉推理吗?模态差距的严格研究

arXiv cs.CL

本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。