多模态大语言模型在阅读前先看吗?诊断上下文谄媚现象

arXiv cs.CL 论文

摘要

本文介绍了大语言模型中的多模态上下文谄媚现象,即外部文本覆盖视觉证据,并提出了一种使用 System-2 Visual Arbitration 的诊断方法来提高性能。

arXiv:2609.00067v1 公告类型:新 摘要:在多模态大语言模型中,外部文本可以覆盖冲突的图像证据,这种失败我们称之为多模态上下文谄媚。我们引入了一个 998 个案例的诊断方法,独立变化视觉证据、常识先验和外部文本,并通过围绕上下文盲视觉见证者移动信息边界来探测这种失败何时出现。在异常图像与 Gemini 生成的错误文本配对的情况下,GPT-5.1 在联合条件下得分为 7.9%,当上下文盲见证者报告直接评分时得分为 49.7%,在匹配的两次调用见证者-仲裁者管道中得分为 63.7%(该管道将文本暴露给见证者),而在 System-2 Visual Arbitration (S2VA) 下得分为 84.2%(该仲裁对见证者隐藏文本)。在六种模型中,S2VA 比直接见证者报告提高了 19.7 到 44.1 分,所有配对的 95% 置信区间均不包括零。最佳信息边界并不统一:文本上下文支撑了一些模型,而一个 GPT-4o 重新生成的子集改变了联合条件、仅见证者和 S2VA 的相对排序。因此,上下文谄媚对文本引入的时间、模型以及上下文来源都很敏感。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:45

# 多模态大语言模型是否在阅读前先观察?语境谄媚现象诊断  
来源:https://arxiv.org/html/2609.00067  

黄鹤宪  
单位:中央研究院资讯科学研究所  
单位:台湾台北市  
邮箱:[[email protected]](mailto:)  
邮箱:[[email protected]](mailto:)  

###### 摘要  
在多模态大语言模型中,外部文本可能覆盖与之冲突的图像证据,这种现象我们称之为多模态语境谄媚。我们引入了一个包含998个案例的诊断测试,该测试独立操纵视觉证据、常识先验和外部文本,并通过调整上下文无关的“视觉见证者”获取信息的边界,探究该现象何时发生。在异常图像与Gemini生成的虚假文本配对时,GPT-5.1在不同条件下的得分分别为:联合条件处理下7.9%,直接评分上下文无关的见证者报告时为49.7%,在让见证者接触文本的匹配双调用见证-仲裁流程中为63.7%,而在不向见证者提供文本的“系统2视觉仲裁”(S2VA)中则达到84.2%。在六款模型中,S2VA相比直接见证者报告的提升幅度为19.7–44.1个百分点,所有配对的95%置信区间均不包含零。最优的信息边界并非固定统一:文本语境对某些模型具有脚手架辅助作用,而一个GPT-4o生成的子集改变了联合条件、仅见证者模式和S2VA的相对排序。因此,语境谄媚现象不仅取决于文本引入的时机,还与具体模型及语境来源密切相关。

## 1 引言  
多模态大语言模型(MLLMs)越来越多地在评估和部署中结合外部文本:如检索到的段落、图像描述、元数据或用户提供的说明。我们特别关注图像-文本视觉-语言输入场景。此类文本本意在于引导模型,但当其与图像信息冲突时,可能改变模型“所见”的承诺——例如,即使存在矛盾的视觉证据,仍生成与图像描述一致的回答。我们将此现象称为多模态语境谄媚:外部文本覆盖视觉证据,类似于对用户陈述信念的谄媚,但由外部信息流诱发。关键问题不在于模型能否看见,而在于它是在阅读前先观察,还是在阅读后才观察。与普通视觉幻觉不同,这种错误由看似合理的竞争性信息源引发。因此,我们将任务框架化为基于语境的图像-文本评估:给定固定的图像-问答对,外部文本如何改变视觉答案?这又如何揭示模型接触文本的时机?

为检验时机是否重要,我们比较了联合条件处理与分阶段探测:模型首先根据图像和问题形成视觉描述,之后由仲裁者将其与文本进行调和。在主要的GPT-5.1实验条件下,准确率从联合处理的7.9%上升到S2VA下的84.2%。在各模型中,仲裁机制普遍提升了独立见证者的表现,而延迟语境引入的价值则随模型和语境生成器的不同而变化。该效应高度依赖于模型。我们将观察到的模式描述为特定于基准的角色,而非固定模型类别:在“干扰模式”(GPT-5.1、Gemini 2.5和Qwen3-Thinking)下,文本可能扰乱对异常图像的推理;在“脚手架模式”(Claude Sonnet 4.5、Qwen3-Instruct和Kimi-K2.5)下,文本可帮助构建视觉解读框架。这种区分在操作上至关重要,因为在干扰模式下严格隔离信息有效,但在脚手架模式下可能移除有用的结构。

#### 创新点  
先前的冲突与谄媚基准研究关注当视觉与文本证据冲突时,模型会遵循哪个信息源(Liu et al. (2025);Jia et al. (2025);Chen et al. (2026);Wang et al. (2026))。而我们关注的是这种偏好在何时形成——通过在模型生成视觉描述之前或之后移动信息边界来探究。我们的贡献包括:  
1. 引入了一个包含998个案例的基于语境的诊断基准,独立操纵视觉证据、常识先验和外部文本,并包含文本遵循率和谄媚率指标。  
2. 识别出两种特定于基准的响应模式:真实文本干扰,以及模型使用文本语境时的“干扰-脚手架”分类。  
3. 通过信息边界消融实验定位失败原因,该实验分离了分阶段提示、语境延迟引入和仲裁机制的贡献,其效果依赖于具体模型和生成器。

## 2 相关工作  
现有工作通常探讨当视觉、语言和先验知识冲突时哪个信息源占优。而我们关注的是竞争性文本相对于视觉承诺的引入时机。这种时间视角组织了最相关的先前研究:谄媚和冲突基准测量压力的结果,而我们的诊断则移动信息边界以测试压力是否会改变视觉解读本身。  
谄媚通常被研究为对用户陈述信念或偏好的遵从,而非对真实性的遵从(Sharma et al. (2024);McKenzie et al. (2023))。在视觉-语言场景中,相关研究探讨引导性或欺骗性提问措辞是否能使模型偏离图像。我们的设置在来源和时机上均不同:压力来自外部信息流(检索的文本、图像描述、元数据或用户提供的语境),并且我们询问它是否在答案选择之前就转移了视觉承诺。  
视觉-知识冲突基准表明,MLLMs可能优先选择参数化常识而非视觉证据(Liu et al. (2025))。MMKC-Bench将此扩展到多模态知识冲突,报告称即使检测到冲突,模型也可能倾向于内部知识而非外部证据(Jia et al. (2025))。同期基准进一步阐明了这一点:CDH-Bench将该现象描述为在反直觉图像上由常识驱动的幻觉(Chen et al. (2026)),而V-FAT则将文本偏差分解为内部(参数化)和外部(指令诱导)来源,并报告在语言支配性高时视觉崩溃(Wang et al. (2026))。仅靠扩大规模无法解决此类冲突——更大的视觉-语言模型在高冲突试验中可能表现低于随机水平(Wang et al. (2025)),这反映出我们发现的某个高性能模型也是最易受影响的模型之一。这些工作测量冲突下的信息源偏好;我们在此基础上独立操纵视觉真实性、参数化先验和外部文本,然后改变文本引入的时机。  
MLLMs中的幻觉缓解通常针对无支持的生成或静态先验。Woodpecker验证并修正生成的视觉声明(Yin et al. (2024));VCD通过对比在原始与失真图像上的解码来减少物体幻觉(Leng et al. (2024));因果方法如Causal-LLaVA和CausalMM通过解纠缠或因果注意力调整来减少先验诱导的幻觉(Hu et al. (2025);Zhou et al. (2025))。这些解决了重要的语义接地问题,但它们并未直接测试模型在外部文本引入后视觉解读是否改变。附录A将我们的诊断置于更广泛的缓解格局中,附录G报告了额外的提示兼容控制。

## 3 基于语境的诊断设置  
#### 符号说明  
实践中,\(Y_K\) 是由生成的问题设定并由虚假文本强化的“典型世界”答案。当 \(Y_V = Y_K\) 时为“一致”条件,当 \(Y_V \neq Y_K\) 时为“不一致”条件。在异常案例中,虚假文本支持 \(Y_K\) 而非 \(Y_V\);我们称这些案例为“虚假文本陷阱”。我们报告文本遵循率(采纳虚假文本)和谄媚率(既采纳虚假文本又与视觉证据矛盾)。在此受控诊断中,\(Y_V\) 作为预设的参考答案;第5.2节定义了评分标准。我们保持图像 \(V\) 和问题 \(Q\) 固定,仅改变外部文本 \(C\)。因此,任何答案变化都反映了模型如何整合文本、视觉证据和先验知识。在联合条件下,\(V\) 和 \(C\) 共享同一上下文窗口,因此 \(C\) 可能在冲突被明确解决之前就“预设”了视觉解读路径。该基准通过提出既需要视觉依据又允许常识先验回答的问题,使这一路径可被观测。虚假文本强化先验;真实文本测试即使文本事实正确,失败是否依然存在。

表 1:受控证据配置。`+` 表示相等,`-` 表示不等;`–` 表示无文本。  
| 条件 | \(Y_V = Y_K\) | \(C = Y_V\) | \(C = Y_K\) | 关系 |  
| :--- | :---: | :---: | :---: | :--- |  
| 正常-真实 | + | + | + | 同时符合两者 |  
| 正常-虚假 | + | - | - | 与两者均冲突 |  
| 正常-无关 | + | - | - | 均不支持 |  
| 异常-无文本 | - | – | – | 无文本 |  
| 异常-真实 | - | + | - | 符合视觉 |  
| 异常-虚假 | - | - | + | 符合先验 |  
| 异常-无关 | - | - | - | 均不支持 |  

### 3.1 隔离测试  
隔离测试强制执行两步分离。首先,模型在没有 \(C\) 的情况下处理 \(V\),生成一个上下文无关的见证者描述 \(W\);然后仲裁者才同时看到 \(C\) 和 \(W\):  
\[ W = \text{LLM}(V, Q, P_w), \quad C \notin \mathrm{ctx}_w \]  
\[ A = \text{LLM}(Q, C, W, P_a) \]  
其中 \(P_w\) 和 \(P_a\) 分别是见证者和仲裁者的提示词,\(\mathrm{ctx}_w\) 是见证者的上下文窗口。这并未移除先验 \(K\),但它阻止外部语境在模型承诺于 \(W\) 之前进入初始视觉读出(图1)。  

图 1:信息流与组件控制。

## 4 信息边界探测  
我们将完整的上下文无关见证者随后进行上下文感知仲裁的过程称为“系统2视觉仲裁”(S2VA)。我们比较三种外部文本可用时机不同的条件。  
* **泄漏见证者(Leaky)**:遵循双调用流程,但让见证者接触 \(C\)。  
* **仅见证者(Witness-Only)**:延迟引入 \(C\),并直接使用生成的视觉描述 \(W\) 作为答案。  
* **S2VA**:首先生成相同的上下文无关见证者,然后通过第二次仲裁调用引入 \(C\)。  
这些条件共同分离了视觉承诺期间的语境暴露与后续的语境调和。

### 4.1 第一步:上下文无关的视觉承诺  
见证者仅根据图像和问题生成 \(W\)(公式 (1))。在“仅见证者”模式下,\(W\) 被直接用作最终答案。在“泄漏”条件下,同一见证者步骤也会接收外部文本 \(C\)。

### 4.2 第二步:上下文感知的仲裁  
在S2VA中,仲裁者在第二次模型调用中接收 \(Q\)、\(C\) 和 \(W\)(公式 (2))。提示词规定:当见证者置信度超过 0.7 且 \(W\) 与外部文本矛盾时,优先采用 \(W\);当置信度低于 0.4 或见证者明确报告相关证据不可见时,允许依赖外部文本或通用知识;在其余情况下,仲裁者在相同的视觉偏好层级下权衡所提供的证据。附录D报告了使用单一置信度阈值的补充敏感性分析。

## 5 实验设置  
我们将外部文本表示为一个与每个图像-问答实例配对的受控句子。这种固定格式允许我们改变文本是否支持视觉证据、常识先验或两者都不支持,同时保持图像和问题不变。

### 5.1 诊断数据集构建  
该基准包含998个平衡且有意对抗的案例,旨在最大化视觉证据、模型先验和文本语境之间的冲突。图2总结了陷阱案例和对照案例的生成方式。

* **陷阱案例:异常图像(499张)**  
  异常分割使用来自WHOOPS!数据集的499张图像,其中可见场景与常识预期冲突。对于每张图像,Gemini 3 Flash生成一个可通过常识回答的问题、视觉真实答案和三个文本变体。虚假文本设计为支持先验答案而非图像,这构成了最强的对抗分割。我们将异常类别作为覆盖度检查,并在附录M中讨论生成器风格的伪影。  

* **对照案例:正常图像(499张)**  
  对照分割使用499张标准ImageNet图像,具有相同的问题和文本条件结构,但视觉真实答案与先验预期一致。这些一致案例用于检测在普通多模态问题上的性能下降,并将陷阱特有的失败与一般的提示性能下降分开。

* **文本条件与虚假文本强度变体**  
  每个案例在三种基线条件下评估:真实文本、虚假文本和无关文本。剂量反应释义(中等文本、弱文本)由Gemini 3 Flash以递减的特异性生成。扩展条件(无语境和随机文本)通过编程推导得出。

* **跨生成器控制**  
  为评估生成器敏感性,我们使用GPT-4o重新生成了一个包含200个案例的保留子集(100个异常和100个正常),保持原始图像和视觉真实标签固定。附录H报告了在异常图像子集上的结果。

### 5.2 实现细节与可复现性  
所有模型均通过提供商API查询(温度0.0;最大图像边长1024像素;直接/思维链调用输出上限1024词元,S2VA上限2048词元;时间为2026年4–5月;提示词见附录N)。对于所评估的模型系列,我们尽可能引用公开的技术报告、系统卡片或官方模型文档。  
GPT-5.1 (Singh et al. (2026))  
Gemini 2.5 (Comanici et al. (2025))

相似文章

超越文本主导:理解全模态大语言模型的模态偏好

Hugging Face Daily Papers

# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa

多模态大语言模型能理解OCT吗?

Hugging Face Daily Papers

本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。