当无关文本变得重要时:多模态大语言模型中的仿射边界移动
摘要
本文研究了无关文本上下文如何偏差多模态大语言模型中的预测,表明上下文诱导的决策边界遵循无上下文边界的仿射变换,为模型敏感性提供了见解。
arXiv:2608.19208v1 公告类型:新
摘要:多模态大语言模型(MLLMs)经常暴露于辅助文本上下文中,其对视觉基础任务的影响尚未得到充分探索。在本文中,我们通过将任务无关上下文表述为二元视觉判断框架中的受控干预来研究其影响。通过保持不变的提示结构并变化辅助输入,我们观察到无关文本在不同基准测试中一致地偏差模型预测。为了超越性能指标,我们通过二元候选之间的对数概率差定义的决策边界来表征这种敏感性。我们的分析揭示了一个稳健的几何规律性:上下文条件边界遵循其无上下文对应边界的仿射变换。这一发现表明,无关上下文不是表现为无结构的随机噪声,而是模型偏好的可估计失真。我们进一步将拟合的仿射参数解释为视觉承诺保持和方向性答案偏差的指标。这些发现为MLLMs中无关上下文效应提供了边界级别的诊断视角,并为未来噪声上下文鲁棒性研究提供了基础。
查看缓存全文
缓存时间: 2026/08/21 09:59
# 当无关文本产生影响:多模态大型语言模型中的仿射裕度偏移 来源:https://arxiv.org/html/2608.19208 王胤丰 姚志远 付哲仁 张磊 毛振东 中国科学技术大学 中国合肥 [email protected] ###### 摘要 多模态大型语言模型(MLLMs)经常暴露于辅助文本上下文中,而这些上下文对视觉相关任务的影响尚未得到充分探索。本文通过在二元视觉判断框架中将其表述为受控干预,研究了任务无关上下文的影响。在保持提示结构不变而改变辅助输入的情况下,我们观察到无关文本在各种基准测试中持续使模型预测产生偏差。为了超越性能指标,我们通过定义二元候选答案之间对数概率差的决策裕度来表征这种敏感性。分析揭示了一个稳健的几何规律:上下文条件裕度遵循其无上下文对应裕度的仿射变换。这一发现表明,无关上下文并非表现为无结构的随机噪声,而是可估计的模型偏好失真。我们进一步将拟合的仿射参数解释为视觉承诺保持和定向答案偏差的度量。这些发现为MLLMs中无关上下文影响提供了裕度层面的诊断视角,并为未来噪声上下文鲁棒性研究奠定了基础。我们在https://github.com/Wangyf1998/Irrelevant_Text_Matters发布了所有代码。 当无关文本产生影响:多模态大型语言模型中的仿射裕度偏移 王胤丰 姚志远 付哲仁 张磊 毛振东††thanks:通讯作者。 中国科学技术大学 中国合肥 [email protected]  图1:受控干预及其行为效应概述。(a)对于每个图像-问题对,我们比较无上下文输入与配对的上下文条件输入,其中插入无关上下文同时保持提示结构不变。(b)跨多个基准测试,无关上下文不仅降低了预测准确率,还将模型决策偏向负面响应。 ## 1 引言 多模态大型语言模型(MLLMs)展现了强大的跨模态理解能力,能够处理视觉问答、多轮推理和多模态智能体等复杂的视觉-语言任务。在这些场景中,输入图像常伴随辅助文本上下文,如检索段落、用户提供的侧面信息或历史对话。此类上下文并不总是与当前任务对齐:检索段落可能偏离主题(Mortaheb等,2025),而指令和对话也可能包含无关信息(Wang等,2024b;Park等,2024)。这引发了一个问题:无关上下文是否影响MLLMs在视觉-语言任务上的预测? 我们的问题源于自然语言处理(NLP)领域的一个更广泛观察:大型语言模型(LLMs)可能对不属于任务相关证据的文本上下文敏感。先前研究表明,无关或干扰性上下文可能在问答和推理任务中误导LLMs(Jia和Liang,2017;Shi等,2023;Amiraz等,2025)。检索增强生成中也存在类似问题,其中包含无关信息的检索段落会影响模型性能(Yoran等,2024;Yan等,2024;Cuconasu等,2024)。在MLLMs中,近期工作显示它们可能过度依赖额外文本上下文并产生强烈偏差(Deng等,2025;Chen等,2024;Zhang等,2024)。然而,尽管存在这些观察,目前仍缺乏对无关上下文如何从行为效应和底层机制两方面转变MLLMs决策的系统性研究。  图2:裕度层面分析示意图。(a)决策裕度定义为正面与负面答案之间的对数概率差。(b)添加无关上下文将无上下文裕度\(m_0\)转换为上下文条件裕度\(m_c\),其近似遵循仿射关系\(m_c \approx a m_0 + b\)。(c)仿射变换将有效决策边界从\(m_0=0\)偏移至\(m_0 = -b/a\)。此偏移扩大了负面区域并压缩了正面区域。因此,翻转区域(即\(0 < |m_0| < |-b/a|\))的样本更可能改变预测。 #### 输入构建 我们为每个图像-问题对创建三种条件。所有模型均使用统一的提示结构,要求“用单个词或短语回答问题”。无上下文输入仅包含图像和问题: > [图像] [问题] 上下文中立输入附加采样的无关上下文: > [图像] [问题] [上下文] 上下文条件输入进一步引入相关性模板: > 以下标题可能与图像相关: 该模板置于上下文之前: > [图像] [问题] [模板] [上下文] 这三种条件代表了无关文本被框定为可能与图像相关的不同程度。所有样本随后输入模型,并使用贪心解码获取最终答案。 #### 评估基准与模型 我们在四个广泛使用的视觉-语言基准上进行评估,这些基准涵盖了多样化的视觉相关判断形式。**POPE**(Li等,2023)专注于物体存在验证,常用于评估MLLMs中的物体幻觉。**AMBER**(Wang等,2023)将此评估扩展到多个幻觉相关维度,包括物体存在、属性和关系。**MME**(Fu等,2023)提供了一个更广泛的诊断基准,涵盖感知导向任务(如颜色、计数、OCR和位置识别)以及认知导向任务(如常识和代码推理)。**GQA**(Hudson和Manning,2019)评估关于物体、属性、关系和空间布局的组合视觉推理。数据统计和实施细节见附录A.3。对于模型,我们报告了LLaVA-1.5-7b(Li等,2023)、Qwen2-VL(Wang等,2024a)系列(2b和7b)和InternVL3-8b(Zhu等,2025)的结果。 #### 混淆因素讨论 我们进一步检查观察到的行为转变是否能由简单的实验混淆因素解释。首先,该效应并非特定于上下文语料库:用替代上下文源(如COCO字幕(Chen等,2015)或打乱的WikiText)替换WikiText保持了主要趋势,尽管类图像字幕倾向于引起更强的干扰。其次,这也不是仅由上下文长度解释的,因为仿射失真在不同长度分组中仍可观察到。最后,提示格式影响现象的程度但不影响其存在。详细设置和结果见附录C.1。 ### 2.3 实验结果 我们报告无上下文条件下的准确率、召回率和是率,以及在上下文中立和上下文条件设置下的变化。我们进一步报告翻转率以衡量样本级预测变化。表1中的结果揭示了三个主要模式: #### 添加无关上下文损害性能。 跨模型和基准,添加图像无关上下文通常会降低预测性能。这种性能下降在上下文中立和上下文条件设置下均出现,表明辅助文本可能干扰视觉相关的预测。 #### 行为转变是定向的。 性能下降伴随着答案偏好的系统性变化。在大多数设置中,添加无关上下文后是率降低,表明引发的误差并非随机。 #### 语义框架放大效应。 上下文条件设置通常比上下文中立设置产生更大的变化,尤其是在是率和翻转率方面。这表明,当相同的无关文本被框定为可能与图像相关时,模型受影响更大。 这些行为模式表明,无关上下文并非作为无结构噪声发挥作用;相反,它系统性地改变了模型的决策偏好。在下一节中,我们通过裕度层面分析详细研究此效应。补充实验结果见附录B.1。 ## 3 仿射裕度偏移 本节中,我们分析无关上下文在logit空间中的影响,并发现一个简单的规律:其影响可通过仿射变换近似。 表2:跨模型和基准的拟合仿射参数。仿射关系表现出持续的高拟合优度,表明此仿射是结构性和稳定的。 ### 3.1 决策裕度设计 给定输入\(x\),我们定义决策裕度为两个候选答案之间的对数概率差: \[ m(x) = \log P(y^+ \mid x) - \log P(y^- \mid x) \] 我们的设计受到DPO(Rafailov等,2023)的启发:其符号指示模型偏好,而其幅度反映置信度。实现细节见附录A.1。 ### 3.2 决策裕度的仿射规律性 图4显示了LLaVA-1.5-7B在四个基准上的仿射裕度模式。我们发现一个规律:无关文本的影响可通过仿射变换表征: \[ m_c \approx a \cdot m_0 + b \] 其中\(a\)和\(b\)是通过最小二乘估计的模型特定参数。进一步,我们有以下观察: #### 仿射形式在不同MLLMs间一致。 表2显示了不同基准和模型在上下文中立设置下的参数。持续的高\(R^2\)值证实仿射关系是对辅助文本输入的基本分数层面响应。此规律独立于特定任务分布而持续存在,表明MLLMs中存在共享的行为约束。 #### 仿射参数跨基准保持稳定。 对于一个模型,拟合的斜率\(a\)和偏移\(b\)在不同基准间保持接近,尽管任务类型和数据分布存在显著差异。这表明仿射模式不是数据集特定的假象,而是反映了模型对辅助文本上下文的特定响应。 #### 不同语义框架影响缩放成分。 与中立相比,条件设置一致产生更小的斜率\(a\),表明更强的裕度压缩。相反,偏移项\(b\)在框架间保持负且量级相当,表明答案方向偏移相对稳定。我们将在下一节对此现象进行解释。 这些观察表明,无关上下文的影响是系统性的失真。更多结果和稳健验证见附录B.2和附录D。 ### 3.3 边界偏移解释预测翻转 以上结果也解释了观察到的行为变化。无上下文时,决策边界位于\(m_0 = 0\)。添加上下文后,裕度近似变换为\(m_c \approx a m_0 + b\),因此上下文条件决策边界满足\(a m_0 + b = 0\)。映射回原始裕度轴,有效边界变为: \[ m_0 = -\frac{b}{a} \] 因此,原始肯定样本必须具有足够大的正裕度才能在添加无关上下文后保持肯定;裕度较弱的样本则可能落入偏移边界以下并翻转。我们通过根据无上下文裕度大小\(|m_0|\)对样本分组并计算每个箱内的翻转率来验证此解释。如图5所示,翻转率对于低裕度样本始终最高,并随着\(|m_0|\)增长而降低,跨模型和基准一致。这证实上下文诱导的翻转并非均匀分布在样本中,而是集中在原始决策边界附近。  图5:跨无上下文裕度箱的翻转率。具有较小\(|m_0|\)的样本在添加无关上下文后更可能改变预测。这表明上下文诱导的翻转集中在原始决策边界附近。 ## 4 解释仿射参数 本节中,我们使用轻量级贝叶斯视角解释拟合参数。 ### 4.1 预备知识 我们首先引入一个轻量级贝叶斯启发式视角,描述无关上下文如何可能进入模型的预测过程。设\(\mathcal{X}\)表示无上下文的原始输入。模型定义无上下文预测分布\(p(Y \mid \mathcal{X})\)。当提供额外上下文\(C\)时,模型在解释输入时可能将其作为额外条件信号。遵循先前工作(Xie等,2021),我们引入潜在解释变量\(Z \in \mathcal{Z}\),其表示任务特定的“概念”。上下文条件预测可写为后验加权边缘化: \[ p(Y \mid \mathcal{X}, C) = \int_{\mathcal{Z}} p(Y \mid \mathcal{X}, Z) \, p(Z \mid \mathcal{X}, C) \, dZ \] 在此视角下,添加\(C\)更新模型对潜在解释的信念: \[ p(Z \mid \mathcal{X}, C) \propto p(C \mid Z, \mathcal{X}) \, p(Z \mid \mathcal{X}) \] 在我们的实验中,\(C\)不提供有用证据,即\(Y \perp C \mid \mathcal{X}\)。然而,图像-文本对齐先验可能引导模型将\(C\)视为有用证据而非无关噪声。因此,\(p(C \mid Z, \mathcal{X})\)可能在潜在解释间非均匀分布,将\(p(Z \mid \mathcal{X}, C)\)从原始信念\(p(Z \mid \mathcal{X})\)转移开。 ### 4.2 仿射参数解释 贝叶斯公式提供了一个合理的视角。在此解释下,拟合的仿射映射总结了两个可观察效应:原始视觉决策结构的保留程度,以及是否存在
相似文章
鲁棒性的错觉:聚合精度掩盖了任务无关上下文下的预测翻转
本文揭示,在聚合层面大语言模型看似对任务无关上下文鲁棒,但在单个示例上预测可能翻转,部分示例性能下降而其他示例提升,突显了聚合精度所掩盖的尾风险。
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
多模态大语言模型在阅读前先看吗?诊断上下文谄媚现象
本文介绍了大语言模型中的多模态上下文谄媚现象,即外部文本覆盖视觉证据,并提出了一种使用 System-2 Visual Arbitration 的诊断方法来提高性能。
语境之代价:在多模态检索增强生成中缓解文本偏差
本文识别并形式化了多模态RAG中的“再污染”现象,即添加准确上下文会导致模型因注意力崩溃(视觉盲区和位置偏差)而放弃正确预测。作者提出BAIR,一种无参数的推理时框架,能恢复视觉显著性并惩罚文本干扰因素,从而在医学、公平性和地理空间基准上提高可靠性。
ContextBias: 文本到图像模型中上下文转变下偏见持续性的受控评估
本文介绍了ContextBias和ContextBench,用于评估文本到图像模型中的偏见持续性,发现在语义无关的上下文中偏见会增加。