缓视缓抑:理解模态在上下文记忆冲突中的影响

arXiv cs.CL 论文

摘要

本文探讨了视觉-语言模型如何处理上下文知识与参数知识之间的冲突,揭示了不对称偏差:对于文本实体,模型倾向于偏好上下文信息;而对于图像实体,则偏好参数信息,原因是视觉处理较慢。

arXiv:2609.00293v1 公告类型:新 摘要:我们研究了视觉-语言模型(VLMs)如何处理上下文记忆冲突;即模型在上下文中被给予的信息与训练期间参数化存储的信息不同的情况。我们记录了不对称偏差:模型倾向于偏好关于文本实体的上下文信息,但偏好关于图像实体的参数信息。我们将这种不对称性与跨模态的延迟表示对齐联系起来,表明解析视觉实体所需的较长处理时间阻止了模型通常事实回忆机制的抑制,从而导致更多的参数化答案。思维链推理似乎未能弥合这一差距,但增加上下文中的视觉信息量确实显示出效果。这些结果说明了随着模型日益多模态和检索增强,确保行为一致性的复杂性。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:49

# 视而不察,抑而不制:理解模态在上下文-记忆冲突中的效应
来源:https://arxiv.org/html/2609.00293

###### 摘要
我们研究视觉-语言模型(VLMs)如何处理上下文-记忆冲突;即模型在上下文中获得的信息与其训练时参数化存储的信息不同的情况。我们记录了不对称偏置:模型倾向于优先采用文本中出现的实体的上下文信息,但对图像中出现的实体则倾向于优先采用参数化信息。我们将这种不对称性归因于跨模态的延迟表征对齐,表明解决视觉实体所需的较长处理时间阻碍了模型常规事实回忆机制的抑制,从而导致更多的参数化回答。思维链推理似乎未能弥合这一差距,但增加上下文中视觉信息量则显示出效果。这些结果阐释了随着模型日益多模态化以及检索增强,确保行为一致性所面临的复杂性。代码和数据集可在 https://github.com/aparaselli/slow-to-see-slow-to-suppress 获取。

## 1 引言
现代AI系统通常被期望在上下文信息比编码在其参数化权重中的信息更新、更具体针对任务或在事实上更可靠时,依赖于上下文信息。这通常发生,例如,当前沿系统集成检索增强生成(RAG)(Gao et al., 2023 (https://arxiv.org/html/2609.00293#bib.bib1)) 或其他类型的工具 (Schick et al., 2023) (https://arxiv.org/html/2609.00293#bib.bib21) 以向模型提供在其权重中可能不可用或不可靠的信息时。先前的工作研究了大型语言模型(LLMs)如何应对上下文知识与参数化知识之间的冲突。例如,Yu et al. (2023) (https://arxiv.org/html/2609.00293#bib.bib2) 在玩具设置中刻画了调节模型回忆参数化知识还是上下文知识倾向的特定机制,而 Xie et al. (2024) (https://arxiv.org/html/2609.00293#bib.bib3) 和 Kortukov et al. (2024) (https://arxiv.org/html/2609.00293#bib.bib4) 则在更现实的场景中描述了模型的偏置。然而,检索增强和工具使用日益不仅限于文本,而可能包含多样的模态和数据类型 (Abootorabi et al., 2025 (https://arxiv.org/html/2609.00293#bib.bib19))。关于模型在模态边界上如何识别和调和这些冲突,我们知之甚少。

在这项工作中,我们研究了视觉-语言模型(VLMs)中的上下文-记忆冲突。我们使用了一个受控的事实检索设置,其中上下文信息包含文本和图像信息的混合,旨在模拟可能源自多模态RAG管道的上下文。首先,我们证明了跨模态的不对称偏置:VLMs倾向于优先采用文本中提及的实体的上下文信息,但对图像中出现的实体则倾向于优先采用参数化信息(§4 (https://arxiv.org/html/2609.00293#S4))。然后,我们确定了一种冲突解决机制来解释这种不对称性(§5 (https://arxiv.org/html/2609.00293#S5))。具体来说,我们发现:对于文本实体,VLMs依赖注意力来检测潜在冲突,并相应地抑制通常负责参数化信息检索的早期层MLP (Geva et al., 2023 (https://arxiv.org/html/2609.00293#bib.bib15));然而,对于图像实体,VLMs解析上下文参考较慢 (Venhoff et al., 2025b (https://arxiv.org/html/2609.00293#bib.bib11)),因此未能抑制相关MLP,导致模型产生参数化回答。最后,我们考虑了几种基于提示的方法来缓解这种不对称性(§6 (https://arxiv.org/html/2609.00293#S6))。我们发现思维链(CoT)对减轻模态不对称性影响甚微,但上下文中存在更多图像信息则减少了视觉实体的参数化偏置。

总而言之,我们的结果指向了影响我们可靠更新多模态、检索增强AI系统所提供信息能力的重要机制。总结来说,我们做出了以下贡献:
1. 我们策划了一个包含37K实例、跨越三个领域的冲突事实检索数据集。
2. 我们表明,在纯文本上下文下,VLMs表现出一种不对称的行为倾向:当实体以文本形式呈现时,它们偏好上下文信息;但当同一实体以视觉形式呈现时,则偏好参数化信息。
3. 我们确定了一种以实体解析为条件的事实回忆抑制机制来解释这种不对称性。
4. 我们评估了用于减少这种不对称性的基于提示的干预措施。我们发现CoT提示影响甚微,而增加图像基底的上下文信息量减少了视觉实体的参数化偏置。
参考说明图1:以文本实体(a)和视觉实体(b)引发的上下文-记忆冲突。

## 2 相关工作
#### LLM/VLMs中的知识检索。LLMs中的知识检索依赖于一个两步过程:实体位置的MLP充分丰富实体表征,使得生成标记处的注意力头能够提取所需关系并促进最终答案的产生 (Meng et al., 2022 (https://arxiv.org/html/2609.00293#bib.bib13); Chughtai et al., 2024 (https://arxiv.org/html/2609.00293#bib.bib14); Geva et al., 2023 (https://arxiv.org/html/2609.00293#bib.bib15))。最近的工作比较了VLMs中的知识检索,试图理解两者之间的不一致性。具体来说,Cohen et al. (2025) (https://arxiv.org/html/2609.00293#bib.bib16) 表明,与给定文本输入相比,VLMs在给定视觉输入时,事实回忆任务的性能会下降。为了理解这一现象,最近的工作提供了证据,表明这一差距是由一个两跳问题引起的,即未能准确回忆事实是由于视觉输入的实体解析发生得太晚,无法利用负责事实回忆的MLP (Venhoff et al., 2025b (https://arxiv.org/html/2609.00293#bib.bib11))。此外,Nikankin et al. (2025) (https://arxiv.org/html/2609.00293#bib.bib12) 发现VLMs根据实体的模态使用不相交的电路来完成事实回忆。
#### 上下文-记忆冲突。已有多种基准测试发布,用于检验模型在面对关于视觉实体的冲突证据时的行为 (Du et al., 2025 (https://arxiv.org/html/2609.00293#bib.bib17); Jia et al., 2025 (https://arxiv.org/html/2609.00293#bib.bib5); Liu et al., 2025b (https://arxiv.org/html/2609.00293#bib.bib32))。然而,这些研究侧重于评估不同VLM架构之间的性能差异,忽略了对文本实体和视觉实体之间直接、受控的比较。另一条研究路线探索了LLMs中如何解决上下文-记忆冲突,识别了影响最终输出的特定注意力头,并指出训练数据频率与提供参数化回答的倾向之间存在关联 (Kortukov et al., 2024 (https://arxiv.org/html/2609.00293#bib.bib4); Xie et al., 2024 (https://arxiv.org/html/2609.00293#bib.bib3))。更具体地说,Jin et al. (2024) (https://arxiv.org/html/2609.00293#bib.bib24) 识别了分别检索上下文信息或参数化信息的特定注意力头,并表明剪枝这些头可以改变模型对两种来源的偏好。此外,Li et al. (2025) (https://arxiv.org/html/2609.00293#bib.bib18) 和 Zhao et al. (2025) (https://arxiv.org/html/2609.00293#bib.bib31) 利用这些见解提出了能够引导模型回答更偏向上下文或参数化的方法。最近,An et al. (2026) (https://arxiv.org/html/2609.00293#bib.bib25) 将冲突缓解技术扩展到VLMs,通过剪枝编码参数化知识的神经元。

| 领域         | 问题类型           | 问答对数量 | 来源                     |
|--------------|--------------------|------------|--------------------------|
| 名人         | 职业、出生年、国籍 | 2,856      | MMKC-Bench, Wikimedia Commons |
| 建筑物       | 地点、完工年、建筑师 | 16,230     | Google Landmarks Dataset v2, Wikimedia Commons |
| 艺术品       | 艺术家、当前位置   | 18,884     | Wikimedia Commons        |
| **总计**     |                    | **37,970** |                          |
表1:我们的反事实上下文基准的组成。每对由一个实体和一个与该实体已知事实相矛盾的上下文陈述配对组成,使得跨模态的上下文-记忆冲突解决测量成为可能。

## 3 实验设置
为了研究跨模态的上下文-记忆冲突,我们需要数据样本,其中同一实体可以通过文本或视觉方式引入,同时模型被问到的事实性问题,其上下文答案可能与存储在模型参数化知识中的答案不同。该设置由三个组成部分构成:(1) 同时具有文本名称和图像的实体;(2) 具有已知参数化答案的事实性问题;(3) 提供看似合理但反事实替代方案的受控上下文陈述。为此,我们策划了一个包含三个领域(名人、建筑物和艺术品)的冲突事实问答对基准。名人子集包含从 MMKC-bench (Jia et al., 2025 (https://arxiv.org/html/2609.00293#bib.bib5)) 衍生的 2,856 对,并从 Wikimedia Commons (Wikimedia Commons contributors, 2026 (https://arxiv.org/html/2609.00293#bib.bib6)) 补充了额外的图像和事实。此子集中的每个问题属于以下三类之一:职业、出生年份或国籍。对于建筑领域,我们使用来自 Google Landmarks Dataset v2 (Weyand et al., 2020 (https://arxiv.org/html/2609.00293#bib.bib7)) 的图像编制了 16,230 对。这些问题涉及地点、完工年份和建筑师。最后,我们开发了 18,884 对艺术品问答对,来源于 Wikimedia Commons,聚焦于艺术家和当前位置。我们基准的组成总结在表1 (https://arxiv.org/html/2609.00293#S2.T1)。

我们使用统一的提示模板评估特定模态行为:\[RAG式提供的文本上下文\] + \[实体(图像或文本)\] + \[查询\](图1 (https://arxiv.org/html/2609.00293#S1.F1))。这种对称结构隔离了实体模态的影响。此外,我们将提供的上下文限制为文本模态,以反映许多RAG系统默认的纯文本增强特性。我们在 Gemma-3-12B, Gemma-3-27B (Team et al., 2025 (https://arxiv.org/html/2609.00293#bib.bib8)), Qwen2.5-VL-7B, Qwen2.5-VL-32B, Qwen2.5-VL-72B (Bai et al., 2025 (https://arxiv.org/html/2609.00293#bib.bib9)), Ministral-3-8B 和 Ministral-3-14B (Liu et al., 2026 (https://arxiv.org/html/2609.00293#bib.bib10)) 上运行基准测试。为确保可靠评估,我们首先过滤数据,仅包含在没有冲突的情况下模型能正确识别实体并回忆其参数化事实的实例。此验证步骤为所有模型生成了一个最终包含超过1,000对的数据集(详见附录A.3 (https://arxiv.org/html/2609.00293#A1.SS3) 的过滤细节)。

参考说明图2:较慢的视觉实体解析削弱了对参数化丰富的抑制。(a) 在标准事实回忆中,MLP用参数化知识丰富实体表征,从而检索相关属性。(b) 对于上下文-记忆冲突中的文本实体,对冲突上下文的早期注意力抑制了下游MLP介导的参数化丰富,导致模型偏好上下文答案。(c) 对于视觉实体,实体解析发生得更慢,因此这种抑制来得太晚:参数化丰富基本不受影响,导致模型偏好参数化答案。

## 4 跨模态的非对称冲突解决
如表2 (https://arxiv.org/html/2609.00293#S3.T2) 所示,我们观察到,使用视觉实体提示VLMs比使用文本实体提示导致显著更高比例的参数化回答。这种趋势在涉及实体核心特征的类别中(例如,名人职业)最为明显。此外,虽然大多数模型在视觉提示下表现出参数化偏置,但其发生的程度在模型和数据集之间并不一致。例如,建筑物位置的参数化偏置...

相似文章

视觉默认、先验覆盖:视觉-语言模型中感知-知识冲突的因果机制

arXiv cs.CL

本文研究视觉-语言模型如何解决视觉证据与世界知识之间的冲突,揭示了视觉基础是默认的,而先验知识依赖于一小部分位于后层的注意力头。作者在三个VLM系列上进行因果分析,展示了一种不对称结构:消融这些头部会使得预测从基于知识的答案转向基于视觉的答案。

超越文本主导:理解全模态大语言模型的模态偏好

Hugging Face Daily Papers

# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa