语境之代价:在多模态检索增强生成中缓解文本偏差

arXiv cs.CL 论文

摘要

本文识别并形式化了多模态RAG中的“再污染”现象,即添加准确上下文会导致模型因注意力崩溃(视觉盲区和位置偏差)而放弃正确预测。作者提出BAIR,一种无参数的推理时框架,能恢复视觉显著性并惩罚文本干扰因素,从而在医学、公平性和地理空间基准上提高可靠性。

arXiv:2605.05594v1 公告类型:新 摘要:尽管多模态大语言模型(MLLMs)越来越多地与检索增强生成(RAG)结合以缓解幻觉,但外部文档的引入可能掩盖实例层面的严重失败模式。我们识别并形式化了再污染现象,即即使引入完全准确的“完美”上下文,也会导致一个能力强的模型放弃最初正确的预测。通过对内部注意力矩阵的机制性诊断,我们表明再污染由双重的注意力崩溃驱动:(1)视觉盲区,其特征是系统性地抑制视觉注意力质量($M_{vis}$)和锐度($S_{vis}$),以及(2)结构性位置偏差,迫使模型优先考虑边界令牌而非语义相关性。我们的分析揭示了一种“成功错觉”,表明许多看似正确的RAG结果仅仅是位置巧合,即模型的文本复制偏差恰好与真实位置一致。为解决这些脆弱性,我们提出了瓶颈注意力干预恢复(BAIR),一种无参数、推理时框架,能够恢复视觉显著性并对文本干扰因素施加位置感知惩罚。在医学真实性、社会公平性和地理空间基准上,BAIR成功恢复了多模态基础并提高了诊断可靠性,且无需模型重新训练或微调。
查看原文
查看缓存全文

缓存时间: 2026/05/08 06:31

# 上下文成本:缓解多模态检索增强生成中的文本偏差  
来源:https://arxiv.org/html/2605.05594  

Hoin Jung, Xiaoqian Wang  
Elmore Family School of Electrical and Computer Engineering  
Purdue University  
West Lafayette, IN 47907  
\{jung414, joywang\}@purdue\.edu  

###### 摘要  
尽管多模态大语言模型(MLLMs)越来越多地与检索增强生成(RAG)结合以缓解幻觉,但外部文档的引入可能掩盖实例层面的严重失效模式。我们识别并形式化了“再污染”(recorruption)现象:即使引入完全准确的“神谕”上下文,也会导致原本有能力的模型放弃其最初正确的预测。通过对内部注意力矩阵的机理诊断,我们发现再污染由双重注意力崩溃驱动:(1)视觉盲区——表现为视觉注意力质量\(M_{vis}\)和锐度\(S_{vis}\)的系统性抑制;(2)结构性位置偏差——迫使模型优先关注边界标记而非语义相关性。我们的分析揭示了“成功的幻觉”:许多看似正确的RAG结果仅仅是位置巧合,即模型的文本复制偏差恰好与真实答案的位置一致。为解决这些漏洞,我们提出**瓶颈注意力干预恢复(BAIR)**,这是一个无参数、推理时框架,可恢复视觉显著性并对文本干扰项施加位置感知惩罚。在医学事实性、社会公平性和地理空间基准上的实验表明,BAIR成功恢复了多模态基础能力,提升了诊断可靠性,且无需模型重新训练或微调。  

¹¹代码:https://github\.com/HoinJung/BAIR  

## 1 引言  

尽管多模态大语言模型(MLLMs)[18]在整合视觉与文本数据方面展现出惊人能力,但它们仍极易产生幻觉。为了锚定生成过程,检索增强生成(RAG)[11]被越来越多地用于提供权威的外部上下文,涵盖医学[19]、技术[17]和法律[25]等高利害领域。虽然引入这类文档通常能提升整个数据集的任务准确率,但这掩盖了实例层面一种反直觉且严重的失效模式。实际中,由于事先不知道模型独立预测的正确性,RAG被普遍采用以确保可靠性。然而,在某些特定实例上,当基础模型本身有能力独立生成正确答案时,引入即使是完全准确的“神谕”文档也会主动降低其输出质量。模型非但没有确认正确回答,反而放弃了最初准确的预测,转而给出错误答案。我们将此现象称为“再污染”(recorruption)。如图2所示,外部文档的引入导致从正确基线预测到错误预测的转移,虽然统计上微小但后果严重。这一漏洞困扰着高度专业化的领域以及通用应用。例如,在放射学等高利害领域,放弃准确的视觉证据转而依赖文本,会导致模型忽略X光片中可见的关键病理,造成严重的诊断失败。同样,在社会公平性评估中,模型会覆盖明确的视觉性别线索以迎合基于文本的职业刻板印象。图1展示了该现象的定性示例,以及我们提出的干预措施成功恢复正确答案的效果。  

为揭示再污染为何发生,我们对生成过程中的内部注意力矩阵进行了机理诊断。我们发现这种现象由双重注意力崩溃驱动。在早期融合的多模态大语言模型中,视觉和文本标记共享统一的上下文窗口,并在零和softmax操作中直接竞争。大量检索文本的注入从根本上打破了这一平衡,导致两种不同的失效模式:  

图1:再污染及我们提出的修复方法的定性示例。在医学诊断(左)、社会公平性(中)和地理空间领域(右)中,模型在没有外部上下文的情况下能正确识别视觉证据。引入神谕上下文导致模型忽略图像并生成幻觉文本(再污染)。我们提出的BAIR方法成功修复了注意力机制,恢复了正确的多模态响应。  

1. **视觉盲区(跨模态主导)**:检索文本吸收了绝大部分可用注意力预算,导致视觉信号严重被抑制。虽然单模态NLP文献经常讨论“上下文胜出”场景[10][22],即外部文档覆盖模型内部参数记忆,但我们的发现暴露了一个根本不同且未被充分探索的威胁——视觉盲区。在多模态大语言模型中,外部文本覆盖了明确的、真实的视觉证据。随着文本主导注意力预算,分配给视觉证据的总概率质量(\(M_{vis}\))显著下降。此外,剩余的视觉注意力变得危险地分散,通过视觉注意力锐度(\(S_{vis}\))的急剧下降表明,模型实质上对图像“视而不见”。  

2. **文本位置偏差(多模态“中间丢失”)**:此外,模型并未均匀处理检索文本。相反,我们观察到注意力在文本序列的极端边界处集中出现巨大峰值,类似于大语言模型中的“中间丢失”现象[14][27]。在多模态大语言模型中,这种极端的位置吸收阻碍了模型对完整上下文进行加权平均,迫使其机械地从边界片段(开头或结尾)复制文本,而非进行有根基的多模态推理。  

**成功的幻觉**。我们在第3节中的机理诊断显示,成功RAG与再污染失败的注意力配置在统计上无法区分。即使在MLLM借助神谕文档输出正确答案的情况下,内部注意力矩阵也表现出相同的扩散视觉焦点和激进的文本边界偏差。这暴露了一个关键漏洞。令人惊讶的是,许多“成功”的多模态RAG场景仅仅是位置巧合。如图3分析所示,模型常常因错误原因获得正确答案——其盲目的文本复制偏差恰好与真实答案的位置一致。  

为了安全地利用检索的好处而不损害模型的视觉感知或文本基础,我们提出了**瓶颈注意力干预恢复(BAIR)**。BAIR是一个无参数的推理时框架,直接操作softmax前的注意力矩阵,以修复诊断出的失效模式。通过主动恢复视觉质量、提升焦点视觉锐度,并对文本干扰项施加位置感知惩罚,BAIR能够纠正再污染生成结果,并修剪多余的文本幻觉。正如我们在后续医学/地理空间事实性及社会公平性基准上的实验所展示的,BAIR以零计算开销成功恢复了多模态基础能力,无需模型重新训练或微调。  

总结而言,我们的贡献有三点:  

- • 我们识别并形式化了多模态RAG中的“再污染”现象。我们证明,引入准确的外部文档可能会反常地降低模型性能,因为它覆盖了跨领域的正确视觉感知。  
- • 我们对这种失效模式进行了机理诊断,引入了视觉注意力质量和锐度的度量指标,证明模型遭受视觉证据的零和抑制以及文本位置偏差。该分析揭示了一个关键“成功的幻觉”:看似正确的RAG输出往往源于位置巧合,而非稳健的推理。  
- • 我们引入了BAIR,一种无参数的推理时干预方法,通过双重恢复机制恢复多模态基础能力。BAIR通过恢复视觉显著性动态重新校准注意力分布,同时施加位置感知惩罚以抑制文本位置偏差。我们的方法可靠地纠正了再污染生成结果,提升了高利害场景下的事实性,且没有训练开销。  

图2:展示多模态医学模型(MedGemma-4B、CheXagent-8B)中“再污染”现象的桑基图。一部分最初正确的视觉预测(无检索)在引入神谕检索上下文后被污染为错误预测。  

## 2 相关工作  

### 2.1 上下文在RAG中的影响  

模型内部知识与外部上下文之间的交互是RAG研究的主要焦点。虽然上下文通常能提升事实性,但它经常主导生成过程,往往覆盖模型独立的预测。例如,即使外部文档与模型内部知识冲突,大语言模型也强烈偏好外部文档[10][22]。从机理上看,这种行为源于一种计算捷径:当上下文可用时,绕过内部处理[22]。这种主导可能是有害的:它会覆盖内部安全约束,导致原本可靠的模型生成不安全的响应[1]。在本工作中,我们研究了上下文对多模态场景的影响。我们识别出一个并行的失效:外部文本抑制了模型正确的视觉感知,我们称之为再污染。尽管当代工作将类似问题描述为注意力分散,并提出通过注意力混合(MAD-RAG)[29]来缓解,但我们通过视觉锐度和质量度量提供了更精细的诊断。此外,我们揭露了成功的幻觉:看似正确的RAG输出源于位置巧合,而非有根基的推理。  

### 2.2 中间丢失  

位置偏差,通常描述为“中间丢失”效应[14],显著限制了长上下文的效用。这种U形偏差源于因果掩码造成的首因偏差与位置嵌入中基于距离的衰减造成的近因偏差之间的结构竞争[26][27]。现有解决方案主要集中于文本重新校准或结构修改。这些方案包括使用伪文档进行注意力校准[8]、缩放位置索引以减轻衰减[28]、或根据语义相关性重新分配位置[24]。此外,提示压缩技术如LongLLMLingua[9]会过滤无关标记并将文档重新排序到上下文边界。尽管这些方法改善了文本RAG,但它们并未解决多模态架构中发生的根本跨模态注意力崩溃。附录H进一步展示了这一局限:现有的校准和位置缩放方法无法恢复视觉注意质量和锐度,也无法充分压平有偏差的文本注意力配置。  

## 3 成功的幻觉的机理诊断  

为了研究文本上下文对视觉处理的影响,我们分析了多模态大语言模型解码器中关键“瓶颈”处的注意力分布。具体地,我们聚焦于预填充阶段的最终注意力操作:最后一个输入标记的隐藏状态作为唯一的查询,预测第一个生成的标记。我们针对这一特定操作,因为它作为最终上下文聚合步骤[8],模型在此综合整个多模态提示以初始化其生成轨迹。如果视觉信号在此阶段被抑制,后续的自回归解码将本质上受损。由于我们仅考察这一查询如何关注作为键的整个前文语境,相关注意力权重形成一个1维概率分布(而非完整的2D矩阵)。设\(A \in \mathbb{R}^N\)表示这个1维瓶颈注意力向量,作用于长度为\(N\)的完整输入序列(按注意力头计算),其中\(A_i\)表示分配给第\(i\)个键标记的标量注意力权重。  

### 3.1 视觉注意力分析  

图3:(a) 视觉注意力退化:引入文本上下文导致各架构(MedGemma-4B和Qwen2.5-VL-7B)中视觉注意力质量(\(M_{vis}\))和锐度(\(S_{vis}\))系统性下降。(b) 成功与再污染配置对比:成功RAG结果与再污染失败案例的注意力度量在统计上无法区分(Qwen2.5-VL-7B)。(c) 文本配置分析:位置配置(ROUGE-L[12])表明生成的回复主要来源于检索文档的末尾段落(MedGemma-4B)。(d) 巧合假说验证:准确性严重依赖于文档中真实证据的空间位置(MedGemma-4B和CheXagent-8B)。当关键证据位于开头或中间段落时,准确性显著下降。  

为量化视觉退化,设\(\mathcal{V}\)表示视觉标记索引集合。我们定义**视觉注意力质量**(\(M_{vis}\))为分配给视觉模态的总概率质量。为衡量模型在图像内的注意力聚焦程度,我们定义**视觉注意力锐度**(\(S_{vis}\))。首先,对视觉注意力进行归一化,形成视觉标记上的概率分布\(\hat{A}\),即\(\hat{A}_i = A_i / M_{vis}\)。锐度定义为归一化熵的补数:  

\[
M_{vis} = \sum_{i \in \mathcal{V}} A_i, \quad S_{vis} = 1 - \frac{-\sum_{i \in \mathcal{V}} \hat{A}_i \log(\hat{A}_i)}{\log(|\mathcal{V}|)}.
\] (1)  

分母\(\log(|\mathcal{V}|)\)代表最大理论熵,即注意力在所有视觉标记上均匀分布时(最大不确定性)的情况。因此,比值项量化了注意力的相对“模糊程度”。通过取补数,\(S_{vis}\)被归一化到区间[0,1],值越大表示注意力越聚焦。

相似文章

上下文优化下的检索增强生成:从梯度下降视角

arXiv cs.CL

本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。

MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成

arXiv cs.CL

MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。

介绍上下文检索

Anthropic Engineering

Anthropic 推出了上下文检索,这是一种结合了上下文嵌入和 BM25 的技术,通过减少检索失败的情况,显著提高了 RAG 的准确性。