信任先于融合:QIMG-7与面向污染多模态RAG的源感知解析方案

arXiv cs.CL 论文

摘要

介绍了QIMG-7,一个针对事实QA中多模态检索污染的基准测试,并提出了源感知信任解析方案(SATR),一种无需训练的方法,相比朴素融合提高了鲁棒性。

arXiv:2607.10798v1 Announce Type: new 摘要:多模态检索增强生成(RAG)通常在干净证据下进行评估,但实际检索可能返回主题相关但不可靠的内容:来自损坏元数据的虚假文本和误导性图像、实体交换、排版覆盖、语义编辑、对抗性补丁、混合或风格迁移。我们引入了QIMG-7,一个针对多句事实问答中多模态检索污染的受控基准,涵盖四个数据集、七种图像攻击家族和16种成对的干净/污染场景,每种方法有1760个评估行。在四个生成器/门控栈中,朴素多模态融合是脆弱的:在主要的gpt-4o-mini栈中,Full-MM支持率从干净文本的0.908下降到污染文本的0.490,通常使得Parametric回退比检索更安全。我们提出了源感知信任解析方案(SATR),一种无需训练的方法,比较Parametric、纯文本和Full-MM候选答案,并根据源可靠性选择候选答案或回退。Field-Selector变体取得了最佳平衡分数0.816,相比Full-MM提升了11.7个百分点,相比Cascaded Router提升了2.7个百分点。消融实验表明,在这种文本优先的设置中,显式的文本可靠性建模是这些收益的主要驱动因素。总体而言,在存在多模态检索冲突的文本优先事实QA中,我们的结果支持选择性信任而非无条件融合。相关资源可在 https://github.com/SaadElDine/Trust_Before_Fusion 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:22

# QIMG-7 与受污染多模态 RAG 的源感知解析

文章来源:https://arxiv.org/html/2607.10798

Saadeldine Eletter Owais Aijaz Preslav Nakov  
穆罕默德·本·扎耶德人工智能大学  
\{saadeldine\.eletter,owais\.aijaz,preslav\.nakov\}@mbzuai\.ac\.ae

###### 摘要

多模态检索增强生成(RAG)通常在干净的证据上进行评估,但实际检索可能返回主题相关但不可靠的内容:虚假文本和误导性图像,来源包括被篡改的元数据、实体替换、文字覆盖、语义编辑、对抗性补丁、图像混合或风格迁移。我们引入了 QIMG-7,这是一个用于多句事实问答中多模态检索污染的可控基准,涵盖四个数据集、七种图像攻击家族以及 16 种成对的干净/受污染测试场景,每种方法有 1,760 个评估行。在四个生成器/门控堆栈上,朴素的多模态融合是脆弱的:在 main-gpt-4o-mini 堆栈中,Full-MM 支持度从干净文本时的 0.908 下降到受污染文本时的 0.490,使得参数回退比检索更安全。我们提出了*源感知信任解析*(SATR),这是一种无需训练的方法,它比较参数、纯文本和 Full-MM 候选答案,并根据源可靠性在候选答案中选择或回退。Field-Selector 变体实现了最佳平衡分数 0.816,比 Full-MM 提升了 11.7 个百分点,比级联路由器提升了 2.7 个百分点。消融实验表明,在这种以文本为先的设置中,显式的文本可靠性建模是这些增益的主要驱动因素。总体而言,在存在多模态检索冲突的以文本为先的事实问答中,我们的结果支持选择性信任而非无条件融合。相关工件可在 https://github.com/SaadElDine/Trust_Before_Fusion 获取。

## 信任先于融合:受污染多模态 RAG 的 QIMG-7 与源感知解析

Saadeldine Eletter Owais Aijaz Preslav Nakov  
穆罕默德·本·扎耶德人工智能大学  
\{saadeldine\.eletter,owais\.aijaz,preslav\.nakov\}@mbzuai\.ac\.ae

## 1 引言

检索增强生成(RAG)被广泛用于将大型语言模型与外部证据相锚定,从而提升知识密集型问答和生成的事实准确性(Lewis 等人,2020 (https://arxiv.org/html/2607.10798#bib.bib9);Izacard 和 Grave,2021 (https://arxiv.org/html/2607.10798#bib.bib7))。然而,*相关*的检索内容并不一定*可靠*:检索语料库中的错误信息可能引导模型给出自信但错误的答案(Pan 等人,2023 (https://arxiv.org/html/2607.10798#bib.bib19);Zeng 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib26))。在长形式场景中,这个问题会被放大,因为早期的事实错误可能在多段答案中传播。多模态场景使问题更加困难。现代系统在检索文本的同时也会检索图像,多模态模型可以同时利用两者。图像可以通过提供锚定来帮助,但也可能通过虚假标题、文字覆盖、脱离背景的裁剪、替换的实体或经过视觉编辑的证据来误导。虽然鲁棒性研究主要关注纯文本检索,且多模态 RAG 基准通常假设干净的证据,但*多模态受污染检索*的组合问题仍然研究不足(Yu 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib25);Hu 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib6);Mortaheb 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib16))。

见图注

图 1:多模态检索污染的典型失败案例。检索到的证据主题相关但混杂:干净的文本支持正确的*东京迪士尼乐园*答案,而受污染的文本和图像证据则暗示了错误的说法——它于 1979 年在*巴黎*附近开放。朴素的多模态 RAG 系统可能会融合这些冲突的信号,产生自信的错误答案,从而推动了源感知信任解析的需求。

图 1 (https://arxiv.org/html/2607.10798#S1.F1) 说明了核心失败模式:检索到的多模态证据可能相关但不可靠,朴素的融合可能将受污染的证据放大为自信的幻觉。在本文中,我们研究多句事实问答中的多模态检索污染,做出以下四项贡献:

- **基准。** 我们构建了 QIMG-7,这是一个用于多句事实问答的成对干净/受污染多模态 RAG 基准,涵盖四个数据集、七种涵盖元数据、像素和风格扰动的图像攻击家族,以及 16 种评估场景(每种方法 1,760 行)。
- **实证发现。** 通过跨数据集和跨模型分析,在四个生成器/门控堆栈上,我们表明多模态融合默认是不安全的:在受污染文本下,朴素 RAG 可能比参数回退表现更差,并且这种脆弱性在所有测试的生成器/门控堆栈中都出现,而基于提示的信任解析的有效性取决于解析器的可靠性评估能力。
- **方法。** 我们引入了*源感知信任解析*(SATR),这是一个无需训练的方法家族,它基于孤立的参数、纯文本和 Full-MM 候选答案以及结构化可靠性字段进行推理,以进行选择、组合或回退。Field-Selector 的平衡分数比 Full-MM 提升了约 12 个百分点,比级联路由器提升了 3 个百分点。
- **机制分析。** 字段消融、攻击家族分解、原子事实性审计、决策行为分析和人工验证表明,SATR 的增益源于显式的文本可靠性建模,而非通用的候选答案聚合。

#### 术语。
QIMG-7 表示我们针对多句事实问答中受污染多模态检索的受控压力测试基准。SATR 表示在参数、纯文本和 Full-MM 候选答案之上进行无需训练的源感知信任解析方法家族。

## 2 相关工作

#### 检索污染与对抗性 RAG。
先前关于纯文本 RAG 的工作表明,当检索到的证据具有误导性、对抗性或事实性污染时,可能是有害的(Pan 等人,2023 (https://arxiv.org/html/2607.10798#bib.bib19);Zeng 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib26))。攻击方面的工作进一步将其形式化为安全威胁:*PoisonedRAG* 表明,向知识库中注入少量精心制作的恶意段落,可以引导 LLM 以高成功率给出攻击者选择的答案,即使在黑盒访问下也是如此(Zou 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib27))。我们的基准在受控的成对干净/受污染设置中研究该问题的防御方,并将其扩展到多模态证据通道。

#### 鲁棒与选择性 RAG。
几种防御性 RAG 方法决定是否以及如何使用检索到的证据。*Self-RAG* 微调 LM,通过反射令牌触发检索并评价段落(Asai 等人,2024 (https://arxiv.org/html/2607.10798#bib.bib1));*CRAG* 使用轻量级检索评估器选择修正动作(Yan 等人,2024 (https://arxiv.org/html/2607.10798#bib.bib24));*Adaptive-RAG* 根据查询复杂度路由至无检索、单跳和多跳检索(Jeong 等人,2024 (https://arxiv.org/html/2607.10798#bib.bib8));*RobustRAG* 通过“先隔离再聚合”的方式提供了针对检索腐败的可认证鲁棒性(Xiang 等人,2024 (https://arxiv.org/html/2607.10798#bib.bib23))。我们的方法是互补且更轻量的:无需训练,基于提示,适用于多模态证据和多个候选答案分支。与先前纯文本防御不同,我们的设置需要决定是否信任文本、图像、两者或两者都不信。并发的工作提出了 MIRAGE,这是一种针对受污染文本检索的无需训练防御,使用跨来源 NLI 声明图和一个防御声明门控(Eletter 等人,2026 (https://arxiv.org/html/2607.10798#bib.bib4))。QIMG-7 和 SATR 则研究成对的文本-图像污染,并在参数、纯文本和 Full-MM 分支之间解析信任。

#### 多模态 RAG 与评估。
最近的多模态 RAG 工作研究了文本-图像证据上的检索和生成,包括以视觉为中心的检索和多模态文档 QA(Yu 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib25);Hu 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib6))。评估框架如 *RAG-Check* 在多模态 RAG 中区分了检索相关性和答案正确性(Mortaheb 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib16))。另一条平行工作路线直接评估 VLM 幻觉:*POPE* 使用轮询式二分类探针测量对象幻觉(Li 等人,2023 (https://arxiv.org/html/2607.10798#bib.bib10)),而 *MMHal-Bench* 提供了对幻觉描述进行惩罚的开放式问题(Sun 等人,2024 (https://arxiv.org/html/2607.10798#bib.bib21))。这些设置大多关注干净输入;我们则构建成对的干净/受污染场景,研究在受控文本和图像腐败下的鲁棒性。

#### 多模态投毒与攻击。
最近的多模态 RAG 安全工作研究了向外部知识库注入或操控图像-文本对的投毒攻击。*MM-PoisonRAG* 提出了对多模态 RAG 的局部和全局投毒攻击,而 *Poisoned-MRAG* 通过注入少量精心制作的图像-文本对,引导 VLM 响应朝向攻击者期望的输出(Ha 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib5);Liu 等人,2025 (https://arxiv.org/html/2607.10798#bib.bib12))。我们的工作是互补的:我们并非仅优化攻击成功率,而是为多句事实问答构建受控的成对干净/受污染场景,并评估决定何时使用多模态检索、纯文本检索或参数回退的选择性信任*防御*。

#### 长形式事实性评估。
长形式和多句 QA 的事实性越来越多地通过分解和验证流水线进行声明级评估,例如 *FActScore*、*SAFE* 和 *VeriScore*(Min 等人,2023 (https://arxiv.org/html/2607.10798#bib.bib14);Wei 等人,2024 (https://arxiv.org/html/2607.10798#bib.bib22);Song 等人,2024 (https://arxiv.org/html/2607.10798#bib.bib20))。我们采用一种轻量级的基准内部变体来补充我们的答案级支持分数(第 6.5 节 (https://arxiv.org/html/2607.10798#S6.SS5));与完整的外部网络事实性评估不同,我们的审计重用缓存的基准证据,从而在相同的受控真实标签下衡量污染影响。

#### 定位。
附录 B (https://arxiv.org/html/2607.10798#A2) 总结了 QIMG-7 与先前鲁棒 RAG、多模态 RAG 和多模态投毒基准的不同之处。与先前工作不同,QIMG-7 结合了多句事实问答、成对的干净/受污染文本和图像证据、七种图像攻击家族以及选择性信任防御。

## 3 基准与威胁模型

我们假设用户问题和答案模型是固定的,但检索到的证据在传递给模型之前可能被污染。攻击者可以影响检索到的文本片段、图像标题或元数据以及图像像素,但不修改答案模型或评估判断器。目标是测试多模态 RAG 系统是否能够避免信任主题相关但不可靠的证据。形式化路由目标见附录 A (https://arxiv.org/html/2607.10798#A1)。

#### 数据集与规模。
我们将 QIMG-7 构建为针对多句事实问答的受控压力测试基准,而非群体规模基准。为了隔离检索污染效应,每个被评估的问题被扩展为 16 种场景,交叉使用干净/受污染文本与干净图像或七种图像污染家族中的一种。我们从四个仅使用提示的事实问答数据集开始:*LongFact*(Wei 等人,2024 (https://arxiv.org/html/2607.10798#bib.bib22)),包含针对实体、事件和概念的开放式提示;*Biography*(Min 等人,2023 (https://arxiv.org/html/2607.10798#bib.bib14)),包含基于维基百科的简短传记提示;*AlpacaFact*(Lin 等人,2024 (https://arxiv.org/html/2607.10798#bib.bib11)),是 *AlpacaFarm*(Dubois 等人,2023 (https://arxiv.org/html/2607.10798#bib.bib3))的寻求事实子集;以及 *FAVA*(Mishra 等人,2024 (https://arxiv.org/html/2607.10798#bib.bib15)),包含针对细粒度幻觉类别进行标注的信息寻求查询。这些来源共同涵盖实体、事件、人物、产品和过程。从 766 个候选问题中,我们评估了 110 个:50 个来自 *LongFact*,其余三个数据集各 20 个。我们使用了较大的 *LongFact* 切片,因为它是主要的多句事实问答来源,并提供了广阔的主题覆盖。我们仅保留那些具有可用干净文本证据、成对受污染文本证据以及至少一张可通过查询检索到的主题相关干净图像的问题;对于图像链接损坏、检索失败、图像明显无关或生成的变体不可用的问题进行移除。最终划分、过滤决策和基准元数据包含在已发布的工件中。对于最终的 QIMG-7 基准,我们直接从问题中检索图像,而不仅仅从证据 URL 中检索,然后构建成对的干净和受污染视觉证据,每种方法产生 1,760 行(表 1 (https://arxiv.org/html/2607.10798#S3.T1))。

表 1:QIMG-7 的受控压力测试基准规模。每个被评估的问题出现在 16 种场景下:干净/受污染文本与干净图像或七种图像污染家族之一交叉组合。

#### 文本与图像证据。
对于每个查询,我们从现有的干净和受污染证据池中缓存 top-k 文本段落。对于图像,QIMG-7 使用基于查询的干净图像检索,每个问题最多选择五张候选图像。这比我们早期基于 URL 派生的图像基准提高了视觉相关性,我们将其保留用于开发/证据源消融,见附录 H.1 (https://arxiv.org/html/2607.10798#A8.SS1)。

#### 答案模型看到的内容。
对于 Full-MM 分支,答案模型接收问题、top-k 文本段落(包含标题、URL 和片段),以及一张图像证据(原始像素,可用时),再加上推理时的图像字段(如标题、alt 文本/说明和来源页面)。基准内部字段——包括攻击家族、污染状态、生成理由和场景标签——仅用于构建和分析,绝不会暴露给答案生成、路由或判断提示。纯文本分支将图像字段留空,而参数分支则将所有证据字段留空。

#### 污染设计。
在文本方面,我们使用最小编辑污染协议,涵盖*明确*、*冲突*、*误导*和*虚构*腐败(附录表 8 (https://arxiv.org/html/2607.10798#A4.T8))。在图像方面,QIMG-7 包含七种图像污染家族:

- **标题翻转:** 保持图像像素不变,但将关联的标题或 alt 文本替换为看似合理的虚假标题。
- **实体替换:** 将图像 URL 替换为来自不同问题的图像,造成主体与图像不匹配。
- **语义实体重写:** 编辑图像,使视觉场景或实体在事实上具有误导性,同时保持主题相关。
- **FigStep 文字覆盖:** 以视觉上权威的风格将虚假文本声明直接注入图像中。
- **对抗性补丁:** 添加一个小的视觉补丁,旨在将视觉表示引导至虚假概念。
- **图像混合:** 将捐赠图像与原始图像合成,以混合不兼容的视觉语义。
- **神经风格迁移:** 将捐赠图像的风格迁移到原始图像上,创造出风格上陌生但 (继续)

相似文章

面向检索增强生成输出的忠实性感知不确定性量化

arXiv cs.CL

本论文介绍了FRANQ方法,用于检测检索增强生成(RAG)系统中的幻觉问题。该方法应用不同的不确定性量化技术来区分事实性和对检索上下文的忠实性。作者构建了一个同时标注事实性和忠实性的新数据集,并证明FRANQ在多个数据集和大语言模型上的事实错误检测性能优于现有方法。

信任区域Q伴随匹配

Hugging Face Daily Papers

信任区域Q伴随匹配(TRQAM)通过投影对偶下降自适应控制路径空间KL散度,解决了离线策略强化学习中的不稳定性问题,从而实现对预训练流策略的稳定微调。该方法在50个OGBench任务上持续优于先前方法,在离线强化学习中达到68%的成功率,而最强基线仅为46%。