MCite-RL:通过引用增强的智能体强化学习实现可靠的多模态RAG

arXiv cs.CL 论文

摘要

MCite-RL 是一种引用增强的智能体强化学习框架,专为可靠的多模态RAG设计,引入了用于视觉引用的迭代检索和推理,以及一种奖励机制来联合优化答案准确性和来源可追溯性。

arXiv:2608.21808v1 Announce Type: new 摘要:多模态检索增强生成(RAG)与视觉引用对于确保MLLMs的可追溯性和可验证性至关重要。然而,当前的RAG和基于SFT的方法难以实现鲁棒的跨模态推理,导致视觉引用不精确或引用与生成答案之间脱节。为解决这些限制,我们提出了MCite-RL,一种专为可靠的多模态RAG设计的引用增强智能体强化学习框架。MCite-RL引入了一个用于视觉引用的智能体精炼模块,该模块采用迭代检索、推理和递归裁剪来逐步缩小搜索空间,将引用转化为一个动态的、证据驱动的推理过程,而非静态步骤。此外,我们整合了一种引用增强奖励机制,该机制在强化学习范式内集成过程级和结果级反馈,以联合优化答案准确性和来源可追溯性。在Wiki-VISA、FinRAGBench-V和MMLongBench-Doc等基准测试上的大量实验表明,MCite-RL有效地实现了引用精确性和答案质量的联合优化。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:18

# MCite-RL:迈向基于引用增强智能体强化学习的可靠多模态RAG
来源:https://arxiv.org/html/2608.21808
苏飞峰, 刘子达,单位:北京大学计算机科学技术系,高可信软件技术教育部重点实验室,中国;雷新宇,单位:北京大学计算机科学技术系,计算语言学教育部重点实验室,中国;孙磊,单位:Panasonic Connect Co., Ltd.,日本东京;\{sfzhao25,zdliu25,xinyulei25\}@stu\.pku\.edu\.cn, sun\.lei@jp\.panasonic\.com, \{gaojun,lisujian\}@pku\.edu\.cn;高骏, 李素建(通讯作者),单位:北京大学计算机科学技术系,计算语言学教育部重点实验室,中国

###### 摘要

带有视觉引用的多模态检索增强生成对于确保多模态大语言模型的输出可追溯性和可验证性至关重要。然而,当前基于检索增强生成和监督微调的方法难以实现稳健的跨模态推理,导致视觉引用不精确或引用与生成答案脱节。为解决这些局限性,我们提出了MCite-RL,一个面向可靠多模态RAG的引用增强智能体强化学习框架。MCite-RL引入了一个用于视觉引用的智能体优化模块,该模块采用迭代检索、推理和递归裁剪来逐步缩小搜索空间,将引用转化为一个动态的、证据驱动的推理过程,而非静态步骤。此外,我们整合了一个引用增强奖励机制,在强化学习范式内融合过程级和结果级反馈,共同优化答案准确性和来源可追溯性。在Wiki-VISA、FinRAGBench-V和MMLongBench-Doc等基准上的大量实验表明,MCite-RL有效实现了引用精确度与答案质量的联合优化。

## 1 引言

参见图注图1:多模态RAG中视觉引用的典型成功与失败模式。一个可靠的案例(上图)展示了精确的视觉引用,直接支持生成的答案。相反,现有模型常常遭遇引用不精确(中图)或引用与生成答案脱节(下图)的情况。多模态大语言模型的最新进展使得检索增强生成系统能够超越纯文本环境,将视觉信息纳入生成过程,从而让模型生成更丰富、更具信息量的回答。与基于文本的检索增强生成系统类似,准确且有据可依的引用对于多模态检索增强生成至关重要,因为它们通过将回答与底层的视觉证据明确关联,提高了生成输出的可验证性和可追溯性。

带有视觉引用的多模态检索增强生成最近引起了初步的研究兴趣,这是一个旨在同时提高准确性和可验证性的框架。初期的工作主要集中于任务定义和建立初步基准。例如,VISA开创了视觉来源归因的概念,通过基于监督微调的方法将答案与细粒度视觉证据联系起来;而FinRAGBench-V则通过引入针对复杂文档中视觉引用的自动化评估来扩展此任务。对于这些基准,所采用的基线方法仍然相对简单,通常依赖于朴素的检索增强生成或基于监督微调的方法来实现基本的引用能力。

尽管已有这些新兴研究,我们认为带有视觉引用的多模态检索增强生成涉及更多尚未充分探索的根本性挑战。首先,引用精确度方面仍存在巨大差距。这一困难源于需要在适当的粒度级别上定位相关证据,过于粗糙或过于细粒度的引用都可能导致错误的视觉支持。如图1所示,多模态大语言模型经常无法定位正确的视觉证据,生成空间错位、过于粗糙或过于详细的边界框。这种不精确的引用无法作为可验证的证据。其次,视觉引用通常与其旨在支持的生成答案错位。如图1底部示例所示,模型可能匹配了一个数值,却引用了来自完全不同上下文的视觉区域。这种错配揭示了答案和引用缺乏共享的证据基础,从根本上削弱了引用增强的多模态检索增强生成系统的可信度。

基于以上分析,我们得出结论:一个可靠的多模态检索增强生成系统远不止于准确的答案,它还需要精确的证据定位和一致的答案-引用对齐。然而,在静态的、单步生成范式内实现这种复杂多模态文档中的细粒度引用本质上是困难的。现有方法,无论是基于提示还是静态监督微调,通常无法提供必要的细粒度反馈来对齐这些目标。我们既需要一个整体反馈机制来确保引用可靠性,也需要一个迭代的智能体工作流来逐步优化视觉证据。受此启发,我们提出了MCite-RL,一个新颖的引用增强智能体强化学习框架。与先前方法不同,我们将引用精确度明确作为主要优化目标,将其作为奖励函数中的一个专用组件,而不是将其仅仅视为答案生成的副产品。借鉴先前在迭代检索和推理方面的工作(例如Search-R1、VRAG-RL),我们还为视觉引用设计了一个智能体优化工作流,通过多步骤证据优化逐步缩小视觉搜索空间,使答案及其对应的引用从一个共享的、证据驱动的推理过程中产生。

我们在三个基准上评估了我们方法的有效性,包括Wiki-VISA、FinRAGBench-V和MMLongBench-Doc。实验结果表明,MCite-RL在所有基准上持续提高了引用精确度,与朴素检索增强生成基线相比,在交并比指标上平均提升了26.16%。此外,基于引用奖励的整合也使答案准确性平均提高了5.89%,这表明明确的引用监督直接有助于提高答案的可靠性。

我们的贡献总结如下:
- • 我们提出了MCite-RL,一个通过集成引用增强智能体强化学习来提高多模态RAG可靠性的框架。
- • 我们为带有视觉引用的多模态RAG引入了一个智能体工作流,其中迭代的证据优化使答案和引用从一个共享的推理过程中产生。
- • 我们开发了一个引用增强的奖励函数,明确优化推理准确性和引用精确度。通过整合多层级的引用反馈,我们的方法利用引用精确度作为模型训练的核心驱动因素。
- • 大量实验证明了我们方法的有效性,不仅提高了引用精确度,也提升了答案准确性。

## 2 相关工作

#### 带视觉引用的多模态RAG

早期的多模态RAG系统主要关注文档或图像的粗粒度检索,旨在利用多模态上下文来增强生成。最近的研究转向视觉引用,这要求将生成内容锚定在细粒度的图像区域,以实现可追溯性和可验证性。VISA通过视觉来源归因将生成的文本片段与检测到的视觉区域对齐,正式确立了这一设定;而FinRAGBench-V则系统性地评估了视觉密集型金融图表和表格中的视觉引用性能。尽管取得了这些进展,大多数现有方法依赖于静态和被动的锚定流程,其中视觉区域在生成之前被预选,之后松散对齐,这限制了在复杂多模态推理场景中的引用精确度和鲁棒性。

#### 智能体推理与强化学习

智能体大语言模型的兴起已将检索增强生成从单次检索转变为迭代的推理-行动循环,这以ReAct范式和后续的智能体推理工作为代表。在纯文本环境中,Search-R1采用链式思维推理来优化检索查询;而在多模态场景中,VRAG-RL引入了强化学习来迭代地裁剪和关注视觉区域。然而,这些方法主要优化答案正确性或任务级奖励,将视觉锚定视为隐式的中间信号,而非显式的优化目标。因此,模型可能在内部关注相关区域,但无法产生精确、可验证的视觉引用。

参见图注图2:MCite-RL的架构。它包含两个阶段:(1) 具有严格质量控制的轨迹合成,用于监督微调;(2) 基于强化学习的视觉引用智能体优化,利用多步推演和引用增强奖励来共同优化答案准确性和引用精确度。

## 3 MCite-RL

图2展示了MCite-RL的整体架构,它包含两个核心组件:用于视觉引用的智能体优化模块(第3.2节)和引用增强的奖励计算模块(第3.3节)。基于该架构,模型通过两阶段过程(第3.4节)进行训练,包括监督微调冷启动和引用增强的强化学习。

### 3.1 带引用的多模态RAG任务形式化

我们正式定义带引用的多模态检索增强生成任务为一个受约束的生成问题。给定用户查询q和初始图像i,目标是生成一个响应元组(y, c_final),其中y代表文本答案,c_final={(x1,y1), (x2,y2)}表示在图像i内提供答案y精确视觉证据的边界框坐标形式的视觉引用。整个过程可以表述为一个函数:

F: (q, i) → (y, c_final). (1)
为了有效导航巨大的搜索空间并确保锚定精度,生成过程被分解为迭代检索和渐进式视觉裁剪之间的协同作用。与标准视觉问答不同,此任务需要联合优化两个关键目标:答案准确性,衡量答案y对查询q的保真度;引用精确度,确保引用c_final与y中相应片段的空间对齐。由于优化F涉及掌握推理与工具操作之间的相互作用,我们采用智能体优化工作流来管理这个迭代过程。

### 3.2 视觉引用的智能体工作流

如图2左下部分所示,我们采用智能体推理流程为多模态RAG输出提供精确的视觉引用。虽然迭代检索和裁剪已被探索用于增强通用问答性能,但我们调整此工作流以同时强制实现答案准确性和引用精确度。

在我们的框架内,这个迭代过程逐步收集回答问题所需的视觉和文本线索。通过在图像检索和视觉锚定之间交替,智能体通过修剪无关区域来连续裁剪视野,从而将其焦点缩小到锚定最终答案所需的精确坐标上。

迭代视觉锚定。我们将推断过程形式化为一个序贯决策轨迹:
τ={(s0,a0), (s1,a1), ..., (sT,aT)}, (2)
其中s_t表示智能体在步骤t的状态,a_t表示相应的动作。动作空间包括图像检索、视觉裁剪以及生成带有视觉引用的最终答案。

每个状态s_t表示为:
s_t = (q, h_t, v_{c_t}), (3)
其中q是输入查询,h_t总结了截至步骤t的交互历史(包括过去的操作和检索到的上下文),v_{c_t}是基于步骤t生成的坐标c_t进行裁剪后的视觉观察。

如图2左下部分所示,智能体通过迭代检索和裁剪逐步优化其视觉观察。此优化的目标是识别一个最优视觉区域v̂_{c_t}。该区域被选择为使在交互历史和查询条件下证据的可能性最大化:
v̂_{c_t} = arg max_v P(v | τ_{<t}, q) (4)
其中τ_{<t}={(s0,a0), ..., (s_{t-1}, a_{t-1})}

相似文章

RL-Index: 强化学习的检索索引推理

Hugging Face Daily Papers

RL-Index 提出了一种基于强化学习的智能索引框架,通过用LLM生成的解释来扩充文档,将推理从查询阶段转移到索引阶段,从而提升检索效果并降低在线延迟。

CMT-RAG: 多轮多跳RAG的互补记忆轨迹

arXiv cs.CL

介绍CMT-RAG,一种用于多轮多跳对话式RAG的互补记忆框架,通过子问题级推理轨迹将对话记忆与检索对齐。同时提出了MuMu-QA,一个具有跨轮子问题依赖关系的基准测试。

Rationale-Guided Learning for Multimodal Emotion Recognition

arXiv cs.AI

Introduces Rationale-Guided Learning (RGL), a framework that reframes multimodal emotion recognition in conversation as a cognitively-inspired reasoning task using dual-process theory and MLLM-generated rationales, achieving state-of-the-art results on IEMOCAP and MELD.