GraMRAG: 利用图记忆与强化学习协调多智能体多步推理
摘要
GraMRAG是一个新的多智能体RAG框架,它使用图记忆和强化学习来提升复杂多模态任务中的推理深度和记忆结构,实现了最先进的性能。
arXiv:2609.14066v1 公告类型:新
摘要:尽管现有的多智能体检索增强生成(RAG)系统在复杂多模态推理任务上显示出潜力,但它们在推理深度和记忆结构方面存在根本性限制,在回答知识密集型问题时遭受不充分检索和状态盲点的困扰。为解决这些局限性,我们提出GraMRAG,一个图记忆引导的多智能体RAG框架,它集成动态多模态记忆图以实现稳定的多步多模态推理。我们引入了一种视觉-文本桥接推理范式,将多尺度实体裁剪与ReAct风格的视觉工具链统一,增强了长距离跨模态推理能力。我们进一步构建了多模态记忆图,将智能体推理形式化为动态有向无环图(DAG),明确建模动作-观察依赖关系以缓解状态盲点并抑制冗余检索。此外,我们提出了拓扑感知策略优化(TAPO),利用图拓扑进行关键路径识别和目标节点修剪,实现跨多步推理轨迹的细粒度信用分配。在具有挑战性的多模态基准测试上的大量实验表明,我们的方法持续优于现有基线,并在复杂长距离推理任务上实现了最先进的性能。
查看缓存全文
缓存时间: 2026/09/15 08:49
# GraMRAG:基于图记忆与强化学习的多智能体多步推理协调框架
来源:https://arxiv.org/html/2609.14066
###### 摘要
尽管现有的多智能体检索增强生成(RAG)系统在复杂多模态推理任务上展现出潜力,但它们在推理深度和记忆结构方面仍存在根本性局限,在回答知识密集型问题时面临检索不足和状态盲区问题。为解决这些局限,我们提出 GraMRAG,一种图记忆引导的多智能体 RAG 框架,该框架集成动态多模态记忆图,以实现稳定、多步的多模态推理。我们引入了一种视觉-文本桥接推理范式,将多尺度实体裁剪与 ReAct 风格的视觉工具链相统一,增强了长期跨模态推理能力。我们进一步构建了多模态记忆图,将智能体推理形式化为动态有向无环图(DAG),显式建模动作-观察依赖关系以减轻状态盲区并抑制冗余检索。此外,我们提出了拓扑感知策略优化(TAPO),利用图拓扑进行关键路径识别和目标节点剪枝,实现了跨多步推理轨迹的细粒度信用分配。在具有挑战性的多模态基准测试上的大量实验表明,我们的方法持续优于现有基线,并在复杂长期推理任务上实现了最先进的性能。
22脚注文本:通讯作者。
## 1 引言
参见标题图 1:我们的 GraMRAG 与现有 RAG 多智能体系统的比较。
“永远不要记住那些你可以查到的东西。”
——阿尔伯特·爱因斯坦
检索增强生成(RAG)通过从外部知识库检索相关信息,扩展了多模态大语言模型(MLLMs)的知识边界Wang (2026) (https://arxiv.org/html/2609.14066#bib.bib26); Fan et al. (2026) (https://arxiv.org/html/2609.14066#bib.bib4); Hu et al. (2026) (https://arxiv.org/html/2609.14066#bib.bib8)。MLLMs的最新进展令人信服地证明,多模态智能体RAG系统能够在包含交错文本和视觉内容的大型语料库上进行高效检索和推理Zhang et al. (2026) (https://arxiv.org/html/2609.14066#bib.bib40); Guan et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib6)。基于MLLM的多智能体架构,利用组件间的专门协作,在复杂多模态RAG任务上展现出优于单智能体框架的性能Zhou et al. (2026) (https://arxiv.org/html/2609.14066#bib.bib44); Chang et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib2); Xu et al. (2025b) (https://arxiv.org/html/2609.14066#bib.bib32)。
然而,现有的多智能体RAG系统面临三个关键局限。首先,当前系统的平均检索轮次仍然有限,这使得智能体在复杂任务上倾向于过早终止探索,满足于部分可用的证据Jiang et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib11); Wu et al. (2025a) (https://arxiv.org/html/2609.14066#bib.bib28); Team et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib22)。这从根本上阻碍了将基于文本的深度研究的长期规划能力转移到多模态场景中,使得这些系统无法满足现实世界深度研究所需的数十次迭代推理步骤。其次,当前主流的基于线性或迭代摘要的记忆结构Yao et al. (2022) (https://arxiv.org/html/2609.14066#bib.bib35); Zhou et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib45); Xu et al. (2025a) (https://arxiv.org/html/2609.14066#bib.bib31); Wu et al. (2025b) (https://arxiv.org/html/2609.14066#bib.bib29),缺乏对智能体推理状态的显式建模,随着交互轮次增加容易导致上下文膨胀和状态盲区,在多跳任务中产生重复查询和冗余检索。第三,传统的基于结果的稀疏奖励将终端状态信号粗略地传播到整个轨迹Huang et al. (2026) (https://arxiv.org/html/2609.14066#bib.bib9); Zhou et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib45),导致有效的检索步骤在负样本中被错误惩罚,而冗余操作在正样本中被不当奖励,阻碍了跨多步推理的细粒度信用分配。
为了解决上述局限,我们提出 GraMRAG,一种新颖的图记忆引导的多智能体RAG框架。首先,为了弥合长期推理的鸿沟,我们引入了一种视觉-文本桥接推理范式,将多尺度实体裁剪与ReAct风格的视觉工具链相协调,将纯文本深度研究模型的迭代规划能力无缝转移到多模态领域,以实现长期的跨模态推理轨迹。其次,为了克服线性记忆范式中的状态盲区和上下文膨胀,我们构建了多模态记忆图,将推理过程形式化为动态有向无环图(DAG),显式编码智能体动作和多模态观察及其时间和逻辑依赖关系,以缓解冗余检索和状态盲区。第三,为了解决来自粗略终端奖励的信用分配问题,我们引入了拓扑感知策略优化(TAPO)算法,该算法利用图拓扑识别关键推理路径并执行目标节点剪枝,在策略更新期间精确掩蔽假阳性和假阴性节点,以实现跨多步推理的细粒度信用分配。
我们的贡献总结如下:
- •我们引入了一种视觉-文本桥接推理范式,将多尺度实体裁剪与ReAct风格的视觉工具链相统一,实现了长期的跨模态推理。
- •我们构建了多模态记忆图,将智能体推理形式化为动态DAG,以系统性地缓解状态盲区和冗余检索。
- •我们开发了TAPO算法,利用图拓扑进行关键路径识别和节点剪枝,实现了跨多步推理的细粒度信用分配。
- •我们在具有挑战性的多模态基准测试上进行了大量实验来评估我们的方法,展示了超越现有基线的最先进性能。
## 2 相关工作
### 2.1 多模态RAG中的多智能体系统
多智能体系统在复杂多模态推理任务上展现了潜力Wang and Liu (2026) (https://arxiv.org/html/2609.14066#bib.bib27); Dong et al. (2026) (https://arxiv.org/html/2609.14066#bib.bib3); Li et al. (2026) (https://arxiv.org/html/2609.14066#bib.bib12); Xinjie et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib30); Zhang et al. (2025a) (https://arxiv.org/html/2609.14066#bib.bib39)。通过部署多个专门的智能体,每个专注于问题的不同方面,这些架构实现了超越单智能体框架能力的协作式问题解决Ni and Ye (2026) (https://arxiv.org/html/2609.14066#bib.bib15); Sinha et al. (2026) (https://arxiv.org/html/2609.14066#bib.bib19); Siingh et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib18)。然而,现有的多智能体RAG系统进行的检索轮次不足,导致智能体在复杂任务上过早终止探索Geng et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib5); Narayan et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib14)。如此浅层的推理轨迹从根本上不足以满足需要数十次迭代推理步骤的苛刻深度研究场景。为解决这一挑战,我们引入了一种视觉-文本桥接推理范式,集成了多尺度实体裁剪与视觉工具链,使用图像描述作为跨模态桥梁,以实现多模态领域的长期规划。
### 2.2 智能体系统的记忆结构
现有智能体系统的记忆架构大致可分为两类范式Zhang et al. (2025b) (https://arxiv.org/html/2609.14066#bib.bib41); Ye et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib36):历史累积范式,以ReActYao et al. (2022) (https://arxiv.org/html/2609.14066#bib.bib35)为代表,它线性连接所有交互记录;以及迭代摘要范式,以Mem1Zhou et al. (2025) (https://arxiv.org/html/2609.14066#bib.bib45)为代表,它通过压缩观察来控制上下文长度。然而,随着交互轮次增加,这两种范式都会导致智能体逐渐丢失历史检索路径,我们称之为状态盲区,进而在多跳任务中引发重复查询和冗余检索。为解决此问题,我们构建了多模态记忆图,将推理过程形式化为动态DAG,显式编码动作和观察之间的时间和逻辑依赖关系,从而有效缓解状态盲区和冗余检索。
参见标题图 2:GraMRAG 框架概览。
## 3 方法
### 3.1 视觉-文本桥接推理范式
#### 多尺度视觉实体定位
给定输入图像 \(I\)、用户查询 \(q\) 和视觉诱导提示 \(p_{v}\),视觉探索器在每个推理步骤 \(t\) 执行层次化区域提案生成。视觉探索器不是将整幅图像作为单一的检索单元提交(这容易因背景噪声干扰而失败),而是同时生成粗粒度上下文区域和细粒度实体级图块,形成候选边界框集 \(\mathcal{B}_{t}=\{b_{t}^{1},\ b_{t}^{2},\ \ldots,\ b_{t}^{N_{t}}\}\),其中每个 \(b_{t}^{i}\) 代表在特定空间尺度或实体粒度上的区域裁剪,\(N_{t}\) 表示步骤 \(t\) 的提案数量。该候选集引导视觉检索动作 \(A_{t}^{v}=\mathrm{VSearch}(\mathcal{B}_{t})\),该动作由两阶段视觉工具链顺序处理:一个图像搜索模块将每个裁剪区域与网络规模索引匹配并返回候选URL,以及一个网页检索模块以结构化的markdown格式获取页面内容。步骤 \(t\) 获得的观察表示为:
\[ O_{t}^{v}=\mathrm{VisChain}(A_{t}^{v}) \tag{1} \]
完成当前步骤后,视觉探索器再次应用诱导提示 \(p_{v}\) 生成下一个搜索上下文,产生视觉推理轨迹:
\[ \tau_{\mathrm{vis}}=\{I,\ q,\ p_{v},\ R_{1},\ A_{1}^{v},\ O_{1}^{v},\ \ldots,\ p_{v},\ R_{T_{v}},\ A_{T_{v}}^{v},\ O_{T_{v}}^{v}\} \tag{2} \]
其中 \(R_{t}\) 表示在动作 \(A_{t}^{v}\) 之前生成的思维链推理,\(T_{v}\) 是视觉检索步骤的总数。
每次视觉检索动作后,一个独立的命中/未命中判定器评估在当前步骤获得的观察 \(O_{t}^{v}\),其条件是原始图像 \(I\) 和查询 \(q\),输出一个二进制接受信号:
\[ s_{t}=\mathrm{Judge}(I,\ q,\ O_{t}^{v})\in\{0,1\} \tag{3} \]
当 \(s_{t}=1\)(命中)时,检索被认为是成功的,意味着检索到的内容与查询实体语义一致,\(O_{t}^{v}\) 被添加到累积的有效证据池:
\[ \mathcal{E}^{v}=\{O_{t}^{v}\mid s_{t}=1,\ t=1,\ \ldots,\ T_{v}\} \tag{4} \]
当 \(s_{t}=0\)(未命中)时,检索被认为是不成功的,触发视觉探索器以更精细的空间粒度重新裁剪或重新制定搜索查询,然后再发起新的检索尝试。当 \(\|\mathcal{E}^{v}\|\) 达到预定义的充分性阈值或总步骤数达到 \(T_{v}\) 时,视觉探索阶段终止。将命中/未命中判定与主智能体解耦并分配给独立的判定器,实现了探索策略与证据评估的清晰分离,增强了多尺度迭代检索过程的鲁棒性。
#### 模态桥接与文本推理
为了将视觉探索阶段累积的证据转移到文本推理领域,我们引入了一个模态桥接步骤。一个标题生成模块首先为输入图像 \(I\) 生成全面的文本描述 \(D\),涵盖关键实体、空间关系和场景级语义。然后,视觉轨迹 \(\tau_{\mathrm{vis}}\) 被转换为桥接上下文:\(I\) 被 \(D\) 替代,所有视觉诱导提示 \(p_{v}\) 被移除,而所有思维链推理 \(R_{t}\)、动作 \(A_{t}^{v}\) 和判定器验证的观察(即 \(\mathcal{Text Researcher}\) 的文本推理轨迹:
\[ \tau_{\mathrm{text}}=\{D,\ q,\ R_{1},\ A_{1}^{v},\ O_{1}^{v},\ \ldots,\ R_{T_{v}},\ A_{T_{v}}^{v},\ O_{T_{v}}^{v},\ R_{T_{v}+1},\ A_{T_{v}+1}^{t},\ O_{T_{v}+1}^{t},\ \ldots,\ R_{T_{v}+T_{t}},\ A_{T_{v}+T_{t}}^{t}\} \tag{5} \]
其中 \(T_{t}\) 表示文本研究器执行的文本推理步骤数。
#### 证据聚合与完整轨迹构建
证据验证器聚合并验证两个推理阶段产生的完整证据集合。以所有判定器验证的视觉观察 \(\mathcal{E}^{v}\) 和文本研究器生成的文本推理轨迹 \(\tau_{\mathrm{text}}\) 作为输入,证据验证器执行跨模态推理以解决证据冲突、过滤幻觉内容并生成最终答案 \(a_{\mathrm{out}}\)。通过将其推理基于图结构记忆而非扁平化的上下文窗口,证据验证器避免了线性记忆范式固有的状态盲区,确保两种模态的完整证据体被忠实地整合到最终答案中。通过合并 \(\tau_{\mathrm{vis}}\) 和 \(\tau_{\mathrm{text}}\) 获得完整的多模态深度研究轨迹:
\[ \tau=\{I,\ q,\ R_{1},\ A_{1}^{v},\ O_{1}^{v},\ \ldots,\ R_{T_{v}},\ A_{T_{v}}^{v},\ O_{T_{v}}^{v},\ R_{T_{v}+1},\ A_{T_{v}+1}^{t},\ O_{T_{v}+1}^{t},\ \ldots,\ R_{T_{v}+T_{t}},\ A_{T_{v}+T_{t}}^{t},\ a_{\mathrm{out}}\} \tag{6} \]
### 3.2 多模态记忆图
参见标题图 3:GraMRAG 框架的推理流程。
我们构建多模态记忆图 \(\mathcal{G}_{t}=(\mathcal{V}_{t},\,\mathcal{E}_{t})\)。相似文章
记忆是重构的,而非检索:LLM 代理的图记忆
MRAgent 提出了一种新颖的基于图的记忆框架,能在推理过程中动态重构记忆,在长程基准测试上实现高达 23% 的性能提升,同时降低了计算成本。
构建 Agentic GraphRAG 系统:从知识图谱和本体论到作为 AI 智能体 MCP 服务器的统一记忆
作者认为 GraphRAG 本质上是一个数据建模问题,而非单纯的检索算法,并提出了一种包含五个组件的架构,利用本体论、知识图谱和 MCP 服务器为智能体提供统一记忆。
GraphReAct:面向多步图推理的推理与行动
本文介绍了 GraphReAct,这是一个将推理与行动范式扩展到图结构数据以进行多步推理的框架。它结合了拓扑检索、语义检索以及上下文精炼,以提升在图学习基准测试上的性能。
ReM-MoA:推理记忆维持混合智能体扩展
ReM-MoA 引入了一种记忆增强的混合智能体框架,通过排序推理记忆和策划的多样化记忆路由来维持扩展,在五个推理基准测试中优于之前的 MoA 变体。
GraphRAG 在 AI 代理中何时真正值得使用?
一位开发者反思了何时 GraphRAG 比标准 RAG 更适合 AI 代理,指出它在多跳推理和关系理解方面很有价值,但增加了显著的复杂性。