EviReform:证据引导的多跳图检索查询重写
摘要
EviReform 提出了一种证据引导的查询重写方法,用于多跳图检索,将检索请求的修订与证据聚合分离,并在 2WikiMultiHopQA、HotpotQA 和 MuSiQue 上超过了最强基线,分别提升了最多 5.59 Recall@5 和 4.50 F1。
查看缓存全文
缓存时间: 2026/08/14 09:28
# EviReform:面向多跳图检索的证据引导查询重写
来源:https://arxiv.org/html/2608.13006
Yoshua Y. Li
机构:美团
###### 摘要
多跳检索必须恢复能够共同提供充分证据的段落。初始段落通常会解析问题中隐含的实体或关系,这使得缺失的证据往往只有在检索开始后才能更容易地被描述出来。图检索通过存储的语料库结构改善了对相关证据的访问,但其检索信号通常源自原始问题。因此,即使观测到的段落提供了更直接的语义线索,补充证据也必须通过存储的关系来获取。我们提出 EviReform,它将检索请求的修订与图中证据的聚合分离开来。检索到的源段落为未解决的信息需求生成残差查询。原始检索信号和残差检索信号分别归一化、组合,并在共享实体的命题之间传播。在 2WikiMultiHopQA、HotpotQA 和 MuSiQue 上,EviReform 在 Recall@5 上最高超过最强基线 5.59 个百分点,在 F1 上最高超过 4.50 个百分点。这些结果表明,观测到的证据可以引导图检索朝向原始问题未充分指定的支撑链部分。代码可在 https://github.com/XrazyMee/EviReform 获取。
## 1 引言
检索增强生成(RAG)将语言模型锚定在外部证据上 [16 (https://arxiv.org/html/2608.13006#bib.bib1)]。多跳问题使这些证据相互依存:回答可能需要涉及不同实体或事件的段落,而后续段落的相关性可能只有在较早段落解析了某个桥梁之后才变得明显。因此,检索必须跨跳恢复互补证据,而不仅仅是独立地类似于原始问题的段落 [33 (https://arxiv.org/html/2608.13006#bib.bib24), 15 (https://arxiv.org/html/2608.13006#bib.bib25)]。稠密检索器根据问题的表示对每个段落进行评分 [11 (https://arxiv.org/html/2608.13006#bib.bib20)]。
GraphRAG 通过将实体、命题和段落组织成语料库结构来解决由此产生的碎片化问题。PropRAG 搜索命题路径并细化图种子;HippoRAG 2 改进语义入口,并使用个性化 PageRank 扩散相关性;CatRAG 根据查询调整遍历策略 [28 (https://arxiv.org/html/2608.13006#bib.bib5), 7 (https://arxiv.org/html/2608.13006#bib.bib3), 13 (https://arxiv.org/html/2608.13006#bib.bib4)]。这些机制改善了相关性到达结构相关证据的方式。
结构本身并不能捕获检索引入的所有变化。假设一个初始段落识别出问题中隐含的人、地点或关系。这个观测使得剩余的信息需求比检索之前更加具体。一个图检索器,如果其种子、路径或边分数仍然与原始问题绑定,则必须通过其存储的关系来恢复补充段落,即使观测到的段落现在提供了对缺失内容的更直接描述。问题不在于图遍历是否适应问题;而在于检索到的证据能否修订进入图检索的查询信号。这一区别将两个往往被一同处理的决定分开。
在阅读任何段落之前,问题可以决定检索从图的何处进入以及如何遍历图。在阅读段落后,系统还可以重新考虑它应该寻找哪些文本证据。第一个决定利用已经存储在语料库中的关系;第二个决定使用检索到的段落的内容来指定新的信息需求。当桥梁是隐含的、在图中不存在,或更直接地表达在段落文本中时,更好的遍历并不能消除对第二个决定的需求。反之,重写并不能替代图结构:针对修订后查询检索到的证据仍可能不完整或分散在相关的命题中。我们的方法结合了这两个角色。
使用证据来引导后续查询有着丰富的历史。相关性反馈根据检索到的文档更新查询 [22 (https://arxiv.org/html/2608.13006#bib.bib22), 36 (https://arxiv.org/html/2608.13006#bib.bib23)],而多跳系统则根据段落、生成的子查询或演化的推理状态来条件化后续检索 [21 (https://arxiv.org/html/2608.13006#bib.bib14), 32 (https://arxiv.org/html/2608.13006#bib.bib21), 27 (https://arxiv.org/html/2608.13006#bib.bib6), 23 (https://arxiv.org/html/2608.13006#bib.bib16)]。MIGRES 和 S2G-RAG 在另一次检索步骤之前明确识别缺失信息或证据不足 [29 (https://arxiv.org/html/2608.13006#bib.bib17), 17 (https://arxiv.org/html/2608.13006#bib.bib18)]。智能体图系统进一步将查询生成与图交互、记忆、停止和答案生成相结合 [24 (https://arxiv.org/html/2608.13006#bib.bib36), 18 (https://arxiv.org/html/2608.13006#bib.bib37), 35 (https://arxiv.org/html/2608.13006#bib.bib38), 30 (https://arxiv.org/html/2608.13006#bib.bib39)]。这些研究确立了让证据影响后续检索的价值。我们专注于这一操作与图检索之间的接口:观测到的段落如何修订检索信号,同时原始问题继续约束最终排序的证据。
EviReform 直接实现了这种分离。初始命题检索识别出能够揭示问题已解决什么以及还缺失什么的源段落。一个重写器将剩余需求表示为一小组残差查询。它们的检索信号与原始问题产生的信号分开归一化,然后将两个通道组合。图传播聚合与任一通道相连的命题,段落读出产生一个排序。因此,重写在观测之后改变了所寻求的证据,而图结构巩固了两个请求所达到的证据。这项工作有三个贡献:
- 我们将观测后的图检索表述为一个同时以原始问题和初始检索段为条件的排序问题。
- 我们提出 EviReform,它分别归一化原始检索信号和残差检索信号,将它们组合,并通过共享实体将它们的证据聚合为一个段落排序。
- 我们在 2WikiMultiHopQA、HotpotQA、MuSiQue 和 GraphRAG-Bench(医学)上评估了 EviReform。它最高超过最强基线 5.59 个 Recall@5 点和 4.50 个 F1 点;控制研究将增益归因于重写和传播。
## 2 相关工作
图1 (https://arxiv.org/html/2608.13006#S2.F1) 总结了下面讨论的三条检索研究路线。
图 1:本节讨论的检索范式。(a) GraphRAG 使用存储的语料库结构来检索相关证据。(b) 迭代检索使用观测到的证据来引导后续搜索。(c) 智能体图检索通过记忆、反思和停止决策来协调图交互。
### 2.1 用于检索的 GraphRAG
GraphRAG 系统组织实体、关系、命题、段落或社区,以恢复分散在文本中的证据 [4 (https://arxiv.org/html/2608.13006#bib.bib2), 8 (https://arxiv.org/html/2608.13006#bib.bib29)]。专为检索设计的系统在使用这种结构的方式上有所不同。PropRAG 构建命题图,使用束搜索探索命题路径,并为第二阶段的图排序构建精化的种子 [28 (https://arxiv.org/html/2608.13006#bib.bib5)]。HippoRAG 2 将问题链接到段落和提取的三元组,用识别记忆过滤三元组候选,并从保留的信号初始化 PPR [7 (https://arxiv.org/html/2608.13006#bib.bib3)]。CatRAG 根据问题修改锚定、边权重和段落偏置,而 QAFD-RAG 类似地使图扩散适应查询 [13 (https://arxiv.org/html/2608.13006#bib.bib4), 38 (https://arxiv.org/html/2608.13006#bib.bib19)]。LightRAG 和 KG2RAG 提供了其他形式的图组织和扩展 [6 (https://arxiv.org/html/2608.13006#bib.bib27), 39 (https://arxiv.org/html/2608.13006#bib.bib28)]。这些方法为问题锚定、路径发现和结构传播开发了不同的机制。
### 2.2 证据引导的迭代检索
检索反馈早于 RAG:Rocchio 根据判定文档更新查询,而稠密伪相关性反馈将问题与初始段落一起编码 [22 (https://arxiv.org/html/2608.13006#bib.bib22), 36 (https://arxiv.org/html/2608.13006#bib.bib23)]。多跳检索器将这个想法扩展到多跳。GoldEn Retriever 从可用上下文生成搜索,Baleen 浓缩早期证据,MDR 学习段落条件化的检索路径 [21 (https://arxiv.org/html/2608.13006#bib.bib14), 12 (https://arxiv.org/html/2608.13006#bib.bib15), 32 (https://arxiv.org/html/2608.13006#bib.bib21)]。IRCoT 将检索与思维链推理交错进行,而 Iter-RetGen 和 FLARE 从演化的生成文本中检索 [27 (https://arxiv.org/html/2608.13006#bib.bib6), 23 (https://arxiv.org/html/2608.13006#bib.bib16), 10 (https://arxiv.org/html/2608.13006#bib.bib26)]。MIGRES 明确为缺失信息生成查询,S2G-RAG 将缺口描述与证据充分性决策耦合 [29 (https://arxiv.org/html/2608.13006#bib.bib17), 17 (https://arxiv.org/html/2608.13006#bib.bib18)]。总之,这些系统展示了检索到的证据如何引导后续搜索。
### 2.3 智能体图检索
最近的系统将从证据中派生的查询与图交互相结合。GeAR 维护一个要点记忆,判断可回答性,重写查询,并反复调用图检索 [24 (https://arxiv.org/html/2608.13006#bib.bib36)]。Graph-R1 将反思、查询生成、图检索和回答建模为跨多轮的学习策略,而 GraphRAG-R1 使用强化学习优化检索行为,并结合图和文本检索 [18 (https://arxiv.org/html/2608.13006#bib.bib37), 35 (https://arxiv.org/html/2608.13006#bib.bib38)]。ToG-3 通过一个判断证据充分性的循环同时演化其查询和检索到的子图 [30 (https://arxiv.org/html/2608.13006#bib.bib39)]。这些系统将图检索整合到自适应推理和答案生成中。
## 3 EviReform
图 2:EviReform 为原始问题检索命题并观测它们的源段落。重写器将未解决的信息需求表示为残差查询。原始检索信号和残差检索信号被组合,通过共享实体传播,并读出一个段落排序。
图2 (https://arxiv.org/html/2608.13006#S3.F2) 展示了 EviReform。该方法首先为原始问题检索命题,然后观测它们的完整源段落以制定残差查询。来自原始问题和残差查询的信号在图传播和段落排序之前被组合。
### 3.1 跨跳证据依赖
设 \(q\) 为一个问题,\(D=\{d_j\}_{j=1}^N\) 为段落语料库。检索器返回排序 \(R(q,D)\),下游阅读器从中获取前 \(K\) 个段落。对于多跳问题,所需证据可能分布在多个段落中。初始检索集 \(E_q \subset D\) 可以解析一个中间实体或关系,从而使剩余证据更容易描述。因此,下一个段落的检索信号可以同时依赖于原始问题和已经观测到的证据。
检索目标并不绑定特定的截断点:它是将一组紧凑的、共同充分的段落放置在排序的前列。我们在实验中使用 \(K=5\),但底层要求是所选段落共同支持答案。金标段落为该要求提供了可观测的代理。如果 \(E_q\) 已经包含一条链的一部分,那么有用的下一个段落更好地通过其与 \((q,E_q)\) 的相关性来刻画,而不是通过与 \(q\) 的独立相似性:
\[
\operatorname{rel}(d \mid q,E_q) \neq \operatorname{rel}(d \mid q) \quad \text{in general.}
\tag{1}
\]
当第一个段落解析了问题中仅隐含的桥梁时,这种差异最大。
### 3.2 基于原始问题的图检索
设 \(\mathbf{b}(q)\) 表示从原始问题获得的检索种子。图检索系统通过语料库图传播该种子,并将得到的单元分数读回段落。在此所需的层次上,排序可以写为
\[
\mathbf{z}_q = \mathbf{B}^\top \mathbf{P}_G(q) \mathbf{b}(q),
\tag{2}
\]
其中 \(\mathbf{P}_G(q)\) 可能依赖于问题,\(\mathbf{B}\) 将图单元映射到段落。适应问题的路径或边权重会改变 \(\mathbf{P}_G(q)\),而更好的链接会改变 \(\mathbf{b}(q)\)。然而,当两者都仅由 \(q\) 计算时,公式 2 不包含检索段落的项。
这一观察覆盖了几种强形式的图检索。过滤器可以从使用问题检索到的候选中选择更准确的图种子,遍历策略可以根据问题调整路径或边权重。两者都改善了对语料库图的使用。它们仍然解决了由原始请求诱导的排序问题。当观测到的段落揭示了一个桥梁时,剩余需求要么必须通过存储的关系来达到,要么必须表达为另一个检索请求。我们研究后一种操作,然后保留图传播来组合由此产生的证据。
### 3.3 从检索证据中重写查询
在观测到 \(E_q\) 后,重写器描述仍未解决的内容:
\[
\boldsymbol{\rho} = \mathcal{R}(q,E_q) = \{\rho_1, \ldots, \rho_L\}.
\tag{3}
\]
每个残差查询产生一个归一化的检索信号 \(\mathbf{r}^{(\ell)}\)。我们平均有效的残差信号,并将其与原始问题的种子组合:
\[
\mathbf{s}(q,E_q) = \beta \mathbf{b}(q) + \frac{1-\beta}{|\mathcal{V}|} \sum_{\ell \in \mathcal{V}} \mathbf{r}^{(\ell)},
\tag{4}
\]
其中 \(\mathcal{V}\) 索引具有有效检索结果的残差查询;如果 \(\mathcal{V}\) 为空,则 \(\mathbf{s}(q,E_q) = \mathbf{b}(q)\)。分开归一化防止了残差结果的数量或原始分数规模压倒原始问题。然后图检索对组合信号进行操作:
\[
\mathbf{z}_{q,E} = \mathbf{B}^\top \mathbf{P}_G \mathbf{s}(q,E_q).
\tag{5}
\]
这个表述赋予这两个操作不同的角色。查询重写为 \(E_q\) 使其可识别的证据引入了直接的检索质量,而图传播聚合与原始信号或残差信号相连的证据。在受控混合之前保持信号分离,既保留了原始问题的约束,又允许观测到的段落修订检索请求。重写器产生检索查询而非答案或推理轨迹,系统返回一个段落排序。第3节 (https://arxiv.org/html/2608.13006#S3) 给出了具体的命题–实体实现。相似文章
DynaKRAG: 多跳检索增强生成中可学习证据控制的统一框架
DynaKRAG提出了一种用于多跳检索增强生成的统一框架,该框架学习状态条件策略以选择证据操作,在HotpotQA、2Wiki和MuSiQue上优于基线。
SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges
This paper proposes SAG, a SQL-retrieval augmented generation architecture that organizes documents into event-entity hyperedges without building a global knowledge graph, enabling query-time dynamic linking of evidence chunks for multi-hop QA. It reports state-of-the-art retrieval and QA performance on HotpotQA, 2WikiMultiHopQA, and MuSiQue benchmarks.
EviRank:多模态图像重排序的结构化相关性证据
EviRank 将多模态图像重排序重新表述为使用结构化证据包的语义约束满足,无需训练即可实现最先进的性能。
P Moth-Retrieval:通过查询时编排实现无图多跳检索(在HotpotQA上击败基于图的系统)[P]
Moth-Retrieval提出了一种无图的多跳检索方法,在HotpotQA基准测试上优于基于图的系统。
HyCE-RAG: 基于超图证据链的检索增强生成用于可解释的多跳问答
HyCE-RAG 是一种新颖的基于超图的检索增强生成框架,专为多跳问答设计,通过置信度感知的启发式搜索构建显式证据链,在准确性、相关性和忠实度方面优于标准 RAG 和基于图的 RAG 方法。