HyperProve: 用于多跳问答的答案引导超图扩展

arXiv cs.CL 论文

摘要

HyperProve 提出了一种利用答案引导超图扩展的检索增强型问答框架,用于处理多跳问题,并在基准测试中取得了优于基线模型的性能。

arXiv:2609.13768v1 公告类型:new 摘要:多跳问答通常在检索将证据视为与原始问题隔离的匹配时失败,因为回答一个复杂问题所需的事实通常通过中间实体、关系和约束相连接。我们提出了 HyperProve,这是一个检索增强型问答框架,通过将问题分解与基于原子事实超图的答案条件扩展相结合来解决这一挑战。HyperProve 并非孤立地使用原子事实、超图或迭代检索;相反,它将中间答案和支持的超边作为检索状态进行携带,然后利用该状态来引导下一步的局部超图扩展。这种设计使 HyperProve 能够为最终答案生成构建连贯的证据链,同时使检索过程具有状态性和事实中心性。在多个多跳问答基准测试中,HyperProve 在我们的评估中取得了最佳的整体性能,以平均 6.2% 的答案准确率和 4.9% 的 F1 值相对改进幅度超越了最强的基线模型。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:41

# 答案引导的超图扩展在多跳问答中的应用  
来源:https://arxiv.org/html/2609.13768  

## HyperProve:面向多跳问答的答案引导超图扩展  
**作者:** Dung Nguyen Quang¹  
¹ 越南河内科技大学  
**Luu Hieu An**  
越南河内科技大学  
**Linh Ngo Van†**  
† 通讯作者:[[email protected]](mailto:[email protected])  
越南河内科技大学  
**Trung Le**  
**Thien Huu Nguyen**  
澳大利亚莫纳什大学、美国俄勒冈大学  

###### 摘要  
多跳问答常因检索过程将证据视为与原始问题的孤立匹配而失败,因为回答复杂问题所需的事实通常通过中间实体、关系和约束相互连接。本文提出**HyperProve**,一个通过将问题分解与基于原子事实超图的答案条件扩展相结合来应对这一挑战的检索增强问答框架。HyperProve并非孤立地使用原子事实、超图或迭代检索;相反,它将中间答案和支持超边作为检索状态传递,并利用该状态指导后续的局部超图扩展。这种设计使HyperProve能够在最终答案生成过程中构建连贯的证据链,同时使检索过程具有状态性和事实中心性。在多跳问答基准测试中,HyperProve在我们的评估中实现了最佳整体性能,相比最强基线方法,答案准确率平均相对提升6.2%,F1值平均相对提升4.9%。  

## 1 引言  
检索增强生成(Lewis等人,2020 (https://arxiv.org/html/2609.13768#bib.bib1))已成为将语言模型锚定于外部证据的标准方式,但许多检索流水线仍将问答视为一次性相关性问题:给定一个问题,检索与之独立相似的段落,然后让阅读器生成答案。这种设置更适用于答案承载证据与查询直接对齐的问题。然而,在多跳问答中,关键证据通常分布在通过中间实体、关系、时间约束或其他桥接条件(Trivedi等人,2022 (https://arxiv.org/html/2609.13768#bib.bib3); Yang等人,2018 (https://arxiv.org/html/2609.13768#bib.bib4); Ho等人,2020 (https://arxiv.org/html/2609.13768#bib.bib5))连接的事实中。在这种情况下,下一个有用的事实可能与原始问题毫不相似;它仅在早期事实建立了正确的桥接或连接后才变得相关。参见标题图1:一个4跳问题的案例研究:PropRAG未能将《最后的晚餐》连接到“彼得”,并漂移到了干扰链“威尼斯→→威尼斯共和国”;HyperProve成功,因为原子事实超边显式地保留了桥接实体和正确路径。先前的研究通过图结构和迭代检索来解决此问题,但其检索控制方式与我们的不同。HyperGraphRAG将n元事实表示为超边,但仍根据原始问题匹配节点并应用一次性二部关联扩展(Luo等人,2025 (https://arxiv.org/html/2609.13768#bib.bib11))。HGRAG则将整个段落表示为超边,并通过固定查询的超图扩散结合实体和段落级别的相关性(Wang等人,2026 (https://arxiv.org/html/2609.13768#bib.bib17))。PropRAG在命题中保留上下文,并执行高效、无需LLM的波束搜索,根据未改变的原始问题对命题路径进行评分(Wang and Han,2025 (https://arxiv.org/html/2609.13768#bib.bib10))。这些方法改进了结构化证据发现,但检索的推进是由图邻接性或原始查询相关性,而非已验证的中间答案及其支撑来决定的。如图1 (https://arxiv.org/html/2609.13768#S1.F1)所示,在未解决的桥接已改变后,固定查询的命题路径可能保留一个全局相似的干扰项。迭代检索方法分解问题、重写查询,或将检索与推理交织(Trivedi等人,2023 (https://arxiv.org/html/2609.13768#bib.bib13); Wang等人,2025 (https://arxiv.org/html/2609.13768#bib.bib18); Ye等人,2025 (https://arxiv.org/html/2609.13768#bib.bib7); Zhu等人,2025 (https://arxiv.org/html/2609.13768#bib.bib8))。例如,SG-FSM使用文本状态在子问题之间动态推进,而IRCoT和ChainRAG使用中间推理或重写的查询来指导后续检索。这类系统在不同跳之间调整查询,但它们并未将已解析的答案及其支撑事实转化为结构化的检索前沿。因此,后续的跳可能从表面相似性重新开始,丢失桥接证据,或跟随一个看似合理的干扰实体。  

我们提出**HyperProve**,一个使检索状态在基于源的原子事实超边层面显式化的检索增强问答框架。其核心耦合是:*已解析的答案 + 支撑原子事实 → 下一跳结构化前沿*。HyperProve将问题分解为依赖的子查询,使用已验证的桥接答案重写每个未解析的关系,将携带的前沿与新的稠密种子结合,并执行有界的、查询感知的实事实扩展。与一次性关联扩展、固定查询扩散或文本答案传播不同,此机制利用已解析的答案及其支撑证据来改变下一个检索分布。在图1 (https://arxiv.org/html/2609.13768#S1.F1)中,生成的前沿保留了隐藏的桥接证据,并将证据链保持在正确路径上。我们的主要贡献总结如下:  
- • 我们提出**HyperProve**,一种答案条件的超边检索公式,统一了基于图的和迭代的RAG:每个中间答案与其支撑的原子事实超边一起作为后续跳的结构化前沿。  
- • 我们设计了一种查询偏置的局部超图扩展算法,该算法在原子事实超边上进行检索,结合了证据单元间的结构连通性与每个重写子查询的语义对齐。  
- • 在可控的检索器、阅读器、语料库和证据预算下,我们证明了HyperProve在三个基准测试上改进了多跳问答,优于稠密、结构化和迭代检索基线方法。  
参见标题图2:HyperProve整体流程。该系统从语料库段落构建离线的、同义词感知的原子事实超图,然后通过将问题分解为子查询、携带中间答案作为桥接实体、在局部超图邻域扩展,并将生成的证据链整合为最终答案,在线执行答案引导的多跳推理。  

## 2 相关工作  
##### 基于图的RAG。  
基于图的RAG通过建模段落、实体或原子事实之间的关系,而非独立地对段落进行评分,从而改进了稠密检索。HippoRAG2使用个性化PageRank构建图记忆(Gutiérrez等人,2025 (https://arxiv.org/html/2609.13768#bib.bib9));PropRAG搜索命题路径以保留细粒度上下文(Wang and Han,2025 (https://arxiv.org/html/2609.13768#bib.bib10));HyperGraphRAG将n元事实表示为超边(Luo等人,2025 (https://arxiv.org/html/2609.13768#bib.bib11));HGRAG使用实体-段落超图进行多跳问答(Wang等人,2026 (https://arxiv.org/html/2609.13768#bib.bib17))。同样的结构视角超越了英语开放域问答:MaGiX构建了一个具有跨同义词边的多粒度跨语言图,用于英越RAG(Hieu等人,2025 (https://arxiv.org/html/2609.13768#bib.bib19));MemORAI在来源感知的多关系图中组织对话记忆,并通过动态加权PageRank进行遍历(Van等人,2026 (https://arxiv.org/html/2609.13768#bib.bib21))。使用对称目标训练的跨语言检索器进一步改进了底层匹配质量(Nguyen等人,2025 (https://arxiv.org/html/2609.13768#bib.bib20))。然而,由于它们的检索仍然基于原始问题进行条件化,而HyperProve在子查询之间携带每个中间答案及其支撑超边来指导基于原子事实的查询偏置局部扩展,因此它们在多跳问答方面仍非最优。  

##### 迭代检索。  
迭代方法跨多个步骤规划、检索和精炼证据。IRCoT将检索与思维链推理交织(Trivedi等人,2023 (https://arxiv.org/html/2609.13768#bib.bib13));SG-FSM使用文本有限状态过程通过动态选择的子问题推进(Wang等人,2025 (https://arxiv.org/html/2609.13768#bib.bib18));T2RAG在三元组上推理(Gong等人,2026 (https://arxiv.org/html/2609.13768#bib.bib14));HopRAG执行检索-推理-剪枝步骤(Liu等人,2025 (https://arxiv.org/html/2609.13768#bib.bib12));ChainRAG渐进式重写查询以缓解检索中的信息丢失错误(Zhu等人,2025 (https://arxiv.org/html/2609.13768#bib.bib8))。KiRAG和UniRAG通过知识驱动的迭代和分解进一步调整检索(Fang等人,2025 (https://arxiv.org/html/2609.13768#bib.bib15); Kim等人,2025 (https://arxiv.org/html/2609.13768#bib.bib16))。HyperProve共享它们跳自适应的观点,但改变了状态类型:已验证的答案及其支撑原子事实定义了下一个结构化前沿,而重写的子查询则偏置在该有界邻域内的转移。这保留了跨跳的证据来源,而非仅将文本携带到新的检索调用中。  

## 3 方法论  
设 \( D=\{d_j\}_{j=1}^{M_d}\) 为文档节点,\(p_j=\text{node}(d_j)\) 表示存储在节点 \(d_j\) 中的段落。给定问题 \(Q\),我们的目标是检索一组紧凑的连贯证据并生成答案 \(a\)。我们将多跳问题视为一个依赖的子查询序列,\(Q \rightarrow (q_1, q_2, ..., q_m)\),其中每个 \(q_t\) 至少解决一个桥接实体、桥接关系或最终目标属性。来自 \(q_{t-1}\) 的答案或证据决定了 \(q_t\) 的解释和检索前沿。HyperProve通过构建超边级别的知识结构并在原子事实超边上执行所有中间推理来实现此观点。图2 (https://arxiv.org/html/2609.13768#S1.F2) 总结了由此产生的离线索引和在线答案引导推理流程。  

### 3.1 作为超边的原子事实  
作为图2 (https://arxiv.org/html/2609.13768#S1.F2) 中的第一个离线阶段,HyperProve从每个段落 \(p_j\) 中提取实体节点,\(\mathcal{E}_j \subseteq \mathcal{V} = \{e_a\}_{a=1}^{M_e}\),其中 \(m_a = \text{name}(e_a)\) 是与实体节点 \(e_a\) 相关联的文本提及。提取的节点包括参与有意义关系的命名实体、日期、显著对象和通用概念。然后将段落分解为原子事实。设 \(\mathcal{H} = \{h_i\}_{i=1}^N\) 为由此产生的超边,\(\sigma(i) = j\) 将超边 \(h_i\) 映射到其源文档。我们将每个原子事实表示为 \(h_i = (x_i, \mathcal{A}_i, d_{\sigma(i)})\),其中 \(x_i = \text{text}(h_i)\) 是一个独立的陈述性事实语句,\(\mathcal{A}_i \subseteq \mathcal{E}_{\sigma(i)}\) 是参与的实体节点集。在结构上,其关联为 \(h_i \sim \mathcal{A}_i \cup \{d_{\sigma(i)}\}\)。这种建模选择解决了二元三元组的局限性。三元组表示成对的关系 \((s, r, o)\),但许多事实涉及两个以上的参与者,以及时间、空间、因果或来源限定词。将这样的事实拆分为不相连的对可能导致*上下文坍缩*。PropRAG同样支持基于上下文的命题而非三元组(Wang and Han,2025 (https://arxiv.org/html/2609.13768#bib.bib10));HyperProve额外将每个原子事实作为一个超边,连接所有参与的实体节点及其源文档。提取提示见附录A.1 (https://arxiv.org/html/2609.13768#A1.SS1)。  

### 3.2 知识超图构建  
下一个离线阶段将语料库转化为同义词感知的超边图。实体表面形式在不同段落中可能不同,因此HyperProve嵌入实体名称 \(m_a\) 并使用余弦相似性创建同义词映射。如果两个名称嵌入超过阈值 \(\eta\)(我们实验中为0.8),则将其视为相邻提及。参与者集合扩展为 \(\mathcal{A}_i^+ = \mathcal{A}_i \cup \text{Syn}(\mathcal{A}_i)\)。扩展的集合允许超边即使在段落为同一实体或概念使用不同表面形式时也能重叠。我们定义超边-实体关联矩阵 \(B_{he} \in \{0,1\}^{N \times M_e}\) 和超边-文档关联矩阵 \(B_{hd} \in \{0,1\}^{N \times M_d}\):  
\[
B_{he}[i, a] = \mathbf{1}[e_a \in \mathcal{A}_i^+], \quad B_{hd}[i, j] = \mathbf{1}[\sigma(i) = j].
\]  
实体和文档的度矩阵为:  
\[
D_e[a, a] = \sum_i B_{he}[i, a], \quad D_d[j, j] = \sum_i B_{hd}[i, j].
\]  
超边之间的加权结构邻接为:  
\[
W_s = B_{he} D_e^{-1} B_{he}^\top + B_{hd} D_d^{-1} B_{hd}^\top.
\]  
第一项连接共享扩展实体节点的超边,第二项连接来自同一文档的超边。\(D_e^{-1}\) 降低常见实体的权重,\(D_d^{-1}\) 降低产生许多原子事实的文档的权重。移除自环后,我们进行行归一化:  
\[
T_s = \text{RowNormalize}\left(W_s - \text{diag}(W_s)\right).
\]  
由此产生的 \(T_s\) 是原子事实超边上的稀疏转移矩阵;行归一化仅在移除自转移后应用。文档保留作为来源和读者上下文,而检索转移在 \(\mathcal{H}\) 上操作。  

### 3.3 查询偏置的超边检索  
对于每个查询或子查询,HyperProve仅使用稠密检索来选择入口超边。这些种子定义了图搜索的起点;然后通过在超边图中导航连接的原子事实对证据进行排序。从当前种子开始,HyperProve通过在 \(T_s\) 上进行随机游走扩展构建局部子图 \(G_t^{\star}\),保留最多600个通过实体、同义词扩展重叠或共享来源连接的超边。设 \(T_{s,t}^{\star}\) 为 \(T_s\) 限制到 \(G_t^{\star}\) 后的行归一化矩阵。对于候选超边 \(h_k\),定义  
\[
c_{t,k} = \cos\left(\phi(q'_t), \phi(x_k)\right), \quad \mathcal{N}_{t,\theta}(i) = \{j \mid (T_{s,t}^{\star})_{ij} > \theta \}
\]  
为从超边 \(h_i\) 通过阈值 \(\theta\) 的转移可到达的超边集。检索状态 \(s_t\) 是一个元组 \((q'_t, \mathcal{F}_{t-1}, s_{t-1})\),其中 \(q'_t\) 是第 \(t\) 个子查询,\(\mathcal{F}_{t-1}\) 是来自前一跳的携带前沿,\(s_{t-1}\) 是之前的检索历史。扩展从种子开始,在 \(T_{s,t}^{\star}\) 上执行最多 \(L\) 步的有界广度优先搜索,仅保留连通分量。然后,我们对扩展后的超边集 \(\mathcal{H}_t\) 中的超边根据其与 \(q'_t\) 的查询相关性以及它们与携带前沿 \(\mathcal{F}_{t-1}\) 的结构连通性进行评分:  
\[
\text{score}(h_k) = \alpha \cdot c_{t,k} + (1-\alpha) \cdot \text{struct}(h_k, \mathcal{F}_{t-1}),
\]  
其中 \(\alpha\) 是一个插值权重,\(\text{struct}\) 计算从 \(h_k\) 到 \(\mathcal{F}_{t-1}\) 中任何超边的最短路径长度的倒数。前 \(K\) 个得分最高的超边被选为当前跳的证据,并更新前沿:\(\mathcal{F}_t = \mathcal{F}_{t-1} \cup \{h_k\}_{k=1}^K\)。此过程重复,直到达到跳数 \(m\)。最终,累积的前沿 \(\mathcal{F}_m\) 中的原子事实被提供给阅读器以生成最终答案。

相似文章

Exploiting Intrinsic Duality for Multi-Hop Question Generation

arXiv cs.CL

The paper proposes QQ, a framework that leverages the intrinsic duality between multi-hop question generation and question answering via bidirectional alignment constraints and contrastive learning, improving question quality on HotpotQA and MuSiQue.