Hi-Q: 用于多跳问答的层次证据引导查询精炼

Hugging Face Daily Papers 论文

摘要

Hi-Q 是一个证据条件框架,基于语料库支持信号动态将多跳查询精炼为层次树,从而提高多跳问答的检索和答案准确性。

多跳问答(QA)中的一个核心瓶颈是,问题表达的粒度通常与语料库证据可检索的粒度不同。现有方法通过在语料库上施加固定图结构、迭代地重新表述查询或执行生成的程序来解决这种不匹配,但这些策略没有明确决定何时一个查询单元已经得到证据支持,何时应该精炼。我们将此瓶颈形式化为可检索粒度发现,并引入 Hi-Q,一个用于层次查询精炼的证据条件框架。在每个查询节点,一个解析操作符测试检索到的证据是否支持当前查询单元;已解析的节点终止,而未解析的节点由依赖保持的二元操作符扩展,并由语义覆盖验证器检查。因此,Hi-Q 增长一个查询树,其拓扑结构由语料库支持信号决定,而不是由固定分解模板或预构建的图决定。我们在三个多跳问答基准测试上评估 Hi-Q,主要在全语料库检索下进行,其中依赖证据必须在开放域干扰项中定位,而不是在小的标注池中。在这种情况下,Hi-Q 在三个基准测试上平均达到 52.3 EM 和 64.0 F1,比迭代检索基线 IRCoT 高出 15.1 EM / 18.2 F1,并且比基于图的 RAG 基线 PropRAG 在 MuSiQue-full 上高出 11.5 EM / 12.0 F1,而无需进行全语料库图构建。在先前工作中使用的受限支持/干扰项设置中,Hi-Q 同样达到了最佳准确性,平均 57.9 EM 和 69.3 F1,比 PropRAG 高出 5.6 EM / 3.9 F1,比 IRCoT 高出 13.7 EM / 15.8 F1。项目页面可在 https://hi-q-project.github.io/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/02 03:46

论文页面 - Hi-Q:面向多跳问答的层次化证据引导查询优化

来源:https://huggingface.co/papers/2608.30468

摘要

Hi-Q 是一个证据条件框架,它能根据语料库支持信号,将多跳查询动态优化为层次化树结构,从而提升检索与答案的准确性,且无需依赖固定图结构。

多跳问答(QA)的一个核心瓶颈在于:问题的表达粒度往往与语料库证据的可检索粒度存在差异。现有方法通过以下方式应对这种不匹配:在语料库上强加固定图结构、迭代地重构查询,或在语料库上执行生成的程序。然而,这些策略并未明确判断一个查询单元何时已得到证据支持,何时应当被优化。我们将此瓶颈形式化为可检索粒度发现问题(https://huggingface.co/papers?q=retrievable%20granularity%20discovery),并引入 Hi-Q,一个用于层次化查询优化(https://huggingface.co/papers?q=hierarchical%20query%20refinement)的证据条件框架。在每个查询节点,一个解析算子(https://huggingface.co/papers?q=resolution%20operator)会测试检索到的证据是否支持当前查询单元;已解析的节点终止处理,而未解析的节点则通过一个保持依赖关系的二元算子(https://huggingface.co/papers?q=dependency-preserving%20binary%20operator)进行扩展,并由一个语义覆盖验证器(https://huggingface.co/papers?q=semantic%20coverage%20verifier)进行检查。因此,Hi-Q 生长出一个查询树(https://huggingface.co/papers?q=query%20tree),其拓扑结构由语料库支持信号决定,而非固定分解模板或预构建图。我们在三个多跳问答(https://huggingface.co/papers?q=multi-hop%20QA)基准上评估了 Hi-Q,主要是在全语料库检索(https://huggingface.co/papers?q=full-corpus%20retrieval)设置下进行,此时相关证据必须在开放域干扰项中定位,而非在小规模标注池内。在此设置下,Hi-Q 在三个基准上的平均值达到 52.3 EM 和 64.0 F1,较迭代检索基线 IRCoT 在相同平均值上领先 15.1 EM / 18.2 F1,较基于图的 RAG 基线 PropRAG 在 MuSiQue-full 数据集上领先 11.5 EM / 12.0 F1,且无需构建全语料库图。在先前工作使用的受限支持/干扰项设置中,Hi-Q 同样达到了最佳准确率,平均为 57.9 EM 和 69.3 F1,较 PropRAG 领先 5.6 EM / 3.9 F1,较 IRCoT 领先 13.7 EM / 15.8 F1。项目主页可通过 https://hi-q-project.github.io/ 访问。

查看 arXiv 页面 (https://arxiv.org/abs/2608.30468) 查看 PDF (https://arxiv.org/pdf/2608.30468) 项目主页 (https://hi-q-project.github.io/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30468)

引用此论文的模型0

没有模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.30468 以从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.30468 以从此页面链接。

引用此论文的空间0

没有空间关联此论文

在空间的 README.md 中引用 arxiv.org/abs/2608.30468 以从此页面链接。

包含此论文的收藏夹0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

EviReform:证据引导的多跳图检索查询重写

arXiv cs.CL

EviReform 提出了一种证据引导的查询重写方法,用于多跳图检索,将检索请求的修订与证据聚合分离,并在 2WikiMultiHopQA、HotpotQA 和 MuSiQue 上超过了最强基线,分别提升了最多 5.59 Recall@5 和 4.50 F1。

DocTrace:通过分层证据图推理实现可追踪的长文档VQA

arXiv cs.AI

本文介绍了DocTrace,一个用于长文档视觉问答的分层框架,将该任务建模为显式证据图推理。它在三个基准上取得了最先进的结果,同时实现了可追踪的证据来源,比Qwen3-VL-8B-Instruct高出11-14个百分点。