QO-Bench:诊断类型化事件元组上的查询算子保留检索

arXiv cs.CL 论文

摘要

QO-Bench 是一个针对类型化事件元组上查询算子问答的诊断性基准测试,涵盖 22,984 篇新闻文章和 614 个企业事件,涉及 18 种查询模板。该基准对 RAG、ReAct RAG、GraphRAG 以及抽取转 SQL 系统进行评估,发现算子执行——而非仅仅是检索——才是核心瓶颈,单纯使用更强的模型并不能解决这一问题。

arXiv:2606.04646v1 公告类型:新提交 摘要:在商业、法律和科学语料库中,现实世界中的许多问题本质上是对文本中潜在记录进行数据库风格查询的自然语言表达。现有的检索增强生成(RAG)系统主要针对语义相关性进行优化,但检索到看似相关的段落并不能保证查询执行的正确性。我们提出 QO-Bench,这是一个针对类型化事件元组上查询算子问答的诊断性基准测试。该基准涵盖 22,984 篇新闻文章和 614 个企业事件,涉及 18 种查询模板,在 785 个问题上进行评估。每个标准答案均从类型化事件元组中确定性地计算得出,并以召回率进行评分,答案与标准元组之间通过精确匹配而非 LLM 裁判进行比对。这一设计支持算子级别的诊断,例如连接和交集操作。我们在统一条件下对 RAG、ReAct RAG、GraphRAG 以及信息抽取转 SQL 进行评估,并设置长上下文 oracle 上限以孤立检索失败的影响。我们提出一个双轴分析框架——索引时保留与查询时执行——用于预测每种范式的失败位置,实验结果也印证了这一判断:系统能够检索到相关文本,但会丢弃算子所需的类型化值;各范式的可部署排名因算子不同而呈现反转,相似度检索在过滤/投影操作上表现领先,而抽取转 SQL 在交集和计数操作上更具优势。即便提供了标准证据,长上下文 oracle 距离饱和仍相差甚远,因此算子执行——而非单纯的检索——才是核心瓶颈,更强的答案模型并不能消除这一问题。QO-Bench 将目标从段落相关性重新定义为查询算子保留检索。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:16

# QO-Bench:诊断基于类型化事件元组的查询算子保留检索

来源:https://arxiv.org/html/2606.04646

Mengao Zhang、Xiang Yang、Chang Liu、Tianhui Tan、Ke-Wei Huang 新加坡国立大学亚洲数字金融研究院 \{mengaoz, chang\_liu, tant, dishkw\}@nus\.edu\.sg e0556732@u\.nus\.edu 通讯作者。本工作在新加坡国立大学亚洲数字金融研究院实习期间完成。

###### 摘要

商业、法律和科学语料库中的许多现实世界问题,本质上是针对文本中潜在记录的自然语言版数据库查询。现有的检索增强生成(RAG)系统主要针对语义相关性进行优化,但检索到合理的段落并不能保证查询执行的正确性。我们提出 QO-Bench,一个针对类型化事件元组上*查询算子问答*的诊断性基准。该基准涵盖 22,984 篇新闻文章和 614 个企业事件,跨越 18 个查询模板,在 785 个问题上进行评估。每个黄金答案均从类型化事件元组中确定性地计算得出,并以召回率评分,答案通过精确匹配而非 LLM 评判与黄金元组进行比对。这一设计支持算子级诊断,例如连接和交集操作。我们在匹配条件下评估了 RAG、ReAct RAG、GraphRAG 以及信息抽取转 SQL,并以长上下文 Oracle 作为天花板来隔离检索失败。以索引时保留与查询时执行为两轴的框架预测了每种范式的失败点,实验结果也印证了这一点:系统能检索到相关文本,但丢弃了算子所需的类型化值;不同算子下可部署范式的排名发生反转,语义相似度检索在过滤/投影上领先,而抽取转 SQL 在交集和计数上领先。即便给定黄金证据,长上下文 Oracle 距离饱和仍相距甚远,因此算子执行而非单纯检索才是核心瓶颈,更强的答案模型也无法消除这一瓶颈。QO-Bench 将目标从段落相关性重新定义为查询算子保留检索。

QO-Bench:诊断基于类型化事件元组的查询算子保留检索

Mengao Zhang††感谢:通讯作者。 Xiang Yang††感谢:本工作在新加坡国立大学亚洲数字金融研究院实习期间完成。 Chang Liu、Tianhui Tan、Ke-Wei Huang 新加坡国立大学亚洲数字金融研究院 \{mengaoz, chang\_liu, tant, dishkw\}@nus\.edu\.sg e0556732@u\.nus\.edu

## 1 引言

商业、法律和政策领域的许多高价值信息需求以自然语言表达,但其行为与数据库查询类似。用户可能会问:*哪些公司在 2018 年和 2022 年的并购公告中均担任买方?* 或 *哪些公司在并购公告发布 30 天内发生了 CEO 变更?* 这些问题所涉及的记录并非以表格形式给出,而是*潜伏在文本语料库中*,分散报道于众多文章之间。由于没有任何单篇文章会针对任意查询对其进行预聚合,此类问题无法依赖一篇汇总性段落作答,而需要选取满足约束条件的事件、分配角色、锚定日期、跨条件连接证据并进行其他聚合操作。我们将这一场景称为*查询算子问答*(QO-QA):自然语言问题指定了针对记录的数据库风格算子。关系数据库通过类型化属性、查询计划和集合语义支持此类问题 Codd([1970](https://arxiv.org/html/2606.04646#bib.bib31),[1972](https://arxiv.org/html/2606.04646#bib.bib32));Gray 等([1997](https://arxiv.org/html/2606.04646#bib.bib33))。然而,许多真实语料库并非规整的数据库,而是新闻文章、文件、合同、报告、电子邮件或分析师报告,其中相关记录必须首先从文本中恢复。因此,QO-QA 处于语义解析与检索增强生成的交界处:问题要求数据库风格的执行,而证据却存在于非结构化文档中。

检索增强生成(RAG)Lewis 等([2020](https://arxiv.org/html/2606.04646#bib.bib1));Karpukhin 等([2020](https://arxiv.org/html/2606.04646#bib.bib2))通常基于不同的契约构建:检索与问题语义相关的段落,然后让语言模型综合生成答案。这一契约在段落查找上很有效,但 QO-QA 暴露了结构性不匹配。对于*哪些公司在 2018 年和 2022 年的并购公告中均担任买方?*,系统必须识别并购事件、规范化公司名称、区分买方与目标方、附加公告日期、构建每年的买方集合并取交集。Top-k 检索可能返回合理的段落,但单纯的语义相关性无法保证角色正确性、时序正确性、集合完整性或计数正确性。

这里所需的能力是*算子保留检索*:检索能够保留执行问题中所表达算子所需的类型化值。这一框架分离了两类失败来源。在语料库侧,索引可能无法保留算子相关的属性;在查询侧,系统可能无法将自然语言问题转化为涉及其所引发算子的可执行计划。标准 RAG 和 ReAct 风格 RAG Yao 等([2023](https://arxiv.org/html/2606.04646#bib.bib8))将大部分算子执行留给生成器。GraphRAG Edge 等([2024](https://arxiv.org/html/2606.04646#bib.bib11))引入了实体-关系结构和摘要,但摘要可能压缩掉必要的属性。信息抽取转 SQL 系统 Li 等([2021](https://arxiv.org/html/2606.04646#bib.bib13));Yu 等([2018](https://arxiv.org/html/2606.04646#bib.bib14));Scholak 等([2021](https://arxiv.org/html/2606.04646#bib.bib15))能显式执行算子,但前提是需要先确定一个模式和抽取流水线,其覆盖范围和规范化程度可能不完整。因此,QO-QA 不仅仅是"针对新闻的文本转 SQL"或"包含更多文档的 RAG":它追问的是检索架构能否在自然语言算子意图与文本中潜在的事件结构之间架起桥梁。

我们提出 QO-Bench,一个针对类型化事件元组上 QO-QA 的诊断性基准。[^1] 该基准跨越 18 个查询模板,在 785 个分层采样问题上进行评估,问题实例化自涵盖 614 个企业事件的 22,984 篇新闻文章。[^2] 每个黄金答案均从具有事件类型、实体、角色、锚定日期、交易对手和来源字段的事件元组中确定性地计算得出。这赋予了 QO-Bench 明确的外延黄金标准。系统返回结构化的最终答案——实体列表、事件列表、有序列表、计数、分组结果——经规范化后与黄金外延通过精确匹配进行比较(而非 LLM 评判),并以模板特定的召回率评分。这一设计使我们能够将每次失败归因于特定算子,而非答案措辞。我们的实验比较了 RAG、ReAct RAG、GraphRAG 本地和全局搜索,以及信息抽取转 SQL。我们的目标并非评出胜者,而是生成失败画像:每种范式支持哪些算子,哪些算子近似效果差,哪些算子无法可靠执行。

我们的实验得出了一致的诊断结论。没有任何范式占据主导:可部署范式的排名在不同算子上*发生反转*,语义相似度检索(RAG、ReAct RAG)在过滤/投影上最强,IE→SQL 在交集和计数上最强。失败也沿框架的两个轴分布——语义相似度检索损失*覆盖率*,GraphRAG 保留结构但不保留精确*值*,IE→SQL 覆盖事件但无法*执行*超出其模式范围的跨事件连接。天花板本身也受算子约束:即便给定黄金证据,长上下文 Oracle 距离饱和仍相距甚远(集合交集上约 ∼4%),更强或推理能力更强的答案模型也无法提升——算子执行而非单纯检索才是核心瓶颈。

#### 贡献

第一,我们形式化了 QO-QA,其中问题指定了针对文本中潜在记录的数据库风格算子,并将算子保留识别为检索的核心属性。第二,我们提出 QO-Bench,一个具有确定性类型化事件元组黄金答案的基准,其外延基于有来源证明的事件,具备角色、日期和交易对手感知能力。第三,我们利用 QO-QA 框架沿两个轴——索引时保留与查询时执行——对代表性范式进行分解,并借助将检索失败与答案综合失败分离的长上下文 Oracle 天花板,定位每种范式的失败所在。

## 2 相关工作

QO-Bench 建立在检索增强、多文档、时序、列表和聚合问答等工作基础之上,但针对不同的诊断单元。密集检索、后期交互和检索增强模型将大规模语料库检索置于 QA 的核心 Karpukhin 等([2020](https://arxiv.org/html/2606.04646#bib.bib2));Khattab 和 Zaharia([2020](https://arxiv.org/html/2606.04646#bib.bib3));Lewis 等([2020](https://arxiv.org/html/2606.04646#bib.bib1));Izacard 和 Grave([2021](https://arxiv.org/html/2606.04646#bib.bib4)),而多文档和长上下文基准测试模型是否能跨段落整合证据 Shaham 等([2023](https://arxiv.org/html/2606.04646#bib.bib16));Bai 等([2024](https://arxiv.org/html/2606.04646#bib.bib17))。多跳和智能体检索方法进一步将问题分解为迭代检索步骤 Yang 等([2018](https://arxiv.org/html/2606.04646#bib.bib5));Trivedi 等([2022](https://arxiv.org/html/2606.04646#bib.bib6));Ho 等([2020](https://arxiv.org/html/2606.04646#bib.bib7));Yao 等([2023](https://arxiv.org/html/2606.04646#bib.bib8));Press 等([2023](https://arxiv.org/html/2606.04646#bib.bib9));Trivedi 等([2023](https://arxiv.org/html/2606.04646#bib.bib10))。这些场景相互关联,但通常评估系统能否找到并综合相关证据,而非检索是否保留了执行数据库风格算子所需的类型化值。

表 1:与相关基准的比较。据我们所知,QO-Bench 是首个将确定性类型化事件元组黄金答案(无需 LLM 评判)、按算子级别的失败归因,以及与 Oracle 天花板对比的多架构匹配比较三者结合的基准。若干基准涵盖了这一问题的部分内容:FanOutQA 评估扇出式多文档问题 Zhu 等([2024](https://arxiv.org/html/2606.04646#bib.bib24));MEBench 研究跨文档推理 Lin 等([2025](https://arxiv.org/html/2606.04646#bib.bib28));TLQA 评估时间参照列表构建 Dumitru 等([2025](https://arxiv.org/html/2606.04646#bib.bib25));ChronoQA 研究具有绝对、聚合和相对时序问题的时序敏感 RAG Chen 等([2025](https://arxiv.org/html/2606.04646#bib.bib26));RAGBench 评估通用 RAG 行为和归因 Friel 等([2024](https://arxiv.org/html/2606.04646#bib.bib29))。列表型 QA 数据集如 LIQUID 评估具有多个非连续答案的问题 Lee 等([2023](https://arxiv.org/html/2606.04646#bib.bib30));而金融 QA 基准如 FinQA、TAT-QA、FinanceBench 和 FAITH 则侧重于金融文档上的数值推理、表格推理、有证据支撑的答案或表格忠实性 Chen 等([2021](https://arxiv.org/html/2606.04646#bib.bib19));Zhu 和 others([2021](https://arxiv.org/html/2606.04646#bib.bib18));Islam 等([2023](https://arxiv.org/html/2606.04646#bib.bib20));Zhang 等([2025](https://arxiv.org/html/2606.04646#bib.bib35))。AGGBench 与本工作最为接近,因为它将非结构化文本上的聚合作为以完整性为导向的"全部查找"任务进行研究 Zhu 等([2026](https://arxiv.org/html/2606.04646#bib.bib27))。与 AGGBench 的实体级聚合设定不同,QO-Bench 评估基于类型化事件元组的确定性查询执行。

QO-Bench 还与基于结构的检索和信息抽取相关。GraphRAG 将抽取的实体和关系组织成图 Edge 等([2024](https://arxiv.org/html/2606.04646#bib.bib11)),这可以改善枚举和全局理解,但可能丢失精确的算子相关值,如日期、角色和计数。事件抽取、语义解析和文本转 SQL 通过将文本转化为结构化记录、将问题转化为程序来使算子可执行 Wang 等([2020](https://arxiv.org/html/2606.04646#bib.bib12));Li 等([2021](https://arxiv.org/html/2606.04646#bib.bib13));Yu 等([2018](https://arxiv.org/html/2606.04646#bib.bib14));Scholak 等([2021](https://arxiv.org/html/2606.04646#bib.bib15)),但依赖于预定义模式和完整的规范化元组。因此,我们在匹配条件下比较这些范式(§[5](https://arxiv.org/html/2606.04646#S5))。目标并非声称聚合、时序推理、列表答案或金融 QA 是新问题,而是测试检索架构能否保留和执行自然语言查询算子所需的类型化事件值。表 [1](https://arxiv.org/html/2606.04646#S2.T1) 总结了这一区别。

## 3 查询算子问答框架

### 3.1 QO-QA 作为外延检索

我们将 QO-QA 形式化为从语料库到答案的推导过程。语料库蕴含具有属性的事件;问题选取事件、投影字段并应用算子;系统根据是否恢复问题所需的外延来评判。

设 $C=\{d_1,\ldots,d_n\}$ 为文档语料库,$E=\{e_1,\ldots,e_m\}$ 为 $C$ 所蕴含的潜在事件集。每个事件 $e\in E$ 具有属性集 $A(e)$,其元素 $a=(n,v)$ 将属性名与可从语料库中导出的值配对。属性名是开放式的:例如,对于并购事件,相关属性名可能包括收购方、目标方、卖方、公告日期、完成日期、交易价值、司法管辖区和监管状态。

问题 $q$ 是一个类型化查询规范

$$q=(k,\mathcal{D}_q,\phi,\pi,\alpha),$$

其中 $k\geq 1$ 为元数,$\mathcal{D}_q\subseteq E_{\tau_1}\times\cdots\times E_{\tau_k}$ 是由问题中事件类型所引发的类型化元组域。当 $k=1$ 时,在不引起歧义的情况下,我们将元组 $(e)$ 与事件 $e$ 等同。谓词 $\phi$ 使用属性约束从 $\mathcal{D}_q$ 中选取元组,当 $k\geq 2$ 时,还使用元组级条件,如共享实体、时间窗口或公告-完成交易同一性。投影 $\pi$ 返回带有分量标签的结构化记录,$\alpha$ 是诸如 list、count、group 等算子。

选定的元组关系和投影关系为:

$$R_q = \{\vec{e}\in\mathcal{D}_q:\phi(A(\vec{e}))=1\}, \tag{1}$$

$$P_q = \langle\pi(A(\vec{e})):\vec{e}\in R_q\rangle, \tag{2}$$

[^1]: 代码、基准、基线和评估脚本:https://github.com/ZHANG-MENGAO/qo-bench
[^2]: 企业事件提供了一个有用的基底,因为它们天然呈现出我们希望测试的算子表面。相同的 QO-QA 结构也出现在商业新闻之外,包括法律案例聚合、生物医学证据综合和政策监测。

相似文章

AISE-Bench:面向学术知识图谱信息检索的全流程精选基准

arXiv cs.AI

本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。