LakeQuest:跨数据湖基于事实的问答三元域基准

arXiv cs.CL 论文

摘要

介绍LakeQuest,一个经过人工验证的基准测试,包含九个领域共9,846个问答对,用于评估在异构数据湖上的端到端检索与合成管道,揭示了现代问答系统中的关键故障模式。

arXiv:2607.12310v1 公告类型:新 摘要:尽管现代问答(QA)系统在干净、模式对齐的语料库上表现出色,但现实世界的知识很少如此整齐地打包。回答企业和科学数据湖上的问题要求系统能够导航异构、弱结构化的表、段落和链接元数据集合。当前基准测试抽象化了这一噪声发现过程,未能评估端到端的性能。为弥补这一差距,我们引入了LakeQuest,一个经过人工验证的基准测试,包含9,846个问答对,旨在评估在真实数据湖上的端到端检索与合成管道。LakeQuest涵盖三个不同领域(AI/ML元数据、零售银行和多模态生物医学药物信息),并为每个问题配以精确、模态感知的证据指针。通过将源发现与跨模态合成分离,LakeQuest揭示了现代QA系统中的关键故障模式。我们的基线评估(包括标准检索增强生成(RAG)和基于智能体的工具使用方法)表明,高质量检索并不能保证正确推理。系统在元数据图中的关系链、银行分类账中的策略依据以及生物医学上下文中的联合表格QA方面持续遇到困难,凸显了未来基于智能体的QA系统中需要鲁棒的发现机制和忠实的跨文件合成机制。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:22

# 面向数据湖的锚定问答三领域基准测试
来源:https://arxiv.org/html/2607.12310

###### 摘要

现代问答(QA)系统在处理干净、模式对齐的语料库时表现出色,但现实世界的知识很少以如此整齐的方式打包。回答企业和科学数据湖上的问题,要求系统能够驾驭异构、弱结构化的表格、段落和链接元数据集合。当前的基准测试抽象掉了这种有噪声的发现过程,未能评估端到端性能。为弥补这一差距,我们引入了LakeQuest,这是一个经过人工验证的基准测试,包含9,846个问答对,旨在评估在真实数据湖上的端到端检索与综合管道。LakeQuest涵盖三个不同的领域——AI/ML元数据、零售银行和多模态生物医学药物信息——并为每个问题配有精确的、模态感知的证据指针。通过将源发现与跨模态综合相分离,LakeQuest揭示了现代问答系统中的关键失败模式。我们的基线评估,包括标准检索增强生成(RAG)和智能体工具使用方法,表明高质量的检索并不能保证正确的推理。系统在元数据图谱中的关系链式推理、银行分类账中的策略锚定以及生物医学背景下的联合表格问答方面持续存在困难,这突显了未来智能体问答系统中需要鲁棒的发现机制和忠实的跨文件组合机制。

## 1 引言

问答(QA)系统在精心策划的同质语料库上取得了强劲性能,涵盖阅读理解(Rajpurkar et al., 2016 (https://arxiv.org/html/2607.12310#bib.bib13))、开放域文本检索(Kwiatkowski et al., 2019 (https://arxiv.org/html/2607.12310#bib.bib14))以及多跳推理(Yang et al., 2018 (https://arxiv.org/html/2607.12310#bib.bib1))。然而,现实世界的企业和科学知识很少以纯文本形式存储。相反,它们通常驻留在数据湖中:异构、弱结构化的表格、段落和链接元数据集合。在数据湖上回答自然语言问题需要驾驭孤立的源、组合跨模态证据,并保持明确出处。然而,现代检索与综合架构(Lewis et al., 2020 (https://arxiv.org/html/2607.12310#bib.bib2); Yao et al., 2023 (https://arxiv.org/html/2607.12310#bib.bib7))缺乏能够同时强调发现、跨源组合以及对异构语料库进行忠实归属的评估环境。现有基准测试绕过了真实数据湖的噪声、规模和弱元数据特征,要么评估纯数据发现而不涉及自然语言综合,要么评估已经在干净、模式对齐文本上的推理。

为弥补这一差距,我们引入了LakeQuest,这是一个旨在评估在真实数据湖上端到端问答管道的基准测试。LakeQuest提供了一个共享的构建和评估框架,实例化于三个不同领域:AI/ML元数据、现实零售银行和多模态生物医学药物信息。LakeQuest并未将这些领域扁平化为统一表示,而是保留了它们作为数据湖的原生结构异构性。每个基准实例将一个自然语言问题与参考答案以及精确的、模态感知的证据指针(例如,特定表格行或段落跨度)配对。此外,由于LakeQuest保留了数据湖的原生结构,它固有地捕获了事实冗余。一个系统可能通过发现有效的*替代出处*(例如,冗余表格或信息密集的段落)成功综合出一个锚定答案,即使错过了目标金标准工件。这种明确的归属使得能够将系统故障精确区分为发现错误(未能检索到证据)与推理错误(未能从检索到的证据中综合出答案)(Bryan et al., 2025 (https://arxiv.org/html/2607.12310#bib.bib28); Leung et al., 2026 (https://arxiv.org/html/2607.12310#bib.bib27))。

我们使用一个可复现的五阶段管道构建LakeQuest,涵盖领域实例化、语言模型驱动的问答合成、结构过滤、语义验证以及严格的人工审查。由此产生的基准测试包含9,846个人工验证的问答对,涉及单源查找、跨源组合和多跳推理。通过评估多种基线方法——从零样本推理(Kojima et al., 2022 (https://arxiv.org/html/2607.12310#bib.bib4))和标准检索增强生成(RAG)(Lewis et al., 2020 (https://arxiv.org/html/2607.12310#bib.bib2))到结构化管道和智能体工具使用方法(如XMode(Nooralahzadeh et al., 2025 (https://arxiv.org/html/2607.12310#bib.bib19))和ReSP(Jiang et al., 2025 (https://arxiv.org/html/2607.12310#bib.bib21)))——我们发现数据湖问答中的瓶颈仍未从根本上解决,并且强烈依赖于领域。具体来说,当需要跨模态组合时,准确的检索并不能保证忠实的推理,即使是智能体策略在弱结构元数据上进行多跳发现时也面临困难。

我们的主要贡献是:
(1) **LakeQuest基准测试**:一个超过9.8k个问题的人工验证数据集,用于评估跨越三个异构数据湖(AI/ML、零售银行和生物医学药物)的锚定推理。
(2) **可复现的构建框架**:一个五阶段协议,用于在弱结构语料库上合成、过滤和验证带有明确证据轨迹的问答对。
(3) **现代问答的实证分析**:广泛的基线评估显示,高检索质量并不总能转化为准确、忠实的答案——尤其是在需要多步或跨源组合时。

参考标题
图1:LakeQuest概述。该基准测试涵盖在共享构建和评估协议下构建的三个异构数据湖,用于锚定问答。

## 2 相关工作

表1 (https://arxiv.org/html/2607.12310#S2.T1) 提供了LakeQuest与现有问答和数据发现基准测试在模态、证据追踪和评估范围方面的结构比较。

表1:LakeQuest与现有问答和数据发现基准测试的比较。**模态**描述涉及的数据格式。**Ev** 表示是否存在将答案链接到来源的明确证据轨迹。**Md** 表示是否包含弱元数据和干扰文档以测试检索鲁棒性。**Val** 表示经过人工验证的数据集。**对象** 表示近似的源端证据容器(例如,段落、表格、段落或混合上下文)。

| 基准测试 | 模态 | Ev | Md | Val | # Qs | 对象 | 任务 | 领域 |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| HotpotQA | 文本 | ✓ | × | ✓ | 113k | 5M+段落 | 文本推理 | Wikipedia |
| HybridQA | 表格 文本 | × | × | ✓ | 69k+ | 13k表格 + 293k段落 | 混合推理 | Wikipedia |
| TAT-QA | 表格 文本 | × | × | ✓ | 16k+ | 2.5k+混合上下文 | 数值问答 | 金融 |
| LakeBench | 表格 元数据 | × | ✓ | ✓ | 10k+ | 16M+表格 | 表格发现 | 开放数据 |
| **LakeQuest** | 表格, 文本 元数据 | ✓ | ✓ | ✓ | 9.8k | 1M+模型/数据卡 + 10k+银行记录 + 500k+药物文本/表格 | 锚定问答 | AI/ML, 银行, 药物 |

**数据发现与集成**。数据管理文献广泛研究了如何发现、链接和集成数据集(Fernandez et al., 2018 (https://arxiv.org/html/2607.12310#bib.bib9); Fan et al., 2023 (https://arxiv.org/html/2607.12310#bib.bib10))。相应地,该领域的基准测试工作,如LakeBench(Deng et al., 2024 (https://arxiv.org/html/2607.12310#bib.bib11))和CMDL(Eltabakh et al., 2023 (https://arxiv.org/html/2607.12310#bib.bib12)),评估的是可连接表格或跨模态工件的检索。虽然这些对于数据发现至关重要,但它们仍然是纯检索导向的,不评估自然语言综合。

**文本中心和多跳问答**。在自然语言处理社区,问答基准测试已从单文档阅读理解(Rajpurkar et al., 2016 (https://arxiv.org/html/2607.12310#bib.bib13))发展到开放域检索(Kwiatkowski et al., 2019 (https://arxiv.org/html/2607.12310#bib.bib14))以及使用HotpotQA(Yang et al., 2018 (https://arxiv.org/html/2607.12310#bib.bib1))进行多跳推理。虽然具有开创性,但这些数据集很大程度上假设在精心策划、相对同质的语料库(如Wikipedia)中存在文本中心的证据。然而,真实数据湖的特点是弱元数据、碎片化的实体引用以及半结构化对象的混合,这使得推理路径比标准纯文本多跳设置中更为嘈杂。

**混合和多模态问答**。一条更接近的研究路线评估跨多种证据类型的问答。HybridQA(Chen et al., 2020 (https://arxiv.org/html/2607.12310#bib.bib15))和OTT-QA(Chen et al., 2021 (https://arxiv.org/html/2607.12310#bib.bib16))需要跨表格和文本进行推理,而TAT-QA(Zhu et al., 2021 (https://arxiv.org/html/2607.12310#bib.bib17))则强调对财务报告的数值推理。MultiModalQA(Talmore et al., 2021 (https://arxiv.org/html/2607.12310#bib.bib18))将范围扩展到文本、表格和图像的联合推理。虽然这些基准测试需要跨模态综合,但它们通常作用于高度策划、模式对齐或任务特定的语料库。它们并未建模企业数据湖的核心挑战:导航孤立的、弱链接的源,跨异构文件解析实体,以及为可审计性维护严格的、模态感知的出处。

**检索锚定和智能体系统**。在方法论上,LakeQuest为现代检索与综合管道提供了必要的测试平台。RAG(Lewis et al., 2020 (https://arxiv.org/html/2607.12310#bib.bib2))和融合解码器(FiD)(Izacard and Grave, 2021 (https://arxiv.org/html/2607.12310#bib.bib3))确立了在检索上下文中锚定生成的基本范式,而近期方法则提出结构化分解(Zhou et al., 2023 (https://arxiv.org/html/2607.12310#bib.bib5))、迭代工具使用(Yao et al., 2023 (https://arxiv.org/html/2607.12310#bib.bib7); Schick et al., 2023 (https://arxiv.org/html/2607.12310#bib.bib8))以及像Symphony(Tang et al., 2024 (https://arxiv.org/html/2607.12310#bib.bib22))这样的多智能体编排。通过提供具有明确证据要求和现实发现瓶颈的异构环境,LakeQuest使社区能够严格评估这些控制策略是否能处理真实数据湖的噪声和规模。

## 3 LakeQuest框架

为严格评估异构数据湖上的问答,我们需要一个能够将源发现与跨模态综合相分离、跨领域扩展并维护严格出处的框架。LakeQuest通过一个形式化的任务定义和可复现的构建管道来具体化这一需求。

### 3.1 问题形式化与任务分类

我们形式化锚定数据湖问答:给定一个数据湖D=\{d1,...,dn\}(其中di是表格、段落或元数据记录)和一个自然语言问题q,系统f必须返回一个文本答案a^和一个精确的支持证据集E^⊆D:f(q,D)→(a^,E^)。现代智能体将此操作分解为检索与综合工作流:E^=R(q,D) 和 a^=G(q,E^)。通过要求系统输出E^,LakeQuest允许我们独立评估检索机制R(发现)和生成器G(综合)。

为系统测试此管道,LakeQuest被组织为四个不同的推理族:**单源查找**,要求从孤立对象中抽取事实;**跨源组合**,需要跨多个异构对象组合事实(例如,将策略与交易连接);**多跳推理**,需要对中间实体或链接元数据进行链式推理;以及**锚点检索**,将问题条件映射到所选实体,迫使智能体在语义相近的干扰项中推理相关实体。与标准文本问答基准中证据仅是文档ID不同,LakeQuest强制执行模态感知的出处。每个基准实例由元组xi=(qi,ai*,Ei*,mi)定义,其中Ei*解析为具体的子文档单元(例如,特定表格行或确切段落跨度),mi跟踪问题族和领域元数据。

图2 (https://arxiv.org/html/2607.12310#S3.F2) 展示了零售银行数据湖中的一个具体跨源实例。

领域:零售银行
族:跨源组合(策略 + 表格 + 元数据)
问题(qi):根据标准路由策略,Acme Corp在10月14日发起的电汇是否需要人工经理批准?
金标准证据(Ei*):
• Policy_Manual_v3:跨度 [1124-1180](“……Tier 2企业账户所有超过15,000美元的国际外发电子转账需要人工经理批准……”)
• Transaction_Ledger_72 (Acme Corp):第84行,列 类型, 金额(“Int_Wire $18,500.00”)
• Client_Profile_7742:键 Account_Tier(“Tier 2”)
参考答案(ai*):是的,18,500美元的转账超过了Tier 2账户15,000美元的限制。

图2:LakeQuest实例的剖析——这需要识别和综合多个异构来源中的具体子文档证据单元,以得出正确答案。

### 3.2 共享五阶段管道

手动编写数万个复杂的跨模态问答对不可扩展,而纯合成数据集通常存在幻觉和琐碎推理路径的问题。为了平衡规模与严谨性,我们使用一个LLM参与的管道构建LakeQuest,该管道包含所有领域共享的五个阶段(零售银行数据湖问答合成过程的可视化示意图见附录G (https://arxiv.org/html/2607.12310#A7))。五个共享阶段包括:
(1) **湖实例化**,保留领域的原生模式而非同质化文档;
(2) **候选合成**,一个强大的语言模型(OpenAI GPT-5, 2026年2月1日)从采样的证据子图中合成候选问题q、答案a*和精确证据指针E*;
(3) **结构过滤**,通过程序化方式去除格式错误或指示性(deictic)问题;
(4) **语义过滤**,利用LLM作为评判者,拒绝那些仅通过参数化记忆即可回答的琐碎候选;
(5) **人工验证**,这是基准包含的最终关卡,评估可回答性和归属。确切的提示和评分标准详见附录B (https://arxiv.org/html/2607.12310#A2)。

### 3.3 人工验证与质量控制

为保证评估保真度,所有通过自动过滤的项目都经过严格的人工验证。标注者的任务是独立验证两个标准:**可回答性**(问题能否仅使用引用证据回答?)和**归属**(生成的答案是否完全忠于引用的文本/表格?)。使用人工标注者已获得作者所在机构伦理审查委员会的批准。Prolific标注者(时薪12美元)独立验证了每个候选项。

相似文章

SANA:大数据湖问答代理的关键因素是什么?

arXiv cs.CL

本文提出了SANA,一个用于数据湖上探索式问答(EQA)的诊断消融框架,它将端到端代理失败分解为搜索、规划、数据分析和策略组件。在LakeQA和KramaBench上的评估显示,数据分析是一个持续的瓶颈,而搜索在大型场景中是一个主要限制。

推出 SimpleQA

OpenAI Blog

OpenAI 推出 SimpleQA,一个新的事实性基准数据集,包含 4,326 个简短事实性问题,旨在评估前沿语言模型在提供准确答案而不产生幻觉的能力。该数据集通过双独立标注、严格标准实现高质量,估计错误率仅为 ~3%,GPT-4o 得分不到 40%。

ResearchQA:科学论文中基于引用的问答基准测试

arXiv cs.CL

ResearchQA是一个新基准,包含来自八个领域494篇开放获取论文的6,211个单论文问答对,旨在通过要求可验证引用并在证据不足时支持基于理由的拒绝,来评估基于引用的问答能力。