超越表格:Doc2DB-Bench —— 用于关系保真的文档到数据库构建

arXiv cs.CL 论文

摘要

介绍了 Doc2DB-Bench,这是一个基准测试,用于评估基于 LLM 从长文档中提取关系数据库的能力,包含 42 个模式和七个领域的 203 个实例。

arXiv:2608.08459v1 公告类型:新 摘要:实际的 AI 系统越来越需要将冗长、异构的文档转换为可查询的关系数据库,而不是孤立的电子表格。在金融、医疗、教育、交通和企业运营等领域,下游工作流依赖于规范化模式、实体标识、键、跨表关系和完整性约束,以支持分析、合规、审计和基于 SQL 的决策。现有的文档到表格(Document-to-Table)基准测试不足以应对这种场景:将证据展平到单个表格中会导致实体重复、掩盖多对多关系、产生稀疏记录,并且无法检验提取的事实是否构成有效的数据库实例。因此,迫切需要将文档理解评估为数据库构建,而非字段提取。我们提出了 Doc2DB-Bench,一个用于文档到数据库构建的基准测试,包含 42 个模式和七个领域组中的 203 个长文档实例,以及 117 个实体表、132 个关系表、7,341 行和 41,935 个单元格。该基准通过可控的数据库到文档(DB-to-Doc)合成流程构建,并按表内提取和表间推理的分类法进行组织,生成的文档经过真实性验证,证明与现实世界参考资料难以区分。Doc2DB-Bench 因此为可靠、可审计且关系保真的基于 LLM 的数据系统提供了测试平台。该基准公开于 https://github.com/SetonLiang/Doc2DB-Bench。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:08

# Beyond Tables: Doc2DB-Bench:用于关系忠实的文档到数据库构建的基准  
来源:https://arxiv.org/html/2608.08459  

Zhuowen Liang1, Zhengxuan Zhang1, Jiayang Wang1, Jiazhuo Chen1, Nan Tang1  
1The Hong Kong University of Science and Technology \(Guangzhou\)  

###### 摘要  
实际的AI系统越来越需要将长篇、异构的文档转换为可查询的关系数据库,而不仅仅是孤立的电子表格。在金融、医疗、教育、交通和企业运营等领域,下游工作流依赖规范化模式、实体标识、键、跨表关系和完整性约束,以支持分析、合规、审计以及基于SQL的决策。现有的文档到表格(Document-to-Table)基准在此场景下并不充分:将证据展平为单一表格会导致实体重复、掩盖多对多关系、产生含有大量NULL值的稀疏记录,并绕过了对抽取事实是否构成有效数据库实例的检验。因此,迫切需要将文档理解评估从字段抽取转向数据库构建。我们提出Doc2DB-Bench,一个面向文档到数据库(Document-to-Database)构建的基准,包含203个长文档实例,覆盖42个模式和7个领域组,共有117张实体表、132张关系表、7,341行和41,935个单元格。该基准通过可控的DB-to-Doc合成流水线构建,并按照表内抽取与表间推理的分类法组织;生成的文档经过真实性验证,证明与现实世界参考资料难以区分。Doc2DB-Bench由此为可靠、可审计且关系忠实的基于LLM的数据系统提供了测试平台。该基准公开于https://github.com/SetonLiang/Doc2DB-Bench  

## 1 引言  
现代组织依赖文档作为运营知识的主要载体,从临床记录、商业合同到财务报告和企业记录idc2023unstructured;chen2023symphony;li2026dataspace。然而,下游应用很少直接使用自由格式文本:分析流水线、商业智能仪表盘、合规工作流和基于SQL的系统都需要结构化、可查询且可审计的数据llamaindex2024extraction;zhang2025datamosaic;zeng2026qwenpaw。随着大型语言模型处理长文档和异构文档的能力日益增强,将文档证据转换为可靠的结构化数据已成为信息抽取的核心目标xu2024llmie;liang2026long;li2025structrag。  

**文档到表格及其局限。**大多数现有基准在文档到表格(Document-to-Table,简称Doc2Table)设定下研究该问题,即系统抽取字段或填充单个扁平化表格dtbench2026;DBLP:conf/emnlp/DengC00FZYS24;DBLP:journals/corr/abs-2507-21340;datamosaic。这一设定对孤立记录抽取是有用的,但当下游工作流需要关系数据库时则不够充分。将多实体证据展平会导致实体重复、掩盖多对多关系、产生大量NULL值的稀疏记录,并且无法检验抽取事实是否满足模式级约束。  

图1:文档到数据库抽取:(a) 文档;(b) 目标数据库模式;(c) 抽取的实体表;(d) 抽取的关系表。  

###### 示例1  
考虑图1 (https://arxiv.org/html/2608.08459#S1.F1)(a)中的一份财务报告,它描述了多家公司、它们在多个财年的现金状况以及它们之间的投资关系。图1 (https://arxiv.org/html/2608.08459#S1.F1)(b)中的目标模式包含一个实体表Company和一个自引用关系表Hold,其中公司标识符是系统生成的键,不直接出现在文本中。构建数据库不仅仅需要抽取局部值。一个LLM抽取器可能正确识别大量公司提及和数字,但仍产生语义上无效的元组。对于实体抽取(图1 (https://arxiv.org/html/2608.08459#S1.F1)(c)),它可能误解单位,例如将“18,524(单位:千)”视为原始值,或将*Coyni Inc*等弱提及物化成不完整的重复实体。对于关系抽取(图1 (https://arxiv.org/html/2608.08459#S1.F1)(d)),表面线索可能导致虚假的互相投资,而隐式多跳链接则可能被遗漏。这些错误表明,局部抽取决策必须与模式级语义和完整性约束相协调。□  

**从抽取到数据库构建。**这促使我们提出文档到数据库(Document-to-Database,简称Doc2DB):给定文档集合FF、目标模式EE以及完整性或业务约束Σ\\Sigma,目标是构建一个关系数据库实例DD,既忠实于文档又在模式下有效:  

\[
(F,\;E,\;\Sigma)\;\xrightarrow{\;\textsc{Doc2DB}\;}D.
\]  

与Doc2Table不同,Doc2DB是一个数据库构建问题。实体标识符通常是隐式的,关系可能分布在文档的多个片段中,有效的输出必须满足全局约束,而不是依赖独立的字段级决策dong2014knowledge;sa2016deepdive;peng2017cross;shin2015incremental。因此,在数据库层面评估文档理解,不仅需要测试值抽取,还需要测试实体对齐、关系构建和关系有效性。尽管Doc2DB具有重要的实际意义,但作为一个基准任务仍鲜有探索。现有的信息抽取基准,包括Rotowirewiseman2017challenges、E2EDBLP:conf/sigdial/NovikovaDR17、LiveSumDBLP:conf/emnlp/DengC00FZYS24、InstructIEDBLP:conf/emnlp/Jiao0LZOJ023、StructTextDBLP:journals/corr/abs-2507-21340和DTBenchdtbench2026,主要关注扁平表格、单表抽取或简化生成任务。SQUiDDBLP:conf/emnlp/SadiaYXCC25探索了文本到关系数据库的生成,但主要针对逻辑关系视图恢复,而非现实的Doc2DB构建。如表1 (https://arxiv.org/html/2608.08459#S1.T1)所总结,这些工作并未全面评估跨表模式构建(即具有表间依赖的规范化多表结构)、长上下文证据聚合以及数据库级正确性。  

**挑战。**构建一个全面的Doc2DB基准面临两方面的挑战。首先,直接进行人工标注很难规模化:标注者必须收集文档、定义模式,并手动构建真实的实体表和关系表。其次,现实的Doc2DB实例必须涵盖多样化的推理需求,包括单位归一化、歧义消解、多跳关系构建、时间变化和约束满足,同时还要覆盖叙事风格和模式结构各异的领域。  

**我们的方案。**我们提出Doc2DB-Bench,一个超越扁平表格抽取的Doc2DB能力评估基准。为避免人工标注的可扩展性瓶颈,我们设计了一条基于现有关系数据库(如BIRDli2023can和Spideryu2018spider)的可控DB2Doc反向合成流水线。该流水线从模式和数据库实例出发,将元组分解为原子证据,分配能力标签,将证据序列化为文档规划,生成风格条件下的文档,并通过覆盖率和抽取一致性检查对生成文档进行验证。为建模现实文档的复杂性,Doc2DB-Bench引入了一个双支柱的Doc2DB分类法:**表内能力**覆盖单元格级抽取、归一化、推理、歧义消解和忠实性;**表间能力**则捕捉数据库特有的推理,包括身份消解、关系链接、多跳组合、动态变化和完整性约束。该分类法支持可控的基准构建和模型失败的细粒度诊断。最后,Doc2DB-Bench在数据库层面评估输出,同时度量实体完整性和关系保真度,从而检验抽取事实是否构成符合模式、可查询且关系忠实的数据库实例。  

表1:现有基准与我们的Doc2DB-Bench的对比。  

| 基准 | 单表抽取 (ST) | 多领域 (MD) | 跨表推理 (CR) | 长上下文 (LC) | 数据库级评估 (DC) |
|---|---|---|---|---|---|
| Rotowirewiseman2017challenges | ✓ | ✗ | ✗ | ✗ | ✗ |
| E2EDBLP:conf/sigdial/NovikovaDR17 | ✓ | ✗ | ✗ | ✗ | ✗ |
| LiveSumDBLP:conf/emnlp/DengC00FZYS24 | ✓ | ✗ | ✗ | ✗ | ✗ |
| InstructIEDBLP:conf/emnlp/Jiao0LZOJ023 | ✓ | ✓ | ✗ | ✗ | ✗ |
| StructTextDBLP:journals/corr/abs-2507-21340 | ✓ | ✓ | ✗ | ✗ | ✗ |
| DTBenchdtbench2026 | ✓ | ✓ | ✗ | ✓ | ✗ |
| SQUiDDBLP:conf/emnlp/SadiaYXCC25 | ✓ | ✓ | ✗ | ✗ | ✓ |
| Doc2DB-Bench(本文) | ✓ | ✓ | ✓ | ✓ | ✓ |

**贡献。**我们总结贡献如下:  
1. **Doc2DB能力分类法。**我们提出了一个双支柱分类法,涵盖Doc2DB构建所需的关键能力,包括**表内**值抽取和**表间**关系推理,以指导基准设计并支持细粒度评估。  
2. **可控的DB2Doc合成流水线。**我们提出了一条反向合成流水线,从真实关系模式和数据库实例生成长期文档Doc2DB实例,在降低人工标注成本的同时控制文档复杂性。  
3. **Doc2DB-Bench基准。**我们构建了一个多领域基准,用于在关系忠实的Doc2DB任务上评估LLM,超越了扁平、单表抽取基准。  
4. **大量实验。**我们在Doc2DB-Bench上评估了多种主流LLM,并在实体级和关系级能力上进行了深入分析,揭示了它们的优势、局限以及Doc2DB抽取的开放研究机会。  

## 2 文档到数据库:问题定义  

### 2.1 问题陈述  
**数据库规范。**我们将目标数据库规范形式化为S=\(E,Σ\)\\mathcal\{S\}=\(E,\Sigma\),其中E=\(E,R\)E=\(\mathcal\{E\},\mathcal\{R\}\)表示实体-关系模式。E\\mathcal\{E\}和R\\mathcal\{R\}分别是实体表和关系表的集合,T=E∪R\\mathcal\{T\}=\mathcal\{E\}\cup\mathcal\{R\}表示所有表的集合。每张表T∈TT\\in\\mathcal\{T\}由一个属性集ATA\_\{T\}和一个主键KT⊆ATK\_\{T\}\\subseteq A\_\{T\}定义。约束集Σ=Σrel∪Σapp\\Sigma=\Sigma\_\{\\mathrm\{rel\}\}\\cup\\Sigma\_\{\\mathrm\{app\}\}由标准关系约束(如类型、域和包含约束)以及应用特定规则(如时间条件)组成。合起来,S\\mathcal\{S\}规定了目标数据库结构及其有效性条件。  

**文档语料。**我们考虑一组异构文档F=\{f1,f2,...,fm\}F=\\\{f\_\{1\},f\_\{2\},\\ldots,f\_\{m\}\\\},它们为实例化目标模式提供证据。我们假设低层处理(如文本提取和布局分析)已完成。由于现实文档可能包含不完整的信息,未观测到的属性自然保持为NULL。因此,每个抽取出的值都应可溯源至源文档,且不能虚构不支持的证据。  

**定义1(Doc2DB问题)。**给定数据库规范\(E,Σ\)\(E,\Sigma\)和文档语料F=\{f1,...,fm\}F=\\\{f\_\{1\},\\ldots,f\_\{m\}\\\},Doc2DB任务是构建一个关系数据库实例:  

\[
(F,E,\Sigma)\xrightarrow{\;Doc2DB\;}D,
\]  

其中D=\{Ix∣x∈E\}D=\\\{I\_\{x\}\\mid x\\in E\\\}是实例化的实体表和关系表的集合。目标实例DD应满足:(1) **约束满足**:D⊧ΣD\\models\\Sigma;(2) **接近真实**:DD尽可能接近真实数据库D∗D^\{\*\}。  

### 2.2 DB2Doc合成范式  
为了构建一个评估Doc2DB抽取的基准,我们采用反向合成视角:给定一个真实的数据库实例D=Ix∣x∈ED=\{I\_\{x\}\\mid x\\in E\}及其规范S=\(E,Σ\)\\mathcal\{S\}=\(E,\Sigma\),我们合成一个源文档语料FF,使得D∗D^\{\*\}能够被忠实地恢复。  

**定义2(DB2Doc合成)。**给定真实数据库D∗D^\{\*\}、其规范S\\mathcal\{S\}以及能力分类法H\\mathcal\{H\},DB2Doc合成一个文档语料FF,满足三个性质:(1) **完备性**:D∗D^\{\*\}中的每个真实值和关系元组都有FF中的证据支持;(2) **排他性**:在S\\mathcal\{S\}下,FF中不包含支持超出D∗D^\{\*\}范围的数据库事实的证据;(3) **能力感知**:每个目标值/关系元组的证据都被构造为需要H\\mathcal\{H\}中特定推理能力才能恢复,其中H\\mathcal\{H\}在第3节 (https://arxiv.org/html/2608.08459#S3)中被形式化为双支柱分类法。完备性和排他性共同确保D∗D^\{\*\}是在S\\mathcal\{S\}下可仅从FF恢复的唯一真实数据库,而能力感知则支持跨分类法层级的细粒度评估。每个实例可以使用H\\mathcal\{H\}中的任意能力子集,这反映了现实世界文档中需求自然不均匀分布的特性。  

## 3 Doc2DB分类法  

图2:Doc2DB抽取能力分类法。  

Doc2DB要求模型既构建值又构建关系。因此,我们将所需能力组织为两个互补的支柱。**表内能力(支柱1)**回答的是“哪些值应填充实体记录”,而**表间能力(支柱2)**回答的是“实体记录应如何连接”。图2 (https://arxiv.org/html/2608.08459#S3.F2)总结了由此产生的分类法及其细粒度子能力。  

### 3.1 支柱1:表内能力  
支柱1关注哪些值应填充实体记录,涵盖四个互补的挑战。  

**变换对齐(TA)。**将观察到的值归一化为符合模式的表示(例如,“18,524 in thousands”→18,524,000\\rightarrow 18\{,\}524

相似文章

ExtractBench:面向模式引导的企业文档抽取基准

Hugging Face Daily Papers

ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。

XL-DocBench:证据支撑的超长文档理解基准测试

arXiv cs.CL

介绍了XL-DocBench,这是一个经过人工验证的超长文档理解基准,涵盖六个专业领域的1,519个问题,要求多页证据和结构化推理,表明当前大语言模型在处理长上下文专业文档时仍存在困难。

SynthDocBench:长上下文视觉文档理解的控制基准

Hugging Face Daily Papers

SynthDocBench 是一个完全合成的长上下文视觉文档理解基准,它系统地控制文档长度、布局、模态和问题类型,揭示了当前VLM中的失败模式,如长度退化和位置敏感性。