LLM能规范化数据库吗?一个用于模式规范化的基准测试与多智能体框架

arXiv cs.CL 论文

摘要

本文提出了一个基准测试(DNBench),用于评估LLM在数据库规范化任务中的表现,并引入了一个多智能体推理框架(MARS),该框架相比单提示方法将准确率提高了82%。

arXiv:2609.11141v1 Announce Type: new 摘要:大型语言模型(LLM)越来越多地被用于生成结构化输出,但当这些输出必须满足数据库级别的约束时,其可靠性仍然不明确。我们通过数据库规范化来研究这个问题,涉及对函数依赖、无损连接分解和表间约束的推理。我们提出了一个数据库规范化基准测试(DNBENCH),包含3,275个样本,用于评估从1NF到BCNF的LLM驱动数据库规范化。DNBENCH使用三轴协议来衡量语义等价性、结构准确性和逻辑有效性。在单一、复杂和现实世界三个层级上,DNBENCH揭示了依赖推断、模式分解和表间约束重建中的常见失败。我们进一步提出了模式多智能体推理(MARS),它将证据提取、违规诊断和分解规划与模式生成和验证分离开来。MARS相比单提示基线将DNB分数提高了82.0%。所有工件将在接受后发布。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:24

# LLM能否实现数据库规范化?一个面向模式规范化的基准测试与多智能体框架

**来源**:https://arxiv.org/html/2609.11141

Dong-Jae Koh*, Huisu Kim*, SeongHwan Yoon*
*同等贡献

Lasse M. Jantsch, Chun-Hee Lee, Seonghyeon Lee, Young-Kyoon Suh†

**单位**:韩国庆北国立大学 计算机科学与工程学院
**联系邮箱**:{djkoh, kimisu0712, shyoon0214, lassejantsch, chunhee, sh0416, yksuh}@knu.ac.kr

###### 摘要

大语言模型(LLMs)越来越多地被用于生成结构化输出,但当这些输出需要满足数据库级别的约束时,其可靠性仍不明确。我们通过数据库规范化这一课题来研究该问题,该问题涉及对函数依赖、无损连接分解和表间约束的推理。我们引入了*数据库规范化基准测试*(DNBench),包含3,275个样本,用于评估从1NF到BCNF的LLM驱动的数据库规范化。DNBench采用三轴协议来衡量*语义等价性*、*结构准确性*和*逻辑有效性*。在*单一*、*复合*和*真实世界*三个层级上,DNBench揭示了在依赖推理、模式分解和表间约束重构方面反复出现的失败模式。我们进一步提出了*面向模式的多智能体推理*(MARS),它将证据提取、违规诊断和分解规划与模式生成和验证分离开来。MARS相比单一提示基线,将DNB分数提升了82.0%。所有成果将在论文接受后发布。

††脚注:*同等贡献
††脚注:†通讯作者

## 1 引言

大型语言模型(LLMs)Brown et al. (2020)(https://arxiv.org/html/2609.11141#bib.bib14)已被探索用于结构化数据推理和数据库相关任务。这些任务要求输出满足形式化约束。在此背景下,LLMs遵循自然语言指令、对表格数据进行推理以及生成结构化输出的能力,使其成为自动化数据库工作流程的一种有前景的方法。

使用LLMs规范化数据库凸显了这一挑战,因为它既需要对依赖关系进行推理,又需要生成满足形式化关系约束的模式。数据库规范化是关系数据管理Banks et al. (1970)(https://arxiv.org/html/2609.11141#bib.bib9)的一项基础技术,通过根据函数依赖(FD)组织数据,减少冗余、防止更新异常并增强模式管理。当数据库模式未正确规范化时,会导致数据不一致、不必要的查询成本和数据质量下降Kent (2000)(https://arxiv.org/html/2609.11141#bib.bib15)。此外,规范化难以自动化,因为它需要对函数依赖、候选键、无损连接分解和依赖保持进行推理Codd (1971)(https://arxiv.org/html/2609.11141#bib.bib25)。

尽管如此重要,现有研究对于LLMs能否处理数据库规范化提供的证据有限。NormTabNahid and Rafiei (2024)(https://arxiv.org/html/2609.11141#bib.bib7)和TABARDChoudhury et al. (2025)(https://arxiv.org/html/2609.11141#bib.bib1)在表格清洗或异常检测场景中解决了与规范化相关的问题,而非模式规范化本身。MiffieJo et al. (2025)(https://arxiv.org/html/2609.11141#bib.bib6)针对1NF-3NF规范化使用了LLM生成器-验证器循环,但其验证缺乏对诸如无损连接、键有效性、依赖推理和外键连接性等属性的显式模式级检查。因此,基于LLMs的数据库规范化的可靠性仍然理解不足。

**表1:** DNBench与相关工作方法的比较。规范化部分涵盖从1NF到BCNF的支持以及复合(多重违规)处理。评估部分涵盖模式和解释级别的评分。

为了解决这些问题,我们引入了一个全面的*数据库规范化基准测试*(DNBench),用于评估端到端的LLM驱动的数据库规范化。DNBench提供了来自真实关系模式的3,275个反规范化样本,涵盖了从1NF到BCNF的违规情况,并带有黄金标准标签和分解目标。DNBench进一步提出了一个三轴评估协议,衡量*语义等价性*、*结构准确性*和*逻辑有效性*,并将它们组合成一个统一的*DNB分数*,将在第3节(https://arxiv.org/html/2609.11141#S3)中介绍。

我们进一步设计了*面向模式的多智能体推理*(MARS),这是一个将规范化过程分解为多个子任务并分配给多个LLM智能体协作执行规范化的框架。我们的实验描述了当前使用LLMs进行自动数据库规范化的状态。我们的DNBench能够量化真实世界数据库上生成的DDL的质量。此外,我们通过实验证明,与简单提示相比,我们的MARS方法平均能生成82.0%更可靠的DDL,同时保持了表间约束。

我们的贡献如下:
- ∙ 我们介绍了DNBench,一个包含3,275个样本的基准测试,用于评估基于LLMs的数据库规范化,覆盖从1NF到BCNF的违规。
- ∙ 我们提出了一个三轴评估协议,用于评估生成模式的语义等价性、结构准确性和逻辑有效性。
- ∙ 我们在DNBench上对现代LLMs进行了基准测试,并识别出主要的失败模式,包括不可靠的FD推理、无效的分解和薄弱的表间约束重构。
- ∙ 我们提出了MARS,一个多智能体规范化框架,相比基线将DNB分数提升了82.0%。

**图1:** 数据库规范化基准测试(DNBench)流程概览。DNBench生成带有黄金标准违规标签和分解的受控反规范化模式,然后从语义、结构和逻辑轴评估LLM生成的DDL、违规类型和解释。

## 2 相关工作

表1(https://arxiv.org/html/2609.11141#S1.T1)将DNBench与之前的规范化工具和基于LLMs的方法进行了对比。现有工作可分为两大类:*传统工具*,用于辅助用户应用规范化规则;以及*基于LLMs的系统*,用于解决相关的表格清洗或有限的规范化任务。然而,这两个类别都没有提供全面的基准测试来评估LLMs是否能够可靠地执行数据库规范化。DNBench通过提供全面的规范化基准测试和多方面的评估协议填补了这一空白。

### 2.1 传统规范化工具

传统的规范化工具主要是基于规则或半自动的系统,旨在辅助用户。虽然对于自动化规范化过程很有用,但它们并非作为基准测试而设计;它们通常只涵盖有限的情况,并且缺乏量化指标来衡量规范化质量。Dongare et al. (2011)(https://arxiv.org/html/2609.11141#bib.bib4)介绍了RDBNorma,一个用于将模式规范化至3NF的半自动化工具。RDBNorma使用链表表示模式和函数依赖,并根据预期的分解检查生成的输出。然而,其评估主要关注运行时和内存效率,而非语义保持、无损分解、键有效性或违规诊断。Levandoski et al. (2013)(https://arxiv.org/html/2609.11141#bib.bib5)提出了EDNA,一个在用户指定函数依赖下支持规范化至BCNF的半自动化工具。EDNA从FDs生成基于规则的规范化模式,但它没有提供量化协议来评估规范化效果或在不同模式和复杂违规下的鲁棒性。

### 2.2 基于LLMs的规范化

最近的工作已开始探索使用LLMs进行表格和模式规范化。然而,现有方法要么针对不同的目标,要么评估范围更窄的规范化形式。Nahid and Rafiei (2024)(https://arxiv.org/html/2609.11141#bib.bib7)提出了NormTab,一个基于LLM的框架,用于规范化人类可读的网页表格,如维基百科表格。NormTab执行值级和结构清洗,但其目标是改进下游基于SQL的问答和事实验证。因此,它更接近于表格预处理,而非数据库规范化:它不评估LLMs是否能够对函数依赖进行推理、保持无损分解或构建有效的规范化模式。TABARD (Choudhury et al., 2025)(https://arxiv.org/html/2609.11141#bib.bib1)评估LLMs在表格数据异常检测中的表现,模型在不同的提示策略下识别异常单元格。尽管与表格推理相关,但TABARD并不针对范式违规或模式分解。因此,TABARD没有解决LLMs能否诊断依赖违规或产生结构有效分解的问题。

与我们的工作最相关的是Miffie (Jo et al., 2025)(https://arxiv.org/html/2609.11141#bib.bib6),它提出了一个用于1NF到3NF规范化的双LLM自我精炼框架。Miffie使用一个LLM生成分解,另一个提供关于剩余违规的反馈。然而,其验证器也是基于LLM的,并且不包含对无损连接、键有效性或外键连接性的显式模式级检查。相比之下,DNBench结合了基于LLM的语义判断与显式的结构和逻辑检查,以衡量分解是否*语义等价*、*结构准确*和*逻辑有效*。

## 3 数据库规范化基准测试

图1(https://arxiv.org/html/2609.11141#S1.F1)展示了提出的数据库规范化基准测试(DNBench)。DNBench将现实世界的关系数据库转换为带有黄金标准违规标签和黄金标准分解目标的受控反规范化样本。对于每个样本,LLM生成规范化的数据定义语言(DDL)、违规标签和解释。DNBench沿着语义、结构和逻辑轴评估这些输出。

DNBench包含两个组件:(i)一个反规范化流程,用于从现实世界的关系模式构建受控的范式违规;(ii)一个三轴评估协议,用于衡量语义等价性、结构准确性和逻辑有效性。这三个分数被组合成一个统一的DNB分数,以总结整体的规范化质量。

### 3.1 数据集构建

我们使用两个Text-to-SQL语料库构建DNBench。SpiderYu et al. (2018)(https://arxiv.org/html/2609.11141#bib.bib3)和BIRDLi et al. (2023)(https://arxiv.org/html/2609.11141#bib.bib8)提供了带有主键(PK)和外键(FK)注释的真实关系模式。这些模式用作受控反规范化的来源:DNBench向现有关系设计中注入并标注范式违规,同时保留键约束。构建完成后,三位数据库专家审核了生成的样本,并确认预期的从1NF到BCNF的违规模式、链式规则标签和黄金标准分解被正确表示。

表2(https://arxiv.org/html/2609.11141#S3.T2)总结了源数据库和生成的DNBench数据集。我们的数据集保留了真实的模式结构,同时引入了受控的范式违规和黄金标准分解目标。

**表2:** 源Spider和BIRD数据集以及生成的DNBench数据集的描述性统计。

我们通过一个三阶段的反规范化流程构建数据集:(1)外键感知的子采样,(2)混合发现-合成违规注入,(3)链式规则标注。

##### 阶段1:外键感知的子采样(Foreign Key-aware Subsampling)
我们首先对每个源数据库进行下采样,同时保留FK约束。采样过程从叶子表向上遍历FK图,从每个源表中采样最多n条元组,并通过FK和自引用FK闭包扩展选定的键集。然后应用全局大小上限,并通过级联清理移除剩余的FK违规。这产生了保持引用完整性的紧凑数据库实例。完整细节和算法见附录A.3(https://arxiv.org/html/2609.11141#A1.SS3)。

##### 阶段2:违规的发现与合成(Discovery and Synthesis of Violations)
对于每个源模式,我们识别范式违规模式:1NF的多值单元格、2NF的部分依赖、3NF的传递依赖以及BCNF的非超键决定因素。由于真实模式通常包含相互纠缠而非孤立的违规,仅靠发现不足以进行受控评估。因此,我们用确定性的合成器补充了2NF、3NF和BCNF的违规。这些合成器分别通过主键分割、传递依赖注入和候选键增强来引入违规。我们按照链式规则的逆序(BCNF、3NF、2NF、1NF)组合合成的违规,这样低范式的注入不会擦除之前引入的高范式违规。这种构造产生了所有预期违规都可观察的复合样本。

##### 阶段3:链式规则标注(Chain-rule Labeling)
每个样本包含两个黄金标准分解目标:一个*单一*目标,仅解决最早的违规;一个*组合*目标,解决完整的违规链。阶段2中的复合合成器确保修复一个低范式违规不会自动移除高范式违规。因此,每个违规必须被显式处理,使得*组合*目标区别于*单一*目标。这使得DNBench能够测试模型是仅修复最早的违规还是规范化整个违规链。每个样本还包含一个预期的FK列表,允许在不重新解析生成的DDL的情况下对FK正确性进行评分。

### 3.2 三轴评估协议

我们沿着三个互补的轴评估每个LLM预测:*语义等价性*、*结构准确性*和*逻辑有效性*。这些轴捕捉了生成的分解是否保留了原始数据、是否匹配预期的模式结构以及是否提供正确的规范化推理。我们将这三个轴聚合为一个统一的DNB分数。LLM生成器和LLM评判器的完整提示词见附录H(https://arxiv.org/html/2609.11141#A8)。

##### 标准1. 语义评估(Semantic Evaluation)
语义轴测试生成的分解是否满足相对于原始表的无损连接属性。具体来说,生成的关系的自然连接必须在不引入虚假元组的情况下重建输入表。我们将此检查报告为二元分数。由于无损连接是有效规范化的必要条件,语义分数在DNB分数中充当门控:任何语义失败都会将最终分数降为零。

##### 标准2. 结构评估(Structural Evaluation)
结构轴衡量生成的DDL与黄金标准分解的匹配程度。我们将LLM生成的DDL解析为关系模式对象,并计算三个指标:
- ∙ 列F1:生成的列集与黄金标准列集之间的F1分数。
- ∙ 主键F1:生成的主键集与黄金标准主键集之间的F1分数。
- ∙ 外键分数:FK匹配度和FK有效性的乘积:
  - ∘ FK F1:生成的外键集与黄金标准外键集之间的F1分数。
  - ∘ FK连接分数:一个二元指标,指示生成的FK约束是否有效引用现存的表和列。

最终的结构分数是列F1、主键F1和外键分数的平均值。

##### 标准3. 逻辑评估(Logical Evaluation)
逻辑轴评估生成的DDL和解释是否正确识别了违规类型,并对规范化决策提供了有效的推理。我们使用LLM作为评判器来评估解释是否清晰、准确地识别了原始模式中的违规,并合理说明了分解如何解决这些违规。

相似文章

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。