使用LLMs的数据质量规则生成
摘要
本文介绍了LeDQeR,一个使用大语言模型自动生成企业工具数据质量规则的框架,提高了规则覆盖率并减少了手动维护工作。
查看缓存全文
缓存时间: 2026/09/10 08:31
# 使用大语言模型生成数据质量规则 来源:https://arxiv.org/html/2609.06053 CCS:信息系统数据清洗 CCS:应用计算业务规则 CCS:应用计算企业数据管理 Anna-Christina Glock、Thomas Hütter https://orcid.org/0000-0002-7190-6825 所属机构:软件能力中心,哈根贝格,奥地利 电子邮件:[[email protected]](mailto:[email protected]) Johannes Fürnkranz https://orcid.org/0000-0002-1207-0159 所属机构:约翰·开普勒大学,林茨,奥地利 电子邮件:[[email protected]](mailto:[email protected]) Wolfram Wöß https://orcid.org/0009-0006-8352-0205 所属机构:约翰·开普勒大学,林茨,奥地利 电子邮件:[[email protected]](mailto:[email protected]) Christine Dominka-Kiss 所属机构:奥地利邮政,维也纳,奥地利 电子邮件:[[email protected]](mailto:[email protected]) 以及 Lisa Ehrlinger https://orcid.org/0000-0002-1825-0097 所属机构:哈索·普拉特纳研究所,波茨坦大学,波茨坦,德国 电子邮件:[[email protected]](mailto:[email protected]) ###### 摘要 对客户和员工数据等数据的验证是许多组织中的重要任务。数据错误可能导致严重后果。例如,患者记录中的错误用药单位可能导致危及生命的用药错误,而地址中缺失的街道编号则可能导致投递失败。企业通常采用基于规则的企业数据质量(DQ)工具,允许领域专家指定规则以随时间验证数据。虽然基于规则的DQ工具计算高效且能提供可解释的报告,但手动维护一套全面的规则集具有挑战性,因为领域专家常常会遗漏必要的规则,尤其是在复杂领域和大数据量的情况下。因此,弥合这些差距在实践中仍是一个开放问题。本文针对自动化DQ规则生成的挑战,我们形式化了一个通用的**生成-过滤框架**,并介绍了LeDQeR——一种基于大语言模型的DQ规则生成方法。首先,大语言模型(LLM)针对给定的基于规则的DQ工具语法,从观察到的脏数据元组生成候选规则。其次,我们应用四种过滤技术,以确保生成的规则的(i)可执行性、(ii)正确性、(iii)泛化性,并避免(iv)冗余。大量实验评估表明,LeDQeR能够为各种数据集和错误类型生成有效且紧凑的规则集。 参见图注图1. LeDQeR扩展了基于规则的企业DQ工具的规则集。传入数据针对现有规则集 \(R=\{r_1,...,r_m\}\) 进行验证。被规则覆盖的错误会被检测到,而未被任何规则覆盖的错误则会悄悄通过验证,并在下游流程中引发故障。LeDQeR弥合了这些差距:未检测到的脏元组被传递到生成-过滤流水线,该流水线生成新的规则 \(\{r_{m+1},r_{m+2}\}\) 来扩展现有规则集,以便将来检测到相同类型的错误。 ###### 关键词:数据质量,规则生成,基于规则的工具,大语言模型 ## 1. 引言 数据质量(DQ)长期以来一直被认为是组织进行有效决策的关键前提(Wang and Strong, 1996 (https://arxiv.org/html/2609.06053#bib.bib33); Redman, 1998 (https://arxiv.org/html/2609.06053#bib.bib34); Pipino et al., 2002 (https://arxiv.org/html/2609.06053#bib.bib35))。Haug et al. (https://arxiv.org/html/2609.06053#bib.bib26)(Haug et al., 2011 (https://arxiv.org/html/2609.06053#bib.bib26))展示了数据质量低下对组织的影响,其范围从错误的决策、客户满意度下降,到医疗领域危及生命的用药错误(de Andrade et al., 2026 (https://arxiv.org/html/2609.06053#bib.bib27))。随着组织在实践中越来越多地部署人工智能(AI),数据质量低下的影响变得更加严重:在低质量数据上训练的AI模型表现出性能下降(Mori et al., 2023 (https://arxiv.org/html/2609.06053#bib.bib28); Mohammed et al., 2025 (https://arxiv.org/html/2609.06053#bib.bib29))。除了这些技术考虑之外,数据质量也成为一项监管义务:欧盟《人工智能法案》要求高风险人工智能系统的训练、验证和测试数据必须*相关*、*具有代表性*、*无错误*且*完整*(European Parliament and Council of the European Union, 2024 (https://arxiv.org/html/2609.06053#bib.bib39))。因此,即使在人工智能和大语言模型(LLMs)的时代,在企业环境中检测和纠正数据错误仍然是一项基本要求。 研究领域已经提出了基于机器学习(ML)的方法来自动化DQ任务,例如在最少专家输入下进行错误检测和纠正(Mahdavi et al., 2019 (https://arxiv.org/html/2609.06053#bib.bib19); Rekatsinas et al., 2017 (https://arxiv.org/html/2609.06053#bib.bib8), 例如)。然而,这些工具缺乏大型组织通常需要的供应商支持和系统集成能力,因此很少在企业环境中部署。最近,大语言模型也被直接应用于检测数据中的错误(Glock et al., 2025 (https://arxiv.org/html/2609.06053#bib.bib20); Chandru et al., 2025 (https://arxiv.org/html/2609.06053#bib.bib40); Narayan et al., 2022 (https://arxiv.org/html/2609.06053#bib.bib42); Bodensohn et al., 2025 (https://arxiv.org/html/2609.06053#bib.bib41); Yang et al., 2025 (https://arxiv.org/html/2609.06053#bib.bib44))。虽然这些方法在语义和依赖上下文的错误类型上特别有效,但它们需要将数据传递给大语言模型,这在企业数据规模下计算成本高昂,并且通常与严格的数据保护要求(如欧洲通用数据保护条例(GDPR)(European Parliament and Council of the European Union, 2016 (https://arxiv.org/html/2609.06053#bib.bib43)))相冲突,特别是当数据包含个人信息时。此外,Bodensohn et al. (https://arxiv.org/html/2609.06053#bib.bib41)(Bodensohn et al., 2025 (https://arxiv.org/html/2609.06053#bib.bib41))表明,大语言模型在真实世界企业数据上的准确性急剧下降,例如由于表尺寸过大和缺乏内部知识。因此,组织主要依赖企业DQ工具(Ehrlinger and Wöß, 2022 (https://arxiv.org/html/2609.06053#bib.bib18); Chien et al., 2025 (https://arxiv.org/html/2609.06053#bib.bib30)),这些工具大多是基于规则的解决方案,并辅以一些ML和AI支持。这些工具计算高效,产生确定性和可解释的结果,并且在生产环境中已经成熟。虽然一些企业DQ工具最近集成了大语言模型,以将自然语言描述转换为规则(Rehberger et al., 2026 (https://arxiv.org/html/2609.06053#bib.bib38)),但规则的创建本身仍然是一个手动过程:数据管理员仍需要知道并指定哪些规则是必需的。 ##### 问题陈述 然而,基于规则的DQ工具的效用仅取决于其规则集。图1(https://arxiv.org/html/2609.06053#S0.F1)说明了这种情况:传入数据针对现有规则集 \(R=\{r_1,...,r_m\}\) 进行验证。被规则覆盖的数据错误会被检测到并得到相应处理。然而,未被任何规则覆盖的数据错误则会悄悄通过验证。因此,数据被分类为干净数据并传播到下游流程,例如ETL管道或主数据管理,其中未检测到的错误会导致处理失败。考虑我们在奥地利邮政的行业用例:缺失的街道编号或语义上难以处理的错误,例如混淆奥地利城市Lienz和Linz,可能导致投递失败。此类故障尤其代价高昂,因为它们出现较晚并且会重复发生,直到规则集相应扩展为止。由于手动定义和维护DQ规则复杂且耗时(Chiang and Miller, 2008 (https://arxiv.org/html/2609.06053#bib.bib10); Ehrlinger and Wöß, 2022 (https://arxiv.org/html/2609.06053#bib.bib18); Taleb et al., 2021 (https://arxiv.org/html/2609.06053#bib.bib17)),弥合这些规则集中的差距在实践中仍是一个开放问题。 ##### 我们的方法 在本文中,我们使用LeDQeR解决了这个问题,这是一个基于大语言模型的框架,当检测到未识别的错误时,它会迭代地扩展企业DQ工具的规则集(参见图1(https://arxiv.org/html/2609.06053#S0.F1)):导致下游故障的脏元组被传递给LeDQeR,LeDQeR生成DQ规则来检测该错误,使得相同类型的错误无法再次悄悄通过验证。LeDQeR遵循生成-过滤方法。在*生成*步骤中,大语言模型根据一个脏元组和给定的DQ规则格式自动生成候选DQ规则。与传统的规则学习方法(Chiang and Miller, 2008 (https://arxiv.org/html/2609.06053#bib.bib10); Yeh and Puri, 2010 (https://arxiv.org/html/2609.06053#bib.bib9))相比,后者难以捕获语义上下文且通常需要标记数据,大语言模型利用预训练知识和语义推理能力,从最少的输入中生成类似代码(例如SQL或Python)语法的DQ规则(Yadav and Mondal, 2025 (https://arxiv.org/html/2609.06053#bib.bib21); R et al., 2025 (https://arxiv.org/html/2609.06053#bib.bib22))。在*过滤*步骤中,候选规则在(i)可执行性、(ii)正确性、(iii)泛化性和(iv)冗余性方面得到逐步完善,从而产生一个最小化且精确的规则集,可随时投入运行部署。 ##### 贡献 总之,本文在企业环境中自动化DQ规则生成方面做出以下贡献: - •我们形式化了DQ规则生成的问题,并引入了一个可泛化的生成-过滤框架。 - •我们提出了LeDQeR,这是该框架的一种基于大语言模型的实现,它根据观察到的脏元组生成DQ规则,并增量扩展现有规则集。 - •我们引入了一套四种过滤技术,以确保新规则的(i)可执行性、(ii)正确性、(iii)泛化性以及(iv)避免冗余。 - •我们在来自不同领域的五个数据集上全面评估了LeDQeR,这些数据集包含多达九种不同的错误类型。 ##### 结果 我们的评估表明,LeDQeR能够生成可执行的规则,这些规则在未见数据上泛化良好,且不会产生误报。具体来说,我们的实验表明,大语言模型在生成DQ规则方面具有前景,并展示了我们过滤器的有效性。我们还观察到,生成的规则检测脏元组的能力受到错误类型和提示中提供的错误上下文量的影响。 ##### 结构 我们首先在第2节(https://arxiv.org/html/2609.06053#S2)介绍数据错误和基于规则的DQ工具必要的背景知识,其中还介绍了本文贯穿使用的运行示例。在第3节(https://arxiv.org/html/2609.06053#S3),我们首先形式化DQ规则生成的问题,然后提出LeDQeR——一个遵循我们生成-过滤形式化的基于大语言模型的DQ规则生成框架。我们在第4节(https://arxiv.org/html/2609.06053#S4)评估LeDQeR,并在第5节(https://arxiv.org/html/2609.06053#S5)讨论相关工作。第6节(https://arxiv.org/html/2609.06053#S6)总结了本文,并展望了未来的工作。 ## 2. 数据错误与基于规则的DQ度量 在本节中,我们在2.1节(https://arxiv.org/html/2609.06053#S2.SS1)介绍数据错误类型的必要背景知识,并在2.2节(https://arxiv.org/html/2609.06053#S2.SS2)介绍基于规则的DQ工具。在整个本节中,我们还将介绍一个源自我们在奥地利邮政行业用例的运行示例:个人联系信息(PCI)数据集(参见表1(https://arxiv.org/html/2609.06053#S2.T1))。此示例用于在第3节(https://arxiv.org/html/2609.06053#S3)解释我们的生成-过滤框架以及第4节(https://arxiv.org/html/2609.06053#S4)的实验评估。 ### 2.1 数据质量与错误类型 表1(https://arxiv.org/html/2609.06053#S2.T1)展示了我们的运行示例:来自我们在奥地利邮政行业用例的个人联系信息(PCI)数据集的一个子集。每个元组描述一个人及其地址,包含Street、FirstName、PostalCode和City列。该示例是我们在实验评估中使用的完整PCI数据集的简化版本,该数据集有14列(参见第4节(https://arxiv.org/html/2609.06053#S4))。数据质量本质上是上下文相关的,因为它通常被定义为“适用性”(Wang and Strong, 1996 (https://arxiv.org/html/2609.06053#bib.bib33)),即数据必须适合其使用的特定目的。因此,数据质量度量必须反映特定领域的语义和使用预期。 ###### 示例 2.1 我们的运行示例的用例对数据提出了以下要求:(1)街道名称必须包含实际的街道名称,而不是诸如“Unknown”之类的占位符值,(2)即使在奥地利通常会添加前导“A”(例如“A-1220”),邮编也需要四位数字的数值表示,例如“1220”,(3)城市仅由城市名称组成,不允许包含子区域。违反这些要求的值是数据错误,并在表1(https://arxiv.org/html/2609.06053#S2.T1)中用颜色突出显示。 表 1. 作为运行示例的PCI数据集子集。 ID | Street | FirstName | PostalCode | City ---|---|---|---|--- 1 | Unknown | Ina-Maria | A-1220 | Wien 2 | Brahmsplatz | Hans | 1040 | Wien, Wieden 3 | Berggasse | Anna | A-4020 | Linz 4 | Feldgasse | Anna-Maria | A6020 | Innsbruck 5 | Unknown | Maria | 8010 | Graz 错误类型:■\\blacksquare 嵌入值 ■\\blacksquare 格式不正确 ■\\blacksquare 伪装缺失值 如示例2.1(https://arxiv.org/html/2609.06053#S2.Thmtheorem1)所示,数据错误是数据质量低下的可观察表现,本质上是特定于上下文和用途的。这导致了众多数据错误分类法的开发(Rahm and Do, 2000 (https://arxiv.org/html/2609.06053#bib.bib11); Müller and Freytag, 2005 (https://arxiv.org/html/2609.06053#bib.bib12); Kim et al., 2003 (https://arxiv.org/html/2609.06053#bib.bib13); Oliveira et al., 2005 (https://arxiv.org/html/2609.06053#bib.bib14); Josko et al., 2016 (https://arxiv.org/html/2609.06053#bib.bib15); Ilyas and Naumann, 2022 (https://arxiv.org/html/2609.06053#bib.bib16); Bhadauria et al., 2026 (https://arxiv.org/html/2609.06053#bib.bib36))。基于这些分类法和领域专家的反馈,我们选择了九种错误类型,涵盖了单个值或元组中出现的广泛DQ问题,用于评估我们的框架: 显式缺失值(emv):值被显式设置为null。这是一种常见的错误类型(Pearson, 2006 (https://arxiv.org/html/2609.06053#bib.bib25)),并且在文献中众所周知(Rahm and Do, 2000 (https://arxiv.org/html/2609.06053#bib.bib11); Oliveira et al., 2005 (https://arxiv.org/html/2609.06053#bib.bib14); Kim et al., 2003 (https://arxiv.org/html/2609.06053#bib.bib13); Müller and Freytag, 2005 (https://arxiv.org/html/2609.06053#bib.bib12); Ilyas and Naumann, 2022 (https://arxiv.org/html/2609.06053#bib.bib16); Jung et al., 2025 (https://arxiv.org/html/2609.06053#bib.bib37); Bhadauria et al., 2026 (https://arxiv.org/html/2609.06053#bib.bib36))。 伪装缺失值(dmv):在语义上缺失(类似于emv)但包含占位符值。例如...
相似文章
基于大语言模型定性及定量评估的常微分方程发现方法
本文介绍了 DoLQ,这是一个多智能体框架,利用大语言模型执行定性和定量评估,从而从观测数据中发现常微分方程。
RIMRULE: 通过MDL引导的规则学习改进工具使用语言代理
RimRule提出了一种神经符号方法,利用最小描述长度原则从失败轨迹中提炼出紧凑、可解释的规则,在不修改权重的情况下提升LLM工具使用性能,并展示了规则在模型间的可迁移性。
RuleChef:将LLM任务知识锚定在人类可编辑规则中
RuleChef 是一个框架,利用大型语言模型(LLM)为自然语言处理任务(如文本分类、命名实体识别或关系抽取)生成人类可编辑、可执行的规则。它基于任务描述和一组标注示例生成规则,然后根据更多示例和人类对现有规则的反馈进行迭代改进。RuleChef 还可以通过观察任何现有模型在给定任务上的输入-输出对来引导规则生成。LLM 仅在训练阶段使用,合成规则并根据在留出集上测量的失败进行迭代修补。这个过程最终产生一个快速、确定且可审查的规则系统。初步评估在分类和命名实体识别任务上进行。我们将 RuleChef 作为开源软件发布,采用 Apache 2.0 许可。
当大语言模型过度回答:测量与缓解基于LLM的硬件描述语言问答中的质量问题
本文研究了LLM生成的硬件描述语言问答中的质量问题,发现过度回答倾向,如冗余(65.7%)和冗长(69.1%),并提出了一种多智能体框架,将核心答案减少37%,非核心内容长度减少31%,同时提高质量分数。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。