自示范在提升基于LLMs的模式-本体映射中的惊人效果
摘要
本文提出了一种基于自示范的LLMs模式-本体映射方法,结合神经符号任务分解,在RODI基准测试上达到了最先进的性能。
arXiv:2609.13776v1 公告类型:新
摘要:将异构关系数据库集成到集中式本体中仍然是企业知识表示中的一个持续挑战,主要是由于语义异构性、晦涩的模式命名、缺失的元数据以及关系模式与本体模型之间的抽象差距。尽管大语言模型(LLMs)提供了强大的语义推理能力,但我们表明,通过一次性提示或多阶段管道直接应用它们会导致模式-本体映射的性能不佳。本文提出了一种基于自示范的方法,结合了神经符号任务分解和一种新颖的机制,用于自动生成模式引导、依赖感知的示范,以解决这一集成挑战。我们的方法结合了两种关键策略,以实现比现有基于LLMs的模式集成方法显著的准确率提升:(i)将任务分解为级联子任务的神经符号分解,其中符号约束构建搜索空间,LLMs在每个专注的子任务中执行语义推理;(ii)由领域无关模式引导的自生成示范,用于监督每个子任务。在RODI基准测试中最具挑战性的三个场景上的实验表明,我们的方法达到了最先进的性能,显著优于(F1提升25个百分点)传统的模式到本体映射技术和最近的基于LLMs的模式到本体及模式匹配方法。消融研究进一步揭示了模式引导自示范的显著益处和神经符号任务分解的互补益处。
查看缓存全文
缓存时间: 2026/09/15 09:01
# 令人惊讶的有效性:LLM自演示在增强模式-本体映射中的效果
来源:https://arxiv.org/html/2609.13776
Manasi PatwardhanSunita Sarawagi地址:TCS Research地址:IIT Bombay
###### 摘要
将异构关系数据库集成到统一的本体中,仍然是企业知识表示中的一个长期挑战,主要原因是语义异构性、晦涩的模式命名、缺失的元数据,以及关系模式与本体模型之间的抽象差距。尽管大型语言模型(LLMs)提供了强大的语义推理能力,但我们发现,通过单次提示或多阶段朴素流水线直接应用它们来进行模式-本体映射时,效果不佳。本文提出了一种自演示驱动的方法,该方法结合了神经符号任务分解与一种新颖的机制,用于自动生成模式引导、依赖感知的演示,以解决这一集成挑战。我们的方法结合了两个关键策略,以在现有的基于LLM的模式集成方法基础上实现显著的准确率提升:(i)将任务神经符号分解为级联子任务,其中符号约束构建搜索空间,而LLM在每个专注的子任务中执行语义推理,以及(ii)由领域无关模式引导的自生成演示,用于监督每个子任务。在RODI基准测试中三个最具挑战性的场景上进行的实验表明,我们的方法达到了最先进的性能,显著优于(F1值提高约25个百分点)传统的模式到本体映射技术和最近的基于LLM的模式到本体以及模式匹配方法。消融实验进一步揭示了模式引导的自演示以及神经符号任务分解的显著互补效益。
###### 关键词
数据库-本体映射\sep数据集成\sep企业搜索\sepR2RML生成
以及
图1:关系数据库到本体的映射示例## 1引言
企业越来越倾向于通过一个统一的本体来表示组织知识,以便分析、搜索和推理能够在一个语义一致的企业视图上运行\[4 (https://arxiv.org/html/2609.13776#bib.bib1),15 (https://arxiv.org/html/2609.13776#bib.bib2),19 (https://arxiv.org/html/2609.13776#bib.bib3)\]。然而在实践中,企业数据分布在多个异构且独立演进的关系数据库中。因此,跨这些源进行查询需要将每个数据库模式映射到一个集中的本体(示例如图1 (https://arxiv.org/html/2609.13776#S0.F1)所示)。在企业规模上,考虑到涉及大量本体实体、数据库表和列,手动执行此操作是一项耗时、易出错且认知负荷高的任务。
传统的自动映射系统\[17 (https://arxiv.org/html/2609.13776#bib.bib5),24 (https://arxiv.org/html/2609.13776#bib.bib7)\]严重依赖词汇相似性和手工制作的模板;因此,它们常常遗漏更深层次的语义对应关系,难以处理晦涩或有噪声的模式元素,并且在关键元数据不完整时失效。大型语言模型(LLMs)非常适合这项任务,因为它们提供了广泛的语义推理能力\[12 (https://arxiv.org/html/2609.13776#bib.bib29),2 (https://arxiv.org/html/2609.13776#bib.bib30),29 (https://arxiv.org/html/2609.13776#bib.bib31),30 (https://arxiv.org/html/2609.13776#bib.bib32)\],能够弥合模式和本体之间的表示差距。然而,我们的早期实验表明,直接提示LLM一次性生成完整的数据库到本体映射会产生糟糕的结果。当整体任务以神经符号方式组织时,即符号结构将任务分解为阶段并约束搜索空间,而LLM在每个阶段内执行语义推理,模型能够做出更好的局部决策并产生更好的映射。然而,这种分阶段的LLM驱动方法在零样本设置下产生的收益会导致次优结果,因为每个LLM阶段的误差会累积,导致整体性能下降。为了提高准确性,我们寻求利用LLM的上下文学习能力(ICL)\[3 (https://arxiv.org/html/2609.13776#bib.bib4)\],通过包含少量输入-输出示例的演示来适应新任务或领域。我们观察到,手工策划的演示显著提高了准确性,但由于需要领域和任务专业知识,它们劳动密集型且难以扩展。
Matchmaker\[20 (https://arxiv.org/html/2609.13776#bib.bib8),21 (https://arxiv.org/html/2609.13776#bib.bib13)\],一种模式匹配方法,展示了LLM自动生成少样本以自我改进的能力。然而,将其方法扩展到我们的流水线中,无法获得与手工策划的少样本相媲美的性能。这主要是因为Matchmaker的方法倾向于生成外观相似的演示,在匹配中语义变化有限。
这引出了本工作的关键洞察:我们允许LLM生成自演示,同时使用跨真实数据集成案例观察到的典型可重用、领域无关的模式来约束生成过程。我们定义了模式族来捕获常见的规律性,并引导LLM在每个阶段实例化它们,以生成自演示。例如,本体中的一个类通过基于字符串、语法、语义、领域或类别-列-值对匹配的精确方式与数据库表匹配。连接两个类的对象属性,则与匹配到领域类的表的外键列,或链接与领域和范围类匹配的表的连接表的列匹配。演示以依赖感知的方式创建:早期阶段的输出(例如类/表对齐)在生成下游子任务(例如属性匹配和SQL视图映射)的演示时被传递下去。我们表明,我们这种分阶段自动生成和利用模式引导、依赖感知、多样且噪声较少的自演示的过程是有效的,并且是LLM驱动的数据库到本体映射任务性能提升的主要驱动力。尽管我们的方法在多个阶段调用LLM,但数据库到本体映射通常是一次性集成过程,其产生的映射会在下游查询和应用程序中广泛重用。因此,在企业环境中,我们优先考虑准确性和语义正确性,而非执行效率或计算成本。我们方法的主要贡献总结如下:
- •我们提出了一种基于神经符号分解的方法,该方法结合了传统符号方法(如Milan\[14 (https://arxiv.org/html/2609.13776#bib.bib6)\])的优势和现代LLM的强大能力。数据库到本体映射任务被系统地分解为多个阶段和细粒度的子阶段,每个阶段都使用自演示引导的LLM执行。
- •我们引入了一种模式引导的上下文感知自演示方法,该方法通过一次性的领域无关模式策划,自动构建多样化的、阶段特定的上下文内示例。
- •我们的方法在RODI基准测试\[17 (https://arxiv.org/html/2609.13776#bib.bib5)\]中三个最具挑战性的场景(地理、会议和油气)上取得了最先进的结果,相比直接提示和先前的自动化基线表现出显著的改进(F1分数提高约25个百分点),甚至略优于手工策划的少样本。
- •我们通过详细的消融实验表明,我们的方法受益于神经符号任务分解和自演示。
参考说明图2:我们数据库到本体映射方法背后的动机
## 2相关工作
数据库-本体映射。早期系统如BootOX\[10 (https://arxiv.org/html/2609.13776#bib.bib20)\]、Ontop\[5 (https://arxiv.org/html/2609.13776#bib.bib21)\]、MIRROR\[7 (https://arxiv.org/html/2609.13776#bib.bib22)\]和D2RQ\[16 (https://arxiv.org/html/2609.13776#bib.bib23)\]从数据库推导出一个引导本体,然后尝试将该本体与模式映射,这不是一个现实的设置。后续工具如COMA\+\+\[1 (https://arxiv.org/html/2609.13776#bib.bib24)\]、IncMap\[18 (https://arxiv.org/html/2609.13776#bib.bib25)\]、A4MO\[24 (https://arxiv.org/html/2609.13776#bib.bib7)\]和MILAN\[14 (https://arxiv.org/html/2609.13776#bib.bib6)\]主要依赖词汇/结构相似性,结合启发式剪枝和基于模板的映射。这些方法在名称晦涩、元数据不完整(例如缺失外键)以及语义对应关系超越字符串相似性的情况下会退化。最近的基于LLM的方法(Table\-to\-KG\[27 (https://arxiv.org/html/2609.13776#bib.bib12)\]和LLM4VKG\[31 (https://arxiv.org/html/2609.13776#bib.bib14)\])引入了基于LLM的学习语义匹配,但往往止步于对齐、保持映射模板驱动,或未向LLM提供有针对性的、阶段特定的指导。相比之下,我们的方法将符号分解和剪枝与基于LLM的语义推理相结合,并通过模式引导的自演示提供有针对性的、阶段特定的指导。模式匹配。在数据库到本体映射任务中,初始对应识别步骤与模式匹配非常相似。基于LLM的模式匹配通常遵循“检索候选然后用LLM重新排序”的模式,如ReMatch\[22 (https://arxiv.org/html/2609.13776#bib.bib10)\]和Magneto\[13 (https://arxiv.org/html/2609.13776#bib.bib9)\]。Matchmaker\[20 (https://arxiv.org/html/2609.13776#bib.bib8),21 (https://arxiv.org/html/2609.13776#bib.bib13)\]进一步探索了自动少样本自我改进。然而,鉴于模式和本体之间的抽象和粒度不匹配,模式匹配通常比数据库-本体映射更简单。Matchmaker的少样本生成方法在适配到我们的场景时会导致次优结果。在我们的场景中,自动化少样本只有在具有多样性、场景特定性和依赖感知性时才有帮助,这些特性我们通过自演示来强制实现。启示。先前文献表明LLM可以捕获超越字符串的语义,但它淡化了如何将语义推理与符号分解相结合,以及如何向LLM提供正确的上下文信号。我们通过神经符号设计和模式引导的自演示来实践这一点,即自动生成的、多样化的、场景特定的示例,在映射阶段引导模型。
## 3背景与问题定义
我们形式化该问题,并回顾关于本体结构和模式到本体映射的基本背景。我们给定的输入包括:(i)一个本体O\\mathcal\{O\},由一组类CC组成(如图1 (https://arxiv.org/html/2609.13776#S0.F1)中的Pipeline),子类CS→CC\_\{S\}\\rightarrow C(例如OilPipeline)是类CC的一个子集,数据属性DCD\_\{C\}(例如pipelineDimension),其定义域是一个类(例如Pipeline),值域是其数据类型(如‘float’),以及对象属性OCD,CRO\_\{C\_\{D\},C\_\{R\}\}(例如pipelineOperator)连接两个类:定义域类CDC\_\{D\}(例如Pipeline)和值域类CRC\_\{R\}(例如Company);以及(ii)关系数据库模式D\\mathcal\{D\},包含实体,如表TT(例如pipeline)、属于这些表的列CTC\_\{T\}(例如pipmedium),以及这些列的数据值VCTV\_\{C\_\{T\}\}(例如‘Oil’)。
一个本体-数据库映射涉及将本体概念(类、数据属性和对象属性)与相应的数据库实体(表、列)关联起来。典型的规律包括:类通过分类列映射到表的主键或过滤后的表子集;子类映射到超类表内或邻接表中的列-值过滤器;数据属性映射到类表或一跳邻居中的列;对象属性映射到连接定义域和值域的外键或连接表键。
图1 (https://arxiv.org/html/2609.13776#S0.F1)展示了为挪威石油局(NPD)制作的部分油气本体与一个关系数据库之间映射任务的片段。映射以R2RML(关系到资源描述框架映射语言)\[6 (https://arxiv.org/html/2609.13776#bib.bib15)\]表示。我们的目标是生成一组包含SQL视图的R2RML映射,其中主体和客体列如图1 (https://arxiv.org/html/2609.13776#S0.F1)所示,使得执行R2RML映射能产生RDF三元组,用D\\mathcal\{D\}中的数据填充O\\mathcal\{O\}。
参考说明图3:自演示驱动映射方法概述。分解:(i)匹配,(ii)映射。自演示。TCT\_\{C\}:与类CC匹配的表,CSC\_\{S\}:类CC的子类,DCD\_\{C\}:类CC的数据属性,TKT\_\{K\}:引用TCT\_\{C\}的表,TJT\_\{J\}:连接表
## 4自演示驱动的方法
### 4.1神经符号分解概述
受以下观察的启发:尽管支持长上下文,当前的LLM在单次一次性生成中难以产生准确的R2RML映射,我们将数据库到本体映射任务分解为两个阶段:(i)匹配:识别数据库模式D\\mathcal\{D\}中最相关的对应本体O\\mathcal\{O\}中源概念的目标实体,(ii)映射:通过为匹配的模式实体生成SQL视图,为每个本体概念O\\mathcal\{O\}构建R2RML映射。在将上述元数据缺失的情况作为输入之前,我们推断D\\mathcal\{D\}中缺失的外键以及O\\mathcal\{O\}中缺失的定义域或值域声明。两个阶段进一步划分为子阶段,以对齐本体概念并保留其依赖关系。与Milan\[14 (https://arxiv.org/html/2609.13776#bib.bib6)\]类似,我们通过自上而下的分阶段匹配来处理庞大的模式-本体搜索空间,利用符号约束逐步剪枝候选。我们基于本体实体类型将整体任务分解为子阶段,并使用基于规则的推理构建专注的候选集,与完整数据库模式相比,大大减少了作为候选考虑的数据库实体数量。与Milan不同,我们通过在每个子阶段调用LLM,将符号分解与神经组件紧密结合,并配备精心限定范围的上下文信息。在这些专注的候选集上操作允许LLM在受限且相关的上下文中进行推理,从而产生更准确和稳健的映射\[8 (https://arxiv.org/html/2609.13776#bib.bib16),9 (https://arxiv.org/html/2609.13776#bib.bib17),23 (https://arxiv.org/html/2609.13776#bib.bib18),32 (https://arxiv.org/html/2609.13776#bib.bib19)\]。
(i)匹配。匹配按四个子阶段依次进行:类、子类、数据属性和对象属性。类匹配是一个两步过程:首先选择最佳匹配表,然后识别其他存在的匹配表。子类匹配仅在超类匹配后被调用,搜索超类表中的一跳关系相似文章
面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)
本文提出了一种针对高风险领域LLM输出的神经符号验证架构,结合形式化符号方法与神经语义分析。在一个医疗器械损伤评估系统上进行的评估显示,该架构对结构化实体的幻觉检测率超过83%,语义虚构的检测率达72%,报告创建时间缩短30%。
通过语言表征塑造图式:拓展LLM智能的下一前沿
本文指出,设计先进的语言表征以塑造认知图式,是在不扩展参数规模的前提下拓展LLM智能的关键前沿。文章提供了形式化定义与实证证据,表明不同的语言结构会显著影响模型性能与内部特征激活。
双层引导的自描述结构化数据:大规模 LLM 知识导航中精准检索的轻量级 RAG 替代方案
SDSR 提出轻量级自描述结构化数据,并辅以双层引导,利用 LLM 的首位偏差,在无向量数据库的情况下实现 100% 路由准确率。
SciOrch:学习编排专家级大语言模型以解决前沿多模态科学推理任务
SciOrch 提出了一种基于 MCTS 训练的 8B 视觉语言模型,用于协调多个专家级大语言模型进行多模态科学推理,在降低 API 成本的同时实现了更优性能。
镜头下的Auto-DSM:面向基于LLM的DSM生成的黑盒评估框架
本文提出了一个黑盒评估框架,用于评估大型语言模型从结构化技术文档生成设计结构矩阵(DSM)的能力。该框架引入了可复现的度量指标和复合质量评分,结果表明,虽然LLM能够生成看似合理的DSM,但它们仍然对歧义和提示措辞敏感。