基于LLM符号化决策过程物化的可解释列标注

arXiv cs.CL 论文

摘要

提出SymCA,一种利用LLM将标注物化为全局到局部符号决策过程的可解释列标注框架,相较于基线取得了显著的准确率提升。

arXiv:2607.25228v1 公告类型: 新 摘要: 列标注(CA)包括列类型标注(CTA)和列属性标注(CPA),旨在识别表列的含义及其之间的语义关系。最近的CA方法通常使用各种神经网络模型来学习列表示,并直接将它们映射到标签类别,从而(1)牺牲了模型的可解释性和自适应性,(2)忽略了丰富的标签语义,最终限制了准确性。为了解决这些限制,我们提出了SymCA,一种基于LLM的可解释CA框架,将列标注物化为从全局到局部的符号决策过程。SymCA由两个组件组成:(1)全局骨架归纳,即在标签空间上构建语义骨架;(2)局部基底演化,即在骨架内演化预测基底。具体来说,为了在利用标签语义的同时保留可解释的决策过程,全局骨架归纳模块利用LLM生成候选的受上位词启发的树结构语义骨架,并采用基于最小贝叶斯风险(MBR)的共识策略来选择鲁棒的骨架,以应对生成方差。由于不同的内部节点需要不同的证据来区分其子节点,局部基底演化模块将每个内部节点物化为一个可执行且可演化的预测基底。在多个演化轮次中,每个基底使用当前操作符集训练一个可解释的随机森林分类器,利用LLM提出节点特定的操作符修改,并使用探索-利用策略优先考虑有潜力的基底。大量实验表明,SymCA准确、鲁棒且可解释,在Micro-F1上平均超过最强基线6.42%,在Macro-F1上平均超过11.03%。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:54

# 可解释的列标注:基于LLM符号化决策过程的具体化

来源:https://arxiv.org/html/2607.25228

Mengqi Wang,Jianwei Wang0009-0000-7887-4179 (https://orcid.org/0009-0000-7887-4179)新南威尔士大学 悉尼 新南威尔士州 澳大利亚 [email protected] (https://arxiv.org/html/2607.25228v1/mailto:[email protected]),Qing Liu0000-0001-7895-9551 (https://orcid.org/0000-0001-7895-9551)Data61,CSIRO 桑迪湾 塔斯马尼亚州 澳大利亚 [email protected] (https://arxiv.org/html/2607.25228v1/mailto:[email protected]),Xiwei Xu0000-0002-2273-1862 (https://orcid.org/0000-0002-2273-1862)Data61,CSIRO 伊夫利 新南威尔士州 澳大利亚 [email protected] (https://arxiv.org/html/2607.25228v1/mailto:[email protected]),Zhenchang Xing0000-0001-7663-1421 (https://orcid.org/0000-0001-7663-1421)Data61,CSIRO 堪培拉 澳大利亚首都领地 澳大利亚 [email protected] (https://arxiv.org/html/2607.25228v1/mailto:[email protected]),Michael Bain0000-0002-4309-6511 (https://orcid.org/0000-0002-4309-6511)新南威尔士大学 悉尼 新南威尔士州 澳大利亚 [email protected] (https://arxiv.org/html/2607.25228v1/mailto:[email protected]),Liming Zhu0000-0001-5839-3765 (https://orcid.org/0000-0001-5839-3765)Data61,CSIRO 悉尼 新南威尔士州 澳大利亚 [email protected] (https://arxiv.org/html/2607.25228v1/mailto:[email protected]) 和 Wenjie Zhang0000-0001-6572-2600 (https://orcid.org/0000-0001-6572-2600)新南威尔士大学 悉尼 新南威尔士州 澳大利亚 [email protected] (https://arxiv.org/html/2607.25228v1/mailto:[email protected])

###### 摘要。列标注(CA)包括列类型标注(CTA)和列属性标注(CPA),旨在识别表列的含义及它们之间的语义关系。最近的CA方法通常使用各种神经模型来学习列表示,并直接将其映射到标签类别,因此(1)牺牲了模型的可解释性和自适应性,(2)忽略了丰富的标签语义,最终限制了准确性。为了解决这些局限性,我们提出了SymCA,一种基于LLM的可解释CA框架,它将列标注具体化为一个从全局到局部的符号化决策过程。SymCA包含两个组成部分:(1)全局骨架归纳,它在标签空间上构建一个语义骨架;以及(2)局部基底演化,它在骨架内演化预测性基底。具体来说,为了利用标签语义同时保留可解释的决策过程,全局骨架归纳模块利用LLM生成候选的上位词启发的树状结构语义骨架,并采用基于最小贝叶斯风险(MBR)的共识策略来选择一个对生成变异鲁棒的骨架。由于不同的内部节点需要不同的证据来区分其子节点,局部基底演化模块将每个内部节点具体化为一个可执行且可演化的预测性基底。经过多轮演化,每个基底使用当前的操作符集合训练一个可解释的随机森林分类器,利用LLM提出特定于节点的操作符修改,并使用探索-利用策略来优先处理有前景的基底。大量实验表明,SymCA是准确、鲁棒且可解释的,其在Micro-F1和Macro-F1上分别平均优于最强基线6.42%和11.03%。††copyright:none

参见图注 图1. 列标注的一个激励性示例,展示了上位词启发的标签语义层级。

## 1. 引言

关系表是跨数据库、电子表格、Web表格和企业数据仓库组织结构化数据的关键格式。它们在异构应用中的有效管理和使用在很大程度上依赖于语义元数据,例如列类型和列之间的关系,而这些元数据在实践中常常缺失、不完整或模糊(Chen等人,2019 (https://arxiv.org/html/2607.25228#bib.bib21);Ding等人,2025 (https://arxiv.org/html/2607.25228#bib.bib5))。列标注(CA)旨在通过将列及其关系映射到广泛认可的本体或词汇表(如DBpedia(Lehmann等人,2015 (https://arxiv.org/html/2607.25228#bib.bib22))和Schema.org(Guha等人,2016 (https://arxiv.org/html/2607.25228#bib.bib23)))中定义的语义类和属性,从表格内容中推断缺失的语义元数据。两个核心的CA任务是列类型标注(CTA),它为目标列分配一个语义类型;以及列属性标注(CPA),它识别一个有序列对之间的语义关系(Deng等人,2022 (https://arxiv.org/html/2607.25228#bib.bib1);Suhara等人,2022 (https://arxiv.org/html/2607.25228#bib.bib3);Miao和Wang,2023 (https://arxiv.org/html/2607.25228#bib.bib2))。这些标注支持下游应用,如数据集成、模式匹配、表格搜索和数据修复(Deng等人,2022 (https://arxiv.org/html/2607.25228#bib.bib1);Suhara等人,2022 (https://arxiv.org/html/2607.25228#bib.bib3);Miao和Wang,2023 (https://arxiv.org/html/2607.25228#bib.bib2);Liu等人,2026 (https://arxiv.org/html/2607.25228#bib.bib47);Chen等人,2026b (https://arxiv.org/html/2607.25228#bib.bib48),a (https://arxiv.org/html/2607.25228#bib.bib49);Sun等人,2026 (https://arxiv.org/html/2607.25228#bib.bib54))。

###### 示例0。图1 (https://arxiv.org/html/2607.25228#S0.F1) 用一张电影表说明了CA中的两个主要任务。CTA为每个目标列分配一个语义类型;例如,第一列被标注为Movie Name。CPA识别一个列对之间的有向语义关系;例如,从第一列到第二列的关系是Has Director。这些标签在语义上是相关的,而不是独立的。例如,Person是Director和Author的上位词,而Temporal Relation是Award Date和Release Year的上位词。显式建模这些上位词启发的关系有助于实现可解释的决策过程。

鉴于CA的重要性,已经开发了一系列方法。传统的基于知识库的CA方法通过将单元格值链接到参考知识库中的实体,并利用相关的类型和关系信息,来推导单个列和列对的语义标注(Limaye等人,2010 (https://arxiv.org/html/2607.25228#bib.bib26);Efthymiou等人,2017 (https://arxiv.org/html/2607.25228#bib.bib24);Luo等人,2018 (https://arxiv.org/html/2607.25228#bib.bib25))。然而,合适的知识库可能不可用,或者对现实世界的关系表覆盖有限。语言模型的进步为CA开辟了一个新范式。通过大规模预训练,语言模型获得了广泛的词汇和语义知识,并能够将异构的表格值置于上下文中,从而使其能够在没有显式实体链接或模式对齐的情况下推断潜在的列含义。基于这些能力,最近的CA研究要么直接通过提示大型语言模型(LLM)来推断语义标注(Feuer等人,2024 (https://arxiv.org/html/2607.25228#bib.bib4);Korini和Bizer,2023 (https://arxiv.org/html/2607.25228#bib.bib12),2024 (https://arxiv.org/html/2607.25228#bib.bib13)),要么从表格内容中学习上下文表示以进行下游预测(Suhara等人,2022 (https://arxiv.org/html/2607.25228#bib.bib3);Ding等人,2025 (https://arxiv.org/html/2607.25228#bib.bib5);Hoseinzade等人,2026 (https://arxiv.org/html/2607.25228#bib.bib6))。

**动机。** 现有方法仍然面临两个核心局限性。第一,现有方法提供的可解释性和自适应性有限。它们通常将表格内容编码为潜在表示,并通过全局参数化的预测器直接映射到标签类别。结果,每个预测背后的语义证据和中间决策在很大程度上仍然是隐含的。此外,它们的预测行为主要通过预定义表示内的参数优化来改进,这使得很难使决策过程适应不同标签组所需的语义证据。第二,现有方法忽略了标签空间的丰富语义,从而限制了CA的准确性。它们通常将标签视为独立的类标识符,尽管许多标签共享更广泛的语义概念并表现出有意义的层次关系。忽略这种结构使得预测无法分解为可解释的语义决策,并且在其适当的语义上下文内区分紧密相关的标签变得更加困难。

**挑战。** 在利用丰富的标签语义构建准确、可解释和自适应的CA方法方面,仍然存在两个挑战。**挑战1:标签语义空间的复杂性。** 标签语义的复杂性使得设计可解释且准确的CA方法具有挑战性。标签词汇通常继承自异构的本体类(如图1 (https://arxiv.org/html/2607.25228#S0.F1) 所示)和与Web表格相关的属性,而不是设计为任务特定的分类法。因此,标签在语义域、本体角色、抽象级别和标注范围上各不相同,而它们的边界和相互关系仍然不均匀或仅部分显式,导致范围重叠、跨领域依赖和非均匀的层次结构。**挑战2:复杂表格上下文中的标签歧义。** 复杂表格上下文中标签的歧义性使得设计可解释且自适应的CA方法具有挑战性。相同的标签可能由不同领域、来源和表示惯例下的完全不同的值实例化,而相同或相似的值可能对应不同的标签,具体取决于其周围的列和关系角色。因此,单个值或全局共享的值模式都不能唯一确定预期的语义。当信息性元数据(如标题或表格描述)不可用时,这种歧义性进一步放大,因此跨列值模式成为消歧的主要证据。因此,识别将观察到的值模式与适当的语义标签联系起来的表格特定证据仍然是一个基本挑战。

**我们的方法。** 为了解决这些挑战,我们提出了SymCA,一种基于LLM的可解释CA框架,它将列标注具体化为一个从全局到局部的符号化决策过程。SymCA包含两个阶段:(1)*全局骨架归纳*,它将标签语义组织成一个层次化骨架;以及(2)*局部基底演化*,它通过节点特定的基底演化将这个骨架具体化为一个自适应的符号化预测器。在全局层面,为了利用嵌入在标签中的复杂语义知识同时保持决策可解释性,SymCA利用预训练LLM的广泛世界知识和推理能力来推断上位词启发的关系,并将标签组织成树状结构的语义骨架,从而将全局标注分解为一系列局部化的语义决策。为了减少生成变异和提示敏感性,SymCA通过重复LLM推理构建多个候选骨架,并应用基于最小贝叶斯风险(MBR)的共识策略(Kumar和Byrne,2004 (https://arxiv.org/html/2607.25228#bib.bib10))来选择在候选骨架中预期结构分歧最小的鲁棒骨架。得到的骨架提供了标签空间语义结构的显式符号表示。在局部层面,为了将归纳出的语义骨架转化为可执行的CA预测器,我们为每个内部节点配备一个预测性基底,该基底在其子节点上执行特定于节点的语义分类。为了使这个决策过程可解释,每个基底使用一个随机森林分类器(Breiman,2001 (https://arxiv.org/html/2607.25228#bib.bib42))处理显式的符号操作符,这些操作符捕获对应节点特定的语义条件。由于不同的基底需要不同的证据来区分其子节点,每个基底通过三个阶段演化其操作符集。SymCA首先训练和评估当前基底以识别其局部预测中的缺陷,然后利用LLM提出节点特定的操作符修改,最后采用探索-利用策略来优先处理有前景的基底以进行高效的重新训练。

总之,本文做出以下贡献:
- • 我们引入了一个基于LLM的从全局到局部的CA框架,用于可解释和自适应的列标注,该框架通过全局骨架归纳和局部基底演化将标注决策过程具体化。
- • 我们开发了一种全局骨架归纳方法,通过多个LLM诱导的骨架候选和基于MBR的共识选择,将隐式的标签语义具体化为一个鲁棒的上位词启发的符号化骨架。
- • 我们开发了一种局部基底演化方法,通过基于随机森林的基底训练、LLM指导的基底修改和基于探索-利用的基底选择,将归纳出的骨架具体化为一个可演化的符号化预测器。
- • 我们进行了大量实验,证明SymCA提供了准确、鲁棒且可解释的标注,其在Micro-F1和Macro-F1上分别平均优于最强基线6.42%和11.03%。

## 2. 问题陈述

设 T = (c₁, c₂, ..., cₙ) 为一个具有n列的表格,其中cᵢ表示表格中的第i列。每列由一个单元格值序列组成,cᵢ = (zᵢ¹, zᵢ², ..., zᵢᵐ),其中zᵢʲ是列cᵢ中第j个单元格的值。遵循最先进的CA方法(Ding等人,2025 (https://arxiv.org/html/2607.25228#bib.bib5)),我们假设列标题和表格名称等元数据不可用,并仅从表格内容推断语义标注。

###### 定义0(列类型标注)。给定一个表格T,一个目标列cᵢ,以及一个预定义的列类型标签空间 ℒ^CTA,列类型标注旨在预测cᵢ的语义类型。任务是学习一个模型 F^CTA(T, cᵢ) ∈ ℒ^CTA。

###### 定义0(列属性标注)。给定一个表格T,一个有序目标列对 (cᵢ, cⱼ),以及一个预定义的列属性标签空间 ℒ^CPA,列属性标注旨在预测从cᵢ到cⱼ的语义属性。任务是学习一个模型 F^CPA(T, cᵢ, cⱼ) ∈ ℒ^CPA。

参见图注 图2. SymCA概述。模块1在标签空间上归纳出一个全局语义骨架,而模块2将其内部节点具体化为可演化的局部预测性基底。

## 3. 方法论

图2 (https://arxiv.org/html/2607.25228#S2.F2) 展示了SymCA,一个可解释的CA框架,它将CA具体化为一个从全局到局部的符号化决策过程。模块1将非结构化的标签词汇表转换为一个上位词启发的语义骨架(第3.1节 (https://arxiv.org/html/2607.25228#S3.SS1))。在这个全局结构的指导下,模块2定义了每个

相似文章

置信度感知对齐让推理型大语言模型更加可靠

arXiv cs.AI

本文介绍了CASPO框架,该框架通过迭代直接偏好优化(DPO),将token级别的置信度与大型推理模型中的逐步逻辑正确性进行对齐。文章还提出了置信度感知思考(CaT),用于在推理过程中动态剪枝不确定的推理分支,以提高可靠性和效率。

基于语义级奖励的LLM校准

arXiv cs.CL

提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。

面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)

arXiv cs.AI

本文提出了一种针对高风险领域LLM输出的神经符号验证架构,结合形式化符号方法与神经语义分析。在一个医疗器械损伤评估系统上进行的评估显示,该架构对结构化实体的幻觉检测率超过83%,语义虚构的检测率达72%,报告创建时间缩短30%。