超维计算在表格数据嵌入的结构化查询中的应用

arXiv cs.AI 论文

摘要

本文提出使用超维计算(特别是全息简化表示)对表格数据行进行嵌入以实现结构化查询,从而获得可解释的相似性阈值和零匹配检测,在行检索任务上优于基线方法。

arXiv:2606.13871v1 公告类型:新 摘要:表格数据嵌入已成为数据分析和数据集成管道的基石,支持实体标注与解析、模式匹配、列类型检测以及表格搜索等任务。现有方法将行、列或整个表格嵌入到向量空间中,并依靠最近邻搜索来检索候选匹配。当前嵌入方法的一个根本性局限是缺乏可解释的相似性分数:查询与其最近邻之间的具体相似性值没有内在含义,因此无法确定该邻域是真正的匹配还是仅是一个没有有效答案的语料库中差异最小的项。无法设置原则性阈值进行检索的做法损害了实际部署,尤其是在零匹配检测方面。 我们研究了超维计算(特别是全息简化表示模型)作为表格行嵌入框架的用途,当检索任务对应于在向量空间中回答结构化选择-投影查询时。利用HDC操作的代数性质,我们推导出等式和非等式检索谓词的闭式期望相似性值,随着维度的增加,这些值收敛到可解释的值,并利用这些值确定合适的检索阈值。我们在两个真实数据集上,针对不同的表格大小和谓词长度,将HDC与基于图的基线方法EmbDI进行了评估。结果表明,HDC在所有配置下的行检索中均达到或优于EmbDI,更稳健地处理非等式谓词,并在足够维度下实现完美的属性投影精度——同时通过其原则性阈值,能够可靠地识别零匹配谓词。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:10

# 面向表格数据嵌入结构化查询的超维计算
来源: https://arxiv.org/html/2606.13871
###### 摘要

表格数据嵌入已成为数据档案与数据整合流程的基石,支撑着实体标注与消解、模式匹配、列类型检测、表格搜索等任务。现有方法将行、列或整个表格嵌入向量空间,并依赖最近邻搜索来检索候选匹配。当前嵌入方法的一个根本局限在于缺乏可解释的相似度分数:查询与其最近邻之间的具体相似值本身并无内在含义,因此无法判断该近邻是真正的匹配,还是只是语料库中不存在有效答案时“最不差”的项。这种无法设定原则性检索阈值的缺陷阻碍了实际部署,特别是在零匹配检测场景中。

我们研究使用超维计算(HDC),特别是全息约简表示(HRR)模型,作为表格行嵌入的框架,其检索任务对应于在向量空间中回答结构化的选择-投影查询。利用HDC操作的代数性质,我们推导了等式及非等式检索谓词的闭式期望相似值,这些值随维度升高收敛至可解释数值,并基于此确定合适的检索阈值。我们在两个真实世界数据集上,针对不同表格大小和谓词长度,将HDC与基于图的基线方法EmbDI进行对比。实验结果表明,在所有配置下,HDC在行检索任务上均达到或超越EmbDI,对非等式谓词处理更为稳健,并在足够维度下实现了完美的属性投影精度——同时,通过其原则性阈值,HDC能唯一可靠地识别零匹配谓词。

## 1. 引言

表格数据广泛存在于企业私有数据仓库与公共网络中。然而,在这些环境中,表格数据常表现出高度异质性、噪声多、不完整,且缺乏指导正确解读的文档。因此,对数据进行全面预处理(如数据档案、清洗或与其他源整合)已成为从“野生”表格中提取有价值见解的关键。此类预处理任务包括模式映射(Parciak et al., 2025)、语义类型检测(亦称列类型标注)(Hulsebos et al., 2019)、实体标注、实体消解(Christophides et al., 2020)、表格搜索(Nargesian et al., 2018)等。

近年来,深度学习能力的提升和普及推动了基于机器学习的方法在这些任务中的应用(Cappuzzo et al., 2020; Hulsebos et al., 2019; Zhang et al., 2020; Li et al., 2020)。这些方法的核心是将表格数据嵌入向量空间(隐式或显式),旨在用某种(任务相关的)语义理解来增强显式数据(Cappuzzo et al., 2020; Khatiwada et al., 2023; Dong et al., 2023)。通常,对于对象类O,向量嵌入是一个从O到某向量空间(通常为有限维度d的R^d)的映射f。其构建理念是,向量空间中的几何关系应反映O中对象间的语义关系。重要的是,我们希望O中相似的对象被映射到在向量空间某个标准度量下彼此接近的向量。这使得我们能够针对查询对象,在已知对象的语料库中通过(近似)最近邻搜索找到语义相似的对象。例如,在实体标注中,可以计算单个表格单元格(可能结合表格中相邻单元格信息)的向量嵌入,并在已知语料库中寻找最近邻以获取候选链接实体,然后将这些候选传递给其他机器学习模型或基于逻辑的系统,以类似RAG的方式完成任务。类似地,在列类型检测中,嵌入整个表格列;在实体消解中,嵌入表格行。

因此,不同的表格数据嵌入方法试图在不同粒度上捕捉表格中的信息和关系,生成单元格、行、列或它们的集合(可能包含整个表格)的嵌入。对于上述许多任务,表格嵌入的一个重要需求是相似度分数的可解释性。实际上,虽然最近邻搜索允许按距离排序检索候选匹配,但仅凭这一点无法指定何时没有候选匹配“足够好”。例如,查询与其最近邻之间的余弦相似度为0.72,这可能意味着匹配极佳(如果嵌入空间校准良好且0.72在上下文中很高),也可能意味着匹配不佳(如果语料库中根本不存在正确答案,0.72是最近错误答案的分数)。这种区别具有实际意义。例如在SemTab实体标注挑战赛中,需要正确识别知识图谱中无对应实体的单元格。同样,在列类型检测中,需要识别何时没有合适的预定义类型;在表格联合搜索中,需要识别何时没有合适的可联合表格。

对于此类任务,我们追求可解释的嵌入方法,能够指定相似度阈值,低于该阈值的候选匹配应被忽略。相比之下,大多数当代嵌入方法在此意义上是不透明的。总体而言,我们可以识别两类嵌入方法:(i) 将单元格、行和/或列表示为图中的节点,并使用图表示学习推导嵌入(Cappuzzo et al., 2020; Cucumides and Geerts, 2025; Chen et al., 2023; Tchuitcheu et al., 2024);(ii) 将表格序列化为文本字符串,输入LLM进行基于注意力的嵌入(Deng et al., 2022; Yin et al., 2020; Herzig et al., 2020; Iida et al., 2021)。这两类方法都无法提供普遍可解释的距离分数。

我们假设超维计算(HDC)(Kanerva, 2009; Thomas et al., 2022)可能为设计可解释的表格数据向量嵌入提供了一个通用框架。HDC是一种符号式表示学习方法,通过简单的向量操作——绑定、捆绑和解绑——将结构化信息编码到高维空间中。它已成功应用于自然语言处理、计算机视觉和机器人等多个领域,且由于计算效率高,是传统神经方法的令人信服的替代方案(Kleyko et al., 2022)。此外,它基于操作的代数性质提供了定义相似度阈值的原则性方法,以及一个可解释的框架,用于从编码实体中提取信息并具有概率保证(Thomas et al., 2022)。

本文初步研究HDC在定义表格嵌入(特别是行嵌入)方面的适用性。我们借鉴Mellouli和Papotti(2025)的工作,他们论证对于行嵌入,“语义相似性”的合理概念应对应于直接在嵌入向量空间(而非原始表格数据)上回答简单的选择-投影查询。举例说明,考虑模式为{A, B, C}的表格。那么,找到与部分行(A:a, B:b)的嵌入最相似的行,对应于在输入表T上执行关系代数选择查询σ_{A=a,B=b}(T)。此外,给定T中一行的嵌入和一个属性A,找到该行在属性A上的值的嵌入,对应于能够在嵌入上执行投影查询。特别地,Mellouli和Papotti展示了由EmbDI嵌入框架生成的嵌入具有在它们上执行结构化查询的属性,而如何在基于LLM的方法上直接实现这一点尚不明确。EmbDI是一种基于图的嵌入方法,专为通用数据整合任务设计,无需大量训练(Cappuzzo et al., 2020)。因此,我们将其视为与HDC比较的合适基线,因为它提供了行嵌入的高级定义,且非基于LLM。

我们的贡献包括三方面:

1. (1) 我们讨论了如何使用HDC进行行嵌入,从而允许结构化的选择-投影查询。
2. (2) 我们理论推导了HDC此类查询的阈值,可以区分匹配与非匹配。
3. (3) 我们通过实验比较了HDC和EmbDI在结构化查询上的表现。结果表明,在所有配置下,HDC在行检索任务上达到或超越EmbDI;对非等式谓词处理更稳健;提高了属性投影精度,尤其是在投影列基数较低时。此外,通过其原则性阈值,HDC能够可靠地识别零匹配谓词,这是EmbDI无法实现的。

总体而言,这说明了HDC适用于基于行的嵌入。它是否适用于其他类型的嵌入仍有待研究;我们在第7节中讨论了这方面的必要未来工作。

本文其余部分组织如下。第2节讨论相关工作,第3节介绍问题陈述和必要背景。第4节介绍HDC,讨论如何将其用于结构化查询,并推导理论阈值。实验设置在第5节,实验结果在第6节。我们在第7节进行总结并讨论未来工作。感兴趣的审稿人可以在附录中找到形式化声明的证明以及额外的实验结果。附录不被视为提交的一部分,审稿人可自行决定是否阅读。

## 2. 相关工作

**表格数据嵌入**。表格数据嵌入方法大致分为两类。基于图的方法从表格实体构建图并应用表示学习:EmbDI (Cappuzzo et al., 2020) 构建一个关于行、列和值的三部图,并在随机游走上训练词嵌入;HyTrel (Chen et al., 2023) 使用超图表示表格实体和关系,然后使用Transformer层进行嵌入;Tchuitcheu等人 (2024) 提出了编码单元格位置的异构图嵌入。基于LLM的方法将表格序列化为文本并利用注意力机制:TaBERT (Yin et al., 2020)、TaPas (Herzig et al., 2020)、TURL (Deng et al., 2022) 和 TABBIE (Iida et al., 2021) 均属于此类。这些方法生成的向量之间的具体相似值如何解释尚不明确,因此如何为检索任务设定阈值也不清楚。我们的工作将HDC作为第三种符号替代方案,可以推导出原则性阈值。

**通用嵌入**。一些研究致力于生成跨数据集的通用嵌入以支持下游整合任务。可联合表发现 (Dong et al., 2023) 依赖于列级相似性;模式匹配 (Parciak et al., 2025) 在模式级别操作;实体消解 (Christophides et al., 2020) 和列类型标注 (Zhang et al., 2020) 分别需要单元格级和列级嵌入。然而,这些方法是任务特异的,在其他设置中相似值无法泛化。EmbDI (Cappuzzo et al., 2020) 旨在通过单一嵌入涵盖多个任务,而Franz等人 (2025) 使用图自编码器方法提出了表格数据的通用嵌入。鉴于HDC轻量级、组合式的框架能够为不同类型结构生成嵌入,它自然适用于此类设置。本文重点研究基于行的嵌入。

**HDC中的阈值设定**。对于我们使用并将在第4.1节描述的特定HDC模型(HRR模型),已有关于相似值理论分析的工作,但针对的解码任务和向量分布与本工作考虑的不同。我们在第4.3节详细讨论差异。

## 3. 预备知识

本节介绍符号和问题陈述,然后介绍EmbDI——我们在实验中作为基线的嵌入方法。

**符号**。我们假设给定两个不相交的集合A(属性名)和B(值),用小写字母(如a, b, c)表示A∪B中的元素。向量用粗体小写字母(如a, b, c)表示,维度为d。索引用方括号表示(如a[i],0≤i≤d-1),在明确时,x表示x的向量表示。我们将...# 面向表格数据嵌入结构化查询的超维计算
来源: https://arxiv.org/html/2606.13871
###### 摘要

表格数据嵌入已成为数据档案与数据整合流程的基石,支撑着实体标注与消解、模式匹配、列类型检测、表格搜索等任务。现有方法将行、列或整个表格嵌入向量空间,并依赖最近邻搜索来检索候选匹配。当前嵌入方法的一个根本局限在于缺乏可解释的相似度分数:查询与其最近邻之间的具体相似值本身并无内在含义,因此无法判断该近邻是真正的匹配,还是只是语料库中不存在有效答案时“最不差”的项。这种无法设定原则性检索阈值的缺陷阻碍了实际部署,特别是在零匹配检测场景中。

我们研究使用超维计算(HDC),特别是全息约简表示(HRR)模型,作为表格行嵌入的框架,其检索任务对应于在向量空间中回答结构化的选择-投影查询。利用HDC操作的代数性质,我们推导了等式及非等式检索谓词的闭式期望相似值,这些值随维度升高收敛至可解释数值,并基于此确定合适的检索阈值。我们在两个真实世界数据集上,针对不同表格大小和谓词长度,将HDC与基于图的基线方法EmbDI进行对比。实验结果表明,在所有配置下,HDC在行检索任务上均达到或超越EmbDI,对非等式谓词处理更为稳健,并在足够维度下实现了完美的属性投影精度——同时,通过其原则性阈值,HDC能唯一可靠地识别零匹配谓词。

## 1. 引言

表格数据广泛存在于企业私有数据仓库与公共网络中。然而,在这些环境中,表格数据常表现出高度异质性、噪声多、不完整,且缺乏指导正确解读的文档。因此,对数据进行全面预处理(如数据档案、清洗或与其他源整合)已成为从“野生”表格中提取有价值见解的关键。此类预处理任务包括模式映射(Parciak et al., 2025)、语义类型检测(亦称列类型标注)(Hulsebos et al., 2019)、实体标注、实体消解(Christophides et al., 2020)、表格搜索(Nargesian et al., 2018)等。

近年来,深度学习能力的提升和普及推动了基于机器学习的方法在这些任务中的应用(Cappuzzo et al., 2020; Hulsebos et al., 2019; Zhang et al., 2020; Li et al., 2020)。这些方法的核心是将表格数据嵌入向量空间(隐式或显式),旨在用某种(任务相关的)语义理解来增强显式数据(Cappuzzo et al., 2020; Khatiwada et al., 2023; Dong et al., 2023)。通常,对于对象类O,向量嵌入是一个从O到某向量空间(通常为有限维度d的R^d)的映射f。其构建理念是,向量空间中的几何关系应反映O中对象间的语义关系。重要的是,我们希望O中相似的对象被映射到在向量空间某个标准度量下彼此接近的向量。这使得我们能够针对查询对象,在已知对象的语料库中通过(近似)最近邻搜索找到语义相似的对象。例如,在实体标注中,可以计算单个表格单元格(可能结合表格中相邻单元格信息)的向量嵌入,并在已知语料库中寻找最近邻以获取候选链接实体,然后将这些候选传递给其他机器学习模型或基于逻辑的系统,以类似RAG的方式完成任务。类似地,在列类型检测中,嵌入整个表格列;在实体消解中,嵌入表格行。

因此,不同的表格数据嵌入方法试图在不同粒度上捕捉表格中的信息和关系,生成单元格、行、列或它们的集合(可能包含整个表格)的嵌入。对于上述许多任务,表格嵌入的一个重要需求是相似度分数的可解释性。实际上,虽然最近邻搜索允许按距离排序检索候选匹配,但仅凭这一点无法指定何时没有候选匹配“足够好”。例如,查询与其最近邻之间的余弦相似度为0.72,这可能意味着匹配极佳(如果嵌入空间校准良好且0.72在上下文中很高),也可能意味着匹配不佳(如果语料库中根本不存在正确答案,0.72是最近错误答案的分数)。这种区别具有实际意义。例如在SemTab实体标注挑战赛中,需要正确识别知识图谱中无对应实体的单元格。同样,在列类型检测中,需要识别何时没有合适的预定义类型;在表格联合搜索中,需要识别何时没有合适的可联合表格。

对于此类任务,我们追求可解释的嵌入方法,能够指定相似度阈值,低于该阈值的候选匹配应被忽略。相比之下,大多数当代嵌入方法在此意义上是不透明的。总体而言,我们可以识别两类嵌入方法:(i) 将单元格、行和/或列表示为图中的节点,并使用图表示学习推导嵌入(Cappuzzo et al., 2020; Cucumides and Geerts, 2025; Chen et al., 2023; Tchuitcheu et al., 2024);(ii) 将表格序列化为文本字符串,输入LLM进行基于注意力的嵌入(Deng et al., 2022; Yin et al., 2020; Herzig et al., 2020; Iida et al., 2021)。这两类方法都无法提供普遍可解释的距离分数。

我们假设超维计算(HDC)(Kanerva, 2009; Thomas et al., 2022)可能为设计可解释的表格数据向量嵌入提供了一个通用框架。HDC是一种符号式表示学习方法,通过简单的向量操作——绑定、捆绑和解绑——将结构化信息编码到高维空间中。它已成功应用于自然语言处理、计算机视觉和机器人等多个领域,且由于计算效率高,是传统神经方法的令人信服的替代方案(Kleyko et al., 2022)。此外,它基于操作的代数性质提供了定义相似度阈值的原则性方法,以及一个可解释的框架,用于从编码实体中提取信息并具有概率保证(Thomas et al., 2022)。

本文初步研究HDC在定义表格嵌入(特别是行嵌入)方面的适用性。我们借鉴Mellouli和Papotti(2025)的工作,他们论证对于行嵌入,“语义相似性”的合理概念应对应于直接在嵌入向量空间(而非原始表格数据)上回答简单的选择-投影查询。举例说明,考虑模式为{A, B, C}的表格。那么,找到与部分行(A:a, B:b)的嵌入最相似的行,对应于在输入表T上执行关系代数选择查询σ_{A=a,B=b}(T)。此外,给定T中一行的嵌入和一个属性A,找到该行在属性A上的值的嵌入,对应于能够在嵌入上执行投影查询。特别地,Mellouli和Papotti展示了由EmbDI嵌入框架生成的嵌入具有在它们上执行结构化查询的属性,而如何在基于LLM的方法上直接实现这一点尚不明确。EmbDI是一种基于图的嵌入方法,专为通用数据整合任务设计,无需大量训练(Cappuzzo et al., 2020)。因此,我们将其视为与HDC比较的合适基线,因为它提供了行嵌入的高级定义,且非基于LLM。

我们的贡献包括三方面:

1. (1) 我们讨论了如何使用HDC进行行嵌入,从而允许结构化的选择-投影查询。
2. (2) 我们理论推导了HDC此类查询的阈值,可以区分匹配与非匹配。
3. (3) 我们通过实验比较了HDC和EmbDI在结构化查询上的表现。结果表明,在所有配置下,HDC在行检索任务上达到或超越EmbDI;对非等式谓词处理更稳健;提高了属性投影精度,尤其是在投影列基数较低时。此外,通过其原则性阈值,HDC能够可靠地识别零匹配谓词,这是EmbDI无法实现的。

总体而言,这说明了HDC适用于基于行的嵌入。它是否适用于其他类型的嵌入仍有待研究;我们在第7节中讨论了这方面的必要未来工作。

本文其余部分组织如下。第2节讨论相关工作,第3节介绍问题陈述和必要背景。第4节介绍HDC,讨论如何将其用于结构化查询,并推导理论阈值。实验设置在第5节,实验结果在第6节。我们在第7节进行总结并讨论未来工作。感兴趣的审稿人可以在附录中找到形式化声明的证明以及额外的实验结果。附录不被视为提交的一部分,审稿人可自行决定是否阅读。

## 2. 相关工作

**表格数据嵌入**。表格数据嵌入方法大致分为两类。基于图的方法从表格实体构建图并应用表示学习:EmbDI (Cappuzzo et al., 2020) 构建一个关于行、列和值的三部图,并在随机游走上训练词嵌入;HyTrel (Chen et al., 2023) 使用超图表示表格实体和关系,然后使用Transformer层进行嵌入;Tchuitcheu等人 (2024) 提出了编码单元格位置的异构图嵌入。基于LLM的方法将表格序列化为文本并利用注意力机制:TaBERT (Yin et al., 2020)、TaPas (Herzig et al., 2020)、TURL (Deng et al., 2022) 和 TABBIE (Iida et al., 2021) 均属于此类。这些方法生成的向量之间的具体相似值如何解释尚不明确,因此如何为检索任务设定阈值也不清楚。我们的工作将HDC作为第三种符号替代方案,可以推导出原则性阈值。

**通用嵌入**。一些研究致力于生成跨数据集的通用嵌入以支持下游整合任务。可联合表发现 (Dong et al., 2023) 依赖于列级相似性;模式匹配 (Parciak et al., 2025) 在模式级别操作;实体消解 (Christophides et al., 2020) 和列类型标注 (Zhang et al., 2020) 分别需要单元格级和列级嵌入。然而,这些方法是任务特异的,在其他设置中相似值无法泛化。EmbDI (Cappuzzo et al., 2020) 旨在通过单一嵌入涵盖多个任务,而Franz等人 (2025) 使用图自编码器方法提出了表格数据的通用嵌入。鉴于HDC轻量级、组合式的框架能够为不同类型结构生成嵌入,它自然适用于此类设置。本文重点研究基于行的嵌入。

**HDC中的阈值设定**。对于我们使用并将在第4.1节描述的特定HDC模型(HRR模型),已有关于相似值理论分析的工作,但针对的解码任务和向量分布与本工作考虑的不同。我们在第4.3节详细讨论差异。

## 3. 预备知识

本节介绍符号和问题陈述,然后介绍EmbDI——我们在实验中作为基线的嵌入方法。

**符号**。我们假设给定两个不相交的集合A(属性名)和B(值),用小写字母(如a, b, c)表示A∪B中的元素。向量用粗体小写字母(如a, b, c)表示,维度为d。索引用方括号表示(如a[i],0≤i≤d-1),在明确时,x表示x的向量表示。

相似文章

通过Nyström方法弥合超维计算与核方法之间的差距

arXiv cs.LG

本文介绍了NysHD,一种通过Nyström近似将超维计算与核方法桥接起来的方法,允许任何正半定相似性函数用作HDC编码。与现有HDC编码方法相比,它在图数据集和字符串数据集上展示了更高的分类准确率。

通过信息多视图投影可视化高维图嵌入

arXiv cs.LG

提出了一种将图嵌入高维空间并搜索信息性二维视角的方法,这些视角优化了美学和可读性指标(例如边交叉和角分辨率),这得益于一种新颖的边交叉可微替代方法。引入了一个交互式系统DataFly,用于探索多个候选视角。