RelGT-AC:用于关系数据库中自动补全任务的关系图变换器

arXiv cs.AI 论文

摘要

本文介绍了RelGT-AC,一种专门为关系数据库中的自动补全任务设计的关系图变换器架构。该模型在RelGT架构基础上扩展了列掩码以防止平凡解、用于多种预测类型的统一任务头,以及利用词汇信号的TF-IDF文本编码器,在RelBench v2基准测试上取得了显著优于基线的改进。

arXiv:2606.03040v1 公告类型:新 摘要:关系数据库是现代企业、科学和医疗系统的基础,但由于其多表、异构和时间结构,这类数据上的预测性机器学习仍具挑战性。关系深度学习通过将数据库表示为异构图并直接应用图神经网络来应对这一挑战。RelBench v2 最近引入了自动补全任务——一种实际驱动的任务类型,其目标是从关系上下文中预测现有列值,类似于智能表单填写助手。我们提出了 RelGT-AC(用于自动补全的关系图变换器),在 RelGT 架构基础上扩展了三项针对性贡献:(1)一种列掩码策略,通过在子图编码期间掩码目标列来防止平凡解;(2)一个统一的预测头,支持在单一模型内进行二分类、多分类和回归自动补全任务;(3)一个 TF-IDF 文本编码器,能够自动检测并编码自由文本列,恢复分类编码器丢弃的强词汇信号。在跨 3 个 RelBench v2 数据集(rel-trial、rel-f1、rel-stack)的 7 个任务上,RelGT-AC 在所有 3 个回归自动补全任务上优于 GraphSAGE 基线,并通过 TF-IDF 编码器在文本密集的资格任务上实现了高达 +10 AUROC 点的提升。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:42

# 关系数据库自动补全任务的关系图Transformer
来源:https://arxiv.org/html/2606.03040

###### 摘要

关系数据库是现代企业、科学和医疗系统的基石,然而由于数据具有多表、异构和时序结构的特点,在此类数据上进行预测性机器学习仍然充满挑战。关系深度学习(RDL)通过将数据库表示为异构图,并直接应用图神经网络(GNN)来解决这一问题。RelBench v2 最近引入了*自动补全任务*——一种具有实际应用价值的任务类型,其目标是从关系上下文中预测已有的列值,类似于智能表单填写助手。虽然 v2 基准测试表明 GNN 在这些任务上显著优于单表基线,但针对自动补全的专用架构设计仍未被探索。我们提出了 RelGT-AC(用于自动补全的关系图Transformer),在 RelGT 架构基础上做出了三项有针对性的贡献:(1)一种*列掩码*策略,通过在子图编码期间掩盖目标列,迫使模型依赖关系上下文,从而防止模型找到简单解;(2)一个*统一任务头*,支持在一个模型内处理二分类、多分类和回归自动补全任务;(3)一个*TF-IDF 文本编码器*,能够自动检测并编码自由文本列,恢复分类编码器丢弃的强词汇信号。在覆盖 3 个 RelBench v2 数据集(rel-trial、rel-f1、rel-stack)的 7 个任务中,RelGT-AC 在所有 3 个回归自动补全任务上均优于 GraphSAGE 基线(qualifying-position 的 R² 提升 +0.224,enrollment 的 R² 提升 +0.436),在 4 个分类任务中的 2 个上也表现更优。在文本密集的 eligibility 任务中,TF-IDF 编码器贡献了高达 +10 个 AUROC 点;若没有它,模型将退化为分类编码,失去大部分词汇信号。消融研究证实,对于文本丰富的关系型任务,TF-IDF 文本编码器是最具影响力的贡献。

## 1 引言

关系数据库是企业、科学和医疗系统中结构化数据的主要存储抽象(Gu et al., 2026 (https://arxiv.org/html/2606.03040#bib.bib4))。一个生产级的数据库可能包含数十个相互关联的表,通过主键-外键(PK-FK)关系连接,编码了丰富的结构信息,而平面表格机器学习方法会丢弃这些信息。*关系深度学习*(RDL)(Dwivedi et al., 2025 (https://arxiv.org/html/2606.03040#bib.bib2))通过将数据库表示为*关系实体图*——一种异构图,其中每个表行是一个节点,每个 FK 链接是一条边——并直接对整个多表结构应用图神经网络(GNN)来解决这一问题。

RelBench 基准测试(Robinson et al., 2023 (https://arxiv.org/html/2606.03040#bib.bib15); Gu et al., 2026 (https://arxiv.org/html/2606.03040#bib.bib4))为 RDL 提供了标准化的评估平台,涵盖了企业、学术、消费和医疗领域的 11 个数据集。RelBench v2 引入了自动补全任务:模型不是预测通过 SQL 构建的未来值(如在标准预测任务中),而是必须根据其他已填充的列和关系上下文预测一个行中*已有的列值*。其实际动机非常直接:销售订单系统必须根据存储在相关表中的客户历史记录推荐付款条款、运输条件或贸易术语。

参见图注 图1:自动补全任务需要从关系上下文中预测已有的列值。RelGT-AC 的 Transformer 注意力(右图)选择性地关注信息最丰富的 FK 连接行,而 GraphSAGE 则对所有邻居进行同等平均。尽管 GraphSAGE 基线在 RelBench v2 自动补全任务上取得了强劲的结果,但仍有两个基本问题未得到解答:(Q1) 基于 Transformer 的全局注意力是否优于邻域聚合用于自动补全?如果是,原因是什么?(Q2) 应该如何设计模型架构以防止模型简单地读取目标列值而不是从关系上下文中学习?

我们通过 RelGT-AC 来解决这两个问题:

- •列掩码(第4.2节 (https://arxiv.org/html/2606.03040#S4.SS2)):对于自动补全任务,目标列存在于输入行中。如果不进行显式掩码,模型可以轻易获得近乎完美的性能。我们引入了一个列掩码层,在子图编码之前将目标列(以及相关列)置零。
- •统一任务头(第4.7节 (https://arxiv.org/html/2606.03040#S4.SS7)):单个 RelGT-AC 模型通过任务类型条件化的输出头,同时处理预测任务(预测未来的 SQL 构建标签)和自动补全任务(预测已有的列值),从而在不同任务类型之间共享关系表示。
- •TF-IDF 文本编码器(第4.4节 (https://arxiv.org/html/2606.03040#S4.SS4)):我们发现,标准的分类编码器通过将唯一字符串映射到未知索引嵌入,丢弃了自由文本列(例如,资格标准描述、产品标题)中的所有词汇信号。我们的自动 TF-IDF 编码器能够检测并编码自由文本列,在文本密集的任务上贡献高达 +10 个 AUROC 点,且无需任何预训练语言模型。
- •注意力分析(第6节 (https://arxiv.org/html/2606.03040#S6)):我们可视化和量化了在自动补全查询中哪些 FK 连接的行获得了较高的注意力权重,从而从机制上解释了为什么全局注意力优于局部聚合。

我们在 4 个 RelBench v2 数据集的 18 个任务上的实验表明,RelGT-AC 始终优于 GraphSAGE 基线、单表 LightGBM 以及未使用掩码的 RelGT 变体。我们已发布代码和模型检查点,以确保可重复性和进一步的研究。

## 2 背景与相关工作

### 2.1 关系深度学习

关系实体图将多表关系数据库形式化为异构图 G = (V, E, T, R),其中节点类型 T 对应于表,边类型 R 对应于 FK 关系,每个节点携带表格特征(数值、类别、文本、时序)(Dwivedi et al., 2025 (https://arxiv.org/html/2606.03040#bib.bib2); Fey et al., 2024 (https://arxiv.org/html/2606.03040#bib.bib23))。RDL 模型对 G 应用具有时间约束的 GNN:在预测时,仅时间戳 ≤ 种子时间的数据可见。

GNN 基线。图卷积网络(Kipf and Welling, 2017 (https://arxiv.org/html/2606.03040#bib.bib27))和图注意力网络(Veličković et al., 2018 (https://arxiv.org/html/2606.03040#bib.bib32))通过消息传递(Gilmer et al., 2017 (https://arxiv.org/html/2606.03040#bib.bib24))奠定了节点级表示学习的基础。使用求和聚合的 HeteroGraphSAGE(Hamilton et al., 2017 (https://arxiv.org/html/2606.03040#bib.bib5))是标准的 RDL 基线,已在官方 RelBench 代码库中实现。异构图 Transformer(HGT)(Hu et al., 2020 (https://arxiv.org/html/2606.03040#bib.bib9))通过类型相关的注意力矩阵对其进行了扩展。RelGNN(Chen et al., 2025 (https://arxiv.org/html/2606.03040#bib.bib21))提出了跨 FK 连接边的复合消息传递,在 RelBench v1 任务上取得了强劲的结果。Peleška 和 Šír(Peleška and Šír, 2024 (https://arxiv.org/html/2606.03040#bib.bib29))研究了如何将原始 Transformer 直接应用于关系数据库。

图 Transformer。Transformer(Vaswani et al., 2017 (https://arxiv.org/html/2606.03040#bib.bib31))及其在图上应用(Ying et al., 2021 (https://arxiv.org/html/2606.03040#bib.bib33))启发了将图节点视为序列令牌的想法。GPS(Rampášek et al., 2022 (https://arxiv.org/html/2606.03040#bib.bib13))将局部 MPNN 聚合与全局 Transformer 注意力并行结合,在图基准测试上达到了最先进的性能。RelGT(Dwivedi et al., 2026 (https://arxiv.org/html/2606.03040#bib.bib3))通过多元素令牌化(每个节点 5 个令牌:特征、类型、跳数距离、时间、结构)和时序感知位置编码,将其扩展到关系数据库。

### 2.2 关系基础模型

关系 Transformer(RT)(Ranjan et al., 2026 (https://arxiv.org/html/2606.03040#bib.bib14))引入了带有表/列元数据的单元格级令牌化和掩码令牌预测预训练,在二分类任务上实现了 93% AUROC 的零样本性能。Griffin(Wang et al., 2025 (https://arxiv.org/html/2606.03040#bib.bib16))将交叉注意力模块与增强型 MPNN 结合,构建了首个以图为中心的 RDB 基础模型,在超过 1.5 亿个节点上进行了预训练。KumoRFM-2(Hudovernik et al., 2026 (https://arxiv.org/html/2606.03040#bib.bib10))通过早期任务注入和原生多表处理,将上下文学习扩展到十亿规模的关系数据库。RDB-PFN(Wang et al., 2026 (https://arxiv.org/html/2606.03040#bib.bib17))仅在由结构因果模型生成的合成关系数据库上训练,无需真实训练数据即可实现强大的少样本性能。PluRel(Kothapalli et al., 2026 (https://arxiv.org/html/2606.03040#bib.bib11))展示了 RFM 预训练损失随合成数据库数量呈现幂律缩放规律。

### 2.3 图与表格的掩码学习

GraphMAE(Hou et al., 2022 (https://arxiv.org/html/2606.03040#bib.bib7))和 GraphMAE2(Hou et al., 2023 (https://arxiv.org/html/2606.03040#bib.bib8))证明了掩码特征重建是图的一种有效的自监督目标。对于表格数据,深度学习模型如 FT-Transformer(Gorishniy et al., 2021 (https://arxiv.org/html/2606.03040#bib.bib25))和 TabPFN v2(Hollmann et al., 2025 (https://arxiv.org/html/2606.03040#bib.bib6))推动了结构化数据的最新技术。TabICL(Qu et al., 2025 (https://arxiv.org/html/2606.03040#bib.bib30))将上下文表格学习扩展到更大的数据集。与此同时,Klein 等人(2024 (https://arxiv.org/html/2606.03040#bib.bib28))引入了 SALT 数据集——一个面向 B2B 销售表格的商业自动补全基准——展示了行业对关系型表单填充的需求。我们的列掩码策略直接受 GraphMAE2 的掩码编码启发,并针对有监督的异构图关系场景进行了适配。

关键空白。上述工作均未系统性地研究 RelBench v2 中的自动补全任务,也未提出专门为此类任务设计的架构。RelGT-AC 填补了这一空白。

## 3 关系数据库中的自动补全任务

### 3.1 任务定义

设 D = {T_1, ..., T_K} 是一个通过 PK-FK 关系连接表的关系数据库。一个*预测任务*指定一个种子实体 e_i 在时间 t_i,以及一个基于 t_i 之后数据通过 SQL 构建的标签 y_i(例如,30 天内的流失)。

一个*自动补全任务*指定一个行 (r, T),其中 r 是表 T 中的一行,而 y = r[c*] 是 r 中一个已有的列值(例如,销售订单的付款条款)。在预测时,c* 和相关列 C^drop 会从 r 的特征中移除;模型必须根据 r 中剩余的特征以及通过 FK 链接从 r 可达的关系上下文来推断 y。

### 3.2 防止数据泄漏

如果没有精心设计,自动补全任务存在两种泄漏来源:

1. 直接泄漏:目标列 c* 存在于节点特征中 → 通过列掩码(第4.2节 (https://arxiv.org/html/2606.03040#S4.SS2))进行预防。
2. 相关性泄漏:与 c* 相关的列会透露答案 → 通过丢弃 C^drop(由 RelBench v2 为每个任务指定)进行预防。

### 3.3 自动补全与掩码预训练的比较

自动补全任务在结构上类似于 BERT(Devlin et al., 2019 (https://arxiv.org/html/2606.03040#bib.bib1))和 GraphMAE2(Hou et al., 2023 (https://arxiv.org/html/2606.03040#bib.bib8))中的掩码令牌预测,但关键区别在于:它是*有监督的*(标签是真实的列值),作用于*异构图关系图*(而非文本或同构图),并且需要*时间约束*(只有过去的 FK 连接数据可见)。

## 4 方法:RelGT-AC

### 4.1 架构概述

RelGT-AC 建立在 RelGT 骨干(Dwivedi et al., 2026 (https://arxiv.org/html/2606.03040#bib.bib3))之上,并进行了三项扩展。图2 (https://arxiv.org/html/2606.03040#S4.F2) 显示了完整的架构。

参见图注 图2:RelGT-AC 架构。列掩码器(红色框)是用于自动补全任务的关键新增组件。统一任务头(蓝色框)支持在单个模型中处理所有四种任务类型。
### 4.2 列掩码

对于自动补全任务,种子行包含目标列值 y = r[c*]。如果 c* 被编码为特征,任何模型都可以通过直接读取它来实现近乎完美的性能——这不是关系学习,而是恒等映射。

我们引入了一个在特征编码之前应用的 AutocompleteColumnMasker:

f̃_v = { 0  如果 v 是种子节点且列属于 {c*} ∪ C^drop; f_v  否则 }   (1)

其中 v_seed 是种子节点(被预测的行),c* 是目标列,C^drop 是 RelBench v2 指定的相关列。关键在于,掩码*仅应用于种子节点*——FK 连接的上下文行保留其完整特征,包括它们自身的 c* 值,这提供了关系信号。

这种设计有一个重要的后果:模型被迫学习到*FK 连接行中的列值可以预测种子行中的列值*。例如,在 rel-trial/eligibilities-adult 任务中,模型学习到研究的方案、条件和干预措施(在 FK 连接的表中可见)可以预测该资格标准是否针对成人。

### 4.3 多元素令牌化

遵循 RelGT(Dwivedi et al., 2026 (https://arxiv.org/html/2606.03040#bib.bib3)),每个节点 v 被分解为 5 种令牌类型:

z_v = e_feat(v) + e_type(τ(v)) + e_hop(d_v) + e_time(Δt_v) + e_struct(deg(v))   (2)

其中 τ(v) 是表类型,d_v 是到种子节点的跳数距离,Δt_v 是与种子节点的时间差,deg(v) 是局部度数。

对于自动补全的种子节点,e_feat(v) 根据掩码特征 f̃_v 计算,而上下文节点则使用未掩码特征。

### 4.4 文本感知特征编码

关系数据库经常包含自由文本列——标准描述、产品标题、临床笔记、用户简介——这些列在自动补全任务中携带强大的预测信号。原始的 RelGT 特征编码器将所有非数值列视为类别型,将每个唯一字符串映射到一个学习的嵌入索引。这种方法对自由文本列无效,因为几乎每一行都包含一个唯一的字符串,导致大多数值被映射到未知索引的嵌入,从而丢失了所有词汇信号。

相似文章

UniT:基于分组自回归Transformer的统一几何学习

Hugging Face Daily Papers

UniT是一种统一的几何感知前馈模型,采用分组自回归Transformer,集成了多种范式(在线/离线、多模态、长时域),同时通过自适应尺度损失和队列式KV缓存保持度量尺度精度。它在涵盖七个任务的十个基准上取得了最先进性能。

GiLT:利用依存图增强Transformer语言模型

arXiv cs.CL

论文提出了GiLT(Graph-Infused Layers Transformer Language Model),它通过在token预测过程中增量构建的依存图特征来调整注意力权重,从而改善句法泛化能力,在保持竞争性困惑度的同时超越基线模型。

面向关系数据的异常检测

arXiv cs.LG

本文介绍了RelAD,一个基于重构的框架,用于检测关系数据库中的异常,通过联合建模属性和关系边重构。在六个新基准上的大量实验表明,RelAD优于现有方法。