课程设计至关重要:基于合成数据的高效数据关系型PFN预训练

arXiv cs.LG 论文

摘要

本文研究了课程设计和合成数据多样性如何影响关系型先验数据拟合网络(PFN)的预训练,结果表明渐进式课程可以用远少于RDB-PFN的合成数据达到或接近其性能。

arXiv:2607.29120v1 公告类型:新论文 摘要:关系型先验数据拟合网络(PFN),如RDB-PFN,通过在数百万个合成任务上进行预训练,来近似多表关系数据库上的贝叶斯推断。我们研究了关于这一范式的三个相互交织的问题。第一,结构不同的合成生成器PluRel能否替代RDB-PFN的先验?第二,合成数据呈现给PFN的顺序对下游性能有多大影响?第三,在引入任何关系数据之前,仅通过单表合成预训练,PFN能获得多少关系推理能力?在所有实验中仅使用PluRel作为合成数据来源,我们发现:(i)一种渐进式单表课程,将模式复杂度从7列逐步扩展到17列,在23任务表格基准上达到了0.703的平均ROC-AUC,仅使用了约13,300个合成表(比RDB-PFN报告的热身方案少约45倍的单表数据集),而相同数据一次性训练则崩溃至0.541的ROC-AUC;(ii)一种从头开始训练的关系型课程,仅使用约5,500个PluRel数据库,在19任务RelBench/4DBInfer基准上达到了0.638的平均ROC-AUC,以约220倍更少的关系型合成数据恢复了RDB-PFN报告性能的88%;(iii)单表课程模型在没有任何关系适配的情况下直接评估于关系型基准,达到了0.631,几乎匹配专用的关系型流水线。这些发现共同表明,对于关系型PFN预训练,课程设计和合成数据多样性可能比具体的关系型生成器或原始合成规模本身更为重要。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:36

# 课程设计至关重要:基于合成数据的关系型 PFN 数据高效预训练
来源:https://arxiv.org/html/2607.29120
###### 摘要\.

关系型先验数据拟合网络(PFN),如 RDB-PFN,通过在数百万个合成任务上进行预训练,来近似多表关系数据库上的贝叶斯推断。我们研究了围绕这一范式的三个相互交织的问题。首先,结构上不同的合成生成器 PluRel 能否替代 RDB-PFN 的先验?其次,合成数据呈现给 PFN 的*顺序*对下游性能有多大影响?第三,在引入任何关系数据之前,PFN 仅从单表合成预训练中能获得多少关系推理能力?在所有实验中将 PluRel 作为唯一合成数据源,我们发现:(i) 一种渐进式单表课程,将模式复杂度从 7 列逐步扩展到 17 列,仅使用约∼\sim13,300 个合成表(约为 RDB-PFN 报告的预热方案所用单表数据集的 45×\times分之一),即可在 23 任务表格基准上达到 0.703 的平均 ROC-AUC,而相同数据一次性全部训练则崩溃至 0.541 的 ROC-AUC;(ii) 一种从头开始的关系课程,仅使用约∼\sim5,500 个 PluRel 数据库,即可在 19 任务 RelBench/4DBInfer 基准上达到 0.638 的平均 ROC-AUC,以约∼\sim220×\times分之一的关系合成数据恢复了 RDB-PFN 报告性能的 88%;(iii) 单表课程模型不经任何关系适配直接评估于关系基准,达到 0.631,几乎与专门的关系流水线持平。综合来看,这些发现表明,对于关系型 PFN 预训练,课程设计和合成数据多样性可能比特定的关系生成器或原始合成规模本身更为重要。

VLDB 研讨会参考格式:课程设计至关重要:数据高效的关系型 PFN 预训练。VLDB 2026 研讨会:表格数据分析(TaDA)。††本作品采用知识共享 BY-NC-ND 4.0 国际许可协议授权。访问 https://creativecommons.org/licenses/by-nc-nd/4.0/ 查看该许可协议副本。超出该许可协议范围的任何使用,请通过发送邮件至 [email protected] (https://arxiv.org/html/2607.29120v1/mailto:[email protected]) 获取许可。版权归所有者/作者所有。出版权授予 VLDB 基金会。VLDB 基金会会议录。ISSN 2150-8097。

## 1. 引言

关系型基础模型在成熟度上远远落后于文本和视觉基础模型,主要原因是高质量的多表关系数据库(RDB)稀缺、专有且结构异构。最近的两条研究路线解决了这一问题。PluRel (Kothapalli et al.,2026 (https://arxiv.org/html/2607.29120#bib.bib6)) 提供了一个轻量级框架,通过层次随机块模型和逐表结构因果模型从零开始采样多样化的合成 RDB。RDB-PFN (Wang et al.,2026 (https://arxiv.org/html/2607.29120#bib.bib13)) 证明了先验数据拟合网络(PFN)风格的上下文学习 (Müller et al.,2022 (https://arxiv.org/html/2607.29120#bib.bib7); Hollmann et al.,2023 (https://arxiv.org/html/2607.29120#bib.bib3)) 最初是为单表任务开发的,可以通过深度特征合成(DFS)(Kanter and Veeramachaneni,2015 (https://arxiv.org/html/2607.29120#bib.bib5)) 线性化结合自定义神经关系先验(LayerDAG 模式生成器、基于注意力的选择性结构因果模型,以及用于内容补全的双向图神经网络)扩展到关系数据。RDB-PFN 报告的方案消耗约 180 万个合成任务,分为单表预热和关系适配两个阶段。

在本文中,我们提出关于 RDB-PFN 范式的三个相互耦合的问题。(Q1) 所报告的上下文学习能力是否依赖于 RDB-PFN 特定的神经生成器,或者一个结构不同、生成机制不同的合成先验是否就足够了?(Q2) 对于在合成数据上训练的 PFN,合成任务呈现的*顺序*对下游质量有多大影响,与原始合成数据量无关?(Q3) 在引入任何关系数据之前,PFN 仅从单表合成预训练中能获得多少关系推理能力?

我们使用 PluRel 作为唯一合成数据源来解决所有三个问题:在整个过程中用它替代 RDB-PFN 的原生生成器(Q1),在两个阶段都运行直接的课程式与一次性全部训练的消融实验(Q2),并在不进行任何关系适配的情况下直接评估关系基准上的单表课程检查点(Q3)。实验涵盖七个族系(第 3 节 (https://arxiv.org/html/2607.29120#S3))。

这些结果重新定位了关于 RDB-PFN 风格关系预训练的讨论。课程顺序,而非合成生成器身份,也非原始合成规模,才是主导性的杠杆。具体来说:

- • 在 PluRel 生成的单表数据上的渐进式宽度课程(7 到 17 列,约∼\sim13,300 个数据集,每个 150 行)在 23 任务表格基准上达到 0.703 的平均 ROC-AUC,恢复了 RDB-PFN 报告性能的 88%,同时使用的数据集数量约为原始单表预热的 45×\times分之一,总表格内容约为其 270×\times分之一;相同数据一次性全部训练则崩溃至 0.541,绝对差距为 16 个百分点(第 4.1 节 (https://arxiv.org/html/2607.29120#S4.SS1))。
- • 在约∼\sim5,500 个 PluRel 数据库上的从头开始关系课程在 19 任务关系基准上达到 0.638 的平均 ROC-AUC,以约∼\sim220×\times分之一的关系合成数据恢复了 RDB-PFN 报告的 0.725 的 88%(第 4.2 节 (https://arxiv.org/html/2607.29120#S4.SS2))。
- • 单表课程模型直接评估于 19 个关系任务而不进行任何关系适配,达到 0.631,与专门的关系流水线相差不到 1 个百分点(第 4.3 节 (https://arxiv.org/html/2607.29120#S4.SS3))。
- • 无论去除单表预热还是关系课程都会降低性能,其中预热被证明是更为关键的阶段(第 4.4 节 (https://arxiv.org/html/2607.29120#S4.SS4))。

## 2. 背景

### 2.1. RDB-PFN 与 DFS 线性化的关系上下文学习

RDB-PFN (Wang et al.,2026 (https://arxiv.org/html/2607.29120#bib.bib13)) 是一种用于关系任务的先验数据拟合网络。它通过应用深度特征合成作为确定性线性化,为每个目标实体生成单一特征矩阵,从而解决多表输入的异构性问题。Mean、Max、Min、Count 和 Mode 等聚合在 1 跳和 2 跳深度上汇总相邻表,之后一个紧凑的双向 Transformer(约∼\sim0.7M 参数,6 层,dmodel=128d_{\text{model}}=128)以二元分类头执行上下文学习。训练过程采用两阶段课程:首先是在大约 600,000 个合成表格任务上的单表预热,然后是在大约 120 万个额外合成 RDB 上的关系适配阶段。

### 2.2. PluRel 作为合成生成器

PluRel (Kothapalli et al.,2026 (https://arxiv.org/html/2607.29120#bib.bib6)) 将关系数据库生成分解为三个阶段。模式图从一族随机有向无环图(Barabási-Albert、反向随机树、Watts-Strogatz)中采样。主外键连接使用层次随机块模型生成。每个表内的特征列由结构因果模型生成,其源节点包含时间模式。该流水线仅使用 CPU 且易于并行。

PluRel 的生成机制在结构上与 RDB-PFN 的原生生成器正交。RDB-PFN 使用学习到的 LayerDAG 模式模型、基于注意力的选择性父节点分配,以及用于内容补全的全局双向 GNN。PluRel 使用随机图先验、块模型连接和表局部 SCM,在生成过程中不进行任何跨表消息传递。如果两者都能带来相当的 PFN 性能,则该结果对于了解合成先验的哪些属性真正重要具有启发性。

### 2.3. Rel-SALT:语义关系模式

Rel-SALT (Ranjan et al.,2025 (https://arxiv.org/html/2607.29120#bib.bib10)) 通过关系 Transformer 使用的语义化模式族扩展了 RelBench (Robinson et al.,2024 (https://arxiv.org/html/2607.29120#bib.bib11))。我们将其用作关系课程阶段的种子模式集,并与 PluRel 生成的随机模式混合,以使模型扎根于与真实企业 RDB 一致的拓扑结构。

## 3. 方法

PluRel 是唯一的合成数据生成器。我们将实验组织为七个族系,共同回答 Q1-Q3。

#### 族系 A – 单表渐进式课程。

从随机初始化开始,我们以宽度渐进阶段在 PluRel 生成的单表上训练。第一阶段将模型暴露于 3,300 个具有 7 列的表(记为 TF07)。每个后续阶段从先前检查点继续,并引入逐渐更宽的模式,范围从 TF08 到 TF17,大多数阶段贡献 1,000 个额外表(TF12 贡献 2,000 个)。所有表包含 150 行。累积预热语料包含约 13,300 个数据集,而原始 RDB-PFN 方案约为 600,000 个。

#### 族系 B:单表一次性全部训练消融。

使用完全相同的 TF07-TF17 PluRel 语料,但混合到单次训练运行中,不进行课程排序。这可以将课程排序的贡献与数据内容的贡献分离开来。

#### 族系 C:从头开始的关系课程。

从随机初始化开始(无单表预热),我们应用四阶段关系课程:Rel-SALT(500 个数据库),然后++PluRelSmall 1(3,000 个数据库),然后++PluRelSmall2(1,000 个数据库),然后++PluRelLarge 1(1,000 个数据库)。每个阶段从先前检查点继续。

#### 族系 D:单表模型在关系任务上的评估。

将族系 A 的最终 TF07-TF17 单表检查点直接评估于 19 个关系任务,不进行任何进一步的关系适配。这探究了仅通过 DFS 线性化的单表预训练能涌现出多少关系能力。

#### 族系 E:单表预热后的关系一次性全部训练。

从族系 A 检查点开始,我们将整个 Rel-SALT + Small 1 + Small 2 + Large 1 语料一次性混合训练,不进行关系课程排序。与族系 A + 族系 C 的组合相比,这可以分离关系课程排序的贡献。

#### 族系 F:无单表预热的关系一次性全部训练。

完整关系语料一次性混合,从随机初始化开始。与族系 E 相比,这可以分离单表预热的贡献。

#### 族系 G:仅关系,完全不含单表。

完整关系语料一次性混合;在任何阶段都没有单表数据。

#### 族系 G:无 Rel-SALT 的关系课程。

与族系 C 相同的关系课程,但去掉 Rel-SALT 种子阶段;仅使用 PluRel 生成的数据库,且无单表预热。

#### 线性化和目标。

所有合成 RDB 均通过 DFS 使用与原始 RDB-PFN 相同的聚合原语进行线性化。我们通过随机特征子采样将后 DFS 特征宽度标准化为 30 列,并按原始方案采样目标列(数值型通过中位数二值化进行二元分类,类别型通过一对多,每个模式 6 个随机目标列)。

#### 评估。

我们使用 RDB-PFN 的消费端架构和训练代码,仅修改合成数据来源。所有其他超参数遵循原始论文。单表评估使用 Grinsztajn 等人 (Grinsztajn et al.,2022 (https://arxiv.org/html/2607.29120#bib.bib2)) 基准中的 23 个分类任务;关系评估使用来自 RelBench (Robinson et al.,2024 (https://arxiv.org/html/2607.29120#bib.bib11)) 和 4DBInfer (Wang et al.,2024 (https://arxiv.org/html/2607.29120#bib.bib12)) 的 19 个任务。我们在关系基准上报告上下文大小为 64 和 1024 时的 ROC-AUC,在单表基准上报告上下文大小为 1024 时的 ROC-AUC。

## 4. 结果

### 4.1. 单表课程(族系 A-B)

表 1 (https://arxiv.org/html/2607.29120#S4.T1) 报告了宽度渐进课程各阶段在 23 个单表分类任务上的平均 ROC-AUC。性能从仅 TF07(3,300 个数据库)时的 0.567 单调增长到 TF07-TF12 检查点(8,300 个数据库)时的 0.715 峰值,随后在后续阶段于 0.687–0.705 范围内波动,最终 TF07-TF17 检查点达到 0.703。使用约为 RDB-PFN 报告的 0.800 的 45×\times分之一的单表预训练数据,该课程恢复了其 88% 的性能。

表 1.单表基准(23 个分类任务,ctx 1024)。在 PluRel 生成的表上的宽度渐进课程;累积数据集数量从 3,300 增加到 13,300。#### 课程消融(族系 B)

相同的 TF07-TF17 语料一次性全部训练,无宽度渐进排序,仅达到 0.541,比课程的 0.703 低 16.2 个百分点。数据相同、优化器相同、计算预算相同;唯一不同的是暴露顺序。我们认为这是直接证据:对于消耗合成表格任务的 0.7M 参数 PFN,课程排序是一阶训练方案变量,而非调参细节。

### 4.2. 从头开始的关系课程(族系 C)

表 2 (https://arxiv.org/html/2607.29120#S4.T2) 报告了仅关系课程(无单表预热)在 19 个关系任务上的平均 ROC-AUC。性能通过 Rel-SALT、Small 1 和 Small 2 阶段逐步提升,在完整的 Rel-SALT + Small 1 + Small 2 + Large 1 配置(ctx 1024)下达到 0.638。使用约为 RDB-PFN 报告的 0.725 的 220×\times分之一的关系预训练数据,先验替换模型恢复了其 88% 的性能,在较小的 ctx 64 设置下恢复 92%。

表 2.关系基准(19 个 RelBench/4DBInfer 任务)。族系 C:从随机初始化开始的仅关系课程,以 PluRel 作为合成生成器。% of paper 是 RDB-PFN 在相同上下文大小下已发表平均值的比例。#### 先验可替换性。

PluRel 的生成机制(随机模式图、HSBM 连接、表局部 SCM)与 RDB-PFN 的原生生成器没有任何共同的设计选择。一个在 PluRel 生成数据上训练的模型,仅使用两个数量级更少的数据就能恢复 RDB-PFN 报告性能的 88% 至 92%,这一事实表明消费端模型的关系上下文学习能力依赖于合成先验的*分布*属性(真实 RDB 特有的块对角 DFS 特征相关模式),而非产生这些模式的特定生成过程。

### 4.3. 单表向关系任务的迁移(族系 D)

一个引人注目的发现是,最终的 TF07-TF17 单表课程模型——在训练期间从未见过多表关系数据库——在 19 个关系任务上的表现几乎与族系 C 的专门关系流水线一样好。

表 3.单表模型在关系任务上的表现(族系 D)与最佳关系流水线(族系 C)以及 RDB-PFN 基线的对比。在 ctx 1024 时,单表模型达到 0.631,而专门的关系流水线为 0.638,RDB-PFN 基线为 0.725。

相似文章

PluRel-to-RDB-PFN: Schema-Guided Synthetic Relational Pretraining

arXiv cs.LG

This paper explores using the PluRel synthetic relational database generator as an external data source for pretraining RDB-PFN, a relational in-context learner, demonstrating that schema-guided curriculum design can recover most of the original performance with far fewer pretraining tasks.

当表格基础模型遇到策略性表格数据:一种先验对齐方法

arXiv cs.AI

本文研究了基于预训练先验数据拟合网络的表格基础模型是否能够泛化到个体在部署后修改特征的策略性表格数据。提出了策略性先验数据拟合网络(SPN),这是一个无需重新训练即可将PFN预测与操纵后分布对齐的推理时框架。

TabPFN-3:技术报告

arXiv cs.LG

TabPFN-3 是一个新的表格数据基础模型,在合成数据上预训练,可扩展到 100 万训练行,同时减少训练和推理时间,在表格预测、时间序列和关系数据上实现了最先进的性能。