AutoGrable:什么是适合表格的好图?
摘要
本文介绍了 AutoGrable,一种无需训练 GNN 即可为表格数据评估候选图构建的方法,它使用基于 1-WL 颜色细化的标签对齐风险,从而能够以低成本搜索有效的表到图映射。
查看缓存全文
缓存时间: 2026/08/13 15:36
# AutoGrable:对于表而言,什么样的图是好的? 来源:https://arxiv.org/html/2608.11431
###### 摘要
图学习预设了一张图的存在,而表格和关系数据库本身并不附带图。将 GNN 应用于它们,需要决定哪些实体成为节点、连接哪些节点、以及通过何种关系连接——这一决定要么由人工做出,要么借助模式启发式,要么通过在每一个候选图上训练模型并保留最佳者来完成。我们给出一个无需训练图模型的标准。在最小的“表到图”抽象中,每一行是一个节点,因此受 1-WL 限制的消息传递 GNN 只会把一种构造看作对行的一个划分,即颜色细化类:当某个划分能将不同标签的行分开,并且不拆分共享同一标签的行时,该构造对该任务就是好的。AutoGrable 把这一标准转化为一个构造过程。对于关联构造(incidence construction),划分由所选列固定下来,因此构建图就归结为选择列;我们用一个标签对齐风险(label-alignment risk)来给候选子集打分:即在该划分的各个块上恒定的最佳预测器的留出风险,再减去一个衡量块被填充得有多稀疏的占用惩罚项。该评分不实例化任何图,也不训练任何 GNN,因此 AutoGrable 可以贪心且廉价地搜索子集空间,并返回由此得到的 *grable*——既适用于单表,也适用于外键模式。我们的实验表明:在候选图空间中,该评分能丢弃大量候选但保留最佳者;在受控任务中,AutoGrable 能恢复生成标签的那些列,并在固定预测器下在真实任务上优于固定、随机和任务感知的构造器;而且,它是所比较方法中唯一能够在没有任何图有帮助时拒绝构建图的方法。
## 1 引言
图学习预设了一个或多个图的存在。图的归纳偏置就体现在这里:只有当一条边或一条边路径连接两个实体时,消息传递才能将它们关联起来。近期的研究将图学习技术应用于主导应用机器学习的两种数据格式——单表以及由外键连接的关系数据库——但这些格式本身并不带有图表示。为了将图模型用于此类数据,我们必须首先决定节点是什么、连接哪些实体、以及通过哪些关系连接。这个决定通常由人工、模式启发式或者干脆不决定地做出,而且是在*任何*学习发生*之前*做出的。本文所追问的问题完全先于架构和优化:当图不是给定的时候,什么样的图适合在其上进行学习,以及我们如何构建它?对此问题已有两种回应,但都没有完全回答。一种是*学习*一张图:把数据点视为节点,在训练模型的同时从特征中推断出一个软邻接矩阵 [franceschi, kazi2022dgm, zhou2023opengsl]。另一种是从表或模式中*构造*一张图,固定外键骨架、搜索模式编辑或对属性打分,并用在其上训练的模型的准确率来评判它 [RDL-fey, autog, augraph]。前者假设结构意味着给定节点上的几何邻近性,而表并不提供这一点:它的关系是共享的分类值,其节点集本身就是一种构造选择。后者只在操作意义上定义好图——如果训练好的模型喜欢它,它就是好图——这带有循环性,每个候选图都要花费一次训练运行,并且没有说明*图向学习器暴露了哪些区分*。我们寻求一种可以在训练前陈述的“好图”概念,并解释为什么某种构造有帮助。
在这项工作中,我们通过运行在图上模型所能做出的区分来判断图表示的质量。消息传递 GNN 受一维 Weisfeiler–Leman(1-WL)检验或颜色细化 [xu2018how, morris-WL-go-neural] 的限制:当 1-WL 给两个节点分配相同颜色时,GNN 无法区分它们;也就是说,当它们的邻域在迭代聚合下不可区分时,无论这两个节点在图中距离多远或多近,都无法区分。因此,对于这样的模型,从表构造出的图只做一件事:它把表行(图中的行节点)划分成 1-WL 颜色类,而学习器只能看到颜色类之间的区分。当这种划分与标签对齐时——不同标签的行落入不同类,同一标签的行不被不必要地进一步拆分——这张图对该任务就是好的。过粗的划分会隐藏标签;过细的划分会让模型记忆个别行而不是泛化。这就给出了一个可以在训练任何模型之前陈述并检查的构图标准。
我们将这一目标转化为算法。对候选图打分很便宜:因为目标只涉及哪些行被分到同一组,所以可以直接从该分组中度量,无需训练模型。然而,搜索最佳图并不便宜;与此密切相关的分离问题是 NP 难的,因此我们以贪心方式构建图,而不是枚举。其结果是 AutoGrable,它根据这个免训练的目标选择一种构造,然后在其上训练图模型。该算法自然地从单表扩展到由外键连接的多个表。
**贡献。** 我们提出一个关于什么使图对任务为好的标准,并将其应用于表格学习——在图不是给定而必须构造的场景。我们的贡献是:(1) *对齐(alignment)*作为图好坏的评判标准:一种构造只能以行的分组形式到达 1-WL 受限的学习器,当该分组与标签匹配时,该构造对该任务就是好的;(2) 一个用于该标准的评分,仅从分组即可计算,无需训练模型,它权衡了该分组所允许的最佳预测器的误差与它将行铺展得有多稀疏;(3) AutoGrable——一个“表到图”构造器,它构建评分所选择的图,适用于单表和多表数据集,并在事务性和关系型基准上优于其他构造方案。
## 2 属性选择作为标签对齐
我们的方法基于一个观察:选择一个属性子集并将其值展开为关联图中的共享节点,会在表的行上恰好诱导出该图的颜色细化(1-WL)划分——而颜色细化正是限制消息传递 GNN 能力的东西(第 4 节)。因此,选择属性就固定了在此构造图上运行的每个 GNN 的表达上限,而且这个选择可以完全在表空间内做出,尽管该选择所产生的跨行通信在表空间中根本不可用。因而我们首先关注如何选择属性子集。指导性概念是:该子集诱导的划分应与标签*对齐*:足够细致使得每个单元内标签同质,但又足够粗糙使得每个单元保有估计所需的样本支持。本节将“对齐”精确化。我们为每个候选属性集合附上一个训练行划分和一个免训练预测器,并用一个目标函数给两者打分;该目标在留出预测收益与碎片化之间权衡,并以一个泛化界作为理由。
**表与候选属性。** 令 \(\mathcal{C}\) 为属性名的全集,\(\mathrm{val}\) 为值域。一个*模式*是有限集 \(C\subseteq\mathcal{C}\),一个 \(C\)-*行*是映射 \(r\colon C\to\mathrm{val}\),一个 \(C\)-*表*是行的有限索引集合。我们用 \(r[c]\) 表示 \(c\) 在 \(r\) 中的值,用 \(r|_{S}\) 表示 \(r\) 到 \(S\subseteq C\) 的限制。某个属性 \(Y\in C\) 是标签,\(A:=C\setminus\{Y\}\) 是输入属性,而 \(F\subseteq A\) 在验证样本被查看之前就已固定,包含有资格进行结构选择的属性。带标签的行被划分为不相交的训练样本和验证样本 \(T_{\mathrm{tr}}\) 与 \(T_{\mathrm{val}}\),大小分别为 \(n_{\mathrm{tr}}\) 和 \(n_{\mathrm{val}}\)。每个候选集合 \(S\subseteq F\) 通过投影划分训练行:
\[
r\sim_{S}r'\quad\Longleftrightarrow\quad r|_{S}=r'|_{S},\qquad
\pi_{S}:=T_{\mathrm{tr}}/{\sim_{S}}.
\]
等价地,\(\pi_{S}\) 由非空单元 \(B_{S,u}:=\{r\in T_{\mathrm{tr}}: r|_{S}=u\}\) 组成,其中 \(u\in\mathrm{val}^{S}\),且 \(N_{S,u}:=|B_{S,u}|\)。当 \(\pi'\) 细化 \(\pi\) 时记 \(\pi'\preceq\pi\);特别地,\(S\subseteq S'\) 蕴含 \(\pi_{S'}\preceq\pi_{S}\)。
**一个免训练的块预测器。** 每个候选集合都用与其划分相容的最简单预测器来打分。记
\[
\widehat{p}_{S}(y\mid u):=N_{S,u}^{-1}\sum_{r\in T_{\mathrm{tr}}}\mathbf{1}\{r|_{S}=u,\ r[Y]=y\}
\]
以及
\[
\widehat{p}_{0}(y):=n_{\mathrm{tr}}^{-1}\sum_{r\in T_{\mathrm{tr}}}\mathbf{1}\{r[Y]=y\},
\]
我们定义
\[
\widehat{h}_{S}(r):=\widehat{p}_{S}(\,\cdot\mid r|_{S})
\]
若 \(N_{S,r|_{S}}>0\),否则 \(\widehat{h}_{S}(r):=\widehat{p}_{0}\):即对已占用的单元取经验标签分布,对未见过的投影取训练边际。该预测器仅用于选择结构;最终预测器是一个图学习模型(第 4 节)。
**对齐评分 \(\mathcal{J}\)。** 对齐必须权衡两种失败模式。欠细化的划分会把不同标签的行混在同一单元中,任何单元恒定的预测器都无法解决;过细化的划分捕获了更多标签变化,但产生了样本支持不足的小单元。对于属性子集 \(S\subset F\),我们用下式度量碎片化:
\[
\Omega(T_{\mathrm{tr}},\pi_{S}):=\frac{1}{n_{\mathrm{tr}}}\sum_{u:N_{S,u}>0}\sqrt{N_{S,u}},
\]
图 1:候选集合 \(S\) 按投影 \(r|_{S}\) 划分训练行。欠细化使不同标签的行留在同一单元;过细化产生支持稀疏的单元。选定 \(S^{\star}\) 后,所选值成为共享的值节点。
该式在细化下单调,取值范围从 \(n_{\mathrm{tr}}^{-1/2}\)(单个单元)到 \(1\)(全部为单元素单元)。令 \(\widehat{\mathrm{Risk}}_{\mathrm{val}}(\widehat{h}_{S})\) 为 \(\widehat{h}_{S}\) 在某个有界损失函数 \(\ell\) 下的平均验证损失。我们按如下方式给 \(S\) 打分:
\[
\mathcal{J}(\pi_{S}):=\widehat{\mathrm{Risk}}_{\mathrm{val}}(\widehat{h}_{S})+\lambda\,\Omega(T_{\mathrm{tr}},\pi_{S}),\qquad \lambda\geq 0.
\tag{1}
\]
第一项奖励在留出行上跟踪标签的区分;第二项对那些仅由太少训练行支持的区分收费。因此,最小化 \(\mathcal{J}\) 会选择与标签最对齐的划分:只有当某个属性的留出收益超过其引入的碎片化时,它才会被选入。该惩罚是有原则的,而非启发式。对于二分类,令 \(\widehat{g}_{S}\) 为在 \(\pi_{S}\) 各单元上的经验多数类分类器,\(\mathrm{Risk}^{\star}\) 为无约束的最优总体风险,\(\mathrm{Risk}^{\star}_{S}\) 为在这些单元上恒定的分类器中的最优总体风险。若 \(S\) 独立于 \(T_{\mathrm{tr}}\) 固定,则以至少 \(1-\delta\) 的概率有
\[
\mathrm{Risk}(\widehat{g}_{S})-\mathrm{Risk}^{\star}
\leq
\bigl(\mathrm{Risk}^{\star}_{S}-\mathrm{Risk}^{\star}\bigr)
+
\Omega(T_{\mathrm{tr}},\pi_{S})
+
4\sqrt{\frac{\ln(4/\delta)}{2n_{\mathrm{tr}}}}.
\]
因此 \(\Omega\) 在泛化界中控制了估计项:细化可以降低近似误差,但也会提高控制估计的可观测量。此外,以 \(T_{\mathrm{tr}}\) 为条件,验证样本上的集中性对所有 \(2^{|F|}\) 个候选是一致的:令
\[
\varepsilon_{L}:=L\sqrt{\frac{|F|\ln 2+\ln(2/\delta)}{2n_{\mathrm{val}}}},
\]
则 (1) 的精确最小化者 \(S^{\star}\) 至少以概率 \(1-\delta\) 满足
\[
\mathrm{Risk}(\widehat{h}_{S^{\star}})+\lambda\Omega(T_{\mathrm{tr}},\pi_{S^{\star}})
\leq
\min_{S\subseteq F}\bigl\{\mathrm{Risk}(\widehat{h}_{S})+\lambda\Omega(T_{\mathrm{tr}},\pi_{S})\bigr\}
+
2\varepsilon_{L}.
\]
由于集中事件对所有 \(2^{|F|}\) 个候选一致成立,它同样覆盖搜索过程中自适应查看的候选;若搜索返回的是一个 \(\eta\)-次优的经验最小化者,则上述预言不等式仍成立,只需增加一个附加项 \(\eta\)。完整陈述与证明见附录 C。
## 3 寻找对齐的属性集
评分 \(\mathcal{J}\) 指明了哪些属性集是理想的;本节讨论如何找到这样的属性集。对所有 \(2^{|F|}\) 个子集进行精确最小化在可证明意义上是不可达的:即使比对齐弱得多的要求也已经是 NP 完全的。
**对齐而非最大分离。** 当对于所有 \(r,r'\in T_{\mathrm{tr}}\),\(r[Y]\neq r'[Y]\) 蕴含 \(r|_{S}\neq r'|_{S}\) 时,属性集 \(S\) *分离标签*。分离是单元恒定预测器拟合训练标签的必要条件,但它不是目标,而且它可以通过两种退化选择达到:取全部属性——只要任一子集能分离就能分离,但代价是最细且支持最差的划分;而键类属性则分离所有行,允许记忆,却不暴露可供泛化的重复结构。理想的划分应与任务*对齐*——足够细以区分标签相关的行类型,足够粗以在应当共享信息的行之间保持支持。即便如此,在预算 \(\|S\|\le k\) 下,分离下限在计算上也是困难的。
###### 定理 1(分离是 NP 完全的)。
给定 \(T_{\mathrm{tr}}\)、\(F\) 和 \(k\),判定是否存在某个满足 \(\|S\|\le k\) 的 \(S\subseteq F\) 能分离标签,是 NP 完全的。除非 \(\mathrm{P}=\mathrm{NP}\),否则即使这个受限选择问题也不存在多项式时间的精确方法,更不用说对齐目标了。因此我们使用贪心局部搜索。
**算法 1** SCS:结构列选择
1: \(T=T_{\mathrm{tr}}\cup T_{\mathrm{val}}\),标签 \(Y\),候选 \(F\subseteq A\),方向 \(\in\{\mathrm{fwd},\mathrm{bwd}\}\),签名 \(\sigma\in\{\mathrm{val},\mathrm{freq}\}\),\(\lambda\geq 0\),容差 \(\tau\geq 0\)
2: 选定列 \(S^{\star}\)
3: 若 \(\sigma=\mathrm{freq}\) 则
4: \(T\leftarrow\textsc{FreqEncode}(T,F)\) // 通过 (2)
5: 结束若
6: 若 direction = \(\mathrm{fwd}\) 则
7: \(S\leftarrow\emptyset\); \(\mathrm{moves}(S):=\{\,S\cup\{c\}:c\in F\setminus S\,\}\)
8: 否则
9: \(S\leftarrow F\); \(\mathrm{moves}(S):=\{\,S\setminus\{c\}:c\in S\,\}\)
10: 结束若
11: 循环
12: \(S'\leftarrow\arg\min_{M\in\mathrm{moves}(S)}\mathcal{J}(\pi_{M})\),并列时选第一个
13: 若 \(\mathcal{J}(\pi_{S'})<\mathcal{J}(\pi_{S})-\tau\) 则
14: \(S\leftarrow S'\)
15: 否则
16: 跳出循环
17: 结束若
18: 结束循环
19: 返回 \(S^{\star}\leftarrow S\)
**频率编码。** \(\mathrm{val}\)-签名通过精确类别值划分行;\(\mathrm{freq}\)-签名则根据行在候选中出现的相对频率划分行。将每个候选列 \(c\in F\) 替换为一个频率列:
\[
\mathrm{FreqEncode}(r,c):=\frac{\text{train 中 } c\text{-值的频率}}{\text{所有值中最频繁的训练频率}}.
\tag{2}
\]
然后对任何 \(S\subseteq F\),其单元由这些实值投影的联合等值类定义。该签名仍然在关联构造中实现为共享值节点:共享同一值的行现在共享一个带权值节点,其观测频率是 \(\mathrm{FreqEncode}\) 的输入。使用哪种签名是一个超参数。\(\mathcal{J}\) 只需一个距离概念,不需要特征向量或图;因此它自然适用于混合类型、表格模式和任意列的块。频率编码也允许算法在数值或高基数属性上操作,而无需对这些列做一次性独热展开。在使用 \(\mathrm{freq}\) 时,我们用相同方式替换验证行:使用来自训练样本的频率以及预定义的验证频率。该过程是确定性的,并且可以在不训练的情况下完成。
**贪心局部搜索。** 算法 1 从空集(前向)或全候选集(后向)开始。每次迭代在保持集合大小不变或将其改变一个元素的相邻集合中,选择使 \(\mathcal{J}\) 最小的集合。由于 \(\mathcal{J}\) 可以被同时评估用于多个候选集合,该过程在前向模式下最多评估 \(|F|(|F|+1)/2\) 个集合,而后向模式则取决于提前停止。使用后向搜索时,可以一次性计算 \(\mathcal{J}(\pi_{F})\);前向搜索从全空集开始。除非另有说明,我们默认使用前向模式与 \(\lambda=0.01\)。
**与相关工作的关系。** 自动构造用于 GNN 的表图的相关工作包括把属性值变成节点(如同我们这里)并加上类型节点 [RDL-fey、autog]、把整数/类别属性变成节点 [augraph、waddle],以及更一般地从表中构造图或从模式中的其他关系构造图 [levie、sheaf]。这些方法根据构造的图训练模型,然后报告该模型的性能——一种黑箱的、操作性的好坏概念,需要为每个候选图进行训练。我们的评分直接度量 \(\mathcal{J}\),只涉及行划分,因此寻找和使用好构造的代价要低得多。
## 4 从对齐选择到图
当我们选定了属性集 \(S^{\star}\) 并构建关联图时,1-WL 在行节点上的颜色恰好是 \(\pi_{S^{\star}}\) 的单元。因此,算法 1 所选择的构造在 1-WL 受限模型下恰好暴露了选定的划分。本节正式说明这一联系,并描述我们最终训练的模型。
**关联构造。** 设 \(W\) 为值节点,\(E\subseteq V\times W\) 使每个行节点 \(r\) 与其每个选定属性 \(c\in C\) 的值 \(r[c]\) 相连;可以添加类型节点来区分属性,例如将 \(r[c]\) 与值节点 \(r[c]\) 的连接标记为类型 \(c\)。这会得到一个二分图。行节点上的消息传递 GNN 进行一次迭代后,会聚合同一类型上具有相同值节点的行;因此行节点在第 \(k\) 次迭代后的特征由行节点在第 \(k\) 次细化后的颜色确定:所有共享相同选定属性投影的行具有相同颜色,不同投影最终会被区分(另见附录 B)。因此自动满足:行颜色的划分恰好是 \(\pi_{S^{\star}}\),并且学习器暴露的区分正好是 \(\mathcal{J}\) 所评分的。
**图构造。** AutoGrable 的默认构造如下:对于每个选定属性 \(c\in S^{\star}\),我们把其值作为节点;经过频率编码后,这些节点是预定义频率的个体值;对于 \(\mathrm{val}\) 签名,每个出现的值成为节点。行节点与其每个选定属性的值节点相连。这会产生一个具有可训练节点特征的二分图,这些特征由每个节点的单热类型决定。节点特征通过一个具有两个隐藏层的 GNN 传播;行节点的最终特征用于标签预测。
## 5 实验
我们测量三个问题:(1)评分 \(\mathcal{J}\) 是否识别出好图?即,在候选构造的广阔空间中,它是否保留最佳者并丢弃其余者?(2)AutoGrable 是否在具有已知生成列的受控任务中恢复列?(3)与替代结构相比,AutoGrable 在真实基准数据上是否产生更好的预测性能?我们同时评估单表和多表场景。
**基准。** 我们使用来自公开数据集的单表任务:Census Income、Obesity、Mushroom、Iris、Ionosphere 和 Wisconsin Breast Cancer,以及多表外键设置:一个来自航空绩效数据库的航班延迟(Flights)任务,以及一个来自 TPC-H 模式派生的销售(Sales)任务。单表的补全数据包括每行约 5–20 个属性;多表模式包含类型(例如客户、订单、产品)的连接表,标签属于事实表行。对于多表设置,AutoGrable 将每一行视为节点,并仅从主“事实”表中选择列;值节点可以由其他表的列补充,算法按第 3 节所述选择贡献列。在可能的情况下,我们遵循文献中的预处理并选择有意义的属性。
**方法。** 比较构造包括:固定构造器(由超参数网格搜索选取的固定图参数,如四元组)、随机构造器(从候选构造空间中采样图,使用相同的下游模型)、任务感知构造器(用下游模型和验证分数对每个候选构造进行训练/评估,即穷举式基线)、以及 AutoGrable。我们将所有构造器用于相同的最终预测器:一个两层 1-WL 受限的 GNN,隐藏维度 64,训练最多 1000 轮,并使用早停。
**结果。** 表 1 报告了平均留出 ROC-AUC(括号内为标准差)。在九个数据集中的八个上,AutoGrable 优于固定和随机基线。在受控任务中,AutoGrable 的选定属性与生成标签的列的重叠度很高(除了少数高相关属性外几乎精确匹配)。与穷举网格(任务感知构造器)相比,AutoGrable 在性能上不差,而计算开销低几个数量级;在若干数据集上,AutoGrable 甚至优于该构造器,这可能是因为该构造器在验证集上有点过拟合。最后,当评分显示没有候选构造能改善标签对齐时,AutoGrable 可以选择不构建任何图:在这种情况下,它返回空集并训练一个仅基于行特征的多层感知机。此能力只有 AutoGrable 具备;其他方法必然输出一张图。
表 1:留出 ROC-AUC(均值 ± 标准差,5 次运行)。F=固定,R=随机,T=任务感知,AG=AutoGrable。最优值加粗;若 AutoGrable 与最优值无显著差异(配对 t 检验,p<0.05),则同时加粗。
| 数据集 | F | R | T | AG |
|---|---|---|---|---|
| Census | 0.752±0.010 | 0.749±0.009 | 0.761±0.006 | **0.768±0.004** |
| Obesity | 0.744±0.021 | 0.730±0.018 | 0.762±0.011 | **0.765±0.009** |
| Mushroom | 0.894±0.017 | 0.901±0.016 | **0.912±0.012** | **0.910±0.011** |
| Iris | 0.932±0.011 | 0.929±0.014 | **0.941±0.008** | **0.939±0.009** |
| Ionosphere | 0.855±0.014 | 0.848±0.019 | 0.862±0.012 | **0.866±0.010** |
| WBC | 0.970±0.006 | 0.967±0.008 | **0.978±0.005** | **0.976±0.005** |
| Flights | 0.714±0.008 | 0.705±0.010 | **0.729±0.006** | **0.731±0.005** |
| Sales | 0.683±0.011 | 0.671±0.013 | **0.704±0.007** | **0.706±0.006** |
| 无帮助任务 | 0.589±0.015 | 0.583±0.017 | 0.597±0.014 | **0.611±0.008**(拒绝构建图) |
**关于评分质量的更多分析。** 我们通过在 Flights 和 Sales 上枚举 1000 个随机构造并绘制每个构造的 \(\mathcal{J}\) 与下游验证 AUC 的关系来评估该评分。\(\mathcal{J}\) 与验证性能呈负相关(Spearman \(\rho\le -0.7\),p<0.001)。丢弃 \(\mathcal{J}\) 最大的 50% 构造会在两个数据集上保留下游 AUC 前三分之一的构造,并排除最差的构造。此外,选择出的 \(S^{\star}\) 的 \(\mathcal{J}\) 对应一个落在枚举构造下游 AUC 前 10% 内的图。
## 6 结论
当图没有被给定时,什么使它成为好图?我们提出,对于一个表,好图的标准是行节点在 1-WL 下如何划分:只有当这种划分将不同标签的行分开时,图才对学习有帮助。这个标准可以是训练前的,并且让我们无需训练模型就能构建图。AutoGrable 通过一个结构列选择算法来实现这一标准,该算法适用于单表和外键模式。我们的实验表明,该评分可以筛选出好的构造,并且在固定预测器下,所得到的图在广谱的真实和受控任务上优于其他构造器。此外,AutoGrable 在结构无帮助时明确地拒绝构建图,而不是强行输出一个无用的图。
本工作最直接的局限是,它只考虑由属性选择所定义的构造。将属性选择扩展到选择*关系*(例如外键连接或路径)是一个自然的方向,而指标 \(\mathcal{J}\) 需要的只是由连接图诱导的行划分。另一个方向是将该标准用于更大的架构搜索:既然图的构造可以独立于模型进行评分,我们就可以将结构选择与模型选择分离开来。我们相信,为“给定一个表,什么是一个好图”建立的训练前答案,有助于将图学习更稳健地应用于实际表格数据。相似文章
GRASP:图推理辅助的综述规划以生成高保真相关工作
介绍GRASP框架,它将LLM规划与图算法结合,通过两层图结构和Steiner树剪枝建模论文间关系,生成高保真的相关工作章节。
GRID:用于安全文本知识图谱构建的情报数据图形表示
本文提出了GRID,一个端到端的框架,用于从网络威胁情报(CTI)文章中使用大型语言模型(LLM)构建安全知识图谱。引入了一种任务库奖励训练方法,无需昂贵的LLM作为裁判即可提升精确率和召回率。该方法在来自五个来源的249篇CTI文章的基准测试中取得了强劲的结果。
GraphGen:利用知识驱动的合成数据生成增强大语言模型的监督微调
GraphGen是一个知识图谱引导的框架,用于生成合成问答数据,以改进大语言模型的监督微调,通过多跳采样和风格控制生成来针对知识缺口。实验表明,它优于传统的合成数据方法。
RelGT-AC:用于关系数据库中自动补全任务的关系图变换器
本文介绍了RelGT-AC,一种专门为关系数据库中的自动补全任务设计的关系图变换器架构。该模型在RelGT架构基础上扩展了列掩码以防止平凡解、用于多种预测类型的统一任务头,以及利用词汇信号的TF-IDF文本编码器,在RelBench v2基准测试上取得了显著优于基线的改进。
Graph Machine: Exploring Edge Mechanisms as an Inductive Bias
This paper introduces Graph Machine, an architecture with explicit edge-based mechanisms (edge-augmented attention and edge-centric referral) to improve iterative relational reasoning. Experiments on Sudoku show it outperforms Transformer baselines, with ablations and mechanistic analysis attributing gains to the edge mechanisms.