在坐标系中生成,而非边界上:LTN-GANs中硬约束的函数符号接地

arXiv cs.AI 论文

摘要

本文介绍了在LTN-GANs中使用函数符号接地来处理生成模型中的硬结构约束,表明它比现有方法更忠实地学习边缘分布,并在高分辨率数据集上进行了验证。

arXiv:2608.21605v1 公告类型:新 摘要:逻辑张量网络增强生成对抗网络(LTN-GANs)通过将每个逻辑公理接地为谓词,并训练生成器提高其满足度(一个在$[0,1]$中的模糊真值)来注入背景知识。先前的LTN-GAN工作以这种方式在谓词级别接地每个约束,改善了约束满足。然而,谓词仅对样本进行评分,因此无法嵌入硬结构约束,如必须在每个生成样本中成立的排序、正定性和定义恒等式。在这项工作中,我们研究在LTN框架内将每个公理接地为函数符号。我们与最先进的替代方法进行比较,该方法是一个约束层,将每个违规样本钳制到可行边界上,从而产生始终有效的输出。我们的研究表明,有效的样本并不总是现实的。不等式不仅仅是满足或不满足;它通过一个边际成立,而忠实的生成器也应再现该边际的真实分布。我们发现,分辨率比率$R$,即数据规模与边际散布的比值,是一个诊断工具,可在训练前计算,用于判断所选接地能学习哪些约束。当$R$较大时,谓词没有学习信号,钳制将每个样本推到边界上,边际分布丢失,而所有标准指标仍然看起来正常。函数符号避免了这两种失败,计算受约束的变量而非对其进行评分。函数符号共同形成一个图表,即可行区域内的坐标系,其中每个样本根据构造都是有效的,边际像任何其他量一样被学习。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:20

# 图表内生成,而非边界上生成:LTN-GANs中硬约束的函数符号落地
来源:https://arxiv.org/html/2608.21605  
Vaishak Belle 邮箱:[vbelle@ed\.ac\.uk](mailto:[email protected])  
所属机构:爱丁堡大学,Crichton Street 10号,爱丁堡,EH8 9AB,英国  

###### 摘要  
逻辑张量网络增强的生成对抗网络(LTN-GANs)通过将每个逻辑公理落地为谓词来注入背景知识,并训练生成器提高其满足度——这是一个在\[0,1\]中的模糊真值。先前的LTN-GAN工作以这种方式在谓词级别落地每个约束,从而改进了约束满足度。然而,谓词仅对样本进行评分,因此无法嵌入必须在每个生成样本中成立的硬性结构约束,例如顺序规则、正定性以及定义恒等式。在本研究中,我们探索在LTN框架内将每个公理落地为函数符号。我们与最先进(SOTA)的替代方法进行了比较,该方法使用约束层将每个违规样本夹紧到可行边界上,从而始终产生有效输出。我们的研究表明,一个有效样本并不总是现实的。一个不等式并非仅仅被满足或违反。它可能以一个余量(margin)满足,一个忠实的生成器也应再现该余量的真实分布。我们发现,分辨率比率(RR),即数据尺度与余量分布之比,是一个可计算的诊断指标,它在训练前就能判断所选落地方式能够学习哪些约束。当RR较大时,谓词接收不到学习信号,夹紧操作会将每个样本推到边界上,余量分布丢失,而所有标准指标看起来依然正常。函数符号则避免了这两种失败,它计算受约束的变量,而不是对其进行评分。这些函数符号共同形成一个图表,即可行区域内的坐标系,其中每个样本在构造上都是有效的,而余量则像其他任何量一样被学习。这在四个高分辨率数据集上恢复了余量分布,其柯尔莫哥洛夫-斯米尔诺夫距离比约束层小至多25倍,并且图表法与夹紧法的混合模型在其自己的基准测试上匹配或超越了约束层。

## 1 引言  
深度生成模型是生成合成表格数据和科学数据的标准工具,用于增补稀缺记录、共享敏感数据以及提出候选设计。对抗式和变分生成器,如CTGAN和TVAE (39 (https://arxiv.org/html/2608.21605#bib.bib13))、基于分数和扩散的模型 (17 (https://arxiv.org/html/2608.21605#bib.bib40); 18 (https://arxiv.org/html/2608.21605#bib.bib39)) 以及关系结构模型 (22 (https://arxiv.org/html/2608.21605#bib.bib14)),能够学习日益精确的行程记录、航班记录和分子属性剖面等数据的分布近似。然而,仅近似数据分布是不够的,因为此类数据遵循已知规则,而近似仍可能违反这些规则。例如,合成的行程记录必须其下客时间晚于上客时间,航班必须报告其出发时间为计划时间加上延误,分子的内能必须从0K(U0)上升至室温(U)且低于其焓值(H)。  
我们的工作提出了一种新方法:让生成器不直接输出受约束变量,而是输出其自由坐标,然后通过一个“图表”函数(即函数符号落地)将其映射到满足所有约束的区域。例如,对于约束b > a,生成器输出a的值,并通过添加一个正的、平滑参数化的增量来组装b。每个样本在构造上满足约束,余量成为判别器可以在单位尺度上解析和塑造的坐标。这些函数符号形成了可行区域的“图表”,这是一个坐标系,生成器在该区域内产生样本,而非在其边界上。图表的每个变量的可容许区间正是约束层通过傅里叶-莫茨金消元法计算出的区间,而约束层成为总进行夹紧操作的特例。我们将结果称为FSG-LTN-GAN,代表LTN-GAN中的函数符号落地(FSG)。由于图表法在高RR连续约束上效果好,而低RR和离散余量更适合夹紧,我们使用一个短的前次运行来决定每个受约束的变量,从而产生一个混合模型。  
我们证明了RR在恢复约束边距分布问题中起到条件数的作用(第4节 (https://arxiv.org/html/2608.21605#S4))。  

#### 贡献。  
(i) 我们证明了硬约束生成在通过所有标准指标的同时,可能会扭曲*约束余量的分布*,并且分辨率比率RR可以作为预测此故障的条件数。  
(ii) 我们开发了*函数符号落地*,这是一种坐标变换,它在可行区域内生成并具有精确的有效性,并将约束层作为其“全部夹紧”的特例包含在内,并将其扩展为每个约束的*混合*方法。  
(iii) 我们证明了函数符号落地在四个真实的高分辨率数据集上,在保持相同有效性的同时,将余量KS距离最高削减了25倍;混合模型在35 (https://arxiv.org/html/2608.21605#bib.bib4)的基准测试上匹配或超越了约束层;基于RR的预测在样本外(nycflights13)有效;并且该方法可以直接迁移到CTGAN和TVAE骨干网络。

## 2 背景:逻辑张量网络与LTN-GANs  
#### 实逻辑与落地。逻辑张量网络(LTN)在实值张量中解释一阶语言,即实逻辑 (3 (https://arxiv.org/html/2608.21605#bib.bib1))。*落地* \(\mathcal{G}\) 为符号赋予含义,每个项都成为一个张量。每个*谓词* \(P\) 变成一个映射 \(\mathcal{G}(P)\) 到真值区间 \([0,1]\),用于对其参数进行*评分*。每个 \(k\) 元*函数符号* \(f\) 变成一个实值映射 \(\mathcal{G}(f): \mathbb{R}^{Dk} \to \mathbb{R}^{D}\),可以是固定或可学习的,用于*计算*一个项。谓词仅通过其贡献的真值参与学习,而函数符号则塑造被评分的对象。逻辑连接词变成模糊算子(\(\wedge\) 使用 t-范数,\(\vee\) 使用其对偶,以及模糊蕴涵),量词变成聚合运算(\(\forall\) 作为误差的广义均值)。闭公式在 \(\mathcal{G}\) 下的真值是其*满足度* \(\mathrm{Sat} \in [0,1]\),其中 1 表示完全为真。一个*公理*是一个断言在域中成立的闭公式,一个知识库 \(\mathrm{KB}\) 是一个有限的公理集合,学习过程最大化它们的聚合满足度 \(\mathrm{Sat}(\mathrm{KB})\)。

#### LTN-GAN目标。GAN耦合一个生成器 \(G_\theta: \mathcal{Z} \to \mathbb{R}^D\),将潜在噪声 \(\zeta \sim p_\zeta\)(标准高斯分布)映射到一个样本,以及一个判别器 \(D_\psi: \mathbb{R}^D \to [0,1]\),被训练来将真实样本评分接近1,生成的样本评分接近0,而 \(G_\theta\) 则被训练来欺骗它。LTN-GAN将生成的样本视为受约束变量的落地,并训练生成器也满足一个知识库,使用目标 \(\mathcal{L}_G = \mathcal{L}_{\mathrm{adv}}(G_\theta, D_\psi) + \lambda\,(1 - \mathrm{Sat}(\mathrm{KB}))\),其公理编码了约束。

#### 约束的谓词落地。标准生成器侧的LTN-GAN(G-LTN-GAN)(37 (https://arxiv.org/html/2608.21605#bib.bib2)) 将一个排序公理 \(b > a\) 落地为谓词 \(\mathcal{G}(P_>)(a,b) = \sigma\bigl((b-a)/s\bigr)\),其中 \(\sigma\) 是logistic函数,带有一个宽度超参数 \(s\),目标中的项 \(\lambda\,(1 - \mathrm{Sat})\) 推动样本趋向 \(b > a\)。这种落地是*软*的。它鼓励但不保证满足度,并且其梯度仅在谓词未饱和的地方有信息。第4节 (https://arxiv.org/html/2608.21605#S4) 显示该区间覆盖了 \(\Theta(1/R)\) 比例的样本,因此随着 \(R\) 增长,可用的梯度消失(RQ4)。我们的方法保留了LTN-GAN目标,但通过函数符号重新落地每个结构公理。受约束的变量成为一个由 \(\mathcal{G}(f)\) 计算的项,而不是一个由谓词评分的自由输出,因此 \(\mathrm{Sat} = 1\) 在构造上成立。*软*指的是满足度信号,因为函数符号落地也使用平滑连接,但为每个输出满足公理。

## 3 问题陈述  
生成器 \(G_\theta\) 接收 \(\zeta\) 和约束 \(\Pi\)。函数符号落地 \(\varphi\) 利用傅里叶-莫茨金界限 \([\ell_i, u_i]\) 计算约束变量,例如 \(x_i = \ell_i + \mathrm{softplus}(z_i)\),生成有效样本 \(x\),使得 \(\mathrm{Sat(KB)} = 1\)。判别器 \(D_\psi\) 对真实/伪造数据进行评分。真实数据 \(x\) 对应自由变量 \(z\),而 \(z\) 可通过 \(\varphi^{-1}(x)\) 变换得到。  
图1:FSG-LTN-GAN概述。落地映射 \(\varphi\) 在约束 \(\Pi\) 的傅里叶-莫茨金界限内,从生成器的自由坐标 \(z\) 组装有效样本,判别器在图表坐标中操作。混合模型则在循环中夹紧低RR和离散变量(附录B (https://arxiv.org/html/2608.21605#A2))。  
设 \(p_X\) 是未知的 \(X \in \mathbb{R}^D\) 上的分布,\(\mathcal{D}\) 是一个包含 \(N\) 个独立同分布样本的数据集。一个*样本*是向量 \(x = (x_1, \dots, x_D)\),其标量分量 \(x_k \in \mathbb{R}\) 是其*特征*。一个具有参数 \(\theta\) 的生成模型(对我们而言即生成器 \(G_\theta\))诱导其输出 \(G_\theta(\zeta)\) 的分布 \(p_\theta\),其中 \(\zeta \sim p_\zeta\),学习选择 \(\theta\) 使得 \(p_\theta \approx p_X\)。背景知识是特征 \(\{x_1, \dots, x_D\}\) 上的一组有限的线性不等式公理 \(\Pi\),每个公理形式为 \(\sum_k w_k x_k + b \trianglerighteq 0\),其中 \(\trianglerighteq \in \{\geq, >\}\),实系数 \(w_k\) 和偏移 \(b\),遵循35 (https://arxiv.org/html/2608.21605#bib.bib4) 的表述。样本 \(\tilde{x}\) *满足* \(\phi \in \Pi\),如果 \(\sum_k w_k \tilde{x}_k + b \trianglerighteq 0\)。如果生成器的所有样本都满足所有 \(\Pi\),则称其是*合规*(有效)的。排序(\(x_i > x_j\))、正定性(\(x_i > 0\))和定义恒等式(\(x_i = \sum_j w_j x_j\),编码为两个不等式)是我们研究的*结构*部分。

#### 余量及其分布。对于 \(\phi: \sum_k w_k x_k + b \geq 0\),其在样本上的*余量*为 \(m_\phi(x) = \sum_k w_k x_k + b\),当且仅当 \(m_\phi \geq 0\) 时 \(\phi\) 成立。正确的目标是*约束余量的分布*,即在数据下余量的条件分布 \(p_X(m_\phi \mid m_\phi \geq 0)\)。我们通过在真实数据的固定参考样本上,生成与真实约束余量之间的柯尔莫哥洛夫-斯米尔诺夫(KS)距离来量化这一点。

#### 分辨率比率。*分布* \(\sigma_m = \mathrm{std}_\mathcal{D}(m_\phi)\) 是数据集上 \(\phi\) 余量的标准差。*尺度* \(\sigma_s = \max_{k: w_k \neq 0} \mathrm{std}_\mathcal{D}(x_k)\) 是 \(\phi\) 相关特征中的最大标准差:对于 \(\phi: U - U_0 \geq 0\),它是 \(\mathrm{std}(U)\)。两者都在原始、未标准化的数据上计算,在训练之前。\(\phi\) 的*分辨率比率*为 \(R_\phi = \sigma_s / \sigma_m\)。当 \(R_\phi\) 较大时,余量是两个大而近乎相等的量的微小差值。在标准化坐标中,它占据一个相对宽度约为 \(1/R_\phi\) 的区间,对于一个Lipschitz判别器来说低于分辨率,因此一个*自由*生成器(一个没有约束机制训练的生成器)即使匹配了边缘分布,仍会在恒定比例的样本上违反 \(\phi\)(RQ4)。第4节 (https://arxiv.org/html/2608.21605#S4) 将 \(R_\phi\) 视为恢复约束余量分布的缩放条件数。

#### 约束层(夹紧)。C-DGM (35 (https://arxiv.org/html/2008.21605#bib.bib4)) 添加了一个可微的*约束层*(CL):给定一个变量顺序,它通过傅里叶-莫茨金消元法计算每个变量的可容许区间 \([\ell_i, u_i]\)(分段线性,依赖于已设置的变量),并将生成的数值*夹紧*到该区间内,即 \(\mathrm{CL}(\tilde{x})_i = \min(\max(\tilde{x}_i, \ell_i), u_i)\),从而保证有效性。夹紧将违规样本移动到最近的边界,那里余量接近零。第4.1节 (https://arxiv.org/html/2608.21605#S4.SS1) 显示这正是约束余量分布丢失的地方,其速率由RR控制。

## 4 函数符号落地作为坐标变换  
*坐标变换*和*图表*贯穿其微分几何含义。在其恒等式定义的仿射子空间内,一个可满足线性系统的可行集 \(\mathcal{M} = \{x : \bigwedge_\phi \phi(x)\}\) 是一个相对开的凸多面体,微分同胚于 \(\mathbb{R}^d\),并被一个全局图表覆盖。下面的映射 \(\varphi\) 就是这样一个图表,每个自由变量一个坐标。我们通过函数符号落地每个结构公理(图1 (https://arxiv.org/html/2608.21605#S3.F1))。生成器发出自由项 \(z \in \mathbb{R}^d\)(每个未被恒等式固定的变量一个),一个落地映射 \(\varphi\) 通过傅里叶-莫茨金顺序处理变量来组装受约束的样本。设 \(\Pi_i^+\)(\(\Pi_i^-\))是 \(x_i\) 具有正(负)系数的简化约束 (35 (https://arxiv.org/html/2608.21605#bib.bib4)),则 \(x_i\) 的可容许区间是已组装变量 \(x_a\) 的分段线性函数:\[x_i \in \left[ \max_{\phi^+ \in \Pi_i^+} \frac{-\sum_{k \neq i} w_k x_k - b}{w_i}, \min_{\phi^- \in \Pi_i^-} \frac{-\sum_{k \neq i} w_k x_k - b}{w_i} \right]\]其中 \(w_i > 0\) 对 \(\phi^+\) 成立,\(w_i < 0\) 对 \(\phi^-\) 成立。我们通过一个平滑、单调的参数化函数(如softplus)将该区间映射到 \(\mathbb{R}\),从而生成 \(x_i\)。  
关键见解是,通过将受约束变量视为自由坐标的函数(而非独立的输出),我们可以在训练中*精确*满足所有线性不等式约束,同时保持对每个变量分布的控制。生成器输出 \(z\),落地函数 \(\varphi\) 计算 \(x = \varphi(z)\)。判别器在 \(x\) 空间中操作。损失函数 \(\mathcal{L}_G\) 保持不变:对抗损失加上知识库满足度损失。但现在,对于结构约束,满足度在构造上为1(或非常高),因此损失的第二项为零,生成器专注于匹配真实数据分布。  
图表(函数符号落地)与夹紧的比较:对于约束 \(b > a\),夹紧将每个违规者发送到 \(b = a\),而函数符号落地将余量作为单位尺度坐标发出,即 \(m_\phi = \mathrm{softplus}(z)\)。  
推论3(定义恒等式是零测集)。设 \(\mathcal{M}_= = \{x \in \mathbb{R}^D : c(x) = 0\}\) 是恒等式的零集,其中 \(c: \mathbb{R}^D \to \mathbb{R}^p\) 是一个 \(C^1\) 映射,其雅可比矩阵在 \(\mathcal{M}_=\) 上具有满秩 \(p\)。则 \(\mathcal{M}_=\) 是勒贝格零集,因此任何绝对连续的生成分布 \(\nu\) 满足 \(\Pr_{x \sim \nu}[c(x) = 0] = 0\),并且任何满足度损失都无法将精确满足度提高到概率0以上。函数符号落地从其父变量导出依赖变量,因此 \(c \equiv 0\) 以概率1成立。  
推论4(谓词落地的排序:\(\Theta(1/R)\) 梯度)。将排序 \(\phi: b > a\) 落地为谓词 \(P_s = \sigma\big((b-a)/s\big)\),区间 \(s = \Theta(\sigma_m)\)。如果生成器已匹配了 \(a\) 和 \(b\) 的边缘分布但未匹配其依赖关系(余量相关性远离1),则其余量分布宽度为 \(\Theta(R\,\sigma_m)\),在 \(b=a\) 附近密度为 \(\Theta(1/\sigma_s)\)(无异常集中)。谓词 \(P_s\) 在区间 \([b-a \in [-s, s]]\) 上具有非零梯度。该区间包含生成余量分布的概率质量为 \(\Theta(1/R)\)(因为余量分布在宽度 \(\Theta(R\,\sigma_m)\) 上大致均匀,而 \(s = \Theta(\sigma_m)\))。因此,平均梯度幅值为 \(\Theta(1/R)\)。当 \(R\) 很大时,梯度信号消失。

相似文章

跨尺度对齐监督训练GANs

Hugging Face Daily Papers

本文提出CAT,一种跨尺度对齐变换器,通过强制中间GAN输出与最终输出之间的一致性来解决轨迹错位问题,在ImageNet-256上实现了1.56的最优FID。