生成模型能否把握时间?合成顺序表格数据的时间感知评估

arXiv cs.LG 论文

摘要

本文提出了一种基于分类学引导的评估协议,用于评估合成顺序表格数据的时间保真度,揭示了传统评估忽略了时间上的失败,并且考虑时间因素后排名结果存在显著差异。

arXiv:2607.15606v1 公告类型:新 摘要:合成顺序表格数据越来越多地用于隐私保护数据共享,然而,生成器可以复制每一个边际分布和外键关系,同时发出的时间戳可能向后运行或重复,并且让实体沿从未有真实实体遵循的路径移动。传统的表格评估将记录汇集到静态分布中,对这种失败视而不见。我们提出了一种基于分类学引导的评估协议,用于时间保真度评估,其中适用的测量由数据决定,而非预先固定。首先对每个数据集沿四个属性进行表征:时间如何表示,观测是否定期采样,轨迹是否相互依赖,以及模式如何将实体与其历史联系起来。这些属性决定了哪些评估维度是有效的。然后,该协议测量时间戳有效性、在对齐时间点的横截面结构、实体内部动态以及随时间变化的关系结构,并将效用和隐私评估重新定位到轨迹上,而非孤立的行上。我们将该协议应用于八个生成模型,跨越六个领域的十三个数据集。传统评估下的排名与时间评估下的排名存在显著差异,并且产生的失败是架构一致的,而非随机的。因此,时间保真度必须在时间轴本身上进行测量,而非从汇集记录分布中推断。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:30

# 生成模型能否保持时间秩序?合成序列表格数据的时间感知评估
来源:https://arxiv.org/html/2607.15606 \(2026\)

###### 摘要。

合成序列表格数据越来越多地用于隐私保护的数据共享,然而,一个生成器可以重现每一个边际分布和每一个外键关系,同时发出的时间戳却可能倒着走或重复,并且让实体沿着真实实体从未走过的路径移动。传统的表格评估将记录聚合到静态分布中,对此类失败视而不见。我们提出一个基于分类法的时序保真度评估协议,其中适用的测量由数据本身决定,而非预先固定。每个数据集首先根据四个属性进行特征化——时间如何表示、观测是否定期采样、轨迹是否相互依赖、以及模式如何将实体与其历史关联起来——这些属性决定了哪些评估维度有意义。然后,该协议测量时间戳有效性、对齐时间点上的横截面结构、实体内部动态以及时变关系结构,并将效用和隐私评估重新定位在轨迹层面而非孤立行上。我们将该协议应用于跨越六个领域的十三个数据集上的八个生成模型。传统评估下的排名与时间评估下的排名存在显著分歧,产生的失败是架构一致性的而非随机的。因此,时序保真度必须在时间轴上直接测量,而不能从聚合的记录分布中推断出来。

合成数据,序列表格数据,时序保真度,基准,生成模型,关系数据

预印本。††期刊年:2026††ccs:计算方法 数据生成与增强††ccs:数学 时间序列分析††ccs:硬件 评估

## 1. 引言

对合成表格数据的需求在金融等领域迅速增长(Potluru 等,2023 (https://arxiv.org/html/2607.15606#bib.bib32);Assefa 等,2020 (https://arxiv.org/html/2607.15606#bib.bib33))以及医疗健康领域(Rankin 等,2020 (https://arxiv.org/html/2607.15606#bib.bib34)),这由隐私法规和对敏感记录访问的限制所驱动(Ntoutsi 等,2020 (https://arxiv.org/html/2607.15606#bib.bib30);Rajpurkar 等,2022 (https://arxiv.org/html/2607.15606#bib.bib31))。序列表格数据——其中带时间戳的记录随时间累积,并按持久性实体(如客户、患者或账户)分组(Zhang 等,2022b (https://arxiv.org/html/2607.15606#bib.bib49))——实际上是许多高风险领域中的主导数据格式:金融中的交易日志、医疗中的就诊记录、零售中的使用历史以及工业系统中的传感器流都具有这种结构。尽管其普遍存在,此类数据的合成与评估仍然是关键且尚未充分探索的问题。现有的评估框架忽略了此类数据的时间结构。单表基准(Qian 等,2023 (https://arxiv.org/html/2607.15606#bib.bib24);Lautrup 等,2024 (https://arxiv.org/html/2607.15606#bib.bib23))将记录视为独立样本,而关系型基准(Jurkovic 等,2025 (https://arxiv.org/html/2607.15606#bib.bib22);Robinson 等,2024 (https://arxiv.org/html/2607.15606#bib.bib25))评估表间依赖关系,但对时间顺序和群体动态保持不可知。针对序列表格数据的先前工作(Zhang 等,2022b (https://arxiv.org/html/2607.15606#bib.bib49);Garuti 等,2025 (https://arxiv.org/html/2607.15606#bib.bib6))依赖于聚合层面的相似性,未能解决横截面动态和轨迹层面保真度的问题。

参考标题
图 1. 时序保真度评估的动机。(a) 仅通过边际分布评估时,合成数据可能与真实数据看起来相似。然而,时间视图揭示了 (b) 时间戳保真度、(c) 随时间变化的横截面分布以及 (d) 轨迹层面演化的不匹配。

一个四面板动机图,展示为何边际分布匹配不足以评估时间合成数据。面板 (a) 显示真实数据和合成数据可能具有几乎重叠的边际分布,尽管一个警告框指出边际分布可能不足以解释数据。面板 (b) 说明了时间戳保真度问题,其中合成序列包含重复时间戳和缺失时间戳,与规则的真实时间戳序列相比。面板 (c) 比较了真实和合成客户价值在日历时间上的变化,并突出了横截面分布的差异。面板 (d) 比较了真实和合成轨迹层面客户趋势随时间的变化,并突出了一阶差分错位和轨迹层面分布差异。总体而言,该图显示,时间不匹配在边际分布评估下可能保持隐藏,但通过时间戳、横截面和轨迹层面保真度视图变得可见。

图 1 (https://arxiv.org/html/2607.15606#S1.F1) 说明了这一差距的后果。ClavaDDPM(Pang 等,2024 (https://arxiv.org/html/2607.15606#bib.bib7)),一种最先进的关系生成模型,生成的合成记录违反时间顺序并包含重复时间戳,这与真实世界序列数据的约束不兼容。然而,这些在现有基准中未被检测到:合成数据在 Rossmann (a) 上达到了近乎完美的边际保真度,因为传统指标将时间结构压缩到静态分布中。差异在时间戳 (b)、横截面 (c) 和轨迹层面 (d) 检查时显现出来,合成群体未能反映真实世界的时间动态。为了解决这一局限性,我们引入了 Seq2Synth,一个用于评估合成序列表格数据时序保真度的统一基准。本文的核心主张是:时序保真度无法可靠地从静态保真度或关系保真度推断出来:一个生成器可能匹配边际或关系分布,同时违反时间顺序、扭曲群体动态、破坏实体内部演化或破坏时变关系结构。Seq2Synth 通过将数据集特征映射到适用的评估维度,并测量四种互补的时序保真度形式——时间戳有效性、横截面保真度、纵向保真度和结构一致性——来操作化这一主张。我们还将标准效用和隐私协议扩展到轨迹感知设置,以便在下游有用性和泄露风险评估中考虑序列依赖关系,而不仅仅是行层面的相似性。

贡献。
(1) 我们为序列表格数据制定了一个基于分类法的评估协议,其中时间表示、采样规律性、跨轨迹依赖性和模式结构决定了哪些时间指标适用。
(2) 我们将该协议实例化为 Seq2Synth,涵盖时间戳、横截面、纵向和结构保真度,并带有轨迹感知的效用和隐私扩展。
(3) 我们构建了一个跨越六个领域的 13 数据集基准,评估了八个代表性生成器,表明静态分布排名与时间感知排名存在显著分歧,并且不同架构沿不同的时间维度失败。

## 2. 相关工作

##### 合成表格数据生成

合成数据生成已通过多种方法进行研究。早期的关系合成方法,如 SDV(Patki 等,2016 (https://arxiv.org/html/2607.15606#bib.bib10))和 RCTGAN(Gueye 等,2023 (https://arxiv.org/html/2607.15606#bib.bib11)),依赖于层次或条件生成,而 ClavaDDPM(Pang 等,2024 (https://arxiv.org/html/2607.15606#bib.bib7))将表间关系整合到扩散中。最近的基于图的方法,包括 RGCLD(Hudovernik,2024 (https://arxiv.org/html/2607.15606#bib.bib12))和 RelDiff(Hudovernik 等,2025 (https://arxiv.org/html/2607.15606#bib.bib8)),使用 GNN 来建模结构依赖并提高关系一致性。RDB-Diffusion(Ketata 等,2025 (https://arxiv.org/html/2607.15606#bib.bib14))应用结构感知扩散,以大规模保存表内分布和表间一致性。同时,合成数据库(SDV)库(DataCebo, Inc.,2020 (https://arxiv.org/html/2607.15606#bib.bib51))通过 CPAR(Zhang 等,2022a (https://arxiv.org/html/2607.15606#bib.bib16))支持序列表格数据,后者与 TabularARGN(Tiwald 等,2025 (https://arxiv.org/html/2607.15606#bib.bib15))一起,在单表设置中使用自回归建模。REaLTabFormer(Solatorio and Dupriez,2023 (https://arxiv.org/html/2607.15606#bib.bib9))(RTF)采用基于 Seq2Seq 的框架,用于将父实体链接到子轨迹表的线性模式。与我们的基准相关的是,TabDiT(Garuti 等,2025 (https://arxiv.org/html/2607.15606#bib.bib6))采用自回归扩散 Transformer 用于时间相关的关系数据,覆盖了现有方法中范围最广的序列表格结构。

##### 合成数据评估

已经开发了各种基准框架来评估跨模态的合成数据质量。SynthCity(Qian 等,2023 (https://arxiv.org/html/2607.15606#bib.bib24))和 SynthEval(Lautrup 等,2024 (https://arxiv.org/html/2607.15606#bib.bib23))提供了评估保真度、效用和隐私的工具。对于关系数据,专门的框架考虑了跨表依赖和结构一致性:RelBench(Robinson 等,2024 (https://arxiv.org/html/2607.15606#bib.bib25))通过将表格记录转换为图结构并将图神经网络应用于下游预测任务来评估效用,而 SyntheRela(Jurkovic 等,2025 (https://arxiv.org/html/2607.15606#bib.bib22))通过将子表特征聚合到父表,然后进行基于分类器的双样本测试来测量关系保真度。SDV 库(Patki 等,2016 (https://arxiv.org/html/2607.15606#bib.bib10))提供了评估指标(例如 SDMetrics),可以捕获序列数据的逐步分布相似性。

针对序列表格数据的模型使用模型特定指标评估时间特征。TabDiT(Garuti 等,2025 (https://arxiv.org/html/2607.15606#bib.bib6))报告 MLD-TS 和 MLE-TS,而 TabularARGN(Tiwald 等,2025 (https://arxiv.org/html/2607.15606#bib.bib15))采用基于连续时间步对的连贯性指标。然而,这些针对序列表格数据的评估缺乏一个统一且系统的框架来评估跨越不同序列结构的时间特征,从而使最先进模型中的关键失败模式仍未被检测到。

参考标题
图 2. 提出的时序保真度评估指标概览。
时间戳保真度检测时间违规。横截面保真度捕获每个时间步的分布差异。纵向保真度比较步级差异和全局轨迹差异。结构保真度检查表关系中的相似性。

一个提出的时序保真度评估指标的概览图,组织为四列。时间戳列说明了三种类型的时间戳违规:重复时间戳、缺失网格点以及超出有效范围的时间戳。横截面列显示了在每个时间步比较的分布,真实值和合成值形成不同的每时间分布。纵向列显示了两种基于轨迹的比较:连续时间点之间的步级差异以及跨整个序列的轨迹级差异。结构列显示了父-子表关系,并比较了真实数据和合成数据之间的关系基数分布。

## 3. Seq2Synth 基准

表 1. 现有合成表格数据评估框架的比较。
✓:明确支持,△:部分或间接支持,✗:未明确解决。

一个现有合成表格数据评估框架的比较表。行表示评估维度,包括时间戳有效性、横截面动态、纵向轨迹动态、关系或结构保真度、时间效用和时间隐私。列将现有框架分为单表基准、关系表基准、序列表格生成模型以及提出的框架。大多数现有框架仅解决了这些维度的一个子集,而提出的框架支持全部六个维度。

| 评估维度 | 单表 | 关系 | 序列 | Ours |
|----------|------|------|------|------|
| | SynthCity (Qian 等, 2023) | SynthEval (Lautrup 等, 2024) | SynMeter (Du and Li, 2025) | RelBench (Robinson 等, 2024) | SyntheRela (Jurkovic 等, 2025) | SDV (DataCebo, Inc., 2020) | TabularARGN (Tiwald 等, 2025) | TabDiT (Garuti 等, 2025) | \cellcolor{blue!7}Seq2Synth |
| 时间戳有效性 | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | \cellcolor{blue!7}✓ |
| 横截面动态 | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | \cellcolor{blue!7}✓ |
| 轨迹动态 | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | △ | ✓ | \cellcolor{blue!7}✓ |
| 结构保真度 | ✗ | ✗ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | \cellcolor{blue!7}✓ |
| 时间效用 | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | ✓ | \cellcolor{blue!7}✓ |
| 时间隐私 | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | \cellcolor{blue!7}✓ |

为了解决现有框架的局限性(见表 1 (https://arxiv.org/html/2607.15606#S3.T1)),Seq2Synth 通过一个基于分类法的协议来评估合成序列表格数据,而不是使用固定的一整套通用指标。给定一个真实关系数据集 \(\mathcal{T}\) 及其合成对应物 \(\hat{\mathcal{T}}\),基准首先识别数据的时序和结构属性,选择适用的评估维度,在需要时对指标输入进行归一化,并在此通用协议下报告保真度、效用和隐私分数。

### 3.1. 数据模型与分类法

真实世界数据,如客户交易历史和患者就诊记录,共享一个共同结构:带时间戳的记录随时间累积,并按持久性实体分组。我们将此类数据定义为序列表格数据。设 \(\mathcal{T} = \{T_1, \ldots, T_D\}\) 表示一个具有时间依赖和引用依赖的关系数据集,并设 \(T \in \mathcal{T}\) 为包含 \(N\) 条带时间戳记录的目标表:
\[
T = \{ (x^{key}_i, x^{time}_i, \mathbf{r}_i) \}_{i=1}^N,
\]
其中 \(x^{key}_i\) 标识实体,\(x^{time}_i \in \Omega\) 是其时间戳,\(\mathbf{r}_i = (\mathbf{x}^{num}_i, \mathbf{x}^{cat}_i)\) 包含数值和类别属性。对于每个实体 \(k\),那些 \(x^{key}_i = k\) 的行按时间戳排序形成一条轨迹:
\[
T(k) = \{ (x^{time}_{k,j}, \mathbf{r}_{k,j}) \}_{j=1}^{L_k}, \quad x^{time}_{k,1} \leq \cdots \leq x^{time}_{k,L_k}.
\]

##### 分类法

Seq2Synth 沿着四个属性对每个数据集进行分类:时间如何表示、观测是否定期采样、轨迹是否相互依赖、以及模式如何将实体与其历史关联起来。这些属性决定了哪些评估维度是适用的。

相似文章

测量依赖差距:诊断表格生成模型中的列间保真度

arXiv cs.LG

本文引入了一种依赖感知的保真度诊断方法,用于测量合成表格数据中的列间依赖关系,揭示了标准指标对依赖关系视而不见,当前的生成器存在一个残余差距,无法通过增加容量或常见修复来弥补。

分布漂移下的时序知识图谱预测:一项合成评估

arXiv cs.LG

本文研究了在受控分布漂移下的时序知识图谱预测,使用了一个编码重复性、同质性和周期性的合成生成器。在七种架构上的实验揭示了信号依赖的鲁棒性以及模型对结构断裂适应性方面的局限性。

Timesynth: 健康信号数字孪生的时间保真度框架

arXiv cs.LG

Timesynth 引入了一个用于健康信号数字孪生的受控基准测试框架,包括一个生理信号生成器和诊断工具来评估时间保真度,揭示了逐点指标无法捕捉预测模型中的相位和频率失真。

生成模型通过市场选择侵蚀人类时间学习

arXiv cs.LG

本文引入“人类时间学习”(Human Temporal Learning, HTL)的概念,论证生成模型通过价值崩溃对知识生产构成结构性风险——当区分人类与AI输出的难度增加时,深度人类工作会在竞争中被排挤。