缺失数据下的流匹配

arXiv cs.LG 论文

摘要

本文提出了缺失数据流匹配(Missing-Data Flow Matching)方法,该方法将训练样本中缺失的坐标视为潜在变量,并在可能取值上对流匹配损失进行平均。理论分析表明该修正是精确的,并提供了设计指导,实验在表格数据上验证了该方法的有效性。

arXiv:2607.28698v1 公告类型:新 摘要:流匹配假设训练数据完全观测,而许多现实应用很少能提供这样的数据。我们提出了缺失数据流匹配(Missing-Data Flow Matching)方法,该方法将训练样本中缺失的坐标视为潜在变量,并在其可能取值上对流匹配损失进行平均。我们首先证明该修正是精确的而非近似的。在完全随机缺失且存在真实补全的情况下,不完整数据目标等于完整数据目标,因此缺失性不会改变流匹配学习的任何内容,全部困难转移到了补全模型上。随后,我们的有限样本分析回答了算法遗留的设计问题,而这些答案并不符合直觉。缺失性转移的是估计量方差而非增加方差;每个样本一次补全已能与完整数据方差精确匹配;在固定评估预算下,一次补全是最优的。学习到的补全模型贡献了一个不可约的偏差,我们通过其与真实补全分布的期望条件Wasserstein距离来界定该偏差。实验在数值上验证了理论预测,表明导致生成分布坍缩的是确定性插补而非冻结插补,并将我们的方法与真实表格数据上强大的经典和深度插补基线进行了对比。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:31

# 缺失数据下的流匹配

来源:https://arxiv.org/html/2607.28698

###### 摘要

流匹配假设训练数据是完全观测的,但许多真实应用很少提供这样的数据。我们提出缺失数据流匹配(Missing-Data Flow Matching),它将训练样本中缺失的坐标视为潜变量,并在这些坐标可能取到的值上对流匹配损失取平均。我们首先证明这种修正是精确的,而不是近似的。在完全随机缺失(MCAR)且使用真实补全时,不完整数据目标等于完整数据目标,因此缺失性不会改变流匹配学习的内容,全部难点转移到补全模型上。我们的有限样本分析随后回答了该算法留下的设计问题,而答案并非直觉所暗示的那样。缺失性转移估计量方差而非增加方差;每个样本一次补全已经与完整数据方差完全匹配;在固定评估预算下,一次补全是最优的。学习得到的补全模型贡献一个单个不可约偏差,我们用它与真实补全分布的期望条件 Wasserstein 距离来界定该偏差。实验在数值上验证了理论预测,表明导致生成分布坍缩的是确定性插补而非冻结插补,并将我们的方法与真实表格数据上强大的经典和深度插补基线进行了比较。

## 1 引言

流匹配已成为生成建模的有效方法。它学习一个依赖时间的向量场,将基础分布传输到数据分布,并通过一个稳定的回归目标训练该向量场,而无需在训练期间模拟生成动力学(Lipman et al., 2023 (https://arxiv.org/html/2607.28698#bib.bib1);Tong et al., 2024 (https://arxiv.org/html/2607.28698#bib.bib2))。然而,标准流匹配假设每个训练端点都是完全观测的。但现实世界的数据往往是不完整的:医疗记录遗漏未做的检查,传感器丢失读数,调查问卷留下未回答的问题。由于训练损失需要完整的数据点作为插值路径的端点,缺失性使标准流匹配无法构造端点、插值路径和相应的回归目标。

点插补:真实离散度(在 \(\mu\) 处的点质量)——生成的 \(\operatorname{Var}(x_{-\Lambda}\mid x_\Lambda)=0\)。重采样(我们的方法):目标与真实相同——生成的 \(\operatorname{Var}(x_{-\Lambda}\mid x_\Lambda)=s^2\)。图 1:点插补会坍缩缺失坐标的条件分布。流匹配学习的是其训练端点的分布。左侧,确定性插补将每个端点设为条件均值 \(\mu\),因此生成坐标的条件方差为 \(0\),丢失了真实的离散程度(虚线)。右侧,从真实条件分布中重采样保留了该离散程度。两者都保留均值,但只有重采样保留条件变异性。

标准的解决方案是点插补(point imputation),即用单个估计值(例如条件均值)填充每个缺失值(Little and Rubin, 2019 (https://arxiv.org/html/2607.28698#bib.bib26))。这对主要依赖均值的预测任务可能足够,但很不适合生成学习。流匹配学习复现其训练端点的分布,因此用单一值填充每个缺失部分会将一整个合理值范围坍缩成一个点,而模型随后学习生成这个点。多重插补被引入的原因——单一填充会低估变异性(Rubin, 1976 (https://arxiv.org/html/2607.28698#bib.bib3))——也正是它破坏生成模型的原因。图 1 的左子图显示了这种坍缩。为解决这一问题,我们将缺失坐标视为潜变量。我们不是承诺单一值,而是从缺失部分在给定观测部分条件下的条件分布中抽取新的补全,并在这些补全上对流匹配损失取平均。我们将我们的方法命名为缺失数据流匹配(Missing-Data Flow Matching, MDFM)。我们证明的一个重要结果是,这种修正是精确的,而不是近似的。当数据完全随机缺失(MCAR)(Rubin, 1976 (https://arxiv.org/html/2607.28698#bib.bib3)),并且补全来自真实条件分布时,从不完整数据训练流匹配与从完整数据训练完全等价。两个目标是模型的同一个函数,因此只要它们可微,其梯度就一致。缺失性不会改变流匹配试图学习的内容,而是把难点转移到估计条件补全分布上。

虽然我们证明的理论表明该算法不需要对普通流匹配做大的修改,但我们发现一些关键设计选择会极大影响性能,因此需要更仔细的研究。每个样本应该获得多少次补全?更高的缺失率是否要求更多补全?固定评估预算应如何在补全和样本之间分配?不完美的补全模型代价有多大?我们的有限样本分析在固定参数设置下回答了这些问题,而我们的训练模型实验则回答了另一个独立的问题:补全应该每个 epoch 重新抽取,还是只抽取一次然后冻结。

缺失数据并不会使损失估计更加嘈杂。它将波动转移到一个可以通过对补全取平均而消除的位置,而我们关于总估计量方差的界不依赖于数据缺失多少。每个样本一次补全被证明已经足够,并且在固定评估预算下,抽取更多补全不如收集更多不完整样本。一旦样本量足够大,重要的便只有补全模型的质量,我们确定了该模型与真实分布之间的距离,它控制了剩余偏差。

我们的工作介于两条近期研究路线之间。带缺失数据的分数匹配修正了针对不完整数据的训练目标(Givens et al., 2025 (https://arxiv.org/html/2607.28698#bib.bib4)),而诸如用于插补的条件流匹配(CFMI)等方法则用流匹配来良好地插补缺失值(Simkus and Gutmann, 2025 (https://arxiv.org/html/2607.28698#bib.bib7))。我们将补全模型作为引擎,但目标是完整的生成流,而我们的理论精确说明了何时以及为何将补全插入流匹配能够恢复完整数据模型。

贡献。我们将贡献总结如下。

- 我们提出了缺失数据流匹配(Missing-Data Flow Matching),通过将缺失坐标视为重采样的潜变量,从部分观测数据训练流匹配。使用 oracle 补全时,其总体目标在 MCAR 下等于完整数据流匹配,并且我们将分析扩展到 MAR 和 MNAR。
- 我们推导了一个有限样本方差分解,表明一次 oracle 补全与完整数据方差匹配,并且在固定评估预算下是最优的。对于学习得到的补全,我们通过其与真实补全的条件 Wasserstein 距离来界定总体目标偏差。
- 我们在合成数据上验证了理论预测,并表明随机补全保留了生成结果的条件变异性。在真实表格数据上,MDFM 与强大的插补流程具有竞争力,并在协方差保留方面表现最佳。

## 2 相关工作

从缺失数据生成建模。流匹配和相关连续生成模型假设训练端点完全观测(Lipman et al., 2023 (https://arxiv.org/html/2607.28698#bib.bib1);Tong et al., 2024 (https://arxiv.org/html/2607.28698#bib.bib2);Chen et al., 2018 (https://arxiv.org/html/2607.28698#bib.bib8);Liu et al., 2023 (https://arxiv.org/html/2607.28698#bib.bib9);Albergo and Vanden-Eijnden, 2023 (https://arxiv.org/html/2607.28698#bib.bib10))。深度潜变量模型通过重要性加权或任意条件自编码器、对抗模型和条件归一化流从不完整数据直接学习(Mattei and Frellsen, 2019 (https://arxiv.org/html/2607.28698#bib.bib19);Ivanov et al., 2019 (https://arxiv.org/html/2607.28698#bib.bib23);Li et al., 2019 (https://arxiv.org/html/2607.28698#bib.bib24), 2020 (https://arxiv.org/html/2607.28698#bib.bib25)),另一条平行路线从不完整测量中学习,而从未见过干净样本(Bora et al., 2018 (https://arxiv.org/html/2607.28698#bib.bib31);Daras et al., 2023 (https://arxiv.org/html/2607.28698#bib.bib30))。这些工作改变生成训练信号以适应损坏算子。我们则保持流匹配损失不变,只修复端点。

插补与目标修正。MICE 和 MissForest 等经典方法在表格数据上仍然强大(Van Buuren and Groothuis-Oudshoorn, 2011 (https://arxiv.org/html/2607.28698#bib.bib17);Stekhoven and Bühlmann, 2012 (https://arxiv.org/html/2607.28698#bib.bib18)),深度插补器扩展到更大规模(Yoon et al., 2018 (https://arxiv.org/html/2607.28698#bib.bib20);Tashiro et al., 2021 (https://arxiv.org/html/2607.28698#bib.bib21);Jolicoeur-Martineau et al., 2024 (https://arxiv.org/html/2607.28698#bib.bib22)),基于流的插补器如 CFMI 报道了最先进的结果(Simkus and Gutmann, 2025 (https://arxiv.org/html/2607.28698#bib.bib7))。这些方法产生补全而不是联合模型,因此在我们的框架中它们是 \(q_\phi\) 的候选,而不是竞争对手。另一条路线直接改变训练目标本身。MissDiff 在缺失坐标上遮蔽去噪分数匹配损失,并证明学习到的分数的一致性(Ouyang et al., 2023 (https://arxiv.org/html/2607.28698#bib.bib29));缺失数据分数匹配通过边际分数恒等式对未观测坐标求边际(Hyvärinen and Dayan, 2005 (https://arxiv.org/html/2607.28698#bib.bib27);Givens et al., 2025 (https://arxiv.org/html/2607.28698#bib.bib4)),两者都在 Rubin 的经典框架内(Rubin, 1976 (https://arxiv.org/html/2607.28698#bib.bib3);Little and Rubin, 2019 (https://arxiv.org/html/2607.28698#bib.bib26))。MDFM 既不改变损失,也不改变目标。它提供普通损失本来就需要

相似文章

遵循均值:参考引导的流匹配

Hugging Face Daily Papers

本文介绍了一种在流匹配中实现可控生成的方法,通过使用参考集调整条件端点均值,提供了无需训练和半参数化的指导方式,用于风格和内容控制。

SDFlow:用于时间序列生成的相似性驱动流匹配

arXiv cs.AI

本文介绍了 SDFlow,这是一种用于时间序列生成的相似性驱动流匹配框架,旨在解决自回归模型中的暴露偏差问题。通过在冻结的 VQ 潜在空间中进行低秩流形分解,SDFlow 实现了最先进的性能并显著提升了推理速度。

基于最优传输势的多边缘流匹配

arXiv cs.LG

提出OTP-FM,一种新颖的多边缘流匹配方法,利用最优传输势来软性地引导流通过中间边缘分布,在单细胞RNA测序、海洋学和气象学数据集上实现了最先进的性能。