基于Flow Matching的表格数据无监督异常检测
摘要
本文研究了使用flow matching在表格数据上的无监督异常检测,重点关注受污染的训练集,并比较不同的评分方法以增强鲁棒性。
arXiv:2608.19801v1 公告类型:新
摘要:金融异常检测通常依赖于大量未标记的交易日志,其中异常样本可能在训练期间已经存在。这种训练集污染违反了许多异常检测方法所基于的清洁正常数据假设。尽管flow matching在生成模型中表现出色,但其在无监督表格异常检测中的鲁棒性仍未得到充分探索。在这项工作中,我们研究了基于flow matching的异常检测在受污染训练数据下的表现,通过比较Time-Conditioned Contraction Matching (TCCM)与Forest-Flow,并评估多种异常评分函数。我们的结果表明,异常评分的选择至关重要。TCCM使用的原始单步Decision评分对污染敏感,而基于轨迹的Deviation和Reconstruction评分提供了更稳定的异常信号。使用这些评分,Forest-Flow变得与TCCM具有竞争力,并在某些情况下优于TCCM。这些发现突显了在严重类别不平衡下的金融异常检测中,异常评分对于flow matching方法的重要性。
查看缓存全文
缓存时间: 2026/08/21 10:28
# 基于流匹配的无监督表格数据异常检测 来源:https://arxiv.org/html/2608.19801 Tejaswini MediMargret KeuperE\-mail[philip\.konz@gmx\.de](mailto:[email protected])附属机构:附属机构:曼海姆大学、马克斯·普朗克信息学研究所、萨尔布吕肯信息学园区,德国 ###### 摘要 金融异常检测通常依赖于大量未标记的交易日志,其中异常样本可能在训练期间就已存在。这种训练集污染违反了许多异常检测方法所依赖的“纯净正常数据”假设。尽管流匹配在生成模型中表现出色,但其在无监督表格异常检测中的鲁棒性仍待深入探索。本工作在受污染的训练集条件下研究了基于流匹配的异常检测,通过比较时间条件收缩匹配与Forest-Flow并评估多种异常评分函数来实现。我们的结果表明,异常评分函数至关重要:TCCM原有的单步决策评分对污染敏感,而基于轨迹的偏离和重构评分则能提供更稳定的异常信号,使得Forest-Flow在某些情况下可与TCCM媲美甚至超越。研究结果凸显了异常评分对于流匹配在金融异常检测中应对严重类别不平衡问题的重要性。 ## 1引言 表格数据的异常检测在金融欺诈检测[7 (https://arxiv.org/html/2608.19801#bib.bib13)]、制造故障检测[30 (https://arxiv.org/html/2608.19801#bib.bib14)]和医疗诊断[5 (https://arxiv.org/html/2608.19801#bib.bib9)]等高风险领域至关重要,这些领域中的罕见异常样本通常对应着高成本或安全关键事件。现有方法大致分为经典机器学习和深度学习方法[13 (https://arxiv.org/html/2608.19801#bib.bib6)]。经典方法,包括局部离群因子[1 (https://arxiv.org/html/2608.19801#bib.bib16)]、主成分分析[27 (https://arxiv.org/html/2608.19801#bib.bib17)]和单类支持向量机[25 (https://arxiv.org/html/2608.19801#bib.bib15)],因其简单性而被广泛使用,但由于可扩展性有限且在复杂特征空间中效果降低,常难以处理高维和大规模数据集[13 (https://arxiv.org/html/2608.19801#bib.bib6)]。深度学习方法通过学习更丰富的表示克服了部分局限性,并展现出强大的实证性能[21 (https://arxiv.org/html/2608.19801#bib.bib32)]。然而,对抗模型如AnoGAN[24 (https://arxiv.org/html/2608.19801#bib.bib2)]存在不稳定的极小极大优化问题,基于扩散的方法[18 (https://arxiv.org/html/2608.19801#bib.bib10)]需要精心设计的噪声调度和缓慢的迭代推理,而标准化流则受限于可逆性要求和雅可比计算[19 (https://arxiv.org/html/2608.19801#bib.bib26)]。许多深度异常检测器还具有较高的推理延迟,限制了其在大规模表格数据上的实用性[13 (https://arxiv.org/html/2608.19801#bib.bib6)]。 另一个重要局限性在于,经典和深度学习方法通常都在假设训练数据纯净正常的半监督设置下进行评估[13 (https://arxiv.org/html/2608.19801#bib.bib6)]。然而在实践中,训练集常包含未标记的异常,识别或移除它们成本高昂[8 (https://arxiv.org/html/2608.19801#bib.bib19)]。这种污染会显著降低检测性能[8 (https://arxiv.org/html/2608.19801#bib.bib19)]。因此,近期工作探索了鲁棒策略,如基于集成的检测器,通过聚合多样化模型来减少受污染样本的影响[8 (https://arxiv.org/html/2608.19801#bib.bib19)],尽管这增加了计算成本。 流匹配[15 (https://arxiv.org/html/2608.19801#bib.bib5)]近期成为一种强大的生成建模框架,它结合了扩散模型的稳定性和表达能力,同时提供了更高效的确定性采样动力学[16 (https://arxiv.org/html/2608.19801#bib.bib29), 12 (https://arxiv.org/html/2608.19801#bib.bib30), 13 (https://arxiv.org/html/2608.19801#bib.bib6)]。它学习一个时间相关的向量场,将样本从简单源分布(如高斯噪声)连续传输到目标数据分布。基于此框架,时间条件收缩匹配将流匹配应用于表格异常检测,并在半监督设置中达到了最先进的性能[13 (https://arxiv.org/html/2608.19801#bib.bib6)]。TCCM并非学习完整的传输向量场,而是预测一个时间条件的收缩向量,将样本逐渐移向原点。 尽管性能出色,TCCM是为干净正常训练数据设计的,其在训练集受污染的全无监督设置下的行为尚未得到充分探索。此外,虽然原始工作报告称传统流匹配模型性能较弱,但该比较仅限于半监督设置。因此,基于流匹配的异常检测器在训练集污染下的鲁棒性仍不完全清楚。 在本工作中,我们研究了全无监督设置下基于流匹配的异常检测。我们首先考察了不同异常评分函数如何影响TCCM在训练数据受污染时的鲁棒性,以及替代评分策略是否能缓解性能下降。然后评估了传统流匹配模型,特别是ForestFlow[10 (https://arxiv.org/html/2608.19801#bib.bib7)],在配合适当评分函数时能否匹配或超越TCCM。实验主要在两个异常比例显著不同的金融表格数据集上进行:Campaign (ρ=11.27%) 和合成商业交易数据集 (ρ=0.786%),从而可以在中等和极端类别不平衡条件下进行评估。 我们的主要贡献如下: - •我们研究了训练集受污染条件下基于流匹配的异常检测,重点关注具有未标记异常的真实无监督金融表格数据集。 - •我们表明异常评分对于鲁棒性至关重要:TCCM原有的单步决策评分对污染高度敏感,而基于轨迹的评分(即偏离和重构评分)能提供更稳定的异常信号。 - •我们证明基于轨迹的评分显著提升了鲁棒性和检测性能。特别是,偏离和重构评分使得ForestFlow在中等和严重异常类别不平衡设置中均能与最先进的TCCM基线相媲美,有时甚至更优。 ##### 本文结构如下:第2节介绍所提模型和异常评分函数,第3节描述实验设置,第4节呈现主要结果,第5节分析超参数敏感性,第6节总结研究发现。 ## 2方法论 我们评估了两种具有不同设计目标的基于流匹配的模型:Forest-Flow[10 (https://arxiv.org/html/2608.19801#bib.bib7)],一种通用的表格数据生成模型,以及TCCM[13 (https://arxiv.org/html/2608.19801#bib.bib6)],一种专为表格异常检测设计的基于流的方法。虽然两者都通过流匹配学习基于常微分方程的速度场,但它们在表示正常性和推导异常分数的方式上有所不同。Forest-Flow学习从高斯噪声到数据分布的生成传输,通过测量样本符合所学生成动力学的程度进行事后异常检测。相反,TCCM学习一个将样本推向固定点的收缩场,使得偏离所学收缩行为成为直接的异常信号。 对于这两个模型,我们评估了三种异常评分函数:决策评分、偏离评分和重构评分。决策评分对应于原始的TCCM评分函数,它相对于输入是利普希茨连续的[13 (https://arxiv.org/html/2608.19801#bib.bib6)]。它在单个代表性时间点评估速度预测误差:对于TCCM是在原始输入处的收缩预测误差,对于Forest-Flow是在数据端点附近的传输速度预测误差。偏离评分沿所学流轨迹在多个时间步上累积速度预测误差,测量所学动力学的时间一致性。重构评分使用欧拉步数值积分所学速度场,并测量在期望端点处的ℓ₂重构误差,捕捉沿流轨迹累积的误差。 ##### 符号说明。 令 \(x \in \mathbb{R}^d\) 表示一个表格样本,其中 \(d\) 是特征维度,并令 \(z \sim \mathcal{N}(0, I_d)\) 表示标准高斯噪声。时间变量是 \(t \in [0,1]\),离散化为 \(t_i = i/(n_t-1)\),其中 \(i = 0, \ldots, n_t-1\)。对于Forest-Flow中的蒙特卡洛估计,我们为每个输入样本抽取 \(K\) 个独立噪声样本 \(z^{(k)}, k=1,\ldots,K\)。 ### 2\.1结合XGBoost回归器的Forest-Flow (FF-XGB) Forest-Flow[10 (https://arxiv.org/html/2608.19801#bib.bib7)]在条件流匹配框架[15 (https://arxiv.org/html/2608.19801#bib.bib5)]下学习速度场。训练期间,每个数据点 \(x\) 与高斯噪声 \(z\) 配对,中间状态通过线性插值构造:\(x_t = (1-t)z + tx\)。对应的目标速度是常位移 \(v_{\mathrm{true}} = x - z\),这定义了从噪声到数据的传输方向。Forest-Flow将时间离散化为 \(n_t\) 个级别,并在每个时间步 \(t_i\) 训练一个独立的XGBoost回归器[3 (https://arxiv.org/html/2608.19801#bib.bib18)] \(v_{\theta}^{(i)}\) 来预测从 \(x_{t_i}\) 出发的该位移。训练目标是 \[\mathbb{E}\left[\left\|v_{\theta}^{(i)}(x_{t_i}) - (x - z)\right\|_{2}^{2}\right],\] 这鼓励学习到的速度场与条件传输路径对齐。测试时,每个样本 \(x\) 与 \(K\) 个独立噪声样本 \(z^{(k)}\) 配对,生成插值点 \(x_{t_i}^{(k)} = (1-t_i)z^{(k)} + t_i x\)。由于后期时间步更接近数据分布且受噪声影响较小,我们在时间步集合 \[\mathcal{T}_{\mathrm{FF}}=\left\{t_i : i=\lfloor n_t/2\rfloor, \ldots, n_t-2\right\}\] 上评估异常分数。决策评分测量最后一个评估时间步的速度预测误差。偏离评分累积所有 \(t_i \in \mathcal{T}_{\mathrm{FF}}\) 上的速度预测误差。重构评分测量使用欧拉步数值积分所学速度场后,能多准确地恢复 \(x\)。分数在 \(K\) 个噪声实现上取平均,以获得每个样本的最终异常分数。评分函数的正式定义见附录附录 0\.A (https://arxiv.org/html/2608.19801#Pt0.A1)。 ### 2\.2时间条件收缩匹配 (TCCM) TCCM[13 (https://arxiv.org/html/2608.19801#bib.bib6)]不是像Forest-Flow那样的生成式噪声到数据模型。相反,它学习一个确定性收缩场,将样本移向原点。给定样本 \(x\) 和时间 \(t \in [0,1]\),一个单独的多层感知机 \(f_{\theta}\) 使用正弦时间嵌入预测一个时间条件速度。训练目标是 \[\mathbb{E}_{x,t}\left[\left\|f_{\theta}\big([x; \mathrm{Embed}(t)]\big) + x\right\|_{2}^{2}\right],\] 这鼓励预测速度匹配收缩方向 \(-x\)。因此,原点充当所学动力学的稳定不动点。 与Forest-Flow不同,TCCM使用一个连续时间条件网络,不学习从噪声到数据的生成传输,也不需要蒙特卡洛采样。评估时,我们使用确定性探测路径 \(x(t_i) = (1-t_i)x\) 并评估早期时间水平 \[\mathcal{T}_{\mathrm{TCCM}}=\left\{t_i : i=0, \ldots, \lfloor n_t/2\rfloor-1\right\},\] 其中探测点保持在原始样本附近。决策评分测量原始输入处的收缩预测误差。偏离评分累积沿探测路径的预测误差。重构评分测量通过数值积分所学收缩场到原点后的误差。评分函数的正式定义见附录附录 0\.A (https://arxiv.org/html/2608.19801#Pt0.A1)。 ## 3实验 ### 3\.1数据集 我们在三个具有不同异常比例和数据特性的表格异常检测数据集上评估模型。 Campaign是来自ADBench[6 (https://arxiv.org/html/2608.19801#bib.bib27)]的公开金融数据集,包含41,188个样本,62个数值特征,4,640个标记的异常,对应异常比例 ρ=11.27%。这个高维数据集是我们的主要金融基准,也在原始TCCM评估中使用过[13 (https://arxiv.org/html/2608.19801#bib.bib6)]。 合成商业交易数据集是一个合成的金融交易数据集,模拟了九个客户的对公支付活动。它包含6,364笔交易和50个标记的异常,对应异常比例 ρ=50/6364≈0.786%。每笔交易使用21个数值的、基于时间的特征进行编码。异常涵盖可疑模式,如金额突增、重复支付、收款人或IBAN变更、时间偏移和非典型支付渠道。这使得该数据集适用于评估极端异常类别不平衡下的异常检测。更多细节见附录附录 0\.C (https://arxiv.org/html/2608.19801#Pt0.A3)。 为了评估在金融数据之外的泛化能力,我们还评估了Waveform,这是来自ADBench[6 (https://arxiv.org/html/2608.19801#bib.bib27)]的物理数据集,也在原始TCCM评估中使用过[13 (https://arxiv.org/html/2608.19801#bib.bib6)]。它包含3,443个样本,21个数值特征和100个异常,对应异常比例 ρ=2.90%。 ### 3\.2评估协议 我们遵循[13 (https://arxiv.org/html/2608.19801#bib.bib6)]评估训练集污染下的鲁棒性。对于Campaign,使用种子42将正常样本随机划分为大小相等的训练集和测试集。异常样本被均匀划分,一半加入固定的测试集,另一半保留用于受控地注入训练集。对于合成商业交易数据集,我们使用时间中点划分以保留其时间序列结构。由于异常在时间上不均匀分布,这导致训练期有28个异常,测试期有22个异常。特征
相似文章
缺失数据下的流匹配
本文提出了缺失数据流匹配(Missing-Data Flow Matching)方法,该方法将训练样本中缺失的坐标视为潜在变量,并在可能取值上对流匹配损失进行平均。理论分析表明该修正是精确的,并提供了设计指导,实验在表格数据上验证了该方法的有效性。
LLM作为检测器:一种用于表格异常检测的上下文学习方法
本文提出了LLM-Detector,这是一个利用大语言模型进行上下文学习的框架,用于执行表格异常检测,无需微调,在多个数据集上展示了相对于现有方法的持续改进。
从基准性能到工具部署:人在回路异常检测
本文在BowTie制造数据集上评估了19种无监督异常检测模型,发现其性能不如基准测试所暗示的那样稳定,并提出了一个已部署的用于制造零件检测的人机协同框架。
重新审视基于能量的表格异常检测:能量与重建的互补性
本文重新审视了基于能量的模型在表格异常检测中的应用,证明将Deep Boltzmann Machine的能量分数与自编码器的重建分数相结合,能显著提升在基准数据集上的性能。
利用流匹配捕获非平衡随机系统中的非马尔可夫动力学
本文开发了一种生成式流匹配方法,用于捕获非平衡随机系统中的非马尔可夫动力学,并展示了与马尔可夫基线相比,在Kramers首次通过时间问题上的改进预测。