量子启发式上下文学习在动态交易图中稀疏环欺诈检测中的应用

arXiv cs.LG 论文

摘要

本文介绍了一个探索性基准测试,用于在动态交易图中检测稀疏环欺诈,采用量子启发式上下文机器学习(CML)与GRU基线进行比较,发现结合身份保持与拓扑摘要的混合图特征取得了最佳结果。

arXiv:2607.09704v1 公告类型: 新 摘要: 我们提出了一个用于动态金融交易图中欺诈筛查的探索性基准测试和量子启发式建模原型。协同欺诈可能无法从单笔交易中显现,但可能表现为跨周期的关系模式。我们专注于稀疏环欺诈,这是一种典型模式,其中完成的有向环分布在数天内,要求模型跨时间和图结构整合证据。我们使用一个合成交易模拟器来研究该问题,该模拟器包含完整的稀疏环注入和断环诱饵。每日有向交易图被聚合到滚动窗口中,并使用原始图特征、持续同源性摘要或结合两者的混合特征向量来表示。我们将门控循环单元(GRU)基线与量子启发式上下文机器学习(CML)作为序列级分类器进行比较。由于基准测试使用合成数据、适中的样本量和序列级标签,结果是探索性的。在此范围内,仅拓扑摘要过于压缩,无法单独解决监督下的环补全任务,这主要是因为它们移除了账户对身份和边方向。最强的结果来自结合身份保持图特征与拓扑摘要的混合表示。这些发现表明,拓扑最有用的是作为动态图特征的上下文层,并且CML是适用于证据分布在时间和关系上下文中的欺诈模式的有前景候选模型。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:13

# 量子启发式上下文学习在动态交易图中稀疏环欺诈检测中的应用 来源:https://arxiv.org/html/2607.09704 ###### 摘要 我们提出了一种用于动态金融交易图欺诈筛查的探索性基准测试和量子启发式建模原型。协同欺诈可能无法从单笔交易中显现,而可能表现为跨多个时间段的关系模式。我们重点关注稀疏环欺诈,这是一种风格化的模式,其中完整的有向环在几天内分布,要求模型同时整合时间和图结构中的证据。我们使用一个合成交易模拟器来研究这个问题,该模拟器注入完整的稀疏环以及断裂环诱饵。每日的有向交易图被聚合到滚动窗口中,并使用原始图特征、持久同调摘要或结合两者的混合特征向量来表示。我们比较了门控循环单元(GRU)基线与量子启发式上下文机器学习(CML)作为序列级分类器。由于基准测试使用合成数据、适中的样本量和序列级标签,结果具有探索性。在这个范围内,仅拓扑的摘要过于压缩,无法单独解决监督下的环完成任务,这主要是因为它们去除了账户对身份和边方向。最强的结果来自结合了保留身份的图特征和拓扑摘要的混合表示。这些发现表明,拓扑作为动态图特征上的上下文层最有用,并且CML是一种有前途的候选模型,用于处理其证据分布在时间和关系上下文中的欺诈模式。 关键词:欺诈检测;动态交易图;稀疏环欺诈;量子启发式机器学习;上下文机器学习;拓扑数据分析;持久同调;序列分类。 ## 1 引言 金融欺诈通常既是关系性的,也是时间性的。一笔单独的交易在孤立观察时可能看起来正常,而多个账户之间的一连串交易可能揭示资金的协调流动、分层行为、循环转账或其他可疑结构。这促使了基于动态图的欺诈检测方法,其中账户表示为顶点,交易表示为有向加权边,可疑行为表示为动态交易网络中的一种模式[19 (https://arxiv.org/html/2607.09704#bib.bib16),7 (https://arxiv.org/html/2607.09704#bib.bib17)]。 在本文中,我们使用一个受控基准来研究动态交易图中的欺诈检测。我们首先提出一个问题:一个完整的稀疏环——其边分布在几天内的一个小型有向循环——能否作为时间图模式被检测出来?然后我们考察两个相关的比较问题。首先,我们询问量子启发的上下文机器学习(CML)[14 (https://arxiv.org/html/2607.09704#bib.bib5)]在检测证据分布在时间和关系结构中的欺诈模式时,其效果是否与传统的循环序列模型(如门控循环单元(GRU))相当或更好。其次,我们询问交易图的拓扑摘要是否为这个检测任务提供了有用的额外上下文。 尽管稀疏环模式被有意简化,但它捕捉到了一个重要的检测挑战。每条边在单日内观察时可能类似于普通交易,而欺诈信号只有在跨滚动时间窗口整合证据后才变得明显。这种设置促使我们使用量子启发的CML[14 (https://arxiv.org/html/2607.09704#bib.bib5)]以及基于拓扑的图特征。我们将CML视为一个序列级分类器,用于处理其重要性取决于时间和关系上下文的模式,并使用拓扑摘要来测试图的形状是否在原始交易特征之外增加了有用信息。因此,目标是比较CML与GRU基线,并评估拓扑增强是否改善了对时间分布稀疏环的检测。 本研究的量子成分是方法论上的,而非基于硬件的。在当前的实验中,我们将CML作为一个经典的、量子启发的模型来使用,该模型受到量子上下文性和量子相关性的启发;结果不应被解释为硬件级别量子优势的证据。尽管如此,我们的研究旨在与未来的量子原生扩展相关,因为稀疏环检测涉及时间上下文、图循环和高阶关系结构。这些特征自然地与关于量子上下文学习[12 (https://arxiv.org/html/2607.09704#bib.bib7),3 (https://arxiv.org/html/2607.09704#bib.bib10),2 (https://arxiv.org/html/2607.09704#bib.bib6)]、量子拓扑数据分析(QTDA)[17 (https://arxiv.org/html/2607.09704#bib.bib4),18 (https://arxiv.org/html/2607.09704#bib.bib3)]以及量子-拓扑信号处理(QTSP)[15 (https://arxiv.org/html/2607.09704#bib.bib1),16 (https://arxiv.org/html/2607.09704#bib.bib2)]的未来工作相联系。 ### 1.1 研究范围与贡献 在本文中,我们提出了一项针对合成动态交易图中稀疏环欺诈检测的探索性仿真研究。该模拟器使得可以精确控制完整稀疏环和断裂环诱饵的时间安排与结构,从而能够在匹配条件下比较特征表示和模型类别。我们使用这个基准来评估原始图特征、仅拓扑摘要以及混合表示,并比较GRU基线与量子启发的CML。 本研究是一个早期的方法论原型:一个用于在合成条件下测试稀疏环检测、拓扑增强以及GRU–CML模型比较的受控基准。其当前范围由适中的基准大小、有限的跨重复运行不确定性分析、序列级标签以及尚未根据真实交易模式进行校准的模拟数据所限定。 我们的第一个贡献是一个受控的动态图模拟器,用于研究随时间展开的欺诈模式。该模拟器创建账户级别的交易活动,包含不同类型的账户行为和日间变化。然后注入稀疏环模式,其中每笔单独转账在单日看来可能正常。该基准还包括断裂环诱饵,这使得任务更有意义:一个好的模型不仅应该检测到异常活动,还应该能够识别该活动是否随时间形成了完整的协调结构。 第二个贡献是一个为滚动交易窗口设计的“图到拓扑”特征流水线。每日有向交易图随时间聚合,转换为类似距离的表示,并使用零维和一维的持久同调进行总结[10 (https://arxiv.org/html/2607.09704#bib.bib11),21 (https://arxiv.org/html/2607.09704#bib.bib12),13 (https://arxiv.org/html/2607.09704#bib.bib13),5 (https://arxiv.org/html/2607.09704#bib.bib14)]。这一流水线使得可以探询连接性和环状结构的拓扑描述符是否提供了传统交易聚合体本身无法捕获的信息。 第三个贡献是对GRU基线和Infleqtion CML(一种量子启发的上下文模型)在原始、仅拓扑以及混合特征表示上的探索性比较。这种比较测试了当欺诈标签依赖于多周期图结构而非孤立交易特征时,CML是否与标准循环序列模型具有竞争力。 ## 2 基准设计与研究假设 ### 2.1 问题形式化 如引言中所述,并遵循基于图的欺诈检测方法[19 (https://arxiv.org/html/2607.09704#bib.bib16),7 (https://arxiv.org/html/2607.09704#bib.bib17)],我们将每日交易活动建模为一系列有向加权图。对于每一天,我们将账户表示为顶点,交易表示为有向边,并使用边权重记录交易金额等数量。我们将这些每日图聚合为滚动历史记录,并训练每个模型为每个历史记录分配一个序列级得分。该标签指示该历史记录是否包含一个完整的稀疏环模式。我们将任务保持在序列级别,这样我们可以首先测试时间图结构和拓扑摘要是否携带有用信号,然后再转向账户级别或交易级别的警报。 对于每一天 \(t\in\{1,\ldots,T\}\),设
\[
G_{t}=(V,E_{t},w_{t}) \quad (1)
\]
表示当日观察到的有向加权交易图。顶点集 \(V\) 代表账户,\(E_{t}\subseteq V\times V\) 代表有向交易,而 \(w_{t}(i,j)\) 记录从账户 \(i\) 到账户 \(j\) 的边属性,如总金额或交易次数。跨 \(T\) 天的动态交易记录为
\[
\mathcal{G}_{1:T}=(G_{1},G_{2},\ldots,G_{T})。 \quad (2)
\]
实现的基准是一个序列级检测问题。设 \(s\in\{1,\ldots,N\}\) 索引一个模拟的交易历史序列,其中 \(N\) 是数据集中模拟图历史记录的数量。对于序列 \(s\),完整的动态图记录为
\[
\mathcal{G}^{(s)}_{1:T}=\left(G^{(s)}_{1},\ldots,G^{(s)}_{T}\right)。 \quad (3)
\]
模型并非对单个交易或单个每日图进行分类,而是接收一个按时间排序的图历史表示。对于每个窗口 \(k\),设
\[
\mathcal{G}^{(s)}_{a_{k}:b_{k}}=\left(G^{(s)}_{a_{k}},G^{(s)}_{a_{k}+1},\ldots,G^{(s)}_{b_{k}}\right) \quad (4)
\]
表示从起始日 \(a_{k}\) 到结束日 \(b_{k}\) 的每日交易图子序列。在最简单的情况下,所有窗口具有固定长度 \(L\) 天,并以步长 \(\delta\) 前进。那么
\[
\begin{aligned}
a_{k} &= 1+(k-1)\delta, \quad (5a)\\
b_{k} &= a_{k}+L-1, \quad k=1,\ldots,K。 \quad (5b)
\end{aligned}
\]
窗口数量为
\[
K = \left\lfloor\frac{T-L}{\delta}\right\rfloor + 1。 \quad (6)
\]
每日特征序列作为特殊情况 \(L=1\) 和 \(\delta=1\) 恢复,此时 \(K=T\)。每个窗口被映射到一个特征向量
\[
x^{(s)}_{k} = \Phi\!\left(\mathcal{G}^{(s)}_{a_{k}:b_{k}}\right), \quad k=1,\ldots,K, \quad (7)
\]
其中 \(\Phi(\cdot)\) 是特征提取映射。根据实验的不同,\(\Phi\) 可能计算原始图特征、拓扑摘要或混合表示。得到的模型输入是有序特征序列:
\[
X^{(s)} = \left(x^{(s)}_{1},\ldots,x^{(s)}_{K}\right)。 \quad (8)
\]
当前实验中使用的监督目标是二值序列级标签。对于每个模拟序列 \(s\),我们定义
\[
y^{(s)} = \mathbf{1}\left\{\mathcal{G}^{(s)}_{1:T} \text{ contains a completed sparse directed ring}\right\}。 \quad (9)
\]
等价地,\(y^{(s)}=1\) 意味着该序列包含在观测范围内完成稀疏环模式所需的所有有向边,而 \(y^{(s)}=0\) 意味着不存在完整的稀疏有向环。\(y^{(s)}=0\) 的序列有两种来源。在干净的情况下,没有注入任何类似稀疏环的事件。在诱饵情况下,注入类似环的有向转账,但它们并未闭合形成完整的有向环。这些断裂环诱饵在当前监督任务中不被视为正面的欺诈标签。相反,它们作为困难比较案例,用于测试模型能否区分完整循环与不完整的类环活动。 给定输入序列 \(X^{(s)}\),训练好的模型返回一个得分
\[
\hat{p}^{(s)} = f_{\theta}\!\left(X^{(s)}\right) \in [0,1]。 \quad (10)
\]
\(\hat{p}^{(s)}\) 的值越大,表示模型认为序列 \(s\) 更可能包含一个完整的稀疏有向环。因此,该得分将相对于序列级标签 \(y^{(s)}\) 进行评估。对于包含断裂环诱饵的序列,高得分被视为误报,因为这些序列不包含完整环。这使我们能够衡量模型是否在检测环的完成,而不仅仅是对不完整的类环活动做出反应。 我们有意地将此公式保持在序列级别。在实际扩展中,我们会引入更细粒度的账户级别或边级别标签,例如
\[
y_{i,t} \quad \text{或} \quad y_{(i,j),t}, \quad (11)
\]
以将每个警报链接到特定账户、交易或局部子图。在当前实验中,我们不使用这些实体级别或边级别的目标进行训练。相反,我们将序列级任务作为一个受控的第一步,以测试时间图结构和拓扑摘要是否包含用于检测完整协调欺诈模式的有用信号。 ### 2.2 研究假设 我们围绕三个研究假设(RP)组织基准测试。每个RP将序列级标签 \(y^{(s)}\) 与模型得分 \(\hat{p}^{(s)}\) 联系起来,并指定我们如何评估稀疏环检测、拓扑增强以及GRU–CML模型比较。 我们将模拟序列分为训练集、验证集和保留测试集。我们在训练集上拟合模型参数,使用验证集调整模型设置并选择阈值,并保留 \(\mathcal{D}_{\mathrm{test}}\) 用于最终评估。对于每个模型选择 \(m\) 和特征表示 \(r\),我们为每个测试序列分配一个得分 \(\hat{p}^{(s)}_{m,r}\)。模型索引 \(m\) 表示用于将特征序列映射到得分的分类器,例如GRU或CML。表示索引 \(r\) 表示用于构建 \(X^{(s)}_{r}\) 的输入表示,例如原始图特征、拓扑特征或混合特征。 我们使用两个标准排名指标——ROC-AUC和PR-AUC[11 (https://arxiv.org/html/2607.09704#bib.bib8),20 (https://arxiv.org/html/2607.09704#bib.bib9)]——来评估这些得分将完整环序列排在无完整环序列之上的效果。ROC-AUC衡量的是,在不同决策阈值下,完整环序列是否倾向于获得比非完整环序列更高的得分。PR-AUC总结了精度-召回率的权衡,当正例稀少或误报影响警报的有用性时尤其有用。我们将这些指标分别表示为 \(A_{\mathrm{ROC}}(m,r)\) 和 \(A_{\mathrm{PR}}(m,r)\)。 我们还测量每个模型将高得分分配给断裂环诱饵的频率。设 \(\mathcal{D}_{\mathrm{decoy}}\) 为包含断裂稀疏环诱饵但不包含完整环的测试序列子集。对于在验证集上选择的阈值 \(\tau_{m,r}\),我们将经验诱饵误报率定义为
\[
\mathrm{FAR}_{\mathrm{decoy}}(m,r;\tau_{m,r}) = \frac{1}{|\mathcal{D}_{\mathrm{decoy}}|} \sum_{s\in\mathcal{D}_{\mathrm{decoy}}} \mathbf{1}\{\hat{p}^{(s)}_{m,r} \geq \tau_{m,r}\}.
\]

相似文章

基于图的金融欺诈检测:校准风险评分与结构正则化

arXiv cs.LG

本文提出了一种用于金融欺诈检测的图神经网络框架,该框架将交易记录和身份信息整合到节点属性中,采用多层消息传递机制,并利用加权监督和结构一致性正则化来改进风险评分和概率校准。在公共数据集上的实验表明,该方法优于现有方法。

信念还是电路?上下文图学习的因果证据

arXiv cs.AI

本文使用主成分分析(PCA)和激活补丁等机制可解释性方法,在一个图随机游走任务上探究了大型语言模型是通过潜在结构推断还是局部模式匹配来进行上下文学习。