SALT-GNN: 通过统计感知注意力处理反洗钱图中的稠密邻域

arXiv cs.LG 论文

摘要

本文介绍了SALT-GNN,一种统计感知的图神经网络架构,它将度感知的统计聚合与注意力机制相结合,以处理反洗钱图中的稠密邻域,在稠密接收方上下文中以更少的参数实现了改进的F1分数。

arXiv:2607.10131v1 Announce Type: new 摘要:洗钱活动威胁金融稳定,并使机构面临处罚,这推动了自动化检测的需求。由于洗钱模式通常通过关系模式出现,图神经网络(GNN)越来越多地用于反洗钱(AML)。然而,AML GNN通常使用总体F1分数等聚合指标进行评估,这掩盖了一个操作性问题:高活跃度的接收方账户集中了大量传入交易,使得可疑信号更难隔离,调查成本更高。我们引入了一种接收方度分层评估方法,按接收方上下文密度报告标准AML指标。在三个数据集(HI-Small、HI-Medium和AMLSim-32k-5%)上,该方法揭示了稠密接收方上下文中的持续性性能下降,我们将其归因于三个GNN特性:两个已知的局限性(AML放大了它们),即(1)多重集不可区分性和(2)基数盲性,以及(3)一个注意力特定效应:在稠密邻域中,归一化注意力会削弱微弱但具有模式相关性的多跳信号。基于这一诊断,我们提出了SALT-GNN,一种轻量级的统计感知架构,它在每个消息传递层将度感知的统计聚合与注意力融合,使得分布和基数信息能够塑造后续注意力步骤所使用的节点状态。消融实验支持融合位置是稠密上下文性能的关键因素。在HI-Small和HI-Medium上,SALT-GNN使用的参数比特定任务的图Transformer基线少77%,同时稠密上下文F1分数提高了3-6个百分点;在AMLSim-32k-5%上,最高度F1分数提高了16-20个百分点。这些增益在Transformer和GAT风格的注意力上都成立,表明收益来源于统计证据和注意力证据的融合位置,而非特定的注意力运算符。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:15

# SALT-GNN:通过统计感知注意力处理反洗钱图中的密集邻域
来源:https://arxiv.org/html/2607.10131

###### 摘要

洗钱威胁金融稳定,并使机构面临处罚风险,从而推动了自动化检测的需求。由于洗钱模式通常通过关系结构显现,图神经网络(GNN)越来越多地被用于反洗钱(AML)。然而,AML GNN 通常使用总体 F1 分数等聚合指标进行评估,这掩盖了一个操作性问题:高活跃度的收款账户汇聚了大量交易,使得可疑信号更难被隔离,且调查成本更高。我们引入了一种按收款方入度分层的评估方法,该方法在不同收款方上下文密度下报告标准 AML 指标。在三个数据集(HI-Small、HI-Medium 和 AMLSim-32k-5%)上的评估揭示了在密集收款方上下文中持续存在的性能下降问题,我们将其归因于三个 GNN 特征:前两个是已知的 GNN 局限性,在 AML 中被放大,即(1)多集不可区分性和(2)基数盲性;以及(3)一个注意力特有的效应,即在密集邻域中,归一化注意力会削弱微弱但具有模式相关性的多跳信号。基于这一诊断,我们提出了 SALT-GNN,一种轻量级的统计感知架构,该架构在每个消息传递层将度感知的统计聚合与注意力融合在一起。这种逐层融合允许分布和基数信息塑造后续注意力步骤所使用的节点状态。消融结果支持融合位置是密集上下文性能的关键因素。在 HI-Small 和 HI-Medium 上,与任务特定的图 Transformer 基线相比,它使用的参数最多减少 77%,同时密集上下文 F1 分数提高 3–6 个点;在 AMLSim-32k-5% 上,它将最高入度区间的 F1 分数提高了 16–20 个点。这种提升在 Transformer 风格和 GAT 风格的注意力中均成立,表明收益来自于统计证据和注意力证据的融合位置,而非特定的注意力算子。

请参阅图注
图 1:收款方上下文示例。一个可疑的传入交易(红色)在低入度下(左)比在高入度下(右,混杂在许多正常转账中)更容易被隔离。

## 1 引言

洗钱通过放置、分层和整合来掩盖非法资产来源,估计占全球 GDP 的 2–5%(每年 8000 亿至 2 万亿美元)(United Nations Office on Drugs and Crime2011 (https://arxiv.org/html/2607.10131#bib.bib31); Lannoo and Parlour2021 (https://arxiv.org/html/2607.10131#bib.bib17))。由于合规失败会使金融机构面临巨额罚款,有效的反洗钱(AML)系统在操作上至关重要(Chen et al.2018 (https://arxiv.org/html/2607.10131#bib.bib7))。一个核心困难在于,洗钱很少表现为单一的异常交易(Altman et al.2023 (https://arxiv.org/html/2607.10131#bib.bib1))。相反,风险信号通常来自关系结构,如循环、扇入/扇出和分层流动(附录 A)。因此,AML 数据天然地具有图结构,账户为节点,交易为有向边。图神经网络(GNN)能够在交易图上传播和聚合信息,因此已成为 AML 研究中的一个重要模型家族(Altman et al.2023 (https://arxiv.org/html/2607.10131#bib.bib1); Egressy et al.2024 (https://arxiv.org/html/2607.10131#bib.bib10))。尽管基于工程特征的流水线仍然具有竞争力(Blanuša et al.2024 (https://arxiv.org/html/2607.10131#bib.bib4)),但近期为 AML 定制的 GNN 为交易级别的边分类和账户级别的节点分类提供了强大的基准(Suzumura and Kanezashi2021 (https://arxiv.org/html/2607.10131#bib.bib30); Lin et al.2024 (https://arxiv.org/html/2607.10131#bib.bib19))。

然而,当前的 AML-GNN 评估仍不完整。F1 分数和 PR-AUC 等聚合指标表明模型在平均水平上表现良好,但并不能显示其在接收方上下文(即许多传入交易竞争被汇总的场景)中是否依然可靠。我们将接收方的传入邻域称为接收方上下文。对于边分类,一条交易继承其接收方的上下文,因为交易本身没有固有的入度;对于节点分类,上下文就是被评估的账户本身。这个单元在操作上具有重要意义:在密集的接收方上下文中出错代价高昂,因为假阳性可能引发大量人工审查,而假阴性则可能遗漏与大规模洗钱相关的汇集点或混币点(Kou et al.2004 (https://arxiv.org/html/2607.10131#bib.bib16); Beneish and Vorst2022 (https://arxiv.org/html/2607.10131#bib.bib2))。

我们的核心观察是,密集的接收方上下文是 AML-GNN 评估和设计中缺失的一个单元。我们通过一个接收方入度诊断方法将其暴露出来:在测试预测后,根据接收方入度进行分层(图1 (https://arxiv.org/html/2607.10131#S0.F1)),而不改变训练或模型选择。在三个广泛使用的 AML 基准数据集(HI-Small、HI-Medium(Altman et al.2023 (https://arxiv.org/html/2607.10131#bib.bib1))和 AMLSim-32k-5%(Suzumura and Kanezashi2021 (https://arxiv.org/html/2607.10131#bib.bib30); Schmidt et al.2024 (https://arxiv.org/html/2607.10131#bib.bib27))上,接收方入度分层评估揭示了一个被聚合指标隐藏的模式:GNN 的性能正好在高入度的接收方上下文中下降。而这些正是检测技术上困难、操作上成本最高的区域。这种性能下降并非某个特定模型或数据集的特有现象,我们的结果表明,简单地增加注意力模型的容量或进行调优并不能解决这个问题。同时,这一发现并不意味着应该放弃注意力机制。注意力在 AML 中仍然有价值,因为它可以在大量背景活动中选择性地关注相关邻居。其局限性在于,随着接收方密度增加,注意力变得脆弱:在完整的洗钱模式被组合起来之前,微弱但具有模式相关性的多跳信号可能会被削弱。因此,接收方入度分层不仅定位了失败点,也指向了一个更广泛的设计问题:在每个注意力步骤之前,模型应该获取哪些信息?

为了回答这个问题,我们将密集接收方的失败映射到 AML 图所放大的三个聚合局限性:(i) 在单一摘要下,对邻域多集的区分能力有限(Corso et al.2020 (https://arxiv.org/html/2607.10131#bib.bib8)),(ii) 在归一化或顺序统计量聚合器中丢失基数信息(Zhang and Xie2021 (https://arxiv.org/html/2607.10131#bib.bib38)),以及 (iii) 在归一化注意力下,微弱的多跳证据被削弱。这些局限性并非 AML 所特有(Wu, He, and Xu2019 (https://arxiv.org/html/2607.10131#bib.bib33); Wu et al.2022 (https://arxiv.org/html/2607.10131#bib.bib34); Sun et al.2026 (https://arxiv.org/html/2607.10131#bib.bib29); Xu et al.2019 (https://arxiv.org/html/2607.10131#bib.bib35)),但在交易图中变得尤为重要,因为可疑证据通常是关系性的,在大量良性活动中稀疏存在,并且只有将多个微弱信号组合成更广泛的模式时才有意义。

这引出了一个简单的设计原则:注意力提供了有用的选择性,但密集的接收方上下文需要将分布和基数信息整合到节点状态中,以便后续的注意力层在其基础上操作。如果这些信息仅在预测时引入(Chen et al.2025 (https://arxiv.org/html/2607.10131#bib.bib6)),后续的注意力步骤仍然是在可能不包含区分密集可疑上下文所需线索的表示上进行选择。我们的消融实验支持这一观点(§5 (https://arxiv.org/html/2607.10131#S5);附录 M),表明统计-注意力融合的位置,而非仅仅是两个分支的存在,对于密集区域的性能至关重要。我们将这一原则实例化为 SALT-GNN,一种轻量级架构,它在每个消息传递层将度感知的统计聚合与学习的注意力耦合在一起,因此在下一步传播之前,分布证据和选择性注意力都是可用的。为了测试该原则是否依赖于特定的注意力算子,我们使用 Transformer 风格和 GAT 风格的注意力分别实例化它(*SALT-Trans*,*SALT-GAT*)。实验表明,SALT 在所有三个基准数据集上提高了总体和高入度区间的 F1 分数,在 HI-Small 和 HI-Medium 上使用的参数比最强基线最多减少 77%,并在分层评估所识别的密集接收方上下文中达到了最大的提升。这种提升在两个骨干网络上均成立,支持了收益来自于证据融合位置而非特定注意力算子的观点。

#### 贡献。
1. 1. 用于 AML-GNN 评估的接收方入度诊断方法。我们引入了一个事后分析协议,该协议根据目标入度范围报告标准 AML 指标,揭示了在边级别和节点级别任务中,聚合指标所掩盖的、在密集接收方上下文中系统性存在的性能下降。
2. 2. 对 AML GNN 的密集上下文诊断。我们将观察到的性能下降与 AML 图所放大的聚合局限性联系起来:多集不可区分性、基数盲性,以及在归一化注意力下微弱多跳证据的削弱。
3. 3. SALT-GNN,一种轻量级的统计感知注意力架构。我们提出了一种逐层融合架构,在每个传播步骤之前将度感知的统计聚合与学习的注意力相结合,精确地在诊断方法所隔离的密集区域中提高了性能。我们发布了代码,用于复现分层协议、基线和消融实验,旨在将密集上下文可靠性作为 AML-GNN 评估的标准组成部分。

## 2 背景与问题形式化

我们正式定义金融交易图以及边级别和节点级别的 AML 任务,回顾标准 GNN 中的消息传递和注意力机制,并介绍三个通用的聚合局限性,将它们与 AML 交易图联系起来。

### 金融交易图

金融交易网络是有向多重图 \(G=(V,E)\),其中账户是节点,带属性的交易是有向边;平行边编码重复转账。

#### 任务定义。
我们研究交易级别的边分类和账户级别的节点分类,预测某笔交易或某个账户是否可疑。这种双重形式化使我们能够跨任务类型验证架构见解。

### 图神经网络

消息传递神经网络(MPNN)更新节点表示如下:
\( h_v^{(k)} = U^{(k)}\left(h_v^{(k-1)}, AGG^{(k)}\left(\{h_u^{(k-1)}: u \in N(v)\}\right)\right) \)
其中 \(N(v)\) 是 \(v\) 的邻域,\(AGG\) 是置换不变函数,\(U\) 通常是一个多层感知机(MLP)。经过 \(k\) 轮后,\(h_v^{(k)}\) 包含了最多 \(k\) 跳的信息。不同架构主要在 \(AGG\) 上有所区别:GCN 使用度归一化的平均(Kipf and Welling2017 (https://arxiv.org/html/2607.10131#bib.bib15)),GAT 学习注意力权重(Velickovic et al.2018 (https://arxiv.org/html/2607.10131#bib.bib32)),GIN 使用求和聚合(Xu et al.2019 (https://arxiv.org/html/2607.10131#bib.bib35); Huang and Villar2021 (https://arxiv.org/html/2607.10131#bib.bib13)),PNA 结合多种统计量并进行基于度的缩放(Corso et al.2020 (https://arxiv.org/html/2607.10131#bib.bib8))。

基于注意力的 GNN 则计算邻居表示的自适应加权平均作为其聚合函数:
\( h_i' = \sum_{j \in N(i)} \alpha_{ij} h_j \quad \text{s.t.} \quad \sum_{j \in N(i)} \alpha_{ij} = 1 \) (1)
其中 \(h_i'\) 是节点 \(i\) 的更新嵌入,\(h_j\) 是邻居 \(j \in N(i)\) 的嵌入,\(\alpha_{ij} \in [0,1]\) 是学习到的重要性系数(通常通过 softmax 获得),它将单位质量分布在 \(i\) 的所有邻居上。对于拥有许多传入交易的枢纽节点,这种归一化可能会将即使是中等信息量的邻居权重降至接近零——这在以模式为中心的金融图中是一个未被充分探索但问题严重的情况,因为微弱但协调的多跳信号至关重要。

### 聚合局限性的特征刻画

下面的三个特征是 GNN 聚合的已知属性:前两个是常见邻域摘要的一般局限性(Corso et al.2020 (https://arxiv.org/html/2607.10131#bib.bib8); Zhang and Xie2021 (https://arxiv.org/html/2607.10131#bib.bib38)),第三个源于归一化注意力在跳间传播的方式。据我们所知,这些特征尚未在 AML 场景中被明确检验,然而在这个场景中它们尤其重要,因为洗钱的结构直接与每个特征相互作用:非法资金隐藏在看似正常的摘要之后,集中在高交易量账户,并被故意安排得在局部看来是合法的。因此,在本节的剩余部分,我们将每个特征映射到一个具体的 AML 解读。

#### 特征 1(多集不可区分性)(Corso et al.2020 (https://arxiv.org/html/2607.10131#bib.bib8))。
单个邻域统计量,如均值、最大值、最小值或标准差,无法唯一地刻画一个多集,因此即使风险特征不同,不同的邻域也可能坍缩为相似的摘要。这在 AML 中很重要,因为这种碰撞可能将结构化行为隐藏在看似正常的摘要之下:一种拆分(smurfing)模式,其中非法总额被分割成许多小额转入交易,其平均转入金额可能与一个普通账户相近,但在离散程度或极端值上存在显著差异。

#### 特征 2(基数盲性)(Zhang and Xie2021 (https://arxiv.org/html/2607.10131#bib.bib38))。
常见的邻域摘要是归一化或基于顺序的:均值、最小值、最大值和标准差本身并不编码产生该摘要的邻居数量。归一化的(softmax)注意力同样输出一个凸组合,其结果不暴露邻域大小,尽管注意力权重本身受到邻域大小的影响(特征 3)。求和聚合确实随基数缩放,但它将这个大小信号与特征内容以及密集邻域中的大量背景流量纠缠在一起。在 AML 中,这不仅仅是通用的局限性,而是直接的信号损失:转入交易的数量本身具有信息量,因为高入度账户是候选的汇集点或混币点,洗钱资金在此集中,同时基数也影响建模难度和操作风险。

#### 特征 3(注意力引起的多跳信号衰减)。
公式 (1) 的归一化注意力具有选择性,但这以转换邻域表示为代价。在每一跳,归一化——无论 softmax 或类似机制——将注意力权重的总和强制为 1。这产生了竞争性分配:如果一个节点有 \(d\) 个邻居,每个邻居在注意力的输出表示中最多贡献 \(1/d\) 的权重(如果注意力是均匀的)。当 \(d\) 很大时,每个邻居的贡献自然很小。但更重要的是,注意力可以而且确实会偏离均匀性:它倾向于放大一些邻居并削弱许多其他邻居。虽然选择性是可取的,但这里有一个隐私的后果:弱信号被传递到下一层之前就被进一步衰减。用图一个洗钱路径可能依赖于两跳远处的第一跳邻居,这些邻居的传入表示已经被密集邻域中的归一化所削弱——即使第一跳账户最终形成可疑模式。因此,跨越多跳的微弱但模式相关的信号可能被系统性地湮没在背景中,这恰恰是在 AML 中用于组装模式的那种信号。

相似文章

用于交通预测的全局-局部图注意力网络

arXiv cs.AI

提出了一种具有成对编码和基于事件的邻接矩阵的全局-局部图注意力网络(GLGAT)用于交通预测,有效捕捉时空相关性,并在真实数据集上取得了有竞争力的性能。