面向金融欺诈检测的多流时序融合

arXiv cs.LG 论文

摘要

提出用于金融欺诈检测的多流欺诈Transformer(MSFT),该模型使用Transformer独立编码交易、登录和风险事件流,并通过时间感知位置编码和门控融合进行融合,在大型数据集上实现了0.9961的AUROC。

arXiv:2606.25007v1 公告类型:新提交 摘要:数字银行中的金融欺诈检测需要对多个异构事件流(交易、登录会话、风险信号)进行推理,这些事件流单独看起来无害,但共同揭示欺诈模式。我们提出多流欺诈Transformer(MSFT),这是一种统一架构,使用独立的Transformer编码器对每个事件流进行编码,并通过可配置机制融合其表示。我们进行了系统的消融研究,比较了五种融合策略:拼接、门控融合、时间感知位置编码、跨流注意力以及完整组合。在一个大规模数据集(1000万用户,1.5%欺诈率)上,使用8500万参数的模型,我们证明:(1)序列模型显著优于基于聚合特征的梯度提升树(AUROC 0.74 vs. 0.99);(2)逐流编码至关重要——在相同参数预算下,单流Transformer基线仅达到0.82 AUROC,存在18个百分点的差距,证实了多流归纳偏置的必要性;(3)时间感知位置编码达到了最高的区分度(AUROC 0.9961);(4)门控融合取得了最佳的精确率(0.989),适合生产部署;(5)风险事件流提供了最强的单个信号贡献。我们还在某数字银行平台的自有生产数据上进一步验证,相对XGBoost基线实现了超过22%的AUROC提升。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:11

# 多流时序融合的金融欺诈检测
来源: https://arxiv.org/html/2606.25007

###### 摘要

数字银行中的金融欺诈检测需要对多个异构事件流——交易、登录会话、风险信号——进行推理,这些事件流单独看似乎无害,但整体却揭示出欺诈模式。我们提出了多流欺诈Transformer(MSFT),这是一种统一架构,为每个事件流使用独立的Transformer编码器进行编码,并通过可配置的机制融合它们的表示。我们进行了一项系统的消融研究,比较了五种融合策略:拼接、门控融合、时间感知位置编码、跨流注意力和完整组合。在一个大规模数据集(1000万用户,1.5%欺诈率)上,使用8500万参数模型,我们证明了:(1) 序列模型显著优于在聚合特征上操作的梯度提升树(AUROC: 0.74 vs. 0.99),(2) 逐流编码至关重要——一个参数预算匹配的单流Transformer基线仅达到0.82 AUROC,相差18个点,这证实了多流归纳偏置的必要性,(3) 时间感知位置编码获得最高的判别能力(0.9961 AUROC),(4) 门控融合获得最适合生产部署的最佳精确度(0.989),(5) 风险事件流提供最强的单独信号贡献。我们还在数字银行平台的生产数据上进行了验证,相对于XGBoost基线,AUROC相对提高了22%以上。

## I 引言

数字银行中的欺诈检测已从基于规则的系统发展到对聚合特征进行操作的机器学习模型。然而,现代欺诈——账户接管、无卡支付欺诈、洗钱方案和第一方欺诈——表现为分布在多个数据流中的细微时间模式。例如,一次欺诈性账户接管可能涉及来自新设备的登录失败,然后是密码重置、向陌生收款人的P2P转账,以及风险系统拒绝——所有这些都发生在48小时内。没有单个事件是异常孤立的;信号来自跨流的时间相关性。

传统方法将这些流聚合为固定特征向量(例如,“7天内登录失败次数”、“30天内转账总额”),并将其输入梯度提升树[1 (https://arxiv.org/html/2606.25007#bib.bib1)]。虽然对简单模式有效,但这种方法丢弃了表征复杂欺诈的序列结构和跨流时间关系。

我们通过多流欺诈Transformer(MSFT)来弥补这一差距,它:

- • 将每个事件流(交易、登录、风险事件)作为可变长度序列,使用其自己的Transformer编码器进行处理
- • 通过从实际事件时间戳导出的时间感知位置编码来保留时间信息
- • 通过编码流表示之间的双向注意力来学习跨流相关性
- • 通过门控融合机制组合流级别和跨流信号

我们通过一项受控消融研究来评估MSFT,该研究隔离了每个架构组件的贡献,证明了时间感知和多流融合带来的明显性能提升。

## II 相关工作

### II-A 基于特征的欺诈检测

梯度提升决策树(XGBoost[1 (https://arxiv.org/html/2606.25007#bib.bib1)], LightGBM[2 (https://arxiv.org/html/2606.25007#bib.bib2)])仍然是欺诈检测的行业标准,它们在固定时间窗口内计算的手工聚合特征上运行。这些模型擅长捕捉静态特征之间的非线性关系,但无法对序列依赖性或跨流时间相关性进行建模。

### II-B 用于欺诈检测的序列模型

最近的工作已应用循环神经网络[4 (https://arxiv.org/html/2606.25007#bib.bib4)]和Transformer[3 (https://arxiv.org/html/2606.25007#bib.bib3)]来处理交易序列,将欺诈检测视为序列分类问题。这些方法捕捉单个流内的时间模式,但通常独立处理流或将它们拼接起来,而不进行显式的跨流推理。

### II-C 多模态与多流学习

多模态融合已在视觉-语言模型[5 (https://arxiv.org/html/2606.25007#bib.bib5)]和多模态情感分析中得到广泛研究。技术包括早期融合(拼接)、晚期融合(集成)和基于注意力的融合。我们的工作将这些思想适应到金融领域,其中流是具有共享时间结构的异构事件序列。

### II-D 时间编码

标准位置编码捕捉序号位置,但不捕捉事件之间的实际时间间隔。在时间点过程[6 (https://arxiv.org/html/2606.25007#bib.bib6)]和事件序列建模中已探索了结合连续时间戳的时间感知编码。我们采用可学习的基于频率的时间编码,允许模型区分相隔几分钟的事件与相隔几天的事件。

## III 问题形式化

给定一个用户 \( u \),具有 \( K \) 个事件流 \(\{S_1, S_2, \ldots, S_K\}\),其中每个流 \( S_k = \{(e_1^k, t_1^k), (e_2^k, t_2^k), \ldots, (e_{n_k}^k, t_{n_k}^k)\} \) 由带有时间戳 \( t_i^k \) 的事件 \( e_i^k \) 组成,以及一组聚合特征 \( \mathbf{x}_u \in \mathbb{R}^d \),我们旨在预测二元标签 \( y_u \in \{0,1\} \),指示该用户是否为欺诈。

每个事件 \( e_i^k \) 是一个异构记录,包含分类字段(商户类别、录入类型、会话事件)和数值字段(金额、事件间时间)。关键挑战在于,判别信号不在于单个事件或聚合统计量,而在于时间模式和跨流相关性。

## IV 架构

### IV-A 概览

多流欺诈Transformer由四个阶段组成:(1) 逐流令牌嵌入,(2) 位置编码,(3) 逐流Transformer编码,以及 (4) 融合与分类。

交易 50–120 事件 | 登录 12–40 事件 | 风险事件 4–15 事件 | 静态 64 特征
--- | --- | --- | ---
令牌嵌入 | 令牌嵌入 | 令牌嵌入 | 静态MLP
位置编码PE | 位置编码PE | 位置编码PE | 
Transformer编码器 | Transformer编码器 | Transformer编码器 |
[CLS]交易 | [CLS]登录 | [CLS]风险 |
融合(拼接 / 门控 / 跨流 / 时间 / 完整) |
MLP \(\rightarrow\) \(\sigma\) \(\rightarrow\) \(P\)(欺诈)

图1: 多流欺诈Transformer(MSFT)架构。每个事件流被独立嵌入、位置编码,并由其自己的Transformer编码器处理。得到的[CLS]令牌与聚合静态特征一起,通过可配置的融合模块组合,然后进行分类。

### IV-B 逐流令牌嵌入

对于每个流 \( k \),一个事件 \( e_i^k \) 包含分类特征 \(\{c_1, \ldots, c_m\}\) 和数值特征 \(\{n_1, \ldots, n_p\}\)。分类特征通过学习嵌入表(或对高基数字段使用哈希)进行嵌入:

\[
\mathbf{h}_{\text{cat}} = [\text{Emb}_1(c_1); \text{Emb}_2(c_2); \ldots; \text{Emb}_m(c_m)] \quad (1)
\]

数值特征通过一个小型MLP进行投影:

\[
\mathbf{h}_{\text{num}} = \text{MLP}_{\text{num}}([n_1; n_2; \ldots; n_p]) \quad (2)
\]

令牌表示为:

\[
\mathbf{h}_i^k = W_k [\mathbf{h}_{\text{cat}}; \mathbf{h}_{\text{num}}] + b_k \quad (3)
\]

### IV-C 位置编码

我们比较两种位置编码策略:

正弦(序数):基于位置索引的标准正弦编码。

时间感知:使用实际时间戳的可学习频率编码:

\[
\text{PE}(t) = W_{\text{proj}} [\sin(\omega_1 t + \phi_1); \cos(\omega_1 t + \phi_1); \ldots] \quad (4)
\]

其中 \(\omega_f\) 和 \(\phi_f\) 是可学习的频率和相位参数。这允许模型理解相隔5分钟的事件比相隔5天的事件更相关。

### IV-D 逐流Transformer编码器

每个流由一个独立的Transformer编码器处理,并在前面添加一个可学习的[CLS]令牌:

\[
[\text{CLS}_k; \mathbf{h}_1^k; \ldots] \xrightarrow{\text{Encoder}_k} [\mathbf{z}_{\text{CLS}}^k; \mathbf{z}_1^k; \ldots] \quad (5)
\]

[CLS]输出 \(\mathbf{z}_{\text{CLS}}^k\) 作为流级别表示。

### IV-E 融合机制

我们研究五种融合策略:

(a) 拼接 | (b) 门控 | (c) 时间 | (d) 跨流 | (e) 完整 = 时间 + 跨流 + 门控
--- | --- | --- | --- | ---
\(z_{\text{交易}}\) \(z_{\text{登录}}\) \(z_{\text{风险}}\) | \(z_{\text{交易}}\) \(z_{\text{登录}}\) \(z_{\text{风险}}\) | 时间感知PE: \(\sin(\omega_f t + \phi_f)\) | \(z_{\text{交易}}\) \(z_{\text{登录}}\) \(z_{\text{风险}}\) | \(z_{\text{交易}}^*\) \(z_{\text{登录}}^*\) \(z_{\text{风险}}^*\)
拼接 → 分类器 | 门控网络 → \(g_k\) | \(z_{\text{交易}}\) \(z_{\text{登录}}\) \(z_{\text{风险}}\) | 跨注意力 (交易↔登录↔风险) | 跨注意力
 | \(\sum g_k z_k\) → 分类器 | 拼接 → 分类器 | 拼接 → 分类器 | 门控融合 → 分类器

图2: 在我们的消融中比较的五种融合机制。(a) 拼接:简单拼接。(b) 门控:学习每流重要性。(c) 时间:时间感知位置编码。(d) 跨流:编码流之间的双向注意力。(e) 完整:组合(b)、(c)和(d)。

**拼接 (concat)**:拼接流CLS令牌和静态特征:

\[
\mathbf{f} = [\mathbf{z}_{\text{CLS}}^1; \ldots; \mathbf{z}_{\text{CLS}}^K; \text{MLP}_{\text{static}}(\mathbf{x}_u)] \quad (6)
\]

这是我们的基线。它将每个流表示视为对每个用户同样重要。下游分类器必须隐式学习对于每个样本,拼接向量的哪些维度是相关的。

**门控融合**。不同的欺诈类型由不同的流主导:账户接管主要是登录现象,无卡支付欺诈主要是交易现象,洗钱活动则两者兼有。拼接迫使分类器隐式发现这种路由。门控融合通过引入一个小型门控网络使其显式化,该网络根据完整的多流上下文为每个流产生一个软重要性权重 \(g_k \in [0,1]\):

\[
g_k = \sigma \left( W_g [\mathbf{z}_{\text{CLS}}^1; \mathbf{z}_{\text{CLS}}^2; \ldots; \mathbf{z}_{\text{CLS}}^K; \mathbf{x}_u] \right)_k \quad (7)
\]

\[
\mathbf{f} = \sum_{k=1}^K g_k \cdot \mathbf{z}_{\text{CLS}}^k \quad (8)
\]

门控网络是一个带有LayerNorm的两层MLP;其最后一层初始化为零,因此所有门从 \(\sigma(0)=0.5\) 开始,防止一个流在训练早期占主导地位。关键在于,融合表示 \(\mathbf{f}\) 的维度是 \(D\)(而不是像concat中的 \(K \cdot D\)),这起到了正则化作用:模型不能依赖 \(K\) 份信号副本,而必须承诺一个单一的加权组合。我们凭经验观察到,这导致精确度显著提高(第VII节),但代价是AUROC略低于仅使用时间感知PE。

**时间**:在编码器输入处使用时间感知PE(式4),输出处使用拼接融合。架构变化很小,但归纳偏置很显著:事件现在按经过时间而不是序号位置索引,因此模型可以将“一小时内三次登录失败”与“一周内三次登录失败”区分开来。

**跨流注意力**。前面的机制将每个流的CLS令牌视为自包含的摘要。跨流注意力放松了这一假设:它允许一个流中的每个令牌在逐流编码后关注另一个流中的每个令牌。具体来说,对于每个有序流对 \((k, j)\),我们维护一个多头注意力层:

\[
\tilde{\mathbf{z}}^k = \text{CrossAttn}(\mathbf{z}^k, \mathbf{z}^j) = \text{softmax} \left( \frac{\mathbf{z}^k W_Q (\mathbf{z}^j W_K)^\top}{\sqrt{d}} \right) \mathbf{z}^j W_V \quad (9)
\]

其中 \(\mathbf{z}^k \in \mathbb{R}^{L_k \times D}\) 是流 \(k\) 的完整编码序列(不仅仅是CLS)。每个跨注意力层后跟一个残差连接、层归一化和一个前馈块,镜像标准Transformer块设计。例如,这允许一个时间 \(t=102h\) 的交易令牌关注一个时间 \(t=100h\) 的登录令牌,并根据该登录是成功还是拒绝来调整其表示。跨注意力后每个流的CLS令牌随后用于下游拼接。对于三个流,我们实例化六个有向跨注意力层,与 \(D=512\) 尺度下的concat相比,这增加了大约1900万个参数,并显著增强了对多流时序相关性的归纳偏置。

**完整**:组合门控融合 + 时间感知PE + 跨流注意力。时间感知PE在编码器输入处应用,跨注意力在逐流编码后应用,门控融合应用于得到的CLS令牌。

### IV-F 分类头

融合表示通过一个两层MLP:

\[
\hat{y} = \sigma(W_2 \cdot \text{ReLU}(W_1 \mathbf{f} + b_1) + b_2) \quad (10)
\]

训练使用二元交叉熵,并带有正类加权。

## V 数据集

### V-A 合成数据生成

我们生成了一个大规模合成数据集,旨在模拟现实世界的数字银行欺诈模式。该数据集包含1000万用户,欺诈率为1.5%,分布在四种欺诈类型中(表I)。

表I: 欺诈类型分布

### V-B 事件流

每个用户有三个事件流:

**交易** (50–120个事件):购买、存款、转账和ATM取款事件,带有商户类别、金额、录入类型和网络信息。

**登录** (12–40个事件):认证事件,带有设备信息、风险带、结果、IP/设备新颖性标志。

**风险事件** (4–15个事件):平台级风险信号,包括登录尝试、密码重置、设备变更、PII变更和争议,带有允许/拒绝结果。

### V-C 设计原则

数据集设计使得:

1. 1. 聚合特征判别力弱——欺诈金额与合法支出重叠
2. 2. 时间模式具有判别力——欺诈事件聚集在 ±96h 时间窗口内
3. 3. 跨流相关性是最强的信号——相同时间窗口内的登录异常 + 交易异常 + 风险拒绝

### V-D 聚合特征

我们计算64个聚合特征,包括窗口化交易计数和金额(7d, 30d, 90d, 365d)、登录统计、P2P比率、百分位金额和余额指标。

## VI 实验设置

### VI-A 数据划分

表II: 数据集统计

### VI-B 基线

**XGBoost**:梯度提升树,在

相似文章

面向金融应用的多模态事件序列基础模型

arXiv cs.LG

本文提出了一种基于预训练Transformer的基础模型,该模型对金融应用中的多模态事件序列进行训练,统一了异构数据源,并通过下一事件预测学习通用表示。该方法优于传统的任务专用模型,并已在东欧一家大型银行部署,带来了可衡量的业务改进。