基于聚类的资本市场可疑交易模式识别框架

arXiv cs.AI 论文

摘要

本文提出一种基于K-Means++的无监督聚类框架,用于检测资本市场数据中的可疑交易模式,轮廓系数达到0.561,识别出2.02%的交易可能为欺诈。

arXiv:2607.04184v1 公告类型: 新 摘要:市场操纵是一种通过操纵股票价格以快速获利的不正当行为,严重损害了交易平台的信任度。我们实现了一套无监督欺诈检测工具,首先采用K-Means++聚类来解决这一问题。研究使用了约100万笔2012年至2024年的金融交易数据集。为了识别欺诈交易并利用市场实践启发式阈值进行分类,本文提出了一种基于聚类的流程。该方法将2.02%的交易标记为可疑,其中51.10%明确为虚假报单(spoofing),0.10%为拉高出货(pump and dump),0.55%为内幕交易(insider trading),1.43%为虚假突破(fake breakout),46.83%未分类。尽管缺少真实标签,但模型性能通过轮廓系数(Silhouette Score) 0.561得到验证。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:36

# 基于聚类的资本市场可疑交易模式识别框架  
来源:https://arxiv.org/html/2607.04184  
Romona Magdalene Sarkar、Sabiha Khair Ohi、Iftekharul Mobin  
美国国际大学孟加拉分校计算机科学与工程系,孟加拉国达卡  
[email protected]  

###### 摘要  
市场操纵是一种可疑行为,通过操纵股票价格快速获利,严重损害了交易平台的信任度。我们实现了一个无监督的欺诈检测工具包,以K-Means++聚类为基础来解决这一问题。研究使用了2012年至2024年间约一百万笔金融交易的数据集。为了识别欺诈性交易并根据市场实践启发式阈值进行分类,本文提出了一种基于聚类的流水线。该方法标记了2.02%的交易为可疑,其中51.10%明显属于“幌骗”(spoofing),0.10%属于“拉高出货”(pump and dump),0.55%属于内幕交易,1.43%属于虚假突破,46.83%未分类。尽管缺乏真实标签,0.561的轮廓分数(Silhouette Score)验证了模型的性能。  

## I. 引言  
每个国家的基础设施都高度依赖其经济状况。股票市场是国家经济增长的重要组成部分。随着新产品和趋势塑造市场,股票市场也在不断演变。股票市场的概念在孟加拉国正逐渐受到关注。尽管金融素养有所提高,达卡证券交易所(DSE)的参与度仍然较低。由于投资者不信任、预期风险以及过去的市场欺诈事件,增长仍然缓慢[2](https://arxiv.org/html/2607.04184#bib.bib4)。由于与国际市场隔离,DSE的增长有限,尤其是在COVID-19等危机时期[5](https://arxiv.org/html/2607.04184#bib.bib5)。孟加拉国股票市场的剧烈波动导致达卡证券交易所表现出持续的波动性聚集。通货膨胀、利率、汇率和外部冲击等宏观经济因素对其产生了显著影响[9](https://arxiv.org/html/2607.04184#bib.bib19)。内幕交易和操纵等问题损害了投资者信任,并阻碍了长期经济进步[19](https://arxiv.org/html/2607.04184#bib.bib7)。传统的监管和监督式机器学习方法依赖于标记数据和预定义模式,因此常常无法识别金融市场中复杂的欺诈活动[18](https://arxiv.org/html/2607.04184#bib.bib11)。K-Means聚类通过快速分类正常交易和可疑交易,在欺诈检测中展现出了潜力[8](https://arxiv.org/html/2607.04184#bib.bib1)。因此,迫切需要一种轻量级、无监督、基于聚类的欺诈检测框架,能够自适应地从不断变化的市场数据中识别可疑交易行为。本研究开发了一个通用流水线,用于检测历史股票交易数据中的潜在市场操纵和操纵行为。  

![参见说明文字](图1)  
图1:市场操纵检测工作流程  

本研究的主要贡献包括:  
1. 提出一个可扩展的无监督股票市场操纵检测(SMMD)框架,将基于聚类的结构异常检测与行为金融启发式相结合。  
2. 使用30天滚动窗口提取九项技术指标,以捕捉指示异常交易行为的时间模式。  
3. K-Means在准确率(0.987)、轮廓分数(0.965)和可扩展性方面优于DBSCAN、OPTICS和层次聚类,对于检测稀疏的欺诈交易模式非常有效[13](https://arxiv.org/html/2607.04184#bib.bib20)。所提出的K-Means聚类算法将离群点标记为可疑活动的潜在指标,同时识别出正常交易模式的自然簇。  
4. 提供可解释的欺诈类型分类,与现实世界的操纵模式一致。  
5. 提出一种基于自适应百分位的风险分类方法和符号级嫌疑评级系统。  
6. 为减少误报,开发了一个混合异常过滤系统,结合基于百分位的行为标准与基于距离的离群点检测。  

## II. 文献综述  
传统的监督学习模型已被广泛用于欺诈检测,但其有效性受到大量标记数据需求的限制,并且无法识别关键欺诈模式。目前,越来越多的研究者关注无监督学习方法,尤其是聚类算法,这些方法能够克服这些问题,在未标记数据中实现异常检测。Zengyi等人[8](https://arxiv.org/html/2607.04184#bib.bib1)使用K-means无监督聚类技术,对实际交易数据进行了金融欺诈识别分析。他们采用主成分分析(PCA)简化数据并识别对欺诈检测有用的关键要素。Xuan Li等人在2024年引入了SimCLR及其应用[16](https://arxiv.org/html/2607.04184#bib.bib2)。SimCLR能够在无需监督的情况下识别交易模式并发现异常交易活动。作者在包含各种操作的eBay交易数据集上进行了实验。研究采用了多种数据准备方法和一种使用SimCLR对比学习的独特技术。为了检测股票价格时间序列数据中的异常,Wenjie、Ruofan和Bofan(2020)[20](https://arxiv.org/html/2607.04184#bib.bib10)设计了一个结合Conv1D和LSTM的深度学习模型。Conv1D能够将数据划分为30天的块,后续的LSTM层能够检测长期趋势。该模型还包含了三个全连接层用于预测。Li等人(2025)[11](https://arxiv.org/html/2607.04184#bib.bib3)开发了一个集成机器学习框架,用于识别亚太(APAC)投资者在美国市场的异常交易。该框架利用来自12个APAC经济体约847,000个账户的数据,将错误率降低了34.7%,AUC-ROC达到0.971。研究强调了将行为经济学和高级机器学习融入监管科技(RegTech)的重要性。为了检测金融科技(fintech)欺诈,Darwish等人(2025)[3](https://arxiv.org/html/2607.04184#bib.bib6)提出了一种多阶段混合方法。为了解决类别不平衡问题,他们使用了基于规则的过滤、K-means聚类、人工蜂群(ABC)优化以及带有ABC采样的KNN分类。在电子商务数据集上,该方法获得了95.0%的准确率,减少了误报,并提高了在不平衡数据上欺诈检测的鲁棒性。  

## III. 研究方法  
提出一种无监督学习模型,用于检测2012年至2024年每日股票数据中的操纵股票。已采取必要步骤对数据进行预处理。图1(https://arxiv.org/html/2607.04184#S1.F1)概述了本研究的过程。  

### III-A. 数据预处理  
为确保股票市场数据集的质量和可靠性,实施了一系列预处理步骤:  
- 将“Date”字段转换为正确的日期时间格式,并删除数据中的重复、错误和不完整条目。  
- 使用Dropna()删除行中的缺失值,最终得到包含1,019,783行的干净数据集。  

### III-B. 特征工程  
为增强模型检测可疑交易模式的能力,从清洗后的股票数据中构建了多个特征。使用30天滚动窗口开发了九项新特征,以捕捉交易趋势并检测异常。无限除法值被替换为NaN,然后用默认值替换。在用于异常检测聚类之前,所有特征均经过标准化。  

### III-C. 特征缩放  
在机器学习中,特征缩放是一种将独立变量或特征归一化到特定范围的方法[7](https://arxiv.org/html/2607.04184#bib.bib9)。清洗后,所有特征保持一致。然后,我们使用StandardScaler对所选特征进行标准化,使其均值为0,标准差为1。这一阶段确保所有特征对聚类过程贡献相等,从而提高模型性能和稳定性。算法1(https://arxiv.org/html/2607.04184#alg1)的伪代码概述了一个六阶段的无监督流水线,用于检测2012–2024年每日股票数据中的异常交易模式。伪代码中使用的所有变量定义见表I(https://arxiv.org/html/2607.04184#S3.T1)。  

### III-D. 模型训练  
聚类是一种无监督分类方法,根据预定标准将多维数据集合划分为簇[15](https://arxiv.org/html/2607.04184#bib.bib16)。  

#### III-D1. K-means++聚类算法  
K-means++是K-means的一种流行变体,用于最小化欧氏距离平方和(SSEDM)。K-means++通过迭代方式选择初始簇中心,使其分布分散,从而使算法收敛更快,避免局部最优解[1](https://arxiv.org/html/2607.04184#bib.bib17)。  

#### III-D2. 使用肘部法进行K-Means++聚类  
为了确定k值(用于将数据集聚为k个簇),我们采用肘部法计算簇的数量。从图中可以看出,从k=2到k=6,惯性(inertia)显著下降。图2(https://arxiv.org/html/2607.04184#S3.F2)展示了用于确定最佳k值的肘部法。  

#### III-D3. K-Means++算法实现步骤  
整个算法按以下步骤运行[10](https://arxiv.org/html/2607.04184#bib.bib15):  
- 使用肘部法确定k值。选择惯性下降趋于平缓时的k值。  
- 质心初始位置随机。对于每个观测点,根据欧氏距离分配最近的质心。然后计算每个簇的质心。  
- 当两次质心移动距离小于某个固定阈值时停止,否则重复上述过程。  

### III-E. 所提算法:股票市场操纵检测(SMMD)  
算法1 SMMD:股票市场操纵检测  
1 输入:Excel sheets 2010–2020, 2021–2024; 排除 {2010, 2011}; k=5, p_{95}, Δp_{thr}=10  
2 输出:标记的交易、欺诈类型、风险分数、指标  
3 // 加载与清洗  
4 df ← Concat(Load(2010–2020), Load(2021–2024))  
5 过滤掉年份 ∈ {2010, 2011}; 将NULL替换为NaN  
6 cleaned_df ← DropNa(df)  
7 // 特征  
8 对于 cleaned_df 中的每一行 do  
9   ΔP% ← (C - O) / O × 100  
10   R ← H - L  
11 endfor  
12 按 Symbol 分组 → G  
13 对于 G 中的每个 g do  
14   V_{30} ← RollMean(g.Vol, 30)  
15   T_{30} ← RollMean(g.Trade, 30)  
16   σ_{30} ← RollStd(g.Close, 30)  
17   S_V = V / V_{30}, S_T = T / T_{30}, S_Turn = Turn / Turn_{30}  
18   VWAP = Turn / V, P_avg = (O + C) / 2  
19 endfor  
20 // 缩放与聚类  
21 X ← [ΔP%, R, σ_{30}, S_V, S_T, S_Turn, VWAP]  
22 X ← RemoveInfNaN(X)  
23 X_s ← Standardize(X)  
24 M ← KMeans(X_s, k)  
25 Cluster ← Predict(M)  
26 // 异常检测  
27 d_i ← ||x_i - c_cluster||_2  
28 t_d ← Quantile(d, 0.95)  
29 t_V, t_T ← S_V, S_T 的第95百分位数  
30 对于每一行 do  
31   if d_i > t_d ∧ (|ΔP%| > 10 ∨ S_V > t_V ∨ S_T > t_T) then  
32     可疑 ← True  
33   endif  
34 endfor  
35 // 风险与欺诈标签  
36 按 Symbol 分组 → G_s  
37 对于 G_s 中的每个 g do  
38   Score ← (% 可疑) × 100  
39   Risk = { Critical if Score > 90, High if 75 < Score ≤ 90, Medium if 50 < Score ≤ 75, Low otherwise }  
40   欺诈类型 ← 根据规则分类(例如:若多个连续上涨且跌幅大→拉高出货)  
41 endfor  
42 返回标记的交易、欺诈类型、风险分数、指标  

(注:伪代码中第39行和第40行在原文中未完整显示,此处根据上下文补充了风险等级分类示例)

相似文章

基于图的金融欺诈检测:校准风险评分与结构正则化

arXiv cs.LG

本文提出了一种用于金融欺诈检测的图神经网络框架,该框架将交易记录和身份信息整合到节点属性中,采用多层消息传递机制,并利用加权监督和结构一致性正则化来改进风险评分和概率校准。在公共数据集上的实验表明,该方法优于现有方法。

我用于检测交易欺诈的SQL模式

Hacker News Top

一份实用指南,介绍六种用于检测金融数据中交易欺诈的SQL模式,包括速度检查、不可能旅行检测等方法。作者分享了真实案例和调优建议。