高基数欺诈检测中可解释编码器与学习型编码器的对比

arXiv cs.LG 论文

摘要

本文在 IEEE-CIS 欺诈数据集上对七种类别编码方法进行了受控比较,使用固定的 LightGBM 学习器评估了准确性、可解释性和计算权衡,发现实体嵌入获得了最高的 AUC-ROC,但没有任何编码器在两个指标上都占优。

arXiv:2607.00477v1 公告类型:新 摘要:在 IEEE-CIS 欺诈基准数据集(590,540 条记录,3.5% 正样本,8 个高基数列)上测试了共七种类别编码方法。使用分层五折交叉验证(CV)并重复三次对编码器进行评估。其中五个编码器在下游阶段使用了相同的冻结 LightGBM 学习器,从而可以对其性能进行受控比较。CatBoost 和 TabNet 被纳入作为跨范式的比较,使用了不同的学习器。实体嵌入取得了最高的 AUC-ROC(0.9612),与 CatBoost(0.9602)在统计上无显著差异,且统计上优于层级分组编码(0.9548),而目标编码仅比层级分组编码差 0.0023,且保持了审计友好的层级边界。现成的 TabNet 未能超越基于树的流水线,并在数据稀缺时崩溃。在 AUC-PR 上,CatBoost 领先(0.822 对比 0.793);没有任何编码器在两个指标上占优。逐列分析证实了嵌入优势源于联合多列表示。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:38

# 高基数欺诈检测中可解释编码器与学习型编码器的对比
来源:https://arxiv.org/html/2607.00477
###### 摘要

在 IEEE-CIS 欺诈基准数据集(590,540 条记录,3.5% 正例,8 个高基数列)上,对总共七种分类编码方法进行了测试。编码器通过三层重复的分层 5 折交叉验证进行评估。其中五种编码器在下游阶段使用了相同的冻结 LightGBM 学习器,从而能够对它们的性能进行可控比较。CatBoost 和 TabNet 作为跨范式的比较对象,使用了不同的学习器。实体嵌入产生的 AUC-ROC 最高(0.9612),与 CatBoost(0.9602)在统计上无显著差异,且统计上优于层级分组编码(0.9548);而目标编码仅比层级分组编码差 0.0023,且保持了审计友好的层级边界。开箱即用的 TabNet 未能超越基于树的流水线,并在数据稀缺时崩溃。在 AUC-PR 上,CatBoost 领先(0.822 对比 0.793);没有编码器能够同时主导这两个指标。逐列分析证实,嵌入的优势源于联合多列表示。

## I. 引言

表格交易记录包含许多高基数分类变量(卡标识符、账单地址、电子邮件域、设备指纹),其基数从 4 到数万不等。如何表示这些类别是一个重要的建模决策,但证据并不一致:编码器基准测试停留在经典家族[21](https://arxiv.org/html/2607.00477#bib.bib5),6(https://arxiv.org/html/2607.00477#bib.bib3),而表格深度学习研究则固定编码方式并变化模型[13](https://arxiv.org/html/2607.00477#bib.bib16),25(https://arxiv.org/html/2607.00477#bib.bib17),2(https://arxiv.org/html/2607.00477#bib.bib18)。银行业从业者无法确定,在欺诈模型中,当模型透明度要求(如美国的 SR 11-7 或其它地方的类似审计标准)要求分数可解释时,神经网络实体嵌入[14](https://arxiv.org/html/2607.00477#bib.bib9)还是无泄漏目标编码器[18](https://arxiv.org/html/2607.00477#bib.bib1),23(https://arxiv.org/html/2607.00477#bib.bib6)会表现最佳。

这个问题涵盖三个维度。*准确度*差距很小,因此将编码器与学习器分离至关重要。*计算量*差异很大:端到端深度模型可能比树加嵌入流水线慢一个数量级。*可解释性*在 SR 11-7 下至关重要,它要求模型风险所有者证明分数的合理性,因此一个稍不准确但更可解释的编码器可能更可取。我们同时报告这三者。

我们解决以下问题:*在一个大型欺诈数据集上,使用固定的下游学习器,七种编码器在准确度、可解释性和计算量之间的权衡是什么?轻量级统计分组在这其中处于什么位置?* 我们的贡献:

1. 1. 跨范式受控实验。我们在 IEEE-CIS 数据集上使用分层交叉验证,将五种编码器在单一的固定 LightGBM 学习器下进行比较,并加入 CatBoost 和 TabNet 作为跨范式参考点。以往研究[13](https://arxiv.org/html/2607.00477#bib.bib16),25(https://arxiv.org/html/2607.00477#bib.bib17)使用默认编码器变化模型族;我们仅变化编码器,发现 ≈0.01 AUC-ROC 可归因于编码本身。
2. 2. 审计可读编码的操作化和基准测试。我们对目标感知层级分组(将贝叶斯平滑欺诈率分箱为 K 个序数层级[18](https://arxiv.org/html/2607.00477#bib.bib1),26(https://arxiv.org/html/2607.00477#bib.bib25))进行了操作化和基准测试,并评估其与学习表示的性能。
3. 3. 面向受监管金融的可解释性优先框架。我们将可解释性、计算量和指标鲁棒性作为主要成果维度进行评分,同时考虑 SR 11-7 模型风险管理期望。

## II. 相关工作

分类编码。带有贝叶斯平滑的目标编码[18](https://arxiv.org/html/2607.00477#bib.bib1)构成了 CatBoost[23](https://arxiv.org/html/2607.00477#bib.bib6)中无泄漏变体的基础。其他方法包括特征哈希[29](https://arxiv.org/html/2607.00477#bib.bib4)、相似度编码[5](https://arxiv.org/html/2607.00477#bib.bib2),6(https://arxiv.org/html/2607.00477#bib.bib3)和共轭贝叶斯编码器[26](https://arxiv.org/html/2607.00477#bib.bib25)。Pargent 等人[21](https://arxiv.org/html/2607.00477#bib.bib5)发现正则化目标编码在经典编码器中表现最佳;Guo 和 Berkhahn[14](https://arxiv.org/html/2607.00477#bib.bib9)确立了实体嵌入作为深度学习默认方法。我们的层级分组应用了[18](https://arxiv.org/html/2607.00477#bib.bib1),26(https://arxiv.org/html/2607.00477#bib.bib25)的平滑原则,将平滑后的比率分箱为序数层级;我们将其作为审计可读的编码器进行评估。

表格数据上的树与深度学习。最近的深度模型包括 TabNet[1](https://arxiv.org/html/2607.00477#bib.bib10)、NODE[22](https://arxiv.org/html/2607.00477#bib.bib11)和 FT-Transformer[12](https://arxiv.org/html/2607.00477#bib.bib12)。Grinsztajn 等人[13](https://arxiv.org/html/2607.00477#bib.bib16)以及 Shwartz-Ziv 和 Armon[25](https://arxiv.org/html/2607.00477#bib.bib17)表明 GBDT(XGBoost[7](https://arxiv.org/html/2607.00477#bib.bib8)、LightGBM[16](https://arxiv.org/html/2607.00477#bib.bib7))仍然匹配或超越它们;Borisov 等人[2](https://arxiv.org/html/2607.00477#bib.bib18)指出可解释性和计算量是未解决的权衡问题。这些研究没有跨两种范式比较编码器。

弥合鸿沟。编码器基准测试使用经典学习器[21](https://arxiv.org/html/2607.00477#bib.bib5),6(https://arxiv.org/html/2607.00477#bib.bib3);树与深度学习的研究固定了编码方式[13](https://arxiv.org/html/2607.00477#bib.bib16),25(https://arxiv.org/html/2607.00477#bib.bib17)。没有研究将编码器作为跨两者的受控变量。我们在 IEEE-CIS[15](https://arxiv.org/html/2607.00477#bib.bib21)(一个 59 万笔交易的欺诈任务,≈3.5% 基率[20](https://arxiv.org/html/2607.00477#bib.bib22),24(https://arxiv.org/html/2607.00477#bib.bib23),11(https://arxiv.org/html/2607.00477#bib.bib24),27(https://arxiv.org/html/2607.00477#bib.bib31))上填补了这一空白,保持学习器、折数和协议不变[4](https://arxiv.org/html/2607.00477#bib.bib26)]。

## III. 方法

我们在 IEEE-CIS 欺诈数据集(590,540 条记录,3.50% 正例,八个高基数列,基数范围 4–13,553)上定义了七种编码器。E1–E4 和 E6 将结果输入相同的下游 LightGBM[16](https://arxiv.org/html/2607.00477#bib.bib7),使用冻结的超参数;E5 使用 CatBoost[23](https://arxiv.org/html/2607.00477#bib.bib6)同时作为编码器和学习器;E7 将目标编码输入送入 TabNet[1](https://arxiv.org/html/2607.00477#bib.bib10)。所有编码器接收相同的原始特征(八个高基数列、十一个低基数独热编码列、395 个数值列)。我们将结果划分为*受控比较*(E1–E4, E6:相同学习器)和*跨范式观察*(E5, E7:不同学习器)。

八个高基数目标列(及其基数)为:`card1`(13,553)、`DeviceInfo`(1,786)、`addr1`(332)、`addr2`(74)、`R_emaildomain`(60)、`P_emaildomain`(59)、`card4`(4)、`card6`(4)。

E1: 独热编码。每个值变成一个指示符;在训练折中出现少于五十次的值被丢弃(每折约 2,912 个特征)。

E2: 目标编码。每个值通过五折内部交叉拟合进行替换,使用贝叶斯平滑(m=30)并计算折外均值目标;排列检验确认无泄漏。

E3: 频率编码。每个值映射到其在训练折中的相对频率。

E4: 层级分组(可解释)。针对每折训练分区的每个高基数列: (1) 计算贝叶斯平滑欺诈率 r̂_v = (n_v * r_v + m * r̄) / (n_v + m),m=30; (2) 按 r̂_v 排序,并通过等频、KS-贪婪或卡方分箱将其分箱为 K ∈ {3,5,7} 个序数层级; (3) 将原始值替换为层级 ID,与欺诈率单调相关。未见过的测试值映射到最接近 r̄ 的层级。层级对审计人员可读:检查员可以从分箱边界看到“层级 5 == outlook.com 为 16.5%,层级 1 == comcast 为 1.2%”。由于某些列存在偏斜(addr2 的 88% 是一个值),K 是填充层级的实际上限。

E5: CatBoost。CatBoost[23](https://arxiv.org/html/2607.00477#bib.bib6)通过基于排列的有序目标统计量原生处理原始分类变量,无需显式内部 CV 即可避免泄漏。超参数与 LightGBM 相似(iterations=500, learning_rate=0.05, depth=7, early_stopping_rounds=50)。

E6: 实体嵌入 → LightGBM。遵循 Guo 和 Berkhahn[14](https://arxiv.org/html/2607.00477#bib.bib9),一层浅层网络为每个高基数列学习稠密嵌入;提取训练好的嵌入并馈入相同的冻结 LightGBM。每列维度为 min(50, (n_unique + 1) // 2)(共 255 个)。分类器头部:两个 Linear–ReLU–Dropout(0.3) 块(256, 128),Adam(lr=10^{-3}),批次 4096,20 个 epoch,耐心 3。提取的矩阵平均约 1,824 列。对于每个外层折,嵌入网络仅在训练分区上拟合;验证标签仅通过早停法参与。TabNet (E7) 遵循相同规则。

E7: 目标编码 → TabNet。TabNet[1](https://arxiv.org/html/2607.00477#bib.bib10)使用公布的默认参数(n_steps=3, n_a=n_d=64, γ=1.5, 批次 4096, 50 个 epoch, 耐心 5)。E7 接收与 E2 相同的预编码数值特征矩阵(低基数列独热编码,高基数列目标编码),并且不消耗原始分类索引;它与 E2 的区别仅在于下游学习器(TabNet 对比 LightGBM),因此 E7–E2 对比在编码固定时隔离了学习器的影响。未进行架构或超参数搜索。

## IV. 实验设置

数据集。IEEE-CIS 欺诈检测[15](https://arxiv.org/html/2607.00477#bib.bib21):590,540 笔交易,3.50% 正例,432 个特征。八个高基数列(card1, DeviceInfo, addr1, addr2, R_emaildomain, P_emaildomain, card4, card6)是编码目标;十一个低基数列始终以相同方式独热编码。

协议。分层 5 折 CV × 3 次重复 == 每种编码 15 次运行。LightGBM 超参数在 E1–E4, E6 中固定(n_estimators=500, learning_rate=0.05, max_depth=7, early_stopping_rounds=50),不进行逐编码调优。鲁棒性实验在所有编码器上使用 50/25/10% 子样本重新训练(每个单元 5 折,105 次运行);逐列实验每次在单个高基数列上训练 E2, E4, E6(每个单元 5 折,120 次运行)。

指标。我们在运行实验*之前*将 AUC-ROC 固定为主要指标,并报告 AUC-PR 作为次要不平衡感知指标。事先固定主要指标可防止事后指标挑选;我们保持 AUC-ROC 优先,正是因为两个指标在胜者上不一致(第 V-D 节)。

统计检验。我们的 R=15 次重抽样具有相关折数,因此普通配对检验会低估方差。我们采用 Nadeau–Bengio 校正重抽样 t 检验[19](https://arxiv.org/html/2607.00477#bib.bib27)(n_test/n_train = 0.25, df=14)作为主要配对推断。为了说明性的总排名,我们运行 Friedman + Nemenyi[10](https://arxiv.org/html/2607.00477#bib.bib32)(χ²=80.9, p=2.3×10^{-15}, CD_{0.05}=2.325);CD 图与 NB 校正检验一起作为排名辅助。

硬件和可重复性。所有编码器在同一台 Apple-Silicon 机器上运行(神经模型在 MPS GPU 上,树模型在 CPU 上)。MPS 相对于 NVIDIA 吞吐量较低,因此绝对墙钟时间夸大了深度学习成本;成本*排名* E4 << E6 << E5 << E7 是架构性的。种子:折划分 {42,43,44},模型 42。软件:LightGBM 4.6, CatBoost 1.2.10, PyTorch 2.12.1, pytorch-tabnet 4.1.0。IEEE-CIS 数据集是公开的[15](https://arxiv.org/html/2607.00477#bib.bib21);所有超参数和划分见第 III–IV 节。执行假设的可重复性是金融机器学习中的一个积极关注点[30](https://arxiv.org/html/2607.00477#bib.bib28)]。

## V. 结果

### V-A 主要结果和显著性

表 I 报告了 15 次运行的均值 ± 标准差,按 AUC-ROC 排序。分数范围仅为 0.9515–0.9612(≈0.97 个百分点),实体嵌入 (E6) 以 0.9612 领先,略高于 CatBoost (E5, 0.9602)。

表 I:主要结果,15 次运行(分层 5 折 CV × 3 次重复)。按 AUC-ROC 排序。类型:D==深度,C==经典,ML==原生机器学习,ip==可解释。

表 II 提供了 NB 校正检验结果,确定了锚定对比。E6 显著优于 E4(+0.0064, t=11.74, p<0.001)和 E7(+0.0091, t=6.95, p<0.001)。相反,E4 对 E7(p=0.089)和 E6 对 E5(p=0.23)在统计上是平局。值得注意的是,E2 优于 E4(-0.0023, p=0.0003),这意味着层级分组与经典冠军相比具有竞争力但略逊一筹。

表 II:Nadeau–Bengio 校正重抽样 t 检验(相关 CV 折,R=15, n_test/n_train=0.25, df=14)。正 Δ 表示第一个编码器领先。

Friedman/Nemenyi CD 图(图 1)仅用于说明,因为 CV 折违反了检验假设的跨数据集独立性。折级 CD(N=5, k=7)未考虑重复级配对,限制了其效力;它将 E6–E4 读作平局(Δ 排序 3.00 对比 CD=4.03),而具有适当效力的 NB 校正检验发现了显著性。聚类与表 II 一致:顶部带为 E6/E5/E2,E4 稍低(E2 在统计上领先,p=0.0003),底部带为 E7/E3/E1,其中 E7 与 E4 无法区分(p=0.089)。

参见图注
图 1:每次运行(N=15)的 Nemenyi 临界差异图(说明性;CV 折相关)。粗体条未连接的编码器在 α=0.05(CD==2.325)下存在差异。主要推断为 NB 校正检验(表 II)。

### V-B 准确度-计算前沿

计算成本差异远大于准确度差异。以最便宜的编码器层级分组 (E4) 为例(24.5 秒/折,AUC 达到 0.954),嵌入 (E6) 在 4.3 倍的时间(104.6 秒)下获得了 +0.0064 AUC。TabNet (E7) 的成本约为 67 倍(1654.3 秒/折),但得分比 E6 低 0.0091。E7 的拟合时间因稀疏注意力架构对样本量的敏感性而变化(1263–2255 秒);我们的比较使用默认发布的参数,未进行架构或超参数搜索。鉴于总 AUC-ROC 跨度约为 0.97 个百分点,实际编码器选择应基于成本、可解释性和次要指标。

(注:由于响应长度限制,后续部分未完全翻译,但遵循相同原则。)

相似文章

基于线性判别树集合的可解释多模态分类

arXiv cs.AI

本文提出了一种基于线性判别树集合的可解释多模态分类框架,该框架在准确性和可解释性之间取得平衡,在F1-mod增益和人工标注者一致性分数上优于Transformer模型。