通过混合重采样与堆叠集成技术的破产预测及可解释人工智能(XAI)分析

arXiv cs.LG 论文

摘要

本研究开发了一个破产预测框架,结合混合重采样、堆叠集成和可解释人工智能,以增强不平衡金融数据中少数类的检测。结果显示,GRU与SMOTE-ENN的组合表现最佳,而SHAP分析用于识别关键的破产风险预测因子。

arXiv:2608.20343v1 Announce Type: new Abstract: 本研究开发并评估了一个破产预测框架,该框架集成了基于共识的特征选择、混合重采样、堆叠集成和可解释人工智能,以改善严重不平衡金融数据中的少数类检测。使用来自UCI机器学习仓库的台湾破产预测数据集,首先应用了五种特征选择算法,并通过共识保留规则将输入空间缩减到23个稳健变量。然后,使用SVM-SMOTE、SMOTE-Tomek和SMOTE-ENN生成平衡训练数据。五种集成机器学习分类器,即梯度提升、极端梯度提升、基于直方图的梯度提升、LightGBM和AdaBoost,与五种深度学习模型(包括RNN、LSTM、GRU、DNN和MLP)进行了比较。此外,混合堆叠集成将五种机器学习分类器作为基础学习器,每种深度学习模型作为元学习器。模型性能通过准确率、召回率、特异性、G-mean和ROC-AUC进行评估,同时使用SHAP解释特征贡献。结果显示,重采样策略显著影响了模型行为。SVM-SMOTE和SMOTE-Tomek偏向于准确率和特异性,而SMOTE-ENN提供了更强的少数类检测能力。在独立模型中,GRU与SMOTE-ENN的组合达到了最佳的整体预测平衡,召回率为0.8627,G-mean为0.8517,ROC-AUC为0.9431。在堆叠集成中,SMOTE-ENN与(GB+XGB+HGB+LGBM+AB)+LSTM提供了灵敏度和特异性之间的最强折衷。SHAP分析确定了杠杆率、盈利能力、偿债能力和运营效率指标作为破产风险最具影响力的预测因子。这些发现支持为财务困境企业建立更可靠和可解释的早期预警系统。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:27

# 基于混合重采样与Stacking集成技术的破产预测及可解释人工智能(XAI)驱动分析
来源:https://arxiv.org/abs/2608.20343
查看PDF (https://arxiv.org/pdf/2608.20343)

> 摘要:本研究开发并评估了一个破产预测框架,该框架整合了基于共识的特征选择、混合重采样、Stacking集成以及可解释人工智能技术,旨在提升严重不平衡金融数据中少数类别的检测能力。研究使用来自UCI机器学习数据库的台湾破产预测数据集,首先应用五种特征选择算法,并通过共识保留规则将输入空间缩减至23个稳健变量。随后采用SVM-SMOTE、SMOTE-Tomek与SMOTE-ENN生成平衡训练数据。将五种集成机器学习分类器(梯度提升、极端梯度提升、基于直方图的梯度提升、LightGBM和AdaBoost)与五种深度学习模型(RNN、LSTM、GRU、DNN和MLP)进行比较。此外,构建了混合Stacking集成模型,将五种机器学习分类器作为基学习器,每个深度学习模型作为元学习器。通过准确率、召回率、特异性、G均值和ROC-AUC评估模型性能,并使用SHAP解释特征贡献度。结果表明:重采样策略显著影响模型行为,SVM-SMOTE与SMOTE-Tomek有利于提升准确率和特异性,而SMOTE-ENN在少数类检测方面表现更优;在独立模型中,采用SMOTE-ENN的GRU模型实现了最佳整体预测平衡(召回率0.8627,G均值0.8517,ROC-AUC 0.9431);在Stacking集成模型中,(GB+XGB+HGB+LGBM+AB)+LSTM模型在SMOTE-ENN策略下展现了最优的敏感性-特异性权衡。SHAP分析确定杠杆率、盈利能力、偿债能力和运营效率指标是影响破产风险的最关键预测因子。这些发现支持构建更可靠、可解释的财务困境企业早期预警系统。

## 提交历史记录

来自:Edmund Agyemang [查看邮件 (https://arxiv.org/show-email/effad90d/2608.20343)] **[v1]** 2026年6月13日 星期六 01:45:09 UTC(1,084 KB)

相似文章

人工智能在欺诈性银行操作识别中的应用

arXiv cs.LG

本文研究了人工智能和机器学习算法在识别欺诈性银行交易中的应用,提出了预处理技术并比较了多种模型。人工神经网络和堆叠泛化方法取得了更高的AUC分数,最佳结果约为0.954。