类别不平衡约束下少数类财务困境预测的机器学习方法比较评估
摘要
本文对在严重类别不平衡条件下预测财务困境的经典方法、集成方法和神经网络方法进行了比较评估,使用SMOTE进行过采样,SHAP进行可解释性分析。
arXiv:2605.14067v1 公告类型:新
摘要:财务困境预测仍然是企业风险分析中的一个重大挑战,因为现实世界金融数据集具有高度不平衡的特征,其中破产或陷入困境的企业通常只占观察样本的极小部分。
本文对在类别不平衡约束下用于少数类财务困境预测的经典统计方法、集成学习方法和探索性神经网络模型进行了比较评估。
研究包括结构化预处理、使用合成少数类过采样技术(SMOTE)进行不平衡缓解、集成学习架构(包括XGBoost、CatBoost、LightGBM、随机森林)的比较评估,以及基于SHAP的特征归因方法的可解释性分析。
实验评估表明,在严重不平衡条件下,梯度提升方法相对于基线统计分类器取得了更好的少数类灵敏度。该工作流程还强调了在企业金融风险环境中可重复、可解释、可审计和面向治理的机器学习评估。
本工作定位为一项应用工程评估,旨在支持在严重类别不平衡约束下进行可重复和可解释的机器学习工作流用于财务困境预测。
查看缓存全文
缓存时间: 2026/05/15 06:26
# 不平衡约束下少数类财务困境预测的机器学习方法比较评估 来源:https://arxiv.org/html/2605.14067 Karan Sehgal 肯特商学院 肯特大学 坎特伯雷,英国 K\.Sehgal@kent\.ac\.uk Khawar Naveed Bhatti 肯特商学院 肯特大学 坎特伯雷,英国 K\.Bhatti@kent\.ac\.uk ###### 摘要 财务困境预测在企业风险分析中仍是一项重大挑战,因为现实世界的财务数据集高度不平衡,破产或陷入困境的公司通常只占观察样本的一小部分。在这种条件下,传统分类模型可能获得较高的整体准确率,但对少数类困境事件的敏感性不足。 本文对在严重类别不平衡约束下用于少数类财务困境预测的经典统计方法、集成学习方法和探索性神经模型进行了比较评估。研究采用了以CRISP-DM为导向的机器学习工作流,包括结构化预处理、特征筛选、使用合成少数类过采样技术(SMOTE)缓解不平衡、比较模型优化以及面向可解释性的评估。 跨多个模型族进行了比较实验,包括逻辑回归、随机森林、AdaBoost、XGBoost、CatBoost和LightGBM,以及探索性时间序列建模方法。模型性能使用少数类的精确率、召回率、F1分数和ROC-AUC指标进行评估,特别关注召回率,因为企业财务环境中与假阴性相关的非对称操作风险。 为了支持可解释性和面向治理的分析,还应用了基于SHAP的可解释性方法来研究特征层面对破产事件预测的贡献。本研究的更广泛目标是支持在高风险操作条件下,为企业财务困境预测提供可复现、可解释且具有不平衡意识的机器学习工作流。 ## 1 引言 财务困境预测是财务风险管理、破产监控、企业治理系统和操作决策支持环境中的一个重要分类问题。尽早识别财务困境公司可能有助于组织减少与破产相关的损失风险、改善战略风险监督并支持更可靠的企业财务规划。然而,由于现实世界财务数据集中破产事件稀少,预测系统的实际实施仍然具有挑战性。 在许多企业和公共财务数据集中,破产公司仅占全部观察样本的一小部分,产生了严重不平衡的分类环境。在这种条件下,传统的机器学习模型可能会偏向多数非破产观察样本,导致整体准确率虚高,而对少数类困境事件的敏感性较差。这个问题在财务风险环境中尤为突出,因为假阴性可能会延误干预并增加下游的操作和财务风险。 传统的财务困境预测方法,如Altman Z-score(Altman, 1968)、Ohlson O-score(Ohlson, 1980)和Zmijewski模型(Zmijewski, 1984),历史上为破产估计提供了可解释的统计框架。这些方法因其方法简单和可解释性而仍然具有影响力,尽管在非线性财务交互、异构操作条件和不断变化的市场行为为特征的企业环境中可能表现出局限性。 更近期的机器学习方法,包括XGBoost(Chen and Guestrin, 2016)、LightGBM(Ke等人,2017)和CatBoost(Prokhorenkova等人,2018),为在结构化企业数据集中建模非线性财务关系和复杂特征依赖提供了更高的灵活性。集成学习架构在涉及异质财务指标的破产预测和财务风险建模任务中,越来越展现出强大的预测能力。 尽管预测建模取得了进展,但在面向企业的财务机器学习系统中,仍有几个重要挑战相关。严重的类别不平衡需要明确的不平衡感知优化策略,以在模型训练和评估期间提高对少数类事件的敏感性。同时,不断增长的企业治理和监管期望要求预测系统支持可解释性、透明度、可复现性和操作可审计性,而不是作为不透明的黑箱分类器运作。 本研究使用SMOTE(Chawla等人,2002)和SHAP可解释性分析(Lundberg and Lee, 2017),评估了多种用于严重类别不平衡条件下少数类财务困境预测的机器学习方法。研究采用CRISP-DM导向的实验框架,包括预处理、不平衡缓解、比较模型评估以及跨多种统计、集成和探索性时间序列建模方法的面向治理的可解释性分析。 这项工作的更广泛目标不仅仅是预测优化,而是开发一个可复现且可解释的机器学习评估框架,能够支持在高不平衡操作条件下值得信赖的企业财务风险分析。 ## 2 文献综述 ### 2.1 经典财务困境预测模型 财务困境预测历史上依赖于源自会计和财务比率分析的统计评分模型。最广泛认可的方法之一是Altman Z-score模型(Altman, 1968),它应用多元判别分析,使用与流动性、盈利能力、杠杆和偿付能力相关的财务比率来估计破产风险。 随后的模型,包括Ohlson O-score(Ohlson, 1980)和Zmijewski模型(Zmijewski, 1984),引入了基于逻辑回归和概率单位的统计方法用于破产估计。这些方法因其可解释性、方法简单和相对较低的计算复杂度而仍然重要。 然而,经典统计模型在以非线性财务交互、异构报告结构、噪声操作指标和不断变化的市场条件为特征的现代企业环境中可能表现出局限性。许多传统方法还依赖线性可分性和相对稳定的财务行为的假设,这在复杂的现实世界分类环境中可能会降低预测灵活性。 尽管存在这些局限性,经典财务困境预测模型仍然为比较评估提供了重要的基线框架,并因其可解释性和历史意义而在财务风险建模文献中保持影响力。 随后的模型,包括Ohlson O-score(Ohlson, 1980)和Zmijewski模型(Zmijewski, 1984),引入了基于逻辑回归和概率单位的统计方法用于破产估计。这些方法因其可解释性和相对较低的计算复杂度而仍然重要。 然而,经典统计模型在以非线性财务交互、异构报告结构和噪声操作指标为特征的现代企业环境中可能表现出局限性。 ### 2.2 财务困境预测的机器学习方法 机器学习方法越来越多地被应用于财务困境预测,因为它们能够建模非线性关系、异质财务行为以及结构化企业数据集中的复杂特征依赖。与传统的统计评分方法不同,机器学习架构能够在动态操作条件下捕获财务指标之间的高阶交互。 包括随机森林、AdaBoost、XGBoost(Chen and Guestrin, 2016)、CatBoost(Prokhorenkova等人,2018)和LightGBM(Ke等人,2017)在内的集成学习方法,在涉及破产预测、欺诈检测和企业风险建模的表格金融分类任务中,已经展现出强大的预测能力。 随机森林模型通过自助聚合和特征随机化提高了鲁棒性,从而减少了方差并在噪声财务环境下提高了泛化性能。包括XGBoost、CatBoost和LightGBM在内的梯度提升架构,通过使用序贯集成构建策略迭代优化残差分类误差,进一步提高了预测性能。 这些基于提升的方法特别适用于结构化企业数据集,因为它们能够建模非线性特征依赖、管理异质变量分布,并在平衡感知优化条件下保持相对较强的预测性能。 包括长短期记忆(LSTM)网络在内的神经方法也被探索用于在序列财务数据集中建模时间财务行为。这种架构可能通过捕获跨历史企业指标的时间依赖性,改进对不断变化的财务条件的表示。同时,包括ARIMA和SARIMA在内的统计预测方法仍然是结构化时间财务分析的相关基线技术。 尽管具有预测优势,但用于财务困境预测的机器学习方法对预处理质量、不平衡缓解程序、评估设计和可解释性考虑仍然高度敏感。因此,可复现性、少数类敏感性和面向治理的评估框架仍然是企业财务机器学习系统中的重要考虑因素。 ### 2.3 财务预测中的类别不平衡 类别不平衡是财务困境预测系统中的一个主要挑战,因为破产观察样本通常相对于非困境企业案例来说是罕见的。在高不平衡的分类条件下,机器学习模型可能会不成比例地偏向多数类观察样本,导致人为夸大的整体准确率,而对少数类事件检测的敏感性较差。 这个问题在企业财务风险环境中尤为突出,因为假阴性可能会延误干预、降低破产可见性并增加下游的操作和财务风险。因此,不平衡感知的优化和评估程序被认为是可靠财务困境预测工作流的关键组成部分。 过采样方法,如合成少数类过采样技术(SMOTE)(Chawla等人,2002),通常用于在模型优化过程中改善少数类表示。SMOTE通过在现有少数样本之间进行最近邻插值来生成合成少数类观察样本,从而减少训练过程中多数类的主导地位。 先前的研究表明,不平衡感知的预处理策略可能改善财务分类环境中的少数类召回率、F1分数性能和破产事件敏感性。然而,如果合成样本生成没有得到仔细控制,过采样程序还可能引入精确率-召回率权衡和潜在的过拟合行为。 因此,不平衡感知的财务机器学习系统需要优先考虑少数类事件敏感性、可复现性和操作可靠性的评估框架,而不是仅仅依赖整体准确率指标。这些考虑在面向企业的财务预测系统中尤为重要,因为少数类事件检测具有不成比例的操作重要性。 ### 2.4 财务机器学习中的可解释性与治理 随着机器学习系统越来越深入地集成到企业决策支持环境中,可解释性和治理考虑变得显著更加重要。财务预测系统可能影响涉及破产监控、信用风险分析、企业风险管理、监管报告和战略财务监督的操作决策。因此,预测模型不仅需要可接受的性能,还需要足够的可解释性和透明度,以支持可审计性、治理审查和操作信任。 事后可解释性方法,如SHAP(Lundberg and Lee, 2017),提供了特征归因机制,用于理解预测模型行为并改善复杂机器学习系统中的透明度。SHAP使用合作博弈论原理估计单个特征对预测结果的贡献,使得能够在不同财务条件下对模型行为进行全局和局部解释。 在面向企业的财务环境中,可解释性机制尤其重要,因为高性能的黑箱模型可能引入与问责性、验证、可追溯性和监管监督相关的治理挑战。特征归因分析使从业者能够识别最强烈影响破产事件预测的财务指标,并改善模型辅助决策过程的可解释性。 除了预测解释之外,可解释性还有助于实现更广泛的目标,包括可复现性、面向治理的模型验证、可信赖的AI评估和操作可审计性。在高风险财务系统中,随着组织寻求部署能够支持透明、可解释和可靠的企业决策支持基础设施的机器学习工作流,这些考虑变得越来越重要。 ## 3 方法论 本研究采用了一个应用机器学习评估框架,用于在严重类别不平衡条件下进行少数类财务困境预测。该方法旨在支持跨多种统计、集成和探索性时间序列建模方法,在企业财务风险环境中进行可复现的比较分析。 整体工作流遵循CRISP-DM导向的流程,包括... (注:原文在此处截断,但根据上下文,可以推测后续内容为CRISP-DM流程的具体步骤描述。由于原文后续内容未提供,翻译至此完成。)
相似文章
通过混合重采样与堆叠集成技术的破产预测及可解释人工智能(XAI)分析
本研究开发了一个破产预测框架,结合混合重采样、堆叠集成和可解释人工智能,以增强不平衡金融数据中少数类的检测。结果显示,GRU与SMOTE-ENN的组合表现最佳,而SHAP分析用于识别关键的破产风险预测因子。
机器学习用于2型糖尿病风险预测的综合评估:大规模外部验证与公平性分析
本文构建了一个多维框架,用于评估基于机器学习的2型糖尿病风险预测模型的区分度、校准度、可解释性和算法公平性,揭示了在现实世界分布偏移下性能显著下降以及按年龄和肥胖程度存在的偏差。
生物医学二分类中不平衡处理方法的系统评估
本文系统评估了五种不平衡处理方法(RUS、ROS、SMOTE、重加权、直接F1优化)在三个生物医学数据集(表格、文本、图像)上使用不同复杂度模型的效果。结果表明,收益取决于模型复杂度和数据模态,其中ROS、重加权和直接F1优化对非结构化数据上的复杂模型有效。
超越聚合校准:分解自动化信用违约预测中的收入条件召回率差异
本文审计了自动化信用违约预测中基于置信度的标签过滤,揭示了收入条件相关的召回率差异,并表明当代理变量和制度性偏见持续存在时,仅对模型遮蔽敏感属性并不能消除公平差距。
校准虚拟筛选中的无声失败:边际共形预测对少数类覆盖不足,类条件修复方案恢复覆盖
本文揭示了标准边际共形预测在不平衡虚拟筛选数据集中无法覆盖少数类,并展示了类条件(Mondrian)共形预测如何恢复每类覆盖。