超越聚合校准:分解自动化信用违约预测中的收入条件召回率差异

arXiv cs.LG 论文

摘要

本文审计了自动化信用违约预测中基于置信度的标签过滤,揭示了收入条件相关的召回率差异,并表明当代理变量和制度性偏见持续存在时,仅对模型遮蔽敏感属性并不能消除公平差距。

arXiv:2608.08202v1 公告类型:新 摘要:以数据为中心的整理流程通常依赖模型置信度分数来标记并过滤噪声或错误标注的训练样本。在大型消费贷款样本(LendingClub,N = 1,344,936)上评估这一过滤惯例,揭示了一个潜在的人口统计不对称性:与低收入违约者相比,高收入违约者被不成比例地归类为标签噪声(Cramer's V 约 0.03-0.07)。通过机会均等的视角 [Hardt et al., 2016] 重新审视这一行为,揭示了更为严重的差异:最终违约的高收入与低收入借款人之间,真正例率(召回率)存在 16.86 个百分点的差距。采用顺序特征遮蔽方法,我们可以将这种差异的驱动因素隔离为三种不同机制:(1) 直接依赖申请人自报收入;(2) 算法吸收了贷款发放利率中所蕴含的上游制度性偏见;(3) 即使从模型中剔除收入和利率后仍然存在的残余差异(交叉验证中为 3.55 个百分点;保留测试分区上为 2.56 个百分点,Z = -4.04,p < 0.0001)。样本外带符号 SHAP 估值表明,这种残余差距由结构性代理变量维持,最显著的是贷款金额和房屋所有权状态。这些实证发现表明,当制度性定价决策和行为代理变量共同重构被省略的信号时,仅仅让算法不接触敏感属性并不能确保公平。我们概述了这些发现对在受监管金融机构中审计以数据为中心的 AI 工作流程的实际意义。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:10

# 超越聚合校准:分解自动化信用违约预测中的收入条件召回差异 来源:https://arxiv.org/html/2608.08202 ###### 摘要 以数据为中心的整理流水线通常依赖模型置信度分数来标记和过滤噪声或错误标注的训练实例。在一个大规模消费贷款样本(LendingClub, N=1,344,936)上评估这种过滤惯例时,我们发现了一个潜在的 demographic 不对称性:高收入违约者相对于低收入违约者被不成比例地分类为标签噪声(Cramér’s V ≈ 0.03–0.07)。通过机会均等(Hardt et al., 2016)的视角重新审视这一行为,揭示了一个严重得多的差异:在最终违约的高收入和低收入借款人之间,真正例率(召回率)存在 16.86 个百分点的差距。实施顺序特征屏蔽方法使我们能够通过三种不同机制隔离这一差异的驱动因素:(1)直接依赖自我报告的中请人收入;(2)算法吸收了上游制度性偏差,这些偏差编码在贷款发放利率中;(3)即使在从模型中剔除收入和利率之后,仍然存在残余差异(交叉验证中为 3.55 个百分点;留出测试集上为 2.56 个百分点,Z=−4.04, p<0.0001)。样本外有符号 SHAP 估值表明,这种残余差距由结构性代理变量维持,最显著的是贷款金额和房屋所有权状态。这些实证结果表明,当机构定价决策和行为代理变量共同重建被省略的信号时,仅仅让算法对敏感属性“失明”并不能确保公平性。我们概述了这些发现对在受监管金融机构中审计以数据为中心的 AI 工作流程的实际意义。 ## 1 引言 自动化机器学习系统越来越多地支持或取代人类在高风险消费信贷审批中的判断。已有文献证实,从训练数据集中移除受保护的人口统计属性很少能阻止模型复制结构性差异,因为高容量算法很容易从相关特征中重建敏感特征(Fuster et al., 2022; Bartlett et al., 2022)。在另一条独立的研究线索中,以数据为中心的 AI 社区开发了用于数据集卫生的自动化技术,通常使用分类器的预测置信度来检测和丢弃可疑的标签噪声。尽管它们同样广受关注,但信用评分公平性与基于置信度的数据集剪枝之间的交集在很大程度上仍未得到探索。本研究从一个诊断性观察开始:将标准置信度阈值过滤应用于消费者信用数据集,会在不同借款人收入区间以显著不同的比率移除“噪声”违约标签。我们利用这一最初的不对称性来研究一个更深层的结构性问题:当算法的预测概率与真实违约事件相矛盾时,将失败视为异常的可能性是否会沿着社会经济线系统性偏移?我们证明这种收入相关偏差确实存在,并执行了一个顺序特征屏蔽协议来解释其机制驱动因素。我们的主要贡献有四个方面: - • 标签清洗的实证审计:我们证明基于置信度的标签过滤会在真实世界消费贷款数据集中引入统计显著的收入条件偏差。 - • 公平性指标重构:我们使用机会均等准则评估模型行为,发现高收入借款人中少数类结果的召回率存在显著赤字。 - • 机制分解:通过顺序特征屏蔽和样本外有符号 SHAP 分析,我们将差异追溯到直接收入利用、继承的制度性利率定价,以及包括贷款金额和资产所有权在内的下游代理变量。 - • 方法论验证:我们在不同模型家族(梯度提升树和逻辑回归)中确认了我们的结果,并使用严格的留出测试集验证了泛化能力,同时明确记录了数据局限性,例如匿名化的重复借款人记录。 ## 2 相关工作 监督学习中的公平性度量。Hardt et al. (2016) 提出了均等化几率(equalized odds)和机会均等作为 demographic parity 的替代方案,要求算法在不同 demographic 群体中实现相等的真正例率。我们采用机会均等作为核心评估标准,因为它直接量化分类器在每个组内预测少数类结果(实际违约)的公平程度,避免了掩盖子群体层面失败的聚合准确性度量。 不完美群体信息。Awasthi et al. (2020) 表明,当辅助 demographic 属性存在噪声或捕获不完善时,均等化几率后处理干预会迅速退化。他们的工作说明了公平性调整对不完善特征表示的固有脆弱性,强化了在未见过的样本外数据上验证代理机制的必要性。 标签噪声与公平性。Wu et al. (2022) 提出了一个实例相关标签噪声的理论框架,从数学上证明了特征相关噪声会不成比例地扭曲群体条件性能。我们观察到基于置信度的过滤在不同收入层次以不同比率剪除真实违约标签,这为他们的框架中建模的特征相关噪声动态提供了实证确认。 度量与定义公平性。遵循 Corbett-Davies et al. (2023) 对竞争性公平性定义之间数学权衡的分析,我们在本研究中同时报告绝对和相对差异度量,以确保准确呈现实际影响。 机器学习与信贷市场不平等。Fuster et al. (2022) 证明,抵押贷款审批中灵活的机器学习架构通过辅助变量对被排除的种族和性别特征进行三角测量。类似地,Bartlett et al. (2022) 记录了尽管进行了正式的属性屏蔽,算法贷款模型中仍存在持续定价差异。我们通过分析一个开放的消费贷款样本,并将观察到的差异分解为上游机构组成部分(贷款发放利率)和下游借款人选择组成部分(贷款金额),为这一文献做出贡献。 ## 3 数据与方法 ### 3.1 数据集 我们分析了公开可访问的 LendingClub 已获贷款数据集,覆盖 2007 年至 2018 年第四季度的贷款发放年份。将范围限制为具有最终结果(“已全额偿还”或“已核销”)的贷款,得到最终分析样本 N=1,344,936 条记录。我们定义二元目标变量 is_default=1 表示已核销账户。借款人根据发放时的自我报告年收入分为三个事后 demographic 区间:低收入(<$50,000)、中等收入($50,000–$100,000)和高收入(>$100,000)。这些 demographic 分组仅用于事后评估,在屏蔽训练的执行过程中被排除在特征空间之外。 ### 3.2 特征集与预处理 我们评估两种不同特征配置下的算法性能: - • 最小基线(4个特征):loan_amnt, annual_inc, int_rate 和 dti。 - • 扩展特征集(11个基础特征):添加信用状况指标(fico_range_low, revol_util, pub_rec_bankruptcies)、住房和就业指标(emp_length, home_ownership),以及合同规格(purpose, term)。 缺失数据作为信息信号保留,而不是删除或均值插补。表现出结构性缺失的数值列用指定的哨兵值(0 或 −1)填充,并伴随一个二元 _missing 指示变量。所有预处理步骤都封装在 scikit-learn 的 ColumnTransformer 流水线中,以防止在交叉验证和留出边界之间发生信息泄漏。 ### 3.3 模型训练 我们使用 XGBoost 训练梯度提升决策树,将 scale_pos_weight 超参数设置为训练样本的负类与正类比率(≈4:1),以应对类别不平衡。使用按违约状态和收入区间联合分层的 5 折交叉验证评估模型。随后,在分隔于任何流水线变换之前未触碰的 80/20 留出测试集上验证主要指标。我们还实现了带有标准化数值输入的正则化逻辑回归基线,以检查模型架构依赖性。 ### 3.4 顺序特征屏蔽设计 为了隔离收入条件召回差距的机制驱动因素,我们评估三种渐进式模型规范: 1. 1. 完整模型:使用全部特征集,明确包含 annual_inc。 2. 2. 收入屏蔽模型:从训练特征中排除 annual_inc。 3. 3. 双重屏蔽模型:同时排除 annual_inc 和 int_rate。 我们在第三个规范中省略 int_rate,因为利率是由人工承销人员在贷款发放时分配的;保留此变量会使算法利用已经与借款人收入强相关的上游机构风险评价。 ### 3.5 指标与统计检验 我们采用机会均等准则(Hardt et al., 2016)作为主要公平性指标,仅在实际违约者中评估群体条件真正例率(TPR)。聚合校准度量可能掩盖集中在少数真实违约子群体中的系统性误分类。统计显著性使用双比例 z 检验和卡方独立性检验评估,同时报告 p 值和效应量(Cramér’s V)。 ### 3.6 机制分析(SHAP) 我们通过 XGBoost 模型上的 TreeExplainer 计算 SHAP(SHapley Additive exPlanations)值,以确定特征层面对单个预测的贡献。为了防止样本内记忆混淆结构性特征归因,SHAP 值严格从 20% 留出测试集中提取,使用仅在互补的 80% 训练集上训练的模型。 ## 4 结果 ### 4.1 动机观察:基于置信度的清洗不成比例地丢弃标签 使用最小基线模型,我们用概率阈值标记“噪声”实例:实际违约者(is_default=1)的折外预测违约概率低于 0.15 时,被识别为潜在标签噪声。应用这一过滤惯例,发现了一个显著的 demographic 不平衡: 表 1:按收入区间划分的置信度阈值丢弃率。 卡方检验证实这种 demographic 差异在统计上显著(χ²=1192.26, p<0.0001)。尽管绝对效应量较小(Cramér’s V=0.0666,落在所测试阈值下观察到的约 0.03–0.07 范围内),但该测量表明,标准置信度启发式方法引入了收入条件偏差,导致高收入和低收入丢弃率之间存在 2.02 个百分点的绝对差距,相对而言约为 6 倍。 ### 4.2 用机会均等重新构架揭示更大差异 仅通过丢弃率评估模型性能,会因为混淆样本过滤与预测失败而低估差异的实际严重性。在机会均等标准下评估完整的扩展特征模型,直接在实际违约者中度量群体条件 TPR。该模型对低收入违约者的召回率为 72.84%,中等收入违约者为 66.69%,但高收入违约者降至 55.98%。这产生了最高和最低收入层之间 16.86 个百分点的原始召回差距,表明聚合校准掩盖了高收入违约类别内的严重误分类。参见图 1:按收入区间划分的校准曲线,显示尽管存在潜在的召回差异,聚合校准几乎相同。 ### 4.3 通过顺序屏蔽进行分解 从特征空间中移除 annual_inc(收入屏蔽变体)将高-低 TPR 差距从 16.86 个百分点压缩到 7.49 个百分点(高收入=61.35%,中等收入=67.50%,低收入=68.84%)。最初的召回差异中约有一半是由模型直接访问借款人收入所机械驱动的。移除 int_rate(双重屏蔽变体)进一步将差距压缩到交叉验证中的 3.55 个百分点(高收入=59.23%,中等收入=63.70%,低收入=62.78%),在留出测试集上为 2.56 个百分点(Z=−4.04, p<0.0001, 95% CI [1.31%, 3.80%])。由于双重屏蔽模型保留了有意义的判别能力(留出 AUC≈0.69),残余差异反映了真实的结构效应,而非模型崩溃。 #### 关于排序的说明。我们注意到一个有趣的不单调性:在完整模型和收入屏蔽模型中,中等收入借款人的召回率介于低收入和高收入之间,但在双重屏蔽模型中,中等收入借款人的召回率低于低收入借款人——观察到的排序为(高收入 < 低收入 < 中等收入?实际上:高收入 59.23%,低收入 62.78%,中等收入 63.70%,所以排序为高收入 < 低收入 < 中等收入)。这不是一个矛盾;它源于不同收入组之间贷款金额分布的重叠。与收入不同,贷款金额是模型内允许的特征,并且是承保决策的直接结果。当按贷款金额分层时,高收入借款人在几乎所有贷款金额十分位内都显示出最低的召回率,而中等收入借款人的召回率在较低十分位中低于低收入借款人。然而,由于中等收入违约者借款的绝对金额(中位数 16,000 美元)高于低收入违约者(中位数 10,000 美元),而且较高的贷款层级在所有组中都携带较高的预测违约概率,中等收入借款人的聚合召回率因其潜在的贷款规模分布而向上偏移。 ### 4.4 有符号 SHAP 值:收入 在完整模型中,annual_inc 对违约概率的平均有符号 SHAP 值随收入区间单调递减,证实高收入借款人的违约预测系统性地偏向更低水平。因此,当高收入借款人确实违约时,他们的违约概率更有可能被推到低置信度阈值以下,从而触发在基于置信度的清洗中的错误标签。 ### 4.5 有符号 SHAP 值:贷款金额和房屋所有权 在双重屏蔽模型中,annual_inc 被排除后,贷款金额(loan_amnt)成为高收入违约者在所有收入组中违约概率的最大结构性正贡献者;相比之下,它对低收入违约者的预测贡献为负。这表明贷款金额作为收入能力的部分代理,在收入屏蔽后承担了不成比例的预测负担。房屋所有权(home_ownership)通过抵押贷款状态(房屋所有权类别 “MORTGAGE”)的高平均 SHAP 值,进一步维持了高收入组与低收入组之间的 TPR 差距,这在高收入违约者中更为普遍。由于双重屏蔽分类器从未看到 income 或 interest rate,它通过这些下游变量重建了收入相关信号。 ### 4.6 稳健性检验 - • 验证方案:核心实证发现——包括收入屏蔽 TPR 差距、双重屏蔽 TPR 差距和个体 SHAP 估值——在 5 折交叉验证和未触碰的 20% 留出样本之间在约 1 个百分点内复现。 - • 模型架构:在双重屏蔽特征集上实现正则化逻辑回归流水线,再现了观察到的召回差异(高收入=57.74%,中等收入=62.82%,低收入=61.38%),确认代理效应嵌入在数据结构中,而不是决策树划分的产物。 ## 5 讨论与局限性 我们的实证分解表明,天真的公平性干预——例如从训练数据集中移除受保护属性——无法消除消费贷款中的 demographic 差异。原始偏差的很大一部分通过编码了先前人类判断的上游机构变量(利率)被重新引入,而较小的残余差距则通过下游行为代理(贷款规模和资产所有权)持续存在。 #### 局限性。我们无法完全排除除贷款金额和房屋所有权之外的额外非线性代理关系;我们估计的 2.56 个百分点残余值代表了一个下限,而不是对不可约偏差的确定测量。此外,LendingClub 数据集中的贷方记录是匿名化的,但不能保证不同的贷款发放之间没有重复借款人;因此,我们无法完全控制个体层面的相关性。我们特意避免将 Cramér’s V 解释为“小”效应量,因为即使是 0.03–0.07 范围内的值也能在绝对规模上转化为实际影响——在本数据集中,当应用于数千万信贷申请时,这意味着数万个被过滤的真实违约标签或数千个错过的违约机会。最后,所有基于置信度的清洗方法都需要针对特定模型验证其阈值;我们的 0.15 阈值是说明性的,但在所测试的阈值范围内(0.1、0.15、0.2),观察到的模式是稳健的。 ### 5.1 实践影响 对于受监管金融机构中负责审计以数据为中心的 AI 工作流程的从业者,我们的研究结果提供了三个可操作的措施: 1. 1. 在数据集卫生之前执行公平性审计:基于置信度的噪声过滤在半自动标签清理流水线中很常见,但应在以公平性为中心的审计之前进行,而不是之后。我们的发现表明,置信度本身可能是收入条件的,使得“清理”操作变成一个有偏的过滤器。 2. 2. 使用机会均等进行监控,而不仅仅是聚合校准:聚合校准曲线低估了高收入违约者中严重的召回赤字。金融机构应针对实际违约的借款人,按收入区间分解 TPR,以检测结构性误分类。 3. 3. 在移除特征时追踪代理路径:对敏感属性的简单屏蔽是不够的。审计应跟踪已删除属性与剩余特征之间的统计相关性,尤其是那些表现出高有符号 SHAP 值且与受保护类别不平相关的特征。贷款金额和房屋所有权在双重屏蔽模型中的 SHAP 贡献表明,下游行为变量可以系统性地重建被省略的敏感信号。 我们的分析证实,公平性审计必须考虑整个数据-模型流水线,而不仅仅是算法输入。上游机构定价决策和下游借款人人行为变量的结构性影响,使得简单的特征屏蔽成为公平性干预的不充分替代方案,并强调了在信贷决策中持续进行细粒度、子群体层面评估的必要性。

相似文章

改进的幻象:信用评分中的拒绝推断策略

arXiv cs.LG

本文系统评估了信用评分中的拒绝推断方法,并发现了一种结构性失效模式:在自然的再训练周期中,模型的准确率提升但召回率骤降,造成了改进的幻象,而实际拒绝质量却在恶化。本文提出了一种受控探索策略,无需统计假设即可打破反馈循环,并证明即使最低的探索率也足以诊断该问题。