改进的幻象:信用评分中的拒绝推断策略
摘要
本文系统评估了信用评分中的拒绝推断方法,并发现了一种结构性失效模式:在自然的再训练周期中,模型的准确率提升但召回率骤降,造成了改进的幻象,而实际拒绝质量却在恶化。本文提出了一种受控探索策略,无需统计假设即可打破反馈循环,并证明即使最低的探索率也足以诊断该问题。
查看缓存全文
缓存时间: 2026/06/18 05:43
# 信用评分中的拒绝推断策略
来源:https://arxiv.org/html/2606.18479
11institutetext:美国波士顿东北大学11email:scarone\.b@northeastern\.edu22institutetext:瑞典斯德哥尔摩KTH皇家理工学院22email:rbaeza@acm\.org
## 改进的幻觉:信用评分中的拒绝推断策略
###### 摘要
拒绝推断方法被广泛用于缓解信用评分中的生存偏差,但其有效性仍不明确。我们系统评估了若干此类方法,并揭示了一种结构性失效模式:在自然重训练周期中,模型准确率提升而召回率崩溃,这会产生一种改进的幻觉,使从业者误以为系统正在变好,而实际上其拒绝质量——正确筛选出违约者的能力——正在恶化。随后,我们提出了一种受控探索策略,无需统计假设即可打破反馈循环:贷款机构故意批准一部分被拒绝的申请者,并观察其真实结果。我们证明,准确率和拒绝质量在是否探索上给出了相反的建议:准确率倾向于不探索,而拒绝质量随探索而改善,这证实了标准评估指标在存在选择偏差时具有误导性。在我们的实验中,即使极低的探索率(2–5%)也足以近乎零成本诊断反馈循环的严重程度。我们的发现在一系列机器学习方法和三个真实世界数据集上保持一致,表明标准评估协议不足以评估在生存偏差下训练的模型。
## 1 引言
如今,许多影响人们生活的重要决策都是在预测性机器学习(ML)模型的支持下做出的,几乎或完全没有人工干预。典型的应用场景包括贷款、招聘、奖学金、政府补贴,甚至刑事司法等。在这种背景下,这些工具可能对某些个体产生歧视或偏袒,造成显著但理解不足的社会影响。因此,根据欧盟关于人工智能使用的新法规[26 (https://arxiv.org/html/2606.18479#bib.bib26)],这些工具中的大多数被归类为高风险。
此外,这些预测工具基于若干假设,这些假设削弱了其科学有效性。首先,人们相信现有数据能合理代表待解决的问题(数据主义[5 (https://arxiv.org/html/2606.18479#bib.bib5)]),这一假设在许多情况下是有争议的,并且因实例而异。这造成了所谓的现实差距[13 (https://arxiv.org/html/2606.18479#bib.bib13)]。其次,在某些用例中,假设新个体的行为可以根据“相似”人群的数据进行预测。这平均情况下可能成立,但肯定不适用于所有个体,特别是考虑到相似性度量是现实的另一个代理。第三,我们通常通过汇总指标(例如准确率)来评估系统成功与否。这意味着所有错误带来的影响相同,这在大多数情况下是错误的。
鉴于这些问题,考虑以下假设场景。假设一家银行基于历史数据构建了一个ML模型,用于预测新客户是否会偿还贷款。也就是说,我们假设可以使用其他人的数据来预测新客户的行为。这一假设是一个简化假设,平均情况下可能成立,但肯定不适用于所有个体。如果预测是正面的,申请者获得贷款;否则,申请被拒绝。一段时间后,随着银行积累更多数据,模型可以重新训练,期望得到改进。然而,新数据相对于模型的错误存在生存或存活偏差。具体来说,我们观察到所有假阳性的结果(受到偏袒的个体,代表生存偏差),但对假阴性(被拒绝或受害的个体)一无所知。这个过程除了忽略上述偏差问题外,还能让我们估计现实差距的大小。
在本研究中,我们使用真实数据模拟这一银行贷款场景,并测量由于生存偏差(假阴性)随时间推移而丢失的信息、其对模型性能的影响,以及缓解生存偏差技术(即拒绝推断方法)的有效性。为此,我们将模型随时间推移与一个能够访问所有可用数据从而减少错误的Oracle(基准)进行比较。我们还提出了一种受控探索技术,使银行能够以几乎零成本估计生存偏差的影响。
我们工作的贡献总结如下:(1) 我们揭示了迭代贷款中的一种结构性失效模式:模型准确率提升而召回率崩溃会产生一种改进的幻觉,并且我们表明这并非偶然:标准指标系统地奖励那些放大生存偏差的策略,正如简单外推始终优于Oracle所展示的那样。(2) 我们提出受控探索作为拒绝推断的一种无假设替代方案,其中贷款机构故意批准一部分被拒绝者并观察真实结果。(3) 我们表明,即使极低的探索率(2–5%)也能以近乎零成本诊断反馈循环的严重性,并且准确率和拒绝质量给出相反的建议,这证实了标准评估在存在生存偏差时具有误导性。
本文其余部分组织如下。我们在第2节 (https://arxiv.org/html/2606.18479#S2)中回顾相关工作,并在第3节 (https://arxiv.org/html/2606.18479#S3)中解释我们的方法论和使用的数据集。然后我们在第4节 (https://arxiv.org/html/2606.18479#S4)中展示拒绝推断结果,在第5节 (https://arxiv.org/html/2606.18479#S5)中展示探索策略,最后在第6节 (https://arxiv.org/html/2606.18479#S6)中得出结论。
## 2 相关工作
**贷款违约预测。** 信用评分和违约风险估计是金融贷款的核心[11 (https://arxiv.org/html/2606.18479#bib.bib11)],基于ML的方法越来越受欢迎[25 (https://arxiv.org/html/2606.18479#bib.bib25)]。现有数据的性质和质量受到质疑[14 (https://arxiv.org/html/2606.18479#bib.bib14)],数据集通常不平衡,有证据表明模型在平衡版本上表现更好[18 (https://arxiv.org/html/2606.18479#bib.bib18), 1 (https://arxiv.org/html/2606.18479#bib.bib1)]。基于树的模型因其可解释性而被广泛选择[18 (https://arxiv.org/html/2606.18479#bib.bib18), 1 (https://arxiv.org/html/2606.18479#bib.bib1), 25 (https://arxiv.org/html/2606.18479#bib.bib25)],尽管哪种方法最有效尚无共识[18 (https://arxiv.org/html/2606.18479#bib.bib18)]。我们在三个数据集上评估了一系列模型,并选择了表现最好的两个(均为基于树的模型)。两个数据集通过欠采样实现平衡。
**贷款违约预测中的生存偏差。** 大量文献强调了可能影响ML管道的多种偏差类型[19 (https://arxiv.org/html/2606.18479#bib.bib19), 12 (https://arxiv.org/html/2606.18479#bib.bib12)]。我们考虑生存偏差,这是一种选择偏差的形式,其中重点关注通过(“幸存”于)给定选择标准的人群子集。生存偏差在共同基金数据中有充分记录[28 (https://arxiv.org/html/2606.18479#bib.bib28), 7 (https://arxiv.org/html/2606.18479#bib.bib7), 23 (https://arxiv.org/html/2606.18479#bib.bib23)],并且在自我报告的财务数据集中也得到评估[27 (https://arxiv.org/html/2606.18479#bib.bib27)],但在这些情况下,它源于数据收集而非模型驱动的选择。更广泛地说,我们研究的反馈循环是执行预测[22 (https://arxiv.org/html/2606.18479#bib.bib22)]的一个实证实例,其中模型部署改变了数据分布;类似的失控(自我强化)效应已在预测性警务中记录[8 (https://arxiv.org/html/2606.18479#bib.bib8)]。当信用评分模型用于接受或拒绝申请者时,只有被接受的申请者的结果被观察到。被拒绝的申请者从未获得信贷,因此他们是否会违约仍然是一个无法验证的反事实。*拒绝推断*(RI)指的是试图恢复这些缺失信息的技术家族,从而减少后续模型重训练所用训练数据中的生存偏差[9 (https://arxiv.org/html/2606.18479#bib.bib9), 4 (https://arxiv.org/html/2606.18479#bib.bib4), 6 (https://arxiv.org/html/2606.18479#bib.bib6)]。RI文献包括通过概率分配、直接模型外推、最近邻迁移或分箱平均插补来为被拒绝申请者插补标签的方法[3 (https://arxiv.org/html/2606.18479#bib.bib3), 4 (https://arxiv.org/html/2606.18479#bib.bib4), 6 (https://arxiv.org/html/2606.18479#bib.bib6)],以及迭代细化插补标签的自学习方法[15 (https://arxiv.org/html/2606.18479#bib.bib15)]、深度生成模型[17 (https://arxiv.org/html/2606.18479#bib.bib17)]和蒙特卡洛模拟框架[2 (https://arxiv.org/html/2606.18479#bib.bib2)];Ehrhardt等人[6 (https://arxiv.org/html/2606.18479#bib.bib6)]提供了全面的综述。
## 3 方法论
我们考虑一家银行使用二分类器来预测贷款违约并决定批准哪些申请者。该银行在*动态*环境中运行:在每个贷款周期 \(t\),一批新的申请者到来,当前模型 \(M_t\) 产生预测,银行仅观察到已批准贷款的结果。我们采用通常的标签惯例:\(y=1\) 表示违约,\(y=0\) 表示未违约。我们的目标是评估这种选择性观察过程如何影响连续重训练周期中的模型质量。[^1] 因此,我们比较了五种RI策略,并与两个基线进行比对:*有偏基准*(仅使用被接受的申请者进行训练)和*Oracle基准*(可以访问所有申请者的真实标签)(两者在第4.1节 (https://arxiv.org/html/2606.18479#S4.SS1)中正式定义)。RI指的是通过插补被拒绝申请者的缺失标签来缓解生存偏差的技术[9 (https://arxiv.org/html/2606.18479#bib.bib9), 4 (https://arxiv.org/html/2606.18479#bib.bib4), 6 (https://arxiv.org/html/2606.18479#bib.bib6)],并将他们连同保留真实标签的被接受申请者一起纳入训练集。
**拒绝推断策略。**
* 分箱法[4 (https://arxiv.org/html/2606.18479#bib.bib4), 24 (https://arxiv.org/html/2606.18479#bib.bib24)]:将申请者按预测风险评分分为 \(K=10\) 个等频率箱,并在每个箱内以该箱中被接受者中的观察坏账率向被拒绝者分配违约标签。
* 模糊增强[3 (https://arxiv.org/html/2606.18479#bib.bib3), 6 (https://arxiv.org/html/2606.18479#bib.bib6)]:为每个被拒绝者分配一个从 \(\tilde{y}_i \sim \text{Bernoulli}(\hat{p}_i)\) 中采样的标签,其中 \(\hat{p}_i\) 是模型预测的违约概率;我们使用这种概率变体,其在期望上等同于原始加权形式,以便与基于树的分类器兼容。
* 简单外推[4 (https://arxiv.org/html/2606.18479#bib.bib4), 6 (https://arxiv.org/html/2606.18479#bib.bib6)]:将当前模型应用于被拒绝申请者,并将其硬预测视为真实标签。
* 孪生法[4 (https://arxiv.org/html/2606.18479#bib.bib4), 6 (https://arxiv.org/html/2606.18479#bib.bib6)]:通过 \(k\) 近邻匹配(\(k=5\))在标准化特征空间中将标签从被接受者转移到被拒绝者。
* 浅层自学习[15 (https://arxiv.org/html/2606.18479#bib.bib15)]:首先通过孤立森林过滤被拒绝者以移除分布异常值,然后使用带有不平衡校正类别权重的弱学习器迭代地仅标记高置信度的被拒绝者。
**数据。** 我们使用三个公开的信用评分数据集[11 (https://arxiv.org/html/2606.18479#bib.bib11), 18 (https://arxiv.org/html/2606.18479#bib.bib18)]:Default[29 (https://arxiv.org/html/2606.18479#bib.bib29)](30,000人,23个特征,77.9%未违约),PPDai[10 (https://arxiv.org/html/2606.18479#bib.bib10)](31,389人,29个特征,77.0%),和LendingClub[20 (https://arxiv.org/html/2606.18479#bib.bib20)](302,595人,97个特征,77.0%)。二值标签指示借款人是否违约。PPDai和LendingClub均通过向下采样以达到上述不平衡比率。对于LendingClub,我们筛选了2017年发放的贷款,移除了事后数据泄露列(例如支付结果、回收字段),并移除了高缺失率列。完整的预处理细节见附录0.A (https://arxiv.org/html/2606.18479#Pt0.A1)。
**模型。** 我们在所有三个数据集上评估了五个二分类器(附录0.B (https://arxiv.org/html/2606.18479#Pt0.A2)),选择了两个始终排名靠前的基于树的模型:梯度提升决策树(GBDT)和随机森林(RF)。这些模型本质上是非线性的,并在 scikit-learn[21 (https://arxiv.org/html/2606.18479#bib.bib21)] 中使用默认决策阈值 \(\tau=0.5\) 实现。两者都是基于树的集成方法;我们在第6节 (https://arxiv.org/html/2606.18479#S6)中讨论模型选择对我们发现的潜在影响。
**时间贷款模拟。** 我们按如下方式模拟基于模型的迭代贷款。从完整数据集 \(\mathcal{D}\) 中均匀抽取大小为 \(n_0\) 的初始训练集 \(\mathcal{D}_0\),模拟银行的初始数据收集步骤。\(n_0\) 的值通过每个数据集-模型对的学习曲线分析确定:我们以递增样本量训练模型,并选择准确率趋于稳定的点(附录0.C (https://arxiv.org/html/2606.18479#Pt0.A3))。这得出 Default 和 PPDai 的 \(n_0 = 5,000\),LendingClub 的 \(n_0 = 60,000\)。在每个后续贷款周期 \(t \in \{1, \dots, T\}\),我们从剩余数据中均匀随机抽取大小为 \(n' = \lfloor (n - n_0) / T \rfloor\) 的样本,将其视为新申请者池。当前模型 \(M_t\) 产生预测:\(\hat{y}=0\) 的申请者被接受,\(\hat{y}=1\) 的申请者被拒绝。每个拒绝推断策略(第3节 (https://arxiv.org/html/2606.18479#S3))定义了将拒绝者纳入或排除出用于 \(M_{t+1}\) 的训练集的不同规则。
**评估指标。** 标准指标在每个周期于累积训练集 \(\mathcal{D}_t\) 的保留拆分上进行计算,其中 \(M_t\) 对两个类别都进行预测。除了标准分类指标(准确率、精确率、召回率),我们还跟踪两个旨在捕捉迭代模型贷款动态的指标。*训练集违约率*(TDR)衡量每次迭代中训练集中违约者的比例:\(\text{TDR}_t = |\{i \in \mathcal{D}_t : y_i = 1\}| / |\mathcal{D}_t|\)。在没有生存偏差的情况下,该比率应保持在总体违约率附近。偏差表明训练分布正偏离真实的申请者分布。
[^1]: 源代码可在 https://github.com/bscarone/survival-bias-credit-scoring 获取。相似文章
超越聚合校准:分解自动化信用违约预测中的收入条件召回率差异
本文审计了自动化信用违约预测中基于置信度的标签过滤,揭示了收入条件相关的召回率差异,并表明当代理变量和制度性偏见持续存在时,仅对模型遮蔽敏感属性并不能消除公平差距。
数据驱动系统何时展现推理能力?
本文开发了一个框架,用于评估欧洲AI法案下数据驱动系统的推理能力,以信用评分为案例,说明推理发生的位置以及哪些方面需要更清晰的监管规定。
@rohanpaul_ai: 自我改进的AI的真实性仅取决于其测试信号的有效性。梳理1250篇论文揭示了……
对1250篇关于AI递归自我改进的论文的分析表明,评估者信号是关键瓶颈。模型只有在强大且可信的信号(如证明检查器)下才能可靠改进,而弱信号则会导致循环崩溃或强化错误。
通过反事实推理路径减少信用分配方差
提出隐式行为策略优化(IBPO),一种基于反事实比较的信用分配框架,通过将稀疏的终端奖励转化为对步骤敏感的学习信号,提升了大型语言模型在多步推理任务中的训练稳定性和性能。
Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning
This paper proves that using error-penalized scoring rules with abstention as a discrete action can kill both the reward gradient and the KL anchor, causing models to collapse toward refusing everything. It proposes a structural repair — training a mandatory confidence report — and validates the mechanism with simulations and language model experiments.