针对代理标签信用风险预测中监督漂移的决策支持审计协议

arXiv cs.LG 论文

摘要

本文提出了一种设计科学审计协议,用于检测代理标签信用风险预测模型中的监督漂移,并在LendingClub数据上测试了多信号诊断方法。

arXiv:2609.16102v1 公告类型:新 摘要:信用风险模型基于代理标签训练,并在时间和细分变化下部署,但没有任何单一转移指标能够分离基础率偏移、概率尺度偏移和特征-标签关系变化。我们贡献了一个设计科学制品:一个锁定的多信号审计协议,用于代理标签信用风险预测中的监督漂移。五层(转移性能、预言机间隙探测、校准诊断、特征-标签稳定性和合成正对照)、阈值和决策规则在解释前已锁定;有界读数是设计的结果。在公开的LendingClub数据集(时间从2013年到2016年和跨细分转移)上,排名稳定且预言机间隙小;最明显的时间信号是普遍性和概率尺度不匹配,这通过截距诊断重新校准大大减少,尽管其原因无法从可用发布中识别。正对照仅对更大的注入偏移有响应;更细微的漂移不能被排除。将诊断模式映射到治理操作是概念性指导,此处未验证。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:41

# 代理标签信用风险预测中监督漂移的决策支持审计方案
来源:https://arxiv.org/html/2609.16102  
穆罕默德·尚巴普(邮箱:[email protected]) | 瓦尔德马·卡尔沃夫斯基(邮箱:[email protected]) | 妮鲁法尔·优素菲(邮箱:[email protected])  
隶属机构:美国佛罗里达州奥兰多市中佛罗里达大学工业工程与管理系  
隶属机构:美国马萨诸塞州波士顿市东北大学经济系

###### 摘要

信用风险模型基于代理标签训练,并在时间段和细分领域变化时部署,但目前尚无单一迁移指标能分离基础率漂移、概率尺度漂移与特征-标签关系变化。我们提出一种设计科学制品:针对代理标签信用风险预测的监督漂移,一种锁定、多信号的审计方案。五个层面(迁移性能、oracle差距探测、校准诊断、特征-标签稳定性及合成正向对照)、阈值和决策规则在解释前已锁定;其有限解读是预设的设计结果。在公开的LendingClub数据集上(2013至2016年时间迁移与跨细分领域迁移),排序稳定且oracle差距较小;最明显的时间信号是发生率与概率尺度的不匹配,这在仅截距诊断重校准中已大幅减少,尽管其具体原因尚无法从现有数据中确定。正向对照仅对注入的较大漂移产生响应;更细微的漂移不能被排除。将诊断模式映射至治理行动仅为概念性指引,本文未对此进行验证。

#### 关键词:

监督漂移,信用风险预测,代理标签,模型校准,设计科学。

## 1引言

用于信用风险预测的机器学习系统基于历史借贷记录训练,随后应用于后期或不同市场细分领域的申请人。监督这些系统的结果标签(例如已发放贷款是否违约)是实际信用风险的操作性代理,而非信用worthiness的直接衡量。两个特征增加了评估的复杂性:监督信号是代理标签,其可靠性可能随时间变化;部署环境是非平稳的,因为宏观经济条件、贷款政策和借款人行为均在演变。生产分析早已将外部世界的变化确定为主要且常被隐藏的风险来源(Sculley等人,2015),而关于数据集偏移和概念漂移的文献则记录了在某一分布上验证的模型在另一分布上可能表现不同的现象(Quiñonero-Candela等人,2009;Gama等人,2014;Koh等人,2021)。

我们沿用其正式定义,将“监督漂移”指代跨上下文\(P(y|x,c)\)的改变(Shoeibi等人,2026),以描述这种代理标签设置中与关系相关的变化:这种变化会影响迁移性能、通过目标上下文训练恢复性能的可能性、校准、边缘特征-标签关联性,或对注入漂移的敏感性。这比完整的分布偏移分类法(Moreno-Torres等人,2012)更窄;纯粹的特征分布变化仅在影响这些层面时才重要。

风险不仅涉及金融。信用评分决定了获取住房、教育和运营资本的机会,而一个概率尺度已漂移的模型,即使其排序看似完好,也可能对风险错误定价,从而导致难以仅从整体准确性中检测出的不同条款或拒绝。误判本身也有代价:在错误解读下继续运行的模型,会基于不再适用的尺度对申请人定价。

一个核心难点在于,单一的迁移指标无法描述监督漂移。区分度和校准是不同的维度,因此模型可能以几乎相同的顺序对申请人排序,同时从特征到实际违约概率的映射已发生变化。仅报告排序指标(如AUROC)可能低估真实的概率尺度变化,而仅报告适当评分规则(如Brier分数)则可能高估关系变化,因为它也吸收了基础率和尺度差异。区分这些解释需要综合解读多个互补信号。

本文做出设计科学贡献:一个锁定的、分层的、多信号的诊断方案,用于审计代理标签信用风险预测中的监督漂移。该方案结合五个互补层面:迁移性能、针对目标可学习变化的oracle差距探测、校准诊断、特征-标签稳定性以及合成正向对照。迁移设置、模型与指标计划、数值阈值以及A至G的决策规则,均在解释输出前锁定,这限制了事后叙事,使有限解读成为预设结果而非失败。第3.1节阐述了组织该制品的设计原则。

其预期场景是为模型风险治理提供决策支持:分析师和信用风险经理必须在条件变化时决定如何处理已部署的评分模型。该方案所应对的风险是,将稳定的排序指标视为安全部署的充分证据,而信用决策和定价所依赖的概率尺度可能已经偏移。

我们在一个大型公开LendingClub数据集上评估该方案,涵盖时间迁移设置(在2013年批次训练,在2016年批次评估)和跨细分领域设置(在2013年债务合并细分领域训练,在2013年信用卡细分领域评估)。经验范围特意限定为一个数据集,以保持分析深度,但限制了外部推广性。诊断结果表明排序迁移稳定且oracle差距较小,最清晰的信号是时间发生率与概率尺度的不匹配,诊断重校准可大幅减少此现象。我们将其作为有限证据报告,而非证明条件关系未变,也未将不匹配归因于特定机制。

## 2相关工作

本研究借鉴了几条研究脉络:数据集偏移和概念漂移的表征、信用评分中的预测建模与偏移处理、概率校准以及弱监督或代理监督。我们依次回顾每条脉络,并定位我们的贡献——这是一个审计方案,而非新模型或适应方法。

### 2.1数据集偏移与概念漂移

模型在某一分布上训练,在另一分布上失败的条件已有深入研究。Quiñonero-Candela等人(2009)对数据集偏移做了奠基性处理,Moreno-Torres等人(2012)提出了区分协变量、先验概率和概念漂移的统一分类法,Gama等人(2004)则对概念漂移与适应进行了综述,主要针对流数据场景。这些建立了本研究依赖的术语体系。我们并未提出新的检测器或适应算法,而是固定一个代理标签的信用风险任务,并利用互补层面来分离排序迁移、概率尺度不匹配、边缘特征-标签变化与目标可学习的多变量变化。Koh等人(2021)引入WILDS并表明标准训练导致显著降低的分布外性能;我们则是在表格信用风险数据上刻画任何观测到差距的特征,而非构建更稳健的预测器。

### 2.2信用评分与信用评分中的偏移

在信用评分领域,模型比较历史悠久:Lessmann等人(2015)在八个信用评分数据集上基准测试了四十一种分类器,Schmitt(2022)发现梯度提升在结构化信用数据上通常优于深度学习。这些研究将分类器视为关注对象;而我们则使用逻辑回归、直方图梯度提升和随机森林作为诊断工具,并非为了识别最佳模型。

少量工作直接关注信用评分中的分布偏移。Qian等人(2022)在LendingClub数据上使用对抗验证来匹配训练和目标分布,并指出混合时间段时存在信息泄露风险;Rahman和Tabassum(2026)研究了在类似LendingClub设置中时间偏移下的部署可靠性。我们的重点是互补的:我们不规定重新训练或重校准政策,而是审计在固定代理标签构建下,证据支持何种类型的偏移。拒绝推断是一个相关问题;Kozodoi等人(2020)提出了一个自学习框架以减少样本选择偏差,而我们则保持代理标签构建固定,而非推断缺失标签。

### 2.3校准与标签偏移

概率可靠性是与排序质量不同的评估维度。Platt(2000)引入了从分类器分数到校准概率的参数映射,Niculescu-Mizil和Caruana(2005)表明学习算法会产生系统性的概率扭曲,可事后校正;Guo等人(2017)证明了即使精确的现代分类器也可能校准不佳,并引入了温度缩放。与之密切相关的是关于标签或先验概率偏移的文献:Lipton等人(2018)提出了黑盒偏移估计来检测和校正标签边际的变化,同时假设类别条件分布不变。在我们的方案中,校准是一个诊断层面,用于识别迁移下的概率尺度和发生率不匹配,采用有意的oracle形式,因为它使用观测到的目标违约率进行分析,而非生产环境数据。标签偏移校正假设偏移属于该类型并加以校正,而我们的方案将发生率偏移视为多个候选机制之一,并检验观测到的时间校准不一致是否与之相符。

### 2.4弱监督与代理监督

监督信号的可靠性是核心,因为我们的结果标签是信用风险的代理,而非观测到的真实标签。Ratner等人(2016)引入数据编程,通过启发式标注函数构建训练集,在Snorkel系统中实现(Ratner等人,2017)。该方向关注标签构建;而我们的研究位于其下游,探讨在时间和细分领域偏移下,固定的代理监督是否仍可靠。近期工作将监督漂移形式化为跨上下文\(P(y|x,c)\)的变化,并在弱监督基因组学设置中研究(Shoeibi等人,2026)。我们采用此概念框架,但评估的是不同的制品:针对代理标签信用风险预测的锁定诊断审计方案。

### 2.5决策支持、模型风险治理与设计科学

该审计被定位为决策支持制品,连接了两个信息系统文献。第一是模型风险治理,以及对已部署评分模型的监控、验证和重校准,其中问题不仅是准确性,还包括模型行为变化应触发何种行动。第二是设计科学研究,它将有意为之的、经过评估的制品视为贡献单位,并提供了我们采用的严谨性-相关性框架、方法论和贡献定位(Hevner等人,2004;Peffers等人,2007;Gregor和Hevner,2013)。这种定位使得有限结果可被理解为制品行为正确,而非薄弱的经验发现。

### 2.6定位

综上所述,先前工作推动了在偏移下评估信用风险模型,但在标签基于代理且目标构建固定的情况下如何解释证据,尚待解决。我们通过一个预设的多信号审计方案来填补这一空白,该方案旨在分离稳定的排序迁移、概率尺度不匹配与更强的与关系相关漂移的证据。

## 3方法

### 3.1制品作为设计科学贡献

本研究遵循设计科学范式,其主要贡献是有意为之的制品及其行为展示,评估其严谨性和相关性(Hevner等人,2004;Peffers等人,2007)。遵循Gregor和Hevner(2013),我们将贡献定位为改进:一种解决已认可问题的新方法,即解释代理标签信用风险模型在部署时的变动,对此,单一指标实践是不足的。该制品是锁定的、多信号的审计方案;LendingClub研究是一个实例,展示其在真实代理标签任务上的行为,而非关于信用市场的普遍性结论。

该制品受四个设计原则指导。*多信号证伪*:由于单一迁移指标无法分离基础率偏移、概率尺度偏移和关系变化,该方案要求收敛证据,并仅在各层面一致时才认为结论得到支持。*预承诺*:所有设置、指标、阈值和规则在解释任何输出前均锁定,因此有限解读是预设的设计结果。*机制分离*:可通过重校准解决的基础率或概率尺度偏移,与需要重新训练的关系变化,被区分开来。*显式敏感性边界*:合成正向对照表征了该方案本可检测到的注入漂移幅度,因此在报告缺乏大漂移证据时,会说明检测下限,而非断言没有漂移。

评估通过演示和分析进行:该方案被应用于一个真实的代理标签任务,跨越时间和跨细分领域迁移,正向对照提供了内部敏感性分析。评估目标是诊断方案本身,即各层面是否刻画了它们设计用以分离的偏移特征。它不是测试相关治理行动是否为正确的组织选择,那将取决于重要性和成本,而该方案未对此建模;这种映射是概念性指引(第5.3节),而非经过验证的决策规则。

### 3.2经验设置与预测目标

我们在一个公开的代理标签表格信用风险设置中研究监督漂移,使用一个公开

相似文章