电信行业客户流失预测的可解释人工智能:CRM集成框架

arXiv cs.AI 论文

摘要

本文介绍了一个将可解释AI集成到CRM系统中用于电信客户流失预测的框架,通过基准测试分类器并利用SHAP和LIME进行可解释预测,以增强客户保留策略。

arXiv:2608.26151v1 公告类型:新 摘要:用户流失是电信提供商面临的一个代价高昂且持续存在的挑战,成熟市场每月流失率约为1.9%,每年侵蚀数十亿美元的收入。预测模型能够准确标记高风险客户,但由于高性能集成和非线性架构的不透明性,这些模型通常被排除在一线CRM工作流之外:保留专家无法仅从概率分数设计个性化干预措施,而不了解订阅者为何面临风险。本文解决了这一差距。我们在IBM Telco Customer Churn基准数据集(7,043条记录;19个特征;26.5%流失率,仅在训练分区上通过SMOTE平衡至50%)上对四种分类器——Logistic Regression、Random Forest、XGBoost和LightGBM——进行了基准测试。Logistic Regression获得了最强的AUC-ROC(0.8411),LightGBM获得了最高的准确率(78.42%);所有四种分类器的AUC均在0.011的范围内(0.831至0.841),且5折交叉验证确认领先模型实际上不分上下。解释在两种粒度上提供:全局SHAP排名确定任期、总费用和月度合同为主导流失信号,以及实例级SHAP和LIME分解揭示每个预测背后的驱动因素。基于这些输出,我们引入了一种四层CRM集成架构,将风险评分和归因向量转换为分层细分,将顶级特征映射到结构化保留行动模板,并将活动结果路由到再训练反馈循环中。针对最高风险五分之一的群体预计将使整体流失率降低3.3至5.3个百分点,每个活动周期估计节省199,000至319,000美元。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:29

# 一、引言
来源:https://arxiv.org/html/2608.26151
可解释人工智能在电信客户流失预测中的应用:面向客户关系管理集成的框架

桑迪普·加达姆瓦尔 (Sandeep Gaddamwar)
gaddamwarsandeep@ieee\.org

> 摘要——用户流失是电信提供商面临的一项代价高昂且持续存在的挑战,成熟市场每月约1\.9%的流失率每年侵蚀数十亿美元的收入。预测模型可以准确标记高风险客户,但通常被排除在一线客户关系管理工作流之外,因为高性能的集成和非线性模型架构具有不透明性:仅凭一个概率分数,留存专家无法设计个性化干预措施,而不了解用户*为何*处于风险之中。本文旨在解决这一差距。我们在IBM电信客户流失基准数据集(7,043条记录;19个特征;26\.5%的流失率,仅在训练分区上通过SMOTE平衡至50%)上基准测试了四种分类器——逻辑回归、随机森林、XGBoost和LightGBM。逻辑回归获得了最强的AUC-ROC(0\.8411),而LightGBM获得了最高的准确率(78\.42%);所有四种模型的AUC值均在0\.011的区间内(0\.831–0\.841),并且5折交叉验证确认领先模型之间没有显著差异。解释以两种粒度提供:全局SHAP排名,将客户生命周期、总费用和按月合同识别为主要流失信号;以及实例级SHAP和LIME分解,揭示每次预测背后的驱动因素。基于这些输出,我们提出了一种四层客户关系管理集成架构,该架构将风险分数和归因向量转化为分层细分,将主要特征映射到结构化的留存行动模板,并将营销活动结果路由到再训练反馈循环中。针对最高风险的五分之一客户群体,预计可将整体流失率降低3\.3–5\.3个百分点,在每次活动周期内保留估计19.9万至31.9万美元的收入。索引关键词——可解释人工智能、客户流失预测、SHAP、LIME、梯度提升、电信分析、客户关系管理集成、不均衡学习、留存管理。

留存用户,在几乎所有的财务指标上,都优于获取新用户。常被引用的获客与留存成本比率在四到七倍之间,具体取决于市场成熟度和竞争激烈程度[1 (https://arxiv.org/html/2608.26151#bib.bib1)]。在此背景下,主动流失——用户决定终止服务并转向竞争对手——代表了一种直接的、可衡量的收入损失,其经济结构清晰易懂。一个每月流失1,000名用户、平均月收入为65美元的运营商,仅从该群体每年就损失了78万美元,这还未考虑对口碑和网络利用率的后续影响。在行业规模上,美国无线运营商的月度总流失率估计约为1\.9%[2 (https://arxiv.org/html/2608.26151#bib.bib2)],该行业年度化收入侵蚀达到数十亿美元。

机器学习提供了一种部分解决方案。通过在账单记录、服务使用日志和人口统计数据上训练,现代分类器可以在用户行动前数周识别潜在流失者,为运营商提供了一个狭窄但可行的干预窗口。集成方法——随机森林、XGBoost、LightGBM——已成为这项任务的主力工具,在标准基准测试中提供了强大的AUC-ROC值[4 (https://arxiv.org/html/2608.26151#bib.bib4), 5 (https://arxiv.org/html/2608.26151#bib.bib5)]。问题在于,这些模型在功能上同样是不透明的。留存分析师看到高流失概率分数时,在不知道哪些具体特征驱动该分数的情况下,无法在合同升级优惠、账单抵免和外呼电话——三种最常见的留存工具——之间做出有原则的选择。更糟的是,如果模型对某个特定客户判断错误,分析师没有机制来捕捉该错误。监管压力加剧了这一问题:GDPR第22条和欧盟AI法案的透明度义务日益要求对个人产生影响的自动化决策必须附带有意义的解释[6 (https://arxiv.org/html/2608.26151#bib.bib6), 7 (https://arxiv.org/html/2608.26151#bib.bib7)]。

自Ribeiro等人引入LIME[9 (https://arxiv.org/html/2608.26151#bib.bib9)]以及Lundberg和Lee将SHAP形式化[8 (https://arxiv.org/html/2608.26151#bib.bib8)]以来,可解释人工智能文献已相当成熟。这两种方法已在从信用评分到医学影像的多个领域得到验证,它们在电信流失预测中的应用在文献中也有充分代表[23 (https://arxiv.org/html/2608.26151#bib.bib23)]。然而,显著缺失的是对这些解释应如何作为结构化的运营输入流入客户关系管理工作流的系统性处理——而不仅仅是供数据科学家检查的事后分析成果。从SHAP瀑布图到具体的个性化留存行动之间的跳跃很少被明确说明,而从活动结果反馈到模型也几乎没有得到关注[10 (https://arxiv.org/html/2608.26151#bib.bib10), 26 (https://arxiv.org/html/2068.26151#bib.bib26)]。

本文的贡献有四个方面:

1. 1\.在公开的IBM电信客户流失基准数据集(7,043条记录,19个特征)上对四种机器学习分类器进行头对头比较,报告了每种分类器的准确率、精确率、召回率、F1分数和AUC-ROC。
2. 2\.结合全局平均|\text{SHAP}|重要性、实例级SHAP瀑布解释、LIME局部代理模型以及三个最具影响力预测因子的SHAP依赖图,进行了完整的可解释人工智能分析。
3. 3\.一种客户关系管理集成架构,将解释输出付诸实践——将SHAP归因向量转化为细分逻辑,并将主要特征驱动因素映射到结构化的留存行动模板。
4. 4\.量化的业务影响估算,表明在此框架下针对最高20%的风险用户,预计可在每次活动周期内保留19.9万至31.9万美元的收入,将整体流失率降低3\.3–5\.3个百分点。

第二部分综述了相关文献。第三部分描述了数据集、预处理、模型配置和可解释人工智能方法。第四部分报告了实验结果。第五部分详细阐述了客户关系管理集成设计。第六部分讨论了意义、局限性和伦理考量。第七部分是结论。

## 二、相关工作

### A. 使用机器学习预测流失

流失预测作为监督分类问题已研究了二十多年。早期工作确立了逻辑回归作为可行的基准,其系数提供了可解释的价值,尽管它处理非线性交互的能力较差[11 (https://arxiv.org/html/2608.26151#bib.bib11)]。集成方法的引入极大地改变了局面:Breiman的随机森林[12 (https://arxiv.org/html/2068.26151#bib.bib12)]和Friedman的梯度提升框架[13 (https://arxiv.org/html/2068.26151#bib.bib13)]使模型能够捕捉复杂的交互效应,两者都很快应用于订阅流失预测。Chen和Guestrin的XGBoost[14 (https://arxiv.org/html/2068.26151#bib.bib14)]以及Ke等人的LightGBM[15 (https://arxiv.org/html/2068.26151#bib.bib15)]将梯度提升精炼为生产就绪的工具,成为当今大多数竞争性流失建模流程的支柱。深度学习也已被探索——用于顺序使用数据的循环网络[16 (https://arxiv.org/html/2068.26151#bib.bib16)]、表格数据转换器[17 (https://arxiv.org/html/2068.26151#bib.bib17)]——尽管证据表明它们在中等规模数据集(远小于10万条记录)上优于调优后的树集成模型的证据至多是参差不齐的[18 (https://arxiv.org/html/2068.26151#bib.bib18)]。类别不平衡是流失数据集几乎普遍存在的特征(少数类通常占观测值的15–30%),已通过SMOTE过采样[19 (https://arxiv.org/html/2068.26151#bib.bib19)]和代价敏感训练[20 (https://arxiv.org/html/2068.26151#bib.bib20)]来解决,两者均显著提高了少数类的召回率。

### B. 商业环境中的可解释性方法

SHAP[8 (https://arxiv.org/html/2068.26151#bib.bib8)]和LIME[9 (https://arxiv.org/html/2068.26151#bib.bib9)]已成为两大主流的事后解释框架。SHAP基于合作博弈论中的Shapley值,具有原则性的可加性属性:特征归因之和等于模型预测与其期望输出之差。TreeSHAP[8 (https://arxiv.org/html/2068.26151#bib.bib8)]将此扩展到树集成模型,其复杂度是多项式而非指数级的。LIME则牺牲全局一致性以换取局部保真度,在每个目标实例的邻域内拟合一个加权线性代理模型。两者都已应用于信用风险[21 (https://arxiv.org/html/2068.26151#bib.bib21)]、临床决策支持[22 (https://arxiv.org/html/2068.26151#bib.bib22)]和电信分析[23 (https://arxiv.org/html/2068.26151#bib.bib23)]。Molnar的综述[10 (https://arxiv.org/html/2068.26151#bib.bib10)]将这些方法置于更广泛的可解释性景观中,并指出人类可理解性——而不仅仅是数学保真度——是可解释人工智能评估中一个未被充分重视的标准。

### C. 集成客户关系管理的留存分析

关于留存管理的运营文献汇聚于一个*预测-细分-行动*范式:根据流失倾向对客户评分,将其分配到风险等级,并路由到预定义的处理程序[25 (https://arxiv.org/html/2068.26151#bib.bib25)]。Neslin等人具有里程碑意义的比较研究[26 (https://arxiv.org/html/2068.26151#bib.bib26)]发现,干预的有效性不仅取决于模型准确性,还取决于正确识别可劝说的细分市场——那些如果不联系就会流失但通过定向优惠可以留存的客户。Verbeke等人[27 (https://arxiv.org/html/2068.26151#bib.bib27)]通过基于利润的模型评估形式化了这一见解,证明最大化AUC与最大化业务价值并非同一回事。尽管有这一系列工作,将可解释人工智能输出转化为明确的客户关系管理行动逻辑——以及随后的反馈闭环——在已发布的框架中基本缺失。

### D. 本文旨在填补的空白

文献将解释视为分析交付成果而非运营输入。将SHAP或LIME应用于流失预测的论文通常呈现特征重要性图表并得出结论;它们没有具体说明留存专家应如何将三特征归因向量转化为具体优惠,也没有说明活动响应数据应如何流回以改进模型。本文直接填补了这一空白,设计了一种集成架构,其中解释输出是客户关系管理决策管道的一等输入。

## 三、方法论

### A. 数据集

实验在公开的IBM电信客户流失基准数据集[29 (https://arxiv.org/html/2068.26151#bib.bib29)]上进行——这是一个在流失预测文献中广泛使用的、包含7,043条记录的参考数据集。相关流程直接加载基准CSV文件;对于完全离线复现,它也可以回退到根据基准文档化的条件流失结构校准的生成器,但此处报告的所有结果都是在真实数据集上计算的。从基准的21列模式中移除客户标识符和流失标签后,剩下19个预测特征,分为四组。*人口统计学*(性别、老年公民标识、配偶、家属)捕捉家庭结构,作为转换成本的代理。*订阅服务*(电话服务、多线路、互联网服务类型、在线安全、在线备份、设备保护、技术支持、流媒体电视和电影)描述服务组合,其广度影响月度支出和感知转换成本。*账户详情*(合同期限、无纸化账单、支付方式)反映参与深度;特别是按月合同,表明锁定程度低。*计费*(月度费用从18\.25美元到118\.75美元不等,总费用,以及从0到72个月不等的客户生命周期)提供财务和时间背景。二元结果变量表示每位客户是否流失;原始比率为26\.5%,仅在训练分区上通过SMOTE平衡至50%。

### B. 预处理

性别和二元是/否特征(配偶、家属、电话服务、无纸化账单)被标签编码为\{0,1\}。剩余的分类特征——多线路、互联网服务、在线安全、在线备份、设备保护、技术支持、流媒体电视、流媒体电影、合同和支付方式——进行独热编码,将特征空间扩展到40维。连续特征通过最小-最大缩放至[0,1]。采用分层80/20的训练-测试划分,以保持分区间的类别比例。SMOTE仅应用于训练数据:在特征空间中,在每个真实流失者与其五个最近邻之一之间插值生成合成少数类实例,产生一个平衡的训练集,包含8,278条记录,且不影响测试集的评估。测试集包含1,409条记录。

### C. 模型

训练并比较四种分类器。*逻辑回归*(使用\ell\_{2}正则化)作为可解释的线性基准,非线性方法与其进行比较。*随机森林*通过自助采样聚合了400棵CART树(最大深度12,最小叶节点8,每次分裂使用\sqrt{p}个特征)。*XGBoost*和*LightGBM*是梯度提升树集成,针对对数损失目标函数的伪残差拟合连续树;该流程直接使用官方XGBoost和LightGBM库,仅在这些库不可用时回退到scikit-learn的梯度提升等效项。所有模型均使用0\.5的决策阈值进行类别分配,没有进行事后阈值调整,以保持可比性。

### D. 解释方法

全局重要性(平均|\text{SHAP}|)。我们使用shap库的LinearExplainer(当主要模型是基于树的模型时,会自动选择TreeExplainer)为逻辑回归主模型的每个测试实例计算Shapley值,并根据平均绝对归因1n∑i|φij|对特征进行排序。这是规范的SHAP全局重要性度量:具有较大平均|\text{SHAP}|的特征对模型输出在人群中的影响最为一致。作为与模型无关的交叉验证,我们还计算了基于准确率的置换重要性,其结果与两个主要预测因子一致。

局部瀑布图(SHAP)。对于单个用户,相同的shap解释器返回一个可加的归因向量,其条目之和*恰好*等于实例的预测对数几率与数据集基础值之间的差距(Shapley值的可加性保证)。正归因将预测推向流失,负归因推向留存;我们将其呈现为SHAP瀑布图。

LIME。局部解释使用lime库的LimeTabularExplainer(分类模式)生成。三个连续特征进行四分位离散化,二元和独热列被声明为分类特征,因此每个代理模型是真正特定于实例的,而不是对全局线性系数的恒定恢复(当LIME应用于线性模型而不进行离散化时会出现这种退化情况)。对于

相似文章

ChurnNet:一种用于流失预测的优化现代AI

arXiv cs.LG

本文评估了传统机器学习技术(随机森林、XGBoost、支持向量机)与深度学习模型(统一多任务时间序列模型)在零售客户流失预测中的表现,发现传统方法在预测性能和效率上可以更胜一筹。