多早才算足够早?订阅流失预测中基于设计的观察窗口充分性
摘要
本文使用KKBox数据集,研究订阅流失预测中需要多少天的早期行为才足够。结果表明,最优观察窗口取决于实验设计,且有关窗口充分性的论断应明确说明队列构建、目标定义和特征族。
arXiv:2607.00473v1 公告类型:新论文
摘要:订阅流失预测需要多少天的早期行为才足够?在公开的KKBox数据集中,流失的早期指标通常是指某人合同状态的指标;然而,在流失严重的自动续费关闭(手动续费)群体中,获取早期行为可以大幅提高对该特定群体的预测能力(120天时PR提升+0.10)。九窗口充分性曲线显示,在45-90天区间内存在一个收益递减的拐点。然而,在三种队列/任务设计上的压力测试表明,该曲线仅适用于所测试的设计;例如,在我们使用移动目标的测试中,曲线会发生反转,并且可能根据所使用的特征集而移动。因此,任何关于窗口充分性的主张都应说明其队列构建、目标定义和特征族。所有证据来自一个音乐流媒体数据集;该机制可泛化,但数值大小可能不可泛化。
查看缓存全文
缓存时间: 2026/07/02 05:38
# 多早才算足够早?订阅流失预测中依赖于设计的观察窗口充分性 来源:https://arxiv.org/html/2607.00473 ###### 摘要 对于订阅流失预测,多少天的早期行为数据就足够了?在公开的KKBox数据集中,流失的早期指标通常是用户合同状态的指标;然而,在大量流失的手动续费用户群体中,使用早期行为数据会显著提升对该群体的预测效果(PR提高+0.10,时间窗口为120天)。一个九窗口的充分性曲线显示,在45-90天的区间内存在一个收益递减的拐点。然而,通过对三种队列/任务设计的压力测试表明,这条曲线仅对正在测试的设计有效;例如,在我们使用移动目标进行的测试中,曲线发生了反转,并且可能随着所使用的特征集而变化。因此,任何关于窗口充分性的论断都应说明其队列构建方式、目标定义和特征家族。所有证据均来自一个音乐流媒体数据集;该机制具有普适性,但具体数值可能不适用。 ## I. 引言 基于订阅的公司应选择合适的时机进行干预以留住客户;如果干预太晚,客户可能已经流失,任何营销手段都将失效;如果干预太早且数据有限,干预措施很可能出错。探索这一问题的有效方法是构建一条充分性曲线:根据模型可观察到的早期行为天数绘制性能图表,找到收益递减开始出现的点,并确定能够获取最大部分可达到信号的最短样本周期。目标是得出两个方面的答案:一个运营数字(“NN天足够”)以及,对于金融应用,明确哪些客户特征构成了决策依据。 两项独立研究奠定了先前的发现。Ballings和Van den Poel[1](https://arxiv.org/html/2607.00473#bib.bib1)(“用于流失预测的客户事件历史:多长才算足够长?”)改变了现有客户历史记录的年限,发现收益递减呈对数函数形式;几乎所有的历史深度都可以被丢弃,而对AUC的影响很小,这一结果在零售环境中得到了复现[2](https://arxiv.org/html/2607.00473#bib.bib2)。Drachen等人[3](https://arxiv.org/html/2607.00473#bib.bib3)指出,玩家的流失可以在其参与早期(第一次会话/第一天/第一周)被部分预测,但仅使用了三个粗略的时间点,且只有准确率指标,没有正式定位拐点。由于这些研究固定了特定的队列设计并仅测量了一条曲线,因此无法测试在改变该设计的任何属性后拐点是否仍然有效。 利用公开的KKBox数据集,我们构建了一条用于订阅流失预测的早期观察窗口充分性曲线,识别了早期预警信号,然后通过三种设计逐步控制随着窗口增长而“变化”的内容,对该曲线进行了压力测试。我们的贡献如下: 1. “NN天足够”这一结论在不同实验设计之间不可迁移。我们使用同一数据集上的三种队列/任务设计研究了充分性曲线。固定时间范围的设计呈现上升趋势,拐点在45-90天之间。在我们的压力测试中,一个里程碑任务使曲线反转,且拐点位置随特征集变化。所有关于窗口充分性的论断都需要明确队列构建、目标定义和特征家族。 2. 从一个大型公开数据集中为订阅流失预测构建了密集的早期观察窗口充分性曲线:九个窗口(N=7...180),采用Kneedle[4](https://arxiv.org/html/2607.00473#bib.bib4)算法结合边际增益拐点检测,使用PR-AUC和ROC-AUC指标,模型类型(GBDT、1D-CNN、逻辑回归)具有鲁棒性(固定随机种子)。拐点落在约45-90天的区间内。 3. 早期信号主要由合同驱动,但在流失密集的细分群体中表现出行为提升。合同基础特征(自动续费、套餐、价格)在整体上占主导地位,但在手动续费细分群体(占用户总数的28%,占流失用户的86.6%)中,基础特征的ROC仅为0.63,而行为数据带来了实际提升(到第120天时PR提高+0.10)。 4. 早期可预测性并非幸存者偏差所致。主要设计以第180天的幸存者为条件,排除了47%的新增用户。在没有任何幸存者过滤的情况下,所有新增用户在第7天的ROC为0.913,单调递增至第120天的0.963。 ## II. 相关工作 Ballings和Van den Poel[1](https://arxiv.org/html/2607.00473#bib.bib1)提出了“多长才算足够长?”的问题,研究维度是现有客户历史记录的年数(对数形式的收益递减;在杂货零售领域由[2](https://arxiv.org/html/2607.00473#bib.bib2)复现)。他们的维度是现有客户历史记录的深度;而我们的维度是自获客以来的天数。他们报告了一条曲线,但只针对一种设计,这正是本文进行压力测试的做法。Drachen等人[3](https://arxiv.org/html/2607.00473#bib.bib3)展示了游戏留存中的早期观察窗口(唯一一项变化早期窗口的先前研究),但并未正式确定拐点;他们只有三个数据点,且仅使用准确率指标。游戏流失研究[5](https://arxiv.org/html/2607.00473#bib.bib5), [6](https://arxiv.org/html/2607.00473#bib.bib6)和Bhattacharjee等人[7](https://arxiv.org/html/2607.00473#bib.bib7)固定了单个窗口,并未改变队列设计。我们的设计B/C是van Houwelingen[12](https://arxiv.org/html/2607.00473#bib.bib12)定义的地标模型:在每个地标NN处,我们使用截至NN观测到的协变量,预测仍处于风险中的对象未来发生的事件。竞争风险框架[13](https://arxiv.org/html/2607.00473#bib.bib13)为将早期退出者视为已解决的结果而非丢弃的样本提供了理论依据。地标分析是一种成熟的技术;我们用它来解释充分性曲线为何呈现特定形状。 WSDM Cup 2018 KKBox挑战赛[8](https://arxiv.org/html/2607.00473#bib.bib8)将流失定义为在到期后30天内未续费;我们根据交易数据重新推导标签,以避免已知的约1%的到期日期泄露问题(第III节)。据我们所知,这是首个基于大型公开订阅数据集构建的早期观察窗口充分性曲线;支持早期信号[9](https://arxiv.org/html/2607.00473#bib.bib9)和调查[10](https://arxiv.org/html/2607.00473#bib.bib10)的工作指出,时间窗口维度尚未得到充分研究。“多少输入才足够?”这一问题并不仅限于流失领域:Shen等人[16](https://arxiv.org/html/2607.00473#bib.bib16)将LLM的上下文长度预算建模为一个成本-性能前沿,这是一个在另一种模态上的类似收益递减问题。 ## III. 方法 **数据集与标签。** KKBox (WSDM Cup 2018):包括会员信息、交易记录(套餐/价格/自动续费/取消/到期)以及约30GB的每日用户日志。我们根据交易数据重新推导流失标签,遵循官方标签逻辑(到期后30天内无有效续费),以便窗口可以干净地锚定,并避免已知的到期泄露问题。我们报告两个一致性数值:(1) 重新推导的机制在95.7%的2017年3月决策用户上复现了train_v2;(2) 我们训练时使用的以t0为锚点的标签与train_v2在92.1%的重叠用户上一致。差异是由锚点不同造成的:两个标签衡量的是不同的续费决策(每个用户t0+180对比固定的2017年3月),因此一致性主要由非流失的多数用户决定。作为独立检查,在重叠队列上使用官方train_v2的流失标签作为目标重新拟合,再现了上升曲线(在N=7至120的区间内,ROC从0.74增加到0.76,约54%的提升在第45天之前实现),因此该现象并非重新推导的产物。 **三种设计(细致的压力测试)。** 使用三种锚定方法来研究相同的自获客以来天数扫描。t0 = 首次交易日期;在所有三种设计中,特征窗口[0, N)随N增长。这些是诊断性设计,而非三种相互竞争的模型。 * **设计A(主要设计)。** 标签固定在t0+180;队列:获客用户,其定义流失的到期日≥t0+180,标签可解析,且至少有1天窗口内活跃日志。这是一个幸存者条件队列(“对于达到≥180天续费决策的用户,多早可以预测?”)。≥180天的过滤条件从2,426,143名获客用户中保留1,294,009人(剔除47%);可解析标签加上≥1天活跃日最终得到1,040,946人的建模队列,流失率为8.37%。特征:48列(6个会员特征 + 11个交易特征 + 31个日志特征)。 * **设计B(所有获客用户地标模型)。** 无幸存者过滤:1,973,026人(占获客用户的81.3%),流失率0.4264。在地标N处,保留仍在订阅的用户,并预测在剩余区间(N, 180]内的流失,这是运营人员可以在第N天部署的设计。随着N增长,有三样东西在变化:特征窗口扩大、剩余目标区间(N, 180]缩小、队列重新选择为截至N的幸存者。随着N增加,预测窗口缩小,剩余队列转向更健康的幸存者;因此性能可能下降,尽管观测到的特征更多了。特征:仅包含17个会员和交易特征(无日志时间序列,因此CNN无法在此设计上运行)。 * **设计C(受控地标模型)。** 为了回答“当只有特征窗口变化时,上升趋势是否仍然存在?”,我们固定了队列和目标:队列 = 在单个地标L=120处仍订阅的可解析获客用户(n = 1,263,885,对所有N相同);目标 = 在(120, 180]区间内的流失(流失率0.1358,恒定)。仅[0, N)变化。这消除了设计B中的移动目标和重新选择,将设计A中的≥180天过滤放松为较温和的≥120天,但并未消除幸存者条件(第V节)。特征:与设计B相同(17个),因此设计A与C在特征集上也不同。表I总结了三种设计。 **表 I:实验设计。** 所有设计共享相同的增长特征窗口[0, N);不同之处在于随着N变化,还有哪些因素也在变化。单独的设计U(无条件控制,第IV-C节)采用与设计B相同的1.97M队列,但将目标固定为截至第180天的流失,且无幸存者过滤。 **泄露控制。** 特征仅使用day_offset小于N的日志行。交易特征在获客时即确定,因此在所有N上保持不变。对于设计A的特征子集(第IV-B节,第3点),我们通过从日志中移除所有未来值来验证行为特征是前向安全的;逻辑回归在整个过程中保持单调性。主要发现是,无论性能水平如何,所有模型都产生相同的形状。压力测试的有效性:设计B是自然主义的(反映部署时的真实准确性);设计A和C是反事实的(固定标签或队列);它们共同展示了曲线取决于设计。我们实验中的N步长为:7, 14, 21, 30, 45, 60, 90, 120, 180。 ## IV. 实验 **设置。** 训练/验证/测试:随机划分(65/15/20),分层以确保流失率一致。每次运行5个独立种子(除了逻辑回归使用50个种子进行配对测试)。逻辑回归(L2正则化,α=0.1);GBDT(LightGBM,300棵树,叶子数31,学习率0.1);1D-CNN:两层卷积(32和64个过滤器,内核大小3),随后是平均池化和密集层,Adam优化器,学习率0.001,50个epoch,早停(验证损失3个epoch无改善)。在CNN中,日志被聚合为深度特征(活跃天数 / N,计数,多样性)。对于所有模型和种子,在N=7时表现出几乎随机性能(PR-AUC 0.020,ROC 0.500)的无效运行会被提示(在测试前排除;但未发生)。所有结果报告为5或50个种子的均值。使用垂直聚合的折线图(每个N点显示平均 ± 一个标准差)。 **N步长:** 7, 14, 21, 30, 45, 60, 90, 120, 180。 ### IV-A 设计A(主要):上升趋势 图1显示了九条密集的充分性曲线,所有模型均单调上升。在我们的压力测试中,GBDT和CNN在PR-AUC和ROC-AUC上均优于逻辑回归,但所有模型在约45-90天的区间内均呈现收益递减的拐点。边际增益(ΔPR-AUC随窗口增长)进一步证实了该区间:在N=7至45天之间,窗口增长一个标准差(σ=1.5天)可带来平均+0.004的PR提升;在45-90天之间,提升降至+0.002;窗口超过90天后,提升进一步减半。使用Kneedle算法(灵敏度1.5,无平滑)在6个种子中的每个上分别计算拐点,平均在第47天(σ=1.2天)。因此,对于该设计,约45-90天的区间是可接受的运营范围;对于该特定设计,声称“90天足够”是合理的(但参见下面的压力测试)。 ### IV-B 压力测试:三条曲线,三种形状 **设计B(移动目标,无幸存者过滤):** 图2显示曲线反转:随着N增长,所有模型全面下降。例如,逻辑回归的ROC从0.841(N=7)下降到0.791(N=120)。为什么?当N增加时,正例比例从0.534降至0.350;剩余高风险用户在N=7时已被预测为流失,而剩下的员工更健康、更难以区分;模型在无历史记录时表现良好(首日计划特征已具有较强的辨别力),而新行为特征无法弥补噪声的增加。因此,运营人员在每日部署场景中使用地标方法时,不会观察到窗口充分性上升;对于该任务,“窗口越大越好”的说法不成立。 **设计C(特征集较小的受控地标模型):** 图2显示,当只变化特征窗口时,曲线从N=7到60的绿色上升持续存在,然后在90-120天趋于平稳。但注意:逻辑回归的ROC在N=7为0.766,在N=60达到0.777,在N=120达到0.781。这与设计A的上升截然不同,且更早趋于平稳。这是由特征集差异驱动的:设计A使用48列特征(包括日志),在手动续费用户上整体提升+0.10 PR(见下文),而设计B/C仅使用17个基础特征。我们训练了一个仅使用会员/交易特征的逻辑回归模型来模拟设计A中的设计C限制条件,并确认了设计C的形状。要点:拐点位置取决于特征集;声称“在45-90天达到拐点”依赖于包含行为特征。 ### IV-C 额外诊断:早期信号强度与可迁移性 **设计U(无条件控制)。** 为了消除设计A中条件幸存者队列的影响,我们构建了一个目标为第180天流失(无幸存者过滤)的队列。使用设计B的1.97M个可解析用户(无0日志排除),N=7时ROC为0.913,单调上升至N=120时的0.963。因此,早期可预测性并非幸存者偏差;信号在获客后不到一周就已强烈存在。设计A的幸存者过滤从2.43M个获客用户中保留了1.04M人;无条件队列上升而无条件队列下降的事实验证了设计B中移动目标驱动的下降,而非幸存者偏差。 **信号分解:合同 vs. 行为。** 我们训练了基于特征族的逻辑回归模型: 1. **仅会员特征:** 人口统计(城市,注册渠道)。所有窗口均呈平坦状态(ROC < 0.58)。 2. **仅交易特征:** 计划类型、价格、自动续费标志。在获客时即已知,因此在所有N上ROC恒定在0.867。在手动续费用户上,合同信号较弱(ROC 0.63)。 3. **交易+日志(全特征):** 在第45天,整体PR从0.09提升至0.11;到第90天,手动续费用户上的PR从0.18提升至0.28(+0.10)。日志特征挽救了手动续费用户的预测能力。 **模型类型:** GBDT、1D-CNN和逻辑回归的曲线形状在每种设计下均一致。水平差异:CNN与GBDT相当或超出,两者均优于逻辑回归,但所有模型在所有设计下均呈现相同的形状。主要发现是,无论性能水平的差异如何,所有模型都产生相同的形状。 **可用的发现。** 压力测试保留了两个发现:(i) 获客时的合同条款携带最早的信号;行为提升集中在手动续费用户群体(PR +0.10,基础ROC 0.63)。留存努力应针对该群体,而非自动续费的多数用户。(ii) 早期可预测性并非幸存者偏差:设计U在所有获客用户上确认了信号(第7天ROC 0.913)。对于追踪至第180天决策的用户,约90%的可达到行为提升在大约90天时已掌握(拐点区间45-90天),对于“该设计”而言是一个合理的运营范围。 **方法学上的警示(示例,非定律)。** 本演示涵盖单个订阅领域(音乐流媒体);设计依赖性的“大小”是否可迁移至电信、SaaS或保险尚待研究,但“机制”(队列、目标和特征集选择塑造任何窗口扫描)是通用的。曲线是真实的,其上升趋势在移除移动目标和重新选择(设计C)后仍然存在;但不可迁移的是其“形状”(在我们的压力测试中,设计B的移动目标任务下降)和“拐点位置”(随特征集变化)。先前的窗口长度研究各固定一种设计[1,3],无法看到这一点。为了实现透明、负责任的部署,任何关于窗口充分性的论断都应披露队列是否幸存者条件化、目标是否随窗口移动,以及哪些特征家族驱动早期信号。 **有效性威胁。** 主要设计是幸存者条件化的(≥180天);设计C消除了移动目标伪影,但自身也是条件化的(截至第120天);设计U(第IV-C节)解决了这两个问题。设计A还丢弃了156,848个零日志用户;设计U包含了这一排除,但仍然上升。B与C的对比显示了任务依赖性,而非“更多数据有害”。特征集归因(第IV-B节,第3点)通过带日志的设计C控制得到了确认。标签重新推导与train_v2在92.1%的重叠用户上一致(差异由锚点驱动,而非标签噪声;机制匹配度:95.7%)。N=180可能包含决策前的交易;所有关键数字均来自N≤120。单一数据集,依赖划分:我们报告均值并附描述性离散度[14,15];压力测试是一个实例,非通用数值。 ## VI. 结论 在进行窗口充分性研究时,必须报告以下信息:队列构建方式(是否幸存者条件化)、目标时间范围(固定还是随窗口移动)以及特征家族(哪些信息源驱动早期信号),因为如果没有这些信息,报告的“NN天足够”结论不可迁移。我们基于大型公开KKBox数据集构建了一条九窗口充分性曲线,拐点在45-90天区间,并通过三种队列/任务设计进行了压力测试:当仅特征窗口变化时,上升趋势保持稳健;但在压力测试中的移动目标任务下,曲线形状发生反转,且拐点位置随特征集变化。早期信号整体上由合同驱动,尽管在流失密集的手动续费用户群体中出现了行为提升;早期可预测性并非幸存者偏差(第7天特征在所有获客用户上达到ROC 0.913,无幸存者过滤)。未来工作应包括多数据集复现和对任何运营点的因果评估。 ## 参考文献 - [1] M. Ballings and D. Van den Poel, “Customer event history for churn prediction: How long is long enough?” *Expert Syst. Appl.*, vol. 39, no. 18, pp. 13517–13522, 2012. - [2] H. Apaydın and P. Tüfekci, “The effect of the length of the customer event history and the staying power of the predictive models in customer churn prediction: A case study of Migros Sanal Market,” *Acad. Platform J. Eng. Sci.*, vol. 6, no. 3, pp. 1–10, 2018. - [3] A. Drachen et al., “Rapid prediction of player retention in free-to-play mobile games,” in *Proc. AAAI Conf. Artif. Intell. Interactive Digital Entertainment (AIIDE)*, 2016, arXiv:1607.03202. - [4] V. Satopää, J. Albrecht, D. Irwin, and B. Raghavan, “Finding a ‘kneedle’ in a haystack: Detecting knee points in system behavior,” in *Proc. 31st Int. Conf. Distrib. Comput. Syst. Workshops (ICDCSW)*, 2011, pp. 166–171. - [5] J. Runge, P. Gao, F. Garcin, and B. Faltings, “Churn prediction for high-value players in casual social games,” in *Proc. IEEE Conf. Comput. Intell. Games (CIG)*, 2014, pp. 1–8. - [6] F. Hadiji, R. Sifa, A. Drachen, C. Thurau, K. Kersting, and C. Bauckhage, “Predicting player churn in the wild,” in *Proc. IEEE Conf. Comput. Intell. Games (CIG)*, 2014, pp. 1–8. - [7] S. Bhattacharjee, U. Thukral, and N. Patil, “Early churn prediction from large scale user-product interaction time series,” in *Proc. IEEE Int. Conf. Mach. Learn. Appl. (ICMLA)*, 2023, pp. 2079–2086, arXiv:2309.1439.
相似文章
一种基于滚动窗口的客户流失预测与行为驱动因素识别框架
本文提出了一种适用于非契约服务环境的滚动窗口客户流失预测框架,利用30天的行为窗口实现持续风险评估。基于真实数据的评估显示,基于特征的模型达到了87.6%的准确率和0.94的ROC-AUC,而基于序列的模型召回率高达96.1%。
ChurnNet:一种用于流失预测的优化现代AI
本文评估了传统机器学习技术(随机森林、XGBoost、支持向量机)与深度学习模型(统一多任务时间序列模型)在零售客户流失预测中的表现,发现传统方法在预测性能和效率上可以更胜一筹。
离线选择器为何无法胜过最佳单一模型:基于edX辍学预测的诊断性研究
本文提出了一个三阶段诊断框架,用于识别离线模型选择器为何无法胜过最佳单一模型,并将其应用于edX点击流数据上的辍学预测。研究发现瓶颈在于局部表征歧义,而非学习器选择或分布偏移,建议重新设计状态或收集新数据,而非进一步调优算法。
当证据稀疏时:对话与LLM-Agent轨迹中的弱监督早期故障预警
本文提出了一种两阶段方法,用于对话和LLM-Agent轨迹中的早期故障预警。该方法通过从轨迹标签中学习逐轮故障证据来解决证据稀疏的挑战,并使用基于注意力的预测器与偏好条件停止策略(α-STOP),以实现可控的准确率-及时性权衡。
基于FT-Transformer和堆叠集成对结构化数据进行客户流失预测
本文提出了一种混合架构,将FT-Transformer与梯度提升树通过校准感知的堆叠方法相结合,用于结构化表格数据上的客户流失预测。在一个公开的银行客户流失数据集上,该方法在F1和AUC-ROC指标上取得了改进。