B2B客户转化预测:一种基于文档表示、图理论和CatBoost的方法论

arXiv cs.LG 论文

摘要

本文提出了一种使用文档表示、图理论和CatBoost来预测B2B客户转化的方法论,在销售漏斗预测中实现了91%的准确率。

arXiv:2609.03239v1 Announce Type: new 摘要:在一次性销售的B2B情境中,购买周期可能持续数月甚至数年。在这一漫长过程中,针对具有高购买潜力的客户并相应地推荐个性化营销活动,对于有效营销至关重要。为此,我们研究了以下问题:B2B客户数据聚合、客户特征生成,以及预测B2B客户是否会表现出购买兴趣(即,预测转化为销售漏斗)。我们提出了一种算法,基于多个键将个人联系聚合到B2B客户级别。对于非标准化的键,如公司名称,我们提出了一种新颖的架构,将其聚类在一个包含拼写错误和拼写变体等不规则性的域中。然后,我们定义和生成了一组特征,并应用CatBoost模型进行客户转化预测。我们的框架达到了91%的预测准确率。基于预测结果和模型分析,我们讨论了个性化营销活动推荐以促进转化。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:23

# 基于文档表示、图论与CatBoost的B2B客户转化预测方法
来源:https://arxiv.org/html/2609.03239
会议:KDD 2023第二届端到端客户旅程优化研讨会;2023年8月;美国加利福尼亚州长滩
Tianqi Wanghttps://orcid.org/注:两位作者对本研究贡献均等。机构:普渡大学,610 Purdue Mall,美国印第安纳州西拉法特,47906邮箱:[wang3175@purdue\.edu](mailto:[email protected])Sheikh Shams Azam机构:Apple,美国马萨诸塞州剑桥邮箱:[mailto:](mailto:),Wan Eih Huang机构:Amazon,美国华盛顿州西雅图邮箱:[mailto:](mailto:),Anton Wiranata机构:HP Inc\.,美国爱达荷州博伊西邮箱:[anton\.wiranata@hp\.com](mailto:[email protected]),Christopher G\. Brinton机构:普渡大学,610 Purdue Mall,美国印第安纳州西拉法特,47906邮箱:[cgb@purdue\.edu](mailto:[email protected])和Jan P\. Allebach机构:普渡大学,610 Purdue Mall,美国印第安纳州西拉法特,47906邮箱:[allebach@purdue\.edu](mailto:[email protected])

2023

###### 摘要\.
在单次销售的B2B场景中,购买周期可能持续数月甚至数年。在此漫长过程中,精准定位具有高购买潜力的客户并推荐个性化营销活动,对有效营销至关重要。为实现这一目标,我们研究了以下问题:B2B客户数据聚合、客户特征生成,以及预测B2B客户是否会对购买表现出兴趣(即预测是否进入销售漏斗)。我们提出一种算法,基于多个键将个人联系人聚合至B2B客户层级。针对公司名称等非标准化键,我们设计了一种新颖的架构,能够在包含拼写错误和拼写变体等不规则性的领域内对它们进行聚类。随后,我们定义并生成一系列特征,并应用CatBoost模型进行客户转化预测。我们的框架达到了91%的预测准确率。基于预测结果与模型分析,我们进一步讨论了如何通过个性化活动推荐来促进转化。

###### 关键词:
转化预测,词语聚类,文档表示

## 1\.引言
数据分析是B2B营销领域的热点议题。越来越多的企业报告称其在大数据和人工智能方面的投资取得了成功成果(Partners, 2021 (https://arxiv.org/html/2609.03239#bib.bib5))。数据分析通过促进B2B销售(Hallikainen et al., 2020 (https://arxiv.org/html/2609.03239#bib.bib4))以及加强供应链(Gunasekaran et al., 2017 (https://arxiv.org/html/2609.03239#bib.bib7))和客户关系管理(CRM)(Nam et al., 2019 (https://arxiv.org/html/2609.03239#bib.bib6);Zerbino et al., 2018 (https://arxiv.org/html/2609.03239#bib.bib8))中的商业运营,为企业创造价值。B2B营销数据涉及大量单个联系人的活动记录,以及人口统计和企业特征(企业特征)。分析这些数据使得回答重要的商业问题成为可能,例如:哪些客户更有可能购买?某些营销活动参与序列是否比其他序列更能有效促成销售?如果是,这种序列本质上是否动态变化,会跨越地区和行业边界而不同?

然而,B2B营销数据分析在数据聚合和客户特征选择方面面临困难。展示客户与公司之间互动的B2B营销参与数据通常是为每个独立的联系人记录的。要分析客户行为,必须在客户-公司层级收集所有活动,包括所有相关员工的行为。尽管CRM平台可以为每个客户账户收集联系人,但由于数据不完整,存在缺失的活动数据。通常,存在标准化键和非标准化键用于关联联系人和客户公司。标准化键,如数据通用编号系统(DUNS)编号,通常是干净的数据,但由于数据不完整或人力不足,并非所有个人联系人和客户账户都拥有此类键。为了获得完整的客户营销活动参与数据以及涵盖不同规模公司、地区和行业的无偏数据集,利用公司名称和公司位置等非标准化键至关重要。与标准化键相反,非标准化键可以是自由输入的文本数据,这会导致拼写错误、缩写不一致和多语言问题。因此,数据处理流程应清洗和标准化键,且联系人到客户账户的映射机制应利用多个键。

LRFM(长度、近度、频率、金额)模型(Anitha and Patil, 2019 (https://arxiv.org/html/2609.03239#bib.bib10);Sarvari et al., 2016 (https://arxiv.org/html/2609.03239#bib.bib11);Kandeil et al., 2014 (https://arxiv.org/html/2609.03239#bib.bib9);Mesforoush and Tarokh, 2013 (https://arxiv.org/html/2609.03239#bib.bib12))广泛用于客户数据分析。时间序列数据也广泛用于客户分析(Espinoza et al., 2005 (https://arxiv.org/html/2609.03239#bib.bib25);Ibrahim and Wang, 2019 (https://arxiv.org/html/2609.03239#bib.bib26))。然而,在B2B业务是一次或少数几次销售后跟随支持服务的情况下,LRFM模型不适用,且客户行为时间序列数据不足以用于建模或分析。在这种情况下,我们考虑三类客户属性:客户公司员工的人口统计特征、企业特征,以及客户营销活动参与特征。这里,企业特征指的是组织、公司、政府实体或任何其他类型机构的特征。人口统计和企业特征从数据库中提取,而营销活动数据,即使将联系人聚合到公司级别,仍然是单个记录。我们关注诸如每个客户参与的营销活动数量以及营销活动时序序列等属性。在B2B场景中,同一家公司的多名员工参与同一营销活动并不罕见。特征生成机制应能反映这两个事实,即同一营销活动和多名员工。

考虑到针对高转化潜力客户的下一步行动,尽管电子商务中个性化内容推荐研究活跃,但营销活动推荐却鲜有研究。Yang等人(Yang et al., 2018 (https://arxiv.org/html/2609.03239#bib.bib13))提出了一种基于图的“下一个运行营销活动”(NCTR)推荐系统用于营销活动推荐。基于我们的转化预测结果,我们讨论了B2B公司可以采取哪些措施来提高客户转化率。

基于B2B业务营销数据分析的需求,我们着手解决处理与聚合个人联系人数据、预测是否进入销售漏斗,以及基于转化预测结果推荐行动的问题。我们的研究做出以下贡献。首先,我们提出一个用于数据收集和清洗的数据准备流程。我们的数据准备流程不仅预处理存储在B2B数据库中的数据,还收集在线公开的企业特征数据。为标准化键,我们设计了一种新颖的文本处理架构,以处理包含拼写错误和拼写变体等不规则性的文本。其次,我们设计了一种基于多个键将联系人聚合至B2B客户层级的算法。拥有相同名称的客户公司可能是不同的子公司或分支机构,因此独立做出购买决策。因此,我们也考虑位置作为键。为了利用账户ID、公司名称和位置作为键,我们创建了两个标准,并采用连通分量进行联系人聚合。第三,我们提取企业特征和营销活动参与特征,并证明这些特征对于预测进入销售漏斗的有效性。在特征提取后,我们采用CatBoost模型进行转化预测。最后,我们基于转化预测结果和模型解释工具,讨论了推荐促进销售行动的可行性。

## 2\.相关工作
词语聚类与清洗大量工作集中于词语聚类和文本聚类。Martin等人(Martin et al., 1998 (https://arxiv.org/html/2609.03239#bib.bib14))采用基于困惑度改进标准的交换算法进行二元和三元词语聚类。Ushioda(Ushioda, 1996 (https://arxiv.org/html/2609.03239#bib.bib15))描述了词语的层次聚类和多词复合词的聚类。这些工作中的词语聚类是为语义分析开发的,基于上下文或词语位置。在公司名称文本清洗任务中,没有可用的上下文。大多数拼写纠正系统通过搜索字典或对周围上下文进行语义分析来检测错误(Hládek et al., 2020 (https://arxiv.org/html/2609.03239#bib.bib27))。对于词语聚类或文本清洗任务,其中自造词很常见,字典同样不可用。

特征选择与提取Kourou等人(Kourou et al., 2015 (https://arxiv.org/html/2609.03239#bib.bib28))和Guyon与Elisseeff(Guyon and Elisseeff, 2003 (https://arxiv.org/html/2609.03239#bib.bib29))的研究强调了识别相关属性以进行预测建模的重要性。业务分析研究使用财务数据(Louzis et al., 2012 (https://arxiv.org/html/2609.03239#bib.bib33))、运营数据(Gunasekaran et al., 2004 (https://arxiv.org/html/2609.03239#bib.bib34))、营销数据(Ngai et al., 2009 (https://arxiv.org/html/2609.03239#bib.bib35))和文本数据(Zhao et al., 2021 (https://arxiv.org/html/2609.03239#bib.bib32))来完成各种任务。Venkatesh与Anuradha(Venkatesh and Anuradha, 2019 (https://arxiv.org/html/2609.03239#bib.bib30))和Ghojogh等人(Ghojogh et al., 2019 (https://arxiv.org/html/2609.03239#bib.bib31))综述了当有一组特征可供选择时的一般特征选择方法。在我们的任务中,我们收集了采集的数据和网络爬取的数据,其中包含客户行为和公司级特征,然后应用特征选择和特征提取技术。

转化预测转化预测已在电子商务(Moe and Fader, 2004 (https://arxiv.org/html/2609.03239#bib.bib16);Park and Park, 2016 (https://arxiv.org/html/2609.03239#bib.bib17);Yeo et al., 2017 (https://arxiv.org/html/2609.03239#bib.bib18))和移动广告领域的B2C市场(Pereira et al., 2021 (https://arxiv.org/html/2609.03239#bib.bib19);Matos et al., 2019 (https://arxiv.org/html/2609.03239#bib.bib20))中得到研究。这些研究使用客户在线行为或点击流作为输入数据,这些数据更易获取且更完整。在B2B市场,转化预测的研究很少。相反,研究人员探索了B2B客户流失预测(Figalist et al., 2019 (https://arxiv.org/html/2609.03239#bib.bib21);Gordini and Veglio, 2017 (https://arxiv.org/html/2609.03239#bib.bib22))。然而,这些研究仍然主要是在电子商务背景下进行的。

推荐系统近年来,推荐系统一直是一个活跃的话题。主要的推荐方法包括基于内容的方法、协同过滤和混合方法(Adomavicius and Tuzhilin, 2005 (https://arxiv.org/html/2609.03239#bib.bib23))。协同过滤模型中考虑了时间模式以学习动态特征(Chen et al., 2013 (https://arxiv.org/html/2609.03239#bib.bib24))。在B2B营销活动背景下,Yang等人(Yang et al., 2018 (https://arxiv.org/html/2609.03239#bib.bib13))为B2B营销活动推荐设计了一个社交和时间模型。他们利用了时间行为模式并构建了一个时间图。该框架识别常见的图模式并预测时间图中的缺失边。他们还将社会因素纳入了他们的方法。

## 3\.数据集与预处理
一些公司(包括我们合作的公司)的营销数据分为两部分:个人联系人数据和客户公司数据。我们分析的营销数据概要如表1所示 (https://arxiv.org/html/2609.03239#S3.T1)。数据不完整。在我们的数据集中,一些联系人未链接到客户公司,因此没有账户ID。对于个人联系人数据和客户公司数据,企业特征:行业、收入和员工数量仅存在于部分联系人/公司中。

表 1\.数据集我们的首要目标是将联系人聚合到公司,以便我们能够收集客户参与的所有营销活动,然后创建时序营销活动序列。然而,营销团队创建的用于关联个人联系人和客户公司的标准化键账户ID仅存在于部分联系人。为了完善拥有账户ID的客户公司的营销活动数据,并为没有账户ID的客户创建营销活动数据,我们需要其他键来确定个人联系人是否属于同一客户公司。我们使用公司名称、国家/地区和城市作为额外的键,将联系人数据分组到公司级别。这三类数据均以自由格式文本回答输入。国家/地区和城市相对于公司名称是更干净的数据。我们对国家/地区和城市应用了数据清洗技术,然后直接使用结果数据作为键。我们的技术和方法包括通过翻译API将非字母国家/地区和城市翻译为英文、转换为小写、删除特殊字符、删除自定义停用词(如“city”),并进行人工检查。而公司名称则包含各种自造词,以及拼写错误、缩写不一致和多语言问题等更多不规则性。我们将在下一节中描述公司名称的处理过程以及所提出的文本文档聚类架构。

从营销专家的经验中学习,企业特征是营销数据分析的重要属性。我们的数据集在联系人数据和公司数据中都存在这些企业特征的缺失值。然而,这些数据可以从其他数据库或在线资源中获取。我们应用网页抓取技术来提取企业特征以填充这些信息。网络爬取的数据与我们数据集中的企业特征格式不同。我们采用字符串处理、翻译和关键字映射来标准化来自两个资源的数据。经过网络爬取和预处理后,这些企业特征仍然存在缺失值。我们将处理后数据中的全局中位数设置为我们的数据集中没有此信息的客户公司的员工数量或收入值。这些企业特征随后将用于特征提取和转化预测。

## 4\.文档表示与聚类架构
### 4\.1\.架构概述
参见图例图1\.我们算法的架构流程图。所有组成模块都是针对我们的数据专门训练的。像公司名称这样的文本数据无法通过词汇表检查来标准化,也无法直接通过词嵌入表示,因为

相似文章

ChurnNet:一种用于流失预测的优化现代AI

arXiv cs.LG

本文评估了传统机器学习技术(随机森林、XGBoost、支持向量机)与深度学习模型(统一多任务时间序列模型)在零售客户流失预测中的表现,发现传统方法在预测性能和效率上可以更胜一筹。