在客户定位中用于特征选择的互信息与敏感性分析:一项比较研究

arXiv cs.LG 论文

摘要

本研究比较了互信息与基于数据的敏感性分析在银行电话营销特征选择中的应用,表明敏感性分析能用更少的特征实现良好的预测,而互信息在成本降低方面更优。

arXiv:2608.20447v1 公告类型:新 摘要:特征选择在数据驱动的知识发现项目中是一个高度相关的任务。已开发出多种技术旨在找到对预测结果影响最大的特征,包括互信息以及近年来基于数据的敏感性分析。本研究重点分析这两种技术的优缺点,将其应用于银行电话营销案例。随后,根据每种技术确定的最有影响力的特征集构建逻辑回归模型,总共有13个特征用于互信息,9个特征用于基于数据的敏感性分析。后者在较低假阳性值时表现更好,而前者在较高假阳性率时略优。因此,如果银行经理打算在不冒着失去大量成功机会的风险下略微降低联系成本,互信息是更好的选择。这些结果表明,互信息虽然不是最新的,但仍然是特征选择的有效方法。另一方面,基于数据的敏感性分析选择用更少的特征实现了良好的预测结果。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:29

# 客户定位中特征选择的互信息与敏感性分析:比较研究
来源:https://arxiv.org/html/2608.20447
1阿根廷Tres de Febrero国立大学,Caseros,阿根廷
2里斯本大学学院 (ISCTE-IUL),ISTAR-IUL,里斯本,葡萄牙 ALGORITMI研究中心,米尼奥大学,吉马良斯,葡萄牙
3Dataxplore,Trenque Lauquen,阿根廷
4Boldt Gaming,布宜诺斯艾利斯,阿根廷

###### 摘要

特征选择是数据驱动知识发现项目中一项高度相关的任务。已开发多种技术旨在找出最能影响预测结果的特征,包括互信息,以及近年来的数据驱动敏感性分析。本研究的重点是通过在一个银行电话营销案例中应用这两种技术,来分析它们各自的优缺点。随后,分别基于两种技术识别出的对电话营销接触成功最具影响的特征集构建了逻辑回归模型,其中互信息选出13个特征,数据驱动敏感性分析选出9个特征。后者在较低的假阳性值下表现更好,而前者在假阳性比例较高时略优。因此,如果银行经理希望在不冒丢失大量成功案例风险的前提下略微降低联系成本,互信息是更好的选择。这些结果表明,互信息虽然不是新技术,但仍是一种有效的特征选择方法。另一方面,数据驱动敏感性分析的特征选择用更少的特征实现了良好的预测结果。

关键词:特征选择;互信息;敏感性分析;客户定位;直接营销;建模。

## 1 引言

客户定位(CT)是商业智能(BI)方法和技术解决的经典问题。它涉及在销售活动产品或服务的营销活动背景下,找到正确的目标客户[40]。典型前沿方法包括使用数据挖掘(DM)来揭示大数据仓库中隐藏的信息模式所蕴含的潜在知识[43]。DM继承了经典统计学和人工智能的最佳实践,试图利用两者优势来增强从原始数据中提取知识的能力[12]。

近年来,全球各行业对数据挖掘(DM)引入的新技术和新方法所带来的益处抱有极高期望,经历了热情的高峰与低谷[10]。在特定时刻发现最佳的目标客户被证明是NP难问题[30]。在现实世界中,大量特征和环境特异性可能影响客户获取产品的接受度。尽管最近的技术和数据挖掘(DM)程序在分析大量数据的能力上不断提升,但由于数据可用性带来的需求增长,识别哪些特征可能影响结果、哪些特征无关且应丢弃变得越来越重要,因为这些无关特征可能直接误导数据挖掘(DM)算法[26]。此外,特征数量越多,在追求最佳可能解决方案时数据挖掘(DM)算法的执行就越慢、越复杂,因为算法需要探索的可能性呈指数级增长[44]。因此,在任何数据挖掘(DM)方法中,特征选择都是高度相关的任务,构成了关键步骤,应投入大部分精力[8]。

已引入并应用多种技术进行特征选择。在文献[2]中,作者进行了一项调查,确定了三种主要方法:过滤法(Filter)、封装法(Wrapper)和嵌入法(Embedded),同时也提到了其他技术的应用,如使用无监督学习和集成方法。表1总结了其分类。

方法 | 描述 | 技术示例
--- | --- | ---
过滤法 | 变量排序技术作为变量选择的主要标准,通过排序 | 相关性标准;互信息
封装法 | 使用预测器作为黑箱,以预测器性能作为评估变量子集的目标函数 | 序列选择算法;启发式搜索算法;敏感性分析
嵌入法 | 通过将特征选择作为训练过程的一部分,减少封装法中重新分类不同子集所耗费的计算时间 | SVM-RFE(递归特征消除)
其他 | 不属于其余三种方法的几种技术 | 聚类;集成;敏感性分析

表1:特征选择方法(改编自文献[2])

互信息(MI)是最广泛采用的特征选择技术之一,最早的研究可追溯到二十世纪九十年代[1]。MI背后的核心概念是通过识别一个特征能从另一个特征获得多少信息,来度量两个随机特征之间的相互依赖性。因此,它与随机特征的熵相关联,该熵由特征所包含的信息量定义[31]。

敏感性分析(SA)在数据挖掘(DM)项目中用于特征选择的研究至少从新世纪之交就已开始[9]。SA背后的主要思想是评估模型对每个输入特征变化在预测结果上的敏感性:模型越敏感,改变输入特征对结果的影响就越相关。在此背景下,根据表1中确定的分类,SA可被视为一种封装法,尽管SA也可以包含在模型训练过程中(在这种情况下,它将成为一种嵌入法)。

大多数数据挖掘(DM)项目需要包括一个数据准备步骤,其中通常会进行特征选择过程[14]。由于客户定位(CT)是一个通过数据挖掘(DM)解决的典型问题,使其成为应用特征选择方法的理想候选。因此,已发表了一些关于将特征选择应用于客户定位(CT)的研究[37, 25]。由文献[38]撰写的最新研究探讨了特征选择对直接营销的影响。他们的工作分析了三种用于特征选择的过滤法(基于相关性的特征选择、子集一致性和对称不确定性),得出结论:对称不确定性产生了更好的模型,优于使用所研究的另外两种方法和没有任何特征选择程序的模型。

虽然已发表了许多关于使用互信息(MI)进行特征选择的研究,也有一些关于敏感性分析(SA)的研究,但没有一项研究直接比较这两种方法以评估使用每种方法的优缺点。此外,尽管通过实际应用比较特征选择方法的少数近期研究被发现[38],但没有一项考虑敏感性分析(SA)。本文的主要贡献如下:

- 比较互信息与敏感性分析在特征选择中的应用,通过在一个真实的客户定位(CT)问题上测试两种方法;
- 通过将实际数据实验取得的结果与该主题文献提供的背景进行交叉验证,评估采用每种特征选择方法的优缺点;
- 提供关于每种方法的见解,以指导学者和研究人员采用每种方法来处理广泛的、数据驱动的现实世界问题的方法。

本文结构如下。第2节概述了应用于客户定位(CT)的互信息(MI)、敏感性分析(SA)和特征选择的相关文献。第3节描述了实验所采用的材料和方法。第4节讨论了应用两种方法的结果和评估。最后,在最后一节得出结论。

## 2 背景

### 2.1 互信息

熵和互信息(MI)是通信和信息论中的著名概念。它们最初由克劳德·香农在其开创性论文[36]中引入,旨在为源编码和有噪信道编码寻找最优方案。熵与随机变量的不确定性或信息含量相关。从这个角度看,一个发生概率为 \(p_{i}\) 的事件 \(i\) 的信息量为:

\(I=-\log p_{i}\) (1)

对数的底数定义了单位,以2为底的对数给出比特单位。事件发生的可能性越大,其发生所提供的信息就越少。公式(1)的期望给出了此类事件集的平均信息含量:

\(H(X)=-\sum p_{i}\log p_{i}\) (2)

公式(2)是随机变量 \(X\) 的熵,其中事件 \(i\) 对应值 \(x_{i}\),即 \(p(x_{i})=p_{i}\)。

熵受限于结果集的基数:\(H(X)\leq\log|\mathcal{X}|\),并在事件遵循均匀分布 \(p_{i}=\frac{1}{|\mathcal{X}|}\) 时达到最大值。熵越大,事件越随机,因此事件的发生提供更多信息,尽管其可预测性越低。

考虑两个具有给定联合概率 \(p(X,Y)\) 的随机变量,联合熵定义为:

\(H(X,Y)=-\sum_{x\in\mathcal{X},y\in\mathcal{Y}}p(x,y)\log p(x,y)\) (3)

条件熵定义为:

\(H(X|Y)=-\sum_{x\in\mathcal{X},y\in\mathcal{Y}}p(x,y)\log p(x|y)\) (4)

两个随机变量之间的互信息定义如下:

\(I(X;Y)=\sum_{x\in\mathcal{X},y\in\mathcal{Y}}p(x,y)\log\frac{p(x,y)}{p(x)\;p(y)}\) (5)

由公式(5)我们可以推导出互信息与熵之间的关系:

\(\begin{aligned}I(X;Y)&=H(X)-H(X|Y)\\&=H(Y)-H(Y|X)\end{aligned}\) (6)

互信息的定义可以扩展到随机变量集 \(X^{n}=\{X_{1},X_{2},\cdots,X_{n}\}\) 和 \(Y^{n}=\{Y_{1},Y_{2},\cdots,Y_{n}\}\):

\(I(X^{n};Y^{n})=\sum_{x^{n}\in\mathcal{X}^{n},y^{n}\in\mathcal{Y}^{n}}p(x^{n},y^{n})\log\frac{p(x^{n},y^{n})}{p(x^{n})\;p(y^{n})}\) (7)

其中 \(\mathcal{X}^{m}\) 和 \(\mathcal{Y}^{m}\) 分别是 \(x^{n}\) 和 \(y^{m}\) 的结果集。

当变量以马尔可夫链形式连接时(如图1所示),冗余信息可以被移除。这种情况的一个著名关系由数据处理不等式给出:\(I(X_{1};X_{2})\geq I(X_{1};Y)\),另一个不等式在引理1中以类似方式证明。

图1:引理1的变量连接

###### 引理 1

如果随机变量 \(X_{1}, X_{2}, Y\) 构成马尔可夫链 \(X_{1}\rightarrow X_{2}\rightarrow Y\),那么:

1. \(I(X_{1},X_{2};Y)=I(X_{2};Y)\)
2. \(I(X_{2};Y)\geq I(X_{1};Y)\)

###### 证明

将链式法则应用于互信息两次:

\(\begin{aligned}I(X_{1},X_{2};Y)&=I(X_{1};Y|X_{2})+I(X_{2};Y)\quad(8)\\&=I(X_{2};Y|X_{1})+I(X_{1};Y)\quad(9)\end{aligned}\)

根据马尔可夫性质:

\(I(X_{1};Y|X_{2})=0\) (10)

将公式(10)代入公式(8),我们证明了第一部分。

考虑到互信息始终大于0(例如参见文献[7]),由公式(8)、(9)和(10)我们得到 \(I(X_{2};Y)\geq I(X_{1};Y)\),引理得证。

∎

然后,我们可以指出,这些信息论中的函数非常适合消除冗余信息,而这通常不被其他方法考虑。

通信信道是一种能够传输信息的设备或媒介。输入信息被传输到输出端。由于任何信息传输机制都不完美,过程中会引入一些噪声。因此,输入和输出信息不完全相同,但相关。我们可以使用互信息来度量这种关系。此后,我们将考虑 \(X\) 是输入端的随机变量,\(Y\) 是输出端的随机变量。

根据信源编码定理,我们知道熵是编码给定随机变量结果所需平均比特信息的度量。这样,\(H(X)\) 是信道输入信息的度量,\(H(Y)\) 是输出端的信息量,\(I(X;Y)\) 是传输的信息量,并考虑公式(6)的关系:\(H(Y|X)\) 是信道引入的噪声的度量。条件熵 \(H(X|Y)\) 称为含糊度或歧义度,必须从输入信息中减去才能得到传输的信息量。根据信道编码定理,互信息给出了信道容量,并决定了信道传输信息的最大速率,详见文献[36]和[7]。

基于互信息的特征选择包括选择一个变量子集,使其根据给定标准最大化输出变量的信息量。该过程从添加携带最多信息的特征开始,直到达到停止标准。由于输出变量 \(Y\) 与给定输入变量子集 \(X^{m}\) 之间的互信息由以下公式给出:

\(I(X^{m},Y)=H(Y)-H(Y|X^{m})\)

相似文章

多目标无监督特征选择中的目标诱导偏差与搜索动态

arXiv cs.LG

本文系统研究了不同评估目标(准确率、轮廓系数、PCA重构损失)以及子集大小正则化方向如何影响多目标无监督特征选择中的搜索动态与解质量,结果表明基于轮廓的公式倾向于产生琐碎的低基数解,而PCA损失则能生成紧凑且具有竞争性准确率的子集。