超越特征重要性:聚类解释中模式检测方法的比较分析

arXiv cs.LG 论文

摘要

本文对事后分析方法(随机森林替代模型、LIME、PCA)在检测聚类结果中的结构化模式方面进行了比较评估,使用注入模式的人工合成数据集。研究发现,没有一种方法能持续检测所有模式类型,凸显了现有可解释性工具的不足。

arXiv:2608.05880v1 公告类型:新 摘要:解释聚类结果仍然是数据分析中的一个基本挑战,尤其是在医疗保健等领域,需要从高维数据中提取有意义的模式。尽管存在许多可解释性技术,但它们主要设计用于评估特征重要性或提供局部实例级解释,而非识别聚类中存在的结构化模式。本文对常用于聚类结果模式检测的事后分析方法进行了比较评估。为了实现受控评估,我们引入了一组合成数据集,在其中系统地注入了预定义模式。评估了三种广泛使用的技术:带置换特征重要性的随机森林替代模型、LIME(局部可解释模型无关解释)和主成分分析。结果表明,尽管每种方法都能成功恢复相关特征,但没有一种方法能持续检测所有注入的模式类型。这些发现凸显了现有可解释性工具与模式级聚类解释要求之间的关键差距,推动了专用模式检测方法论的开发。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:52

# 超越特征重要性:聚类解释中模式检测方法的比较分析 来源:https://arxiv.org/html/2608.05880 ###### 摘要 解读聚类结果仍然是数据分析中的一个基本挑战,尤其是在医疗保健等领域,必须从高维数据中提取有意义的模式。尽管存在大量可解释性技术,但它们主要用于评估特征重要性或提供局部实例级解释,而非识别聚类内部存在的结构化模式。本研究对聚类结果中常用的模式检测事后分析方法进行了比较评估。为实现受控评估,我们引入了一套合成数据集,在其中系统性地注入了预定义模式。研究评估了三种广泛使用的技术:带置换特征重要性的随机森林代理模型、LIME(局部可解释模型无关解释)以及主成分分析。结果表明,尽管每种方法都能成功恢复相关特征,但没有一种方法能够一致地检测出所有注入的模式类型。这些发现突显了现有可解释性工具与模式级聚类解释需求之间的关键差距,从而推动了对专用模式检测方法开发的探索。© 2026 IEEE。允许个人使用此材料。任何其他用途,包括当前或未来媒体中的重印/再版、广告或促销目的、创作新的汇编作品、转售或再分发到服务器或列表,或将他人的版权组件用于其他作品,均需获得 IEEE 的许可。本工作已被 2026 年第 36 届爱尔兰信号与系统会议(ISSC)接收。最终出版版本将通过 IEEE Xplore 提供。

## I 引言

聚类算法广泛用于揭示复杂数据集中的潜在结构,尤其是在生物医学研究、人群健康分析和探索性数据挖掘等高维领域。虽然聚类方法能够成功地将数据划分为具有相似特征的组,但解释聚类为何存在以及哪些模式定义该聚类仍然是一个未解决的主要挑战 [10 (https://arxiv.org/html/2608.05880#bib.bib2),2 (https://arxiv.org/html/2608.05880#bib.bib1)]。在实践中,聚类的分析价值不仅在于将数据点分配到组中,更在于识别表征这些组的有意义模式。

现有的聚类解释方法通常依赖于事后可解释性技术。基于代理模型的特征重要性度量、LIME 等局部解释框架以及主成分分析(PCA)等降维技术经常被用于理解聚类结构 [7 (https://arxiv.org/html/2608.05880#bib.bib3),9 (https://arxiv.org/html/2608.05880#bib.bib4),8 (https://arxiv.org/html/2608.05880#bib.bib13),14 (https://arxiv.org/html/2608.05880#bib.bib14)]。然而,这些方法最初并非为检测聚类结果中的模式而设计。相反,它们侧重于识别有影响力的变量、解释单个预测或捕捉降维表示中的方差。因此,它们恢复结构化多特征模式的能力仍不清楚。

在许多实际应用中,尤其是在医学研究中,聚类预期应代表可解释的行为或生理模式,而非孤立的特征效应 [13 (https://arxiv.org/html/2608.05880#bib.bib6),7 (https://arxiv.org/html/2608.05880#bib.bib3)]。此类模式可能涉及协同的特征行为,包括相关变量、共同升高或降低的值,或聚类内部的异质分布。检测这些结构需要能够识别特征间关系的方法,而非独立评估特征。

评估模式检测方法的一个主要障碍是真实数据集中缺乏真实标签(ground truth)。在未知模式的情况下,很难评估一种解释方法是否成功捕获了有意义的结构,还是仅仅产生了看似合理的解释。为解决这一局限,我们构建了一个基于显式注入模式的合成数据集的受控实验框架。每个数据集代表一个由正态分布特征生成的单个聚类,在保持合理噪声水平的同时引入预定义模式。这一设计使得检测到的解释与已知底层结构之间能够进行系统性比较。

在本研究中,我们评估了三种常用的聚类结果分析方法:使用置换特征重要性的随机森林(RF)代理模型、LIME 和 PCA。每种方法均独立应用于包含已知模式类型的合成聚类,包括高值、低值、基于相关性和分布切换模式。通过这一评估,我们不仅检验相关特征是否被识别出来,还检验特征之间的关系——从而检验模式本身——是否被成功恢复。我们的研究发现,尽管这些方法能够突出重要变量,但它们无法可靠地检测多特征模式,这凸显了对专用模式检测方法的需求。

本工作的贡献有三方面:

1. 1. 将模式检测正式界定为不同于聚类和特征归因的任务。
2. 2. 一个用于评估模式检测方法的受控合成基准,具有已知的真实标签。
3. 3. 一项比较分析,展示了广泛使用的可解释性技术的系统性局限,从而推动了对专用模式检测方法论的需求。

通过以经验方式确立这些局限,本工作为未来旨在开发专门检测和量化聚类结果中模式的方法的研究奠定了基础。

## II 背景与相关工作

聚类算法旨在通过根据相似性对观测值进行分组来发现数据中的潜在结构。虽然已有大量研究聚焦于改进聚类算法本身 [5 (https://arxiv.org/html/2608.05880#bib.bib7)],但对结果聚类的解释关注相对较少。在许多应用领域,尤其是医疗保健和生物医学分析中,主要目标不是聚类分配本身,而是识别表征每个聚类的模式。

聚类解释通常使用汇总统计、质心分析或特征排序方法 [12 (https://arxiv.org/html/2608.05880#bib.bib9),4 (https://arxiv.org/html/2608.05880#bib.bib10),7 (https://arxiv.org/html/2608.05880#bib.bib3)]。这些技术描述了聚类之间的差异,但通常独立处理特征,从而限制了它们揭示结构化关系(如相关特征组或聚类内部的异质分布)的能力。因此,研究人员越来越多地使用最初为监督学习开发的模型可解释性方法来分析聚类结果。

一种常见策略是将聚类转化为监督问题,即训练一个分类器来预测聚类成员关系,然后对分类器应用可解释性工具 [1 (https://arxiv.org/html/2608.05880#bib.bib5)]。尽管这种方法很实用,但它隐含地假设为预测解释而设计的方法适用于模式发现——这一假设尚未得到系统性验证。

### II-A 代理模型与特征重要性

代理模型使用更具可解释性的预测模型来近似复杂或不可解释系统的行为 [3 (https://arxiv.org/html/2608.05880#bib.bib8)]。在聚类解释的背景下,聚类标签被视为目标变量,并训练一个监督模型来预测(一对一)聚类成员关系。然后从代理模型中导出解释。

设数据集定义为 \(X\in\mathbb{R}^{n\times d}\),其中 \(n\) 表示样本数量,\(d\) 表示特征数量,聚类标签为 \(y\in\{0,1\}\)。代理模型学习一个映射 \(f:X\rightarrow y\),近似聚类的决策边界。在本工作中,使用随机森林分类器采用一对一(one-versus-rest)形式。特征重要性通过置换重要性计算,该方法衡量当特征值被随机置换时预测性能的下降程度。

置换重要性能够捕捉全局预测相关性,并支持模型学到的非线性关系。然而,特征重要性能够识别有影响力的变量,但并不能直接揭示结构化的多特征模式。

### II-B 局部可解释模型无关解释(LIME)

LIME 是一种局部解释框架,旨在使用局部忠实的可解释近似来解释黑盒模型的单个预测 [11 (https://arxiv.org/html/2608.05880#bib.bib11)]。给定一个实例 \(x\),LIME 在 \(x\) 的邻域内用一个更简单的可解释模型 \(g\) 来近似复杂模型 \(f\)。该过程包括:

1. 1. 选择要解释的特定数据点 \(x\),
2. 2. 在实例 \(x\) 周围生成合成样本 \(S\),
3. 3. 查询黑盒模型以获得 \(x\) 和来自 \(S\) 的样本的预测,
4. 4. 根据与 \(x\) 的邻近程度对 \(S\) 中的样本进行加权,
5. 5. 在 \(S\) 上拟合一个可解释模型,
6. 6. 提取特征贡献作为解释规则。

连续变量通常被离散化为箱体,以产生描述特征范围的人类可读规则。在我们的评估中,对所有连续特征应用离散化,解释限制在固定数量的特征内,并使用预定义数量的合成样本生成。LIME 提供了可解释的局部解释和模型无关的适用性。然而,解释是实例特定的,且对采样变异性敏感,这使得聚合为聚类级模式描述具有挑战性。

### II-C 主成分分析(PCA)

PCA 是一种线性降维技术,广泛用于探索性数据分析和结构发现 [6 (https://arxiv.org/html/2608.05880#bib.bib12)]。给定一个中心化数据矩阵 \(X\),PCA 识别最大化方差的正交方向:

\[
\max_{\|w\|=1}\mathrm{Var}(Xw).
\]

该优化问题导致协方差矩阵的特征值分解:

\[
\Sigma=\frac{1}{n}X^{T}X.
\]

\(\Sigma\) 的特征向量定义了主成分,而特征值表示解释方差。每个主成分计算为 \(w_k\),其中 \(w_k\) 表示与第 \(k\) 个成分相关联的载荷向量,指示贡献强度。高幅值载荷表示较高的重要性。符号相似表示正相关,而符号相反表示负相关。

PCA 能够有效捕捉特征间的线性相关结构。然而,它假设线性关系,并优先考虑方差最大化而非语义模式识别。它并不保证所得成分对应有意义或可解释的模式。

## III 问题定义

聚类算法将数据集 \(X\in\mathbb{R}^{n\times d}\) 划分为 \(K\) 个聚类:

\[
\mathcal{C}=\{C_{1},C_{2},\dots,C_{K}\},\quad\bigcup_{k=1}^{K}C_{k}=X,
\]

使得同一聚类内的点彼此之间的相似度高于与其他聚类中的点的相似度 [5 (https://arxiv.org/html/2608.05880#bib.bib7)]。虽然聚类分配了成员关系,但它并不解释聚类为何存在或哪些特征组合定义了聚类 [2 (https://arxiv.org/html/2608.05880#bib.bib1)]。我们将模式检测问题定义为在给定聚类中识别结构化的、多特征关系的任务,这些关系将该聚类与其他聚类或随机噪声区分开来。

### III-A 模式的定义

设 \(C_k\) 表示一个聚类,\(X_{C_{k}}\in\mathbb{R}^{|C_{k}|\times d}\) 为其相关数据。一个模式 \(P\) 定义为特征子集 \(F_{P}\subseteq\{1,2,\dots,d\}\) 以及在 \(X_{C_{k}}\) 上的联合特征行为,该行为满足以下一个或多个性质:

1. 1. **基于值的模式**:\(F_{P}\) 中的特征在大多数样本中一致地取高值或低值。
2. 2. **基于相关性的模式**:\(F_{P}\) 中的特征在聚类内具有统计依赖性,无论是正相关还是负相关:
   \[
   \mathrm{Corr}(X_i,X_j)\neq 0,\quad\forall i,j\in F_{P}.
   \]
3. 3. **分布模式**:\(F_{P}\) 中的特征表现出异质分布,例如多模态行为。

### III-B 模式检测的目标

给定聚类 \(C_k\),模式检测方法的目标是输出一组模式:

\[
\mathcal{P}_{k}=\{P_{1},P_{2},\dots,P_{N_{k}}\},
\]

其中每个模式 \(P_i\) 识别:

* 所涉及的特征子集 \(F_{P_{i}}\),
* 联合行为的类型(值、相关性、分布性),
* 模式在聚类中的强度或显著性。

### III-C 评估背景

该问题在受控合成框架下进行评估,其中聚类包含已知类型的模式(基于值的、基于相关性的、切换/多模态的)。这使得能够严格评估现有方法(代理模型、LIME、PCA)是否能够正确识别上述模式。

## IV 合成数据设计

为了验证模式检测方法能够可靠地识别聚类结果中的有意义结构,我们构建了一套受控合成数据集。仅使用真实世界数据集进行评估不足以实现这一目的,因为其真实的底层模式通常是未知的。合成数据能够引入预定义的真实标签模式,从而可以客观评估分析方法是否成功恢复已知结构。

模式是与医学领域专家合作定义的,以反映临床数据集中常见的行为,包括协调的特征行为、极端值特征以及患者亚组内的异质分布。每个合成数据集均被设计为代表上游聚类算法产生的单个聚类的结果,从而将模式检测任务与聚类本身分离开来。

考虑了五类模式:

* **高值**:选定的特征取值接近其分布的上端(2–3 个特征)。
* **低值**:选定的特征取值接近其分布的下端(2–3 个特征)。
* **正相关**:选定的特征表现出正线性相关(2–4 个特征)。
* **负相关**:选定的特征表现出负线性相关(2–3 个特征)。
* **高-低**:一些特征取值接近其分布的上端或下端(2 个高值,2 个低值)。
* **切换高–低**:选定的特征表现出异质行为,其中大约一半的样本取高值,剩余一半取低值(2 或 4 个特征)。

每个模式涉及预定义数量的随机选择特征,范围从两个到四个,如括号中所示。每个合成数据集包含 \(n=500\) 个样本。

相似文章

基于一致性和标签解耦的可解释判别性文本表示

arXiv cs.CL

本文提出了一种基于注释者间一致性和标签解耦的可解释文本表示的操作性标准,并引入了LLM辅助特征发现(LFD)方法,该方法通过跨LLM一致性筛选和残差预测增益来选择清晰、标签解耦的特征。实验表明,LFD在保持预测性能的同时,产生了更可解释的特征,并通过人工审计进行了验证。