基于可微D-vine Copula的局部异常检测

arXiv cs.AI 论文

摘要

提出了一种新颖的D-vine copula估计框架,该框架利用基于梯度的最大似然估计和束搜索以获得更好的全局拟合,并给出了一种通过共形预测进行不确定性量化的局部异常检测方法。

arXiv:2607.25020v1 Announce Type: new 摘要:Vine copula通过将复杂多元分布层次分解为二元pair-copula,提供了一种灵活的建模框架。拟合D-vine需要从编码不同依赖模式的候选集合中,为每个pair-copula选择copula族和参数配置。随着变量和候选族数量的增加,可能的配置数量组合增长。现有的拟合过程通过顺序贪婪决策来应对这一挑战,在每一步中选择单一的局部最优族,从而可能丢弃那些能实现更好全局拟合的配置。为克服此限制,我们提出了一种新颖的估计框架,它将基于梯度的最大似然估计(通过我们完全可微的实现)与束搜索策略相结合,在拟合过程中维护多个竞争的D-vine配置。这使得我们能够更广泛地探索配置空间,同时保持计算可行性。基于拟合的D-vine,我们引入了一个局部异常检测框架,利用层次分解生成全局异常分数和边级解释。通过Mondrian共形预测提供统计保证,而pair-copula结构使得异常能够定位到特定的变量关系。我们在基准数据集和真实数据集上评估了所提出的框架,展示了其在具有不确定性量化的可解释异常检测中的有效性。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:53

# 基于可微D-Vine Copula的局部化异常检测
来源:https://arxiv.org/html/2607.25020
11institutetext:的里雅斯特大学,的里雅斯特,意大利
22institutetext:Idrostudi srl,的里雅斯特,意大利
22email:nicholasandrea\.pearson@phd\.units\.itFrancesca Zanello Davide RussoLuca Bortolussi Francesca Cairoli

###### 摘要

Vine copulas 通过将多元分布层次分解为二元 pair-copulas,为建模复杂多元分布提供了一个灵活框架。拟合 D-vine 需要从一组编码不同依赖模式的候选族中,为每个 pair-copula 选择一个 copula 族和参数配置。随着变量和候选族数量的增加,可能配置的数量呈组合增长。现有的拟合过程通过顺序贪心决策来解决这一挑战,每一步只采用一个局部最优族,可能会丢弃那些能产生更好全局拟合的配置。为了克服这一局限,我们提出了一种新的估计框架,它将基于梯度的最大似然估计(通过我们的完全可微实现实现)与波束搜索策略相结合,在整个拟合过程中维护多个竞争的 D-vine 配置。这使得在保持计算可行性的同时,能够更广泛地探索配置空间。基于拟合的 D-vine,我们引入了一个局部化异常检测框架,利用层次化分解产生全局异常分数和边缘级解释。通过 Mondrian 共形预测提供统计保证,而 pair-copula 结构则将异常定位到特定的变量关系。我们在基准数据集和真实数据集上评估了所提出的框架,证明了其在具有不确定性量化的可解释异常检测中的有效性。

## 1 引言

异常检测可以看作是识别偏离正常数据模式观测值的任务。它在诸如欺诈检测、工业监控和医疗保健等广泛的实际应用中扮演着重要角色[chandola2009anomaly]。在这些场景中,错误识别的后果可能很严重,因此不仅需要预测观测值是否异常,还需要量化相应预测的可靠性。通常,定位每个异常、识别导致异常的变量并提供关于其根本原因的可操作见解是很有价值的。为了满足这些需求,我们将任务视为一个两阶段问题。首先,我们在正常条件下估计观测值的联合分布,通过 copula 建模获得正常行为模型。其次,我们基于此分布,将异常检测视为二分类任务,并使用一个分类器,其预测通过共形预测[angelopoulos2023conformal]提供可靠性保证。

Copulas 通过将边缘行为与依赖结构分离,为建模一组变量的联合分布提供了一个灵活框架[sklar1959fonctions]。标准多元 copula 难以扩展到高维[nelsen2006introduction],这一局限由 pair-copula 构造克服[aas2009pair],它将多元分布分解为一系列二元 copula。其中,我们关注 D-vine,它沿着路径顺序排列变量[czado2019analyzing]。拟合 D-vine 需要为每个 pair-copula 选择一个族和参数,这是一个组合问题,现有方法要么探索的配置太少[dissmann2013selecting],要么计算成本很高[chapon2023imputation]。

我们提出了一种方法,结合了高效的 D-vine 拟合过程与提供每类可靠性保证的共形异常检测方案。我们的贡献是:

1. i\.一个完全可微的 PyTorch 实现的二元 copula 族,支持基于梯度的参数估计和 GPU 加速。
2. ii\.一种用于 D-vine 拟合的波束搜索过程,在每个 pair-copula 处评估所有候选族,并仅向前传播最有希望的配置。同时评估多个候选路径,允许在配置空间中进行更广泛的探索,而无需承担穷举搜索的成本。
3. iii\.一种异常检测过程,将检测框定为正常与异常行为之间的分类任务。应用 Mondrian 共形预测,以获得预测区域,保证以规定的置信水平包含每个类别的真实标签。然后利用 D-vine 的层次结构,将每个异常定位到分解中的单个 pair-copula,从而定位到负责的变量。

**相关工作**。已经提出了几种*拟合 D-vines* 的方法,其中标准方法[dissmann2013selecting]在贪心过程中选择一个单一配置,限制了探索的配置数量。贝叶斯替代方案,如[chapon2023imputation]的 RJMCMC 过程,完全探索配置空间,但遭受高计算成本和收敛问题。*基于 copula 的异常检测* 的例子包括 CoCAI[pearson2025cocai],它将 copula 建模与共形预测相结合用于时间序列,以及 COPOD[li2020copod],它使用经验 copula 进行异常值检测。最后,[horvath2020copula] 通过定义在生成树结构上的无条件 pair-copulas 来研究异常依赖模式。

## 2 背景

### 2\.1 Copula 理论

设 X=\(X_1,\dots,X_d\) 是一个随机向量,具有联合累积分布函数 \(CDF\) F 和连续的边缘 CDF \(F_1,\dots,F_d\)。通过概率积分变换,变量 \(U_i=F_i(X_i)\),其中 \(i=1,\dots,d\),在 \([0,1]\) 上均匀分布[yan2007enjoy]。\((U_1,\dots,U_d)\) 的联合分布称为 *copula*,并*刻画了 X 独立于其边缘的依赖结构*[nelsen2006introduction]。copula 理论的核心结果是 Sklar 定理[sklar1959fonctions]。

###### 定理 2\.1 Sklar 定理

设 F 是一个 d 维 CDF,具有连续边缘 \(F_1,\dots,F_d\)。则存在唯一的 copula \(C:[0,1]^d \to [0,1]\),使得

\[
F(x_1,\dots,x_d) = C\left(F_1(x_1),\dots,F_d(x_d)\right)。
\]

反之,对于任何 copula C 和边缘 CDF \(F_1,\dots,F_d\),方程 (1) 定义了一个有效的 d 维分布。

Sklar 定理将边缘行为与依赖结构分离。如果 C 是绝对连续的,其 copula 密度定义为

\[
c(u_1,\dots,u_d) = \frac{\partial^d C(u_1,\dots,u_d)}{\partial u_1 \cdots \partial u_d}。
\]

如果边缘是绝对连续的,具有密度 \(f_1,\dots,f_d\),则联合密度分解为

\[
f(x_1,\dots,x_d) = c\left(F_1(x_1),\dots,F_d(x_d)\right) \prod_{i=1}^d f_i(x_i)。
\]

这种分解构成了基于似然推断的基础,特别是 pair-copula 构造[aas2009pair]。

#### 2\.1\.1 Pair-Copula 构造

由于灵活性和依赖性假设的限制,直接使用高维 copula 建模通常不可行[min2010bayesian]。Pair-copula 构造通过将多元 copula 分解为一组二元 copula 来解决这个问题,从而能够灵活且可扩展地建模复杂依赖结构[aas2009pair]。二元 copula 对两个变量之间的依赖关系进行建模,也称为 pair-copula。它们通常分为椭圆族和阿基米德族。椭圆族 copula,如高斯和 Student-t copula,以对称依赖模式为特征。相比之下,阿基米德族 copula,包括 Gumbel 和 Clayton copula,捕捉非对称和尾部依赖行为[dissmann2013selecting]。pair-copula 捕捉的依赖关系由一组特定于族的参数刻画,这些参数控制相应变量之间关系的强度。两个变量同时取极高或极低值的概率可以通过 copula 的尾部依赖系数来总结,该系数取值在 \([0,1]\) 内,接近零的值表示尾部独立,而接近一的值表示强依赖[nelsen2006introduction]。附录LABEL:app:families 提供了每个 copula 族尾部依赖的更详细特征。二元 copula 的一个关键特性是条件分布可以通过 copula 的偏导数来表示[schepsmeier2014derivatives]。为了符号方便,我们将这些条件分布函数表示为 h-函数,其中:

\[
h_1^C(u_1,u_2) = \frac{\partial C(u_1,u_2)}{\partial u_2}, \quad h_2^C(u_1,u_2) = \frac{\partial C(u_1,u_2)}{\partial u_1}。
\]

这些函数在 PCC 中起着核心作用,使得能够从二元 copula 开始递归构建高维依赖模型。

图 1: d=5 个变量的 D-vine 分解。每行是一棵树 T_1 - T_4,每条边是一个 pair-copula。T_1 中的节点是被建模的变量,而在后续树中,它们对应于前一个树的边。虚线箭头表示 h-函数(或 T_1 中的伪观测值 u_i),它们将数据从一棵树传播到下一棵。一个 d 维的 PCC 由 d(d-1)/2 个 pair-copula 组成[aas2009pair]。一种常见的 PCC 结构是 *D-vine*,它将这些 pair-copula 排列为跨 d-1 棵链接树的边(图1)。第一棵树包含所选顺序中相邻变量之间的无条件 pair-copula。更高级别的树引入渐进更远变量之间的条件 pair-copula,以位于它们之间的变量为条件。所需的条件分布通过 h-函数递归计算[hobaek2013parameter]。

这种构造产生了 d 维密度的分解:

\[
f(x_1,\dots,x_d) = \prod_{i=1}^d f_i(x_i) \cdot \prod_{\ell=1}^{d-1} \prod_{i=1}^{d-\ell} c_{i,i+\ell \mid D_{i,\ell}}(F_{i\mid D_{i,\ell}}, F_{i+\ell\mid D_{i,\ell}})
\]

其中 \(D_{i,\ell} = \{i+1,\dots,i+\ell-1\}\) 表示条件 pair-copula \(c_{i,i+\ell \mid D_{i,\ell}}\) 的中间变量集[czado2019analyzing]。例如,当 d=3 时:

\[
f(x_1,x_2,x_3) = f_1(x_1)f_2(x_2)f_3(x_3) \, c_{12}(u_1,u_2) \, c_{23}(u_2,u_3) \, c_{13|2}(u_{1|2},u_{3|2}),
\]

其中 \(u_{1|2}\) 和 \(u_{3|2}\) 通过 h-函数获得。

拟合 D-vine 需要为每个 d(d-1)/2 个 pair-copula 选择 copula 族及其参数[dissmann2013selecting]。由于可能配置的数量随着候选族和变量顺序的数量呈组合增长,穷举搜索很快变得不可行[chapon2023imputation]。此外,pair-copula 不能独立优化:更高级别树中使用的条件分布依赖于较低级别树的 h-函数,导致早期建模决策在整个 vine 中传播[hobaek2013parameter]。

### 2\.2 共形预测

共形预测通过为每个测试样本 x 关联一个预测区域(而不是单点预测)来提供无分布不确定性量化[angelopoulos2023conformal]。给定一个训练好的分类器,使用单独的校准集 D_cal 来计算校准样例的非一致性分数 ncf_i。给定显著性水平 α,对于候选标签 y,测试点 (x,y) 被分配一个非一致性分数 ncf(x,y),然后与基于校准分数计算的阈值进行比较[fontana2023conformal]:

\[
\tau_\alpha = \frac{\lceil (|D_{cal}|+1)(1-\alpha) \rceil}{|D_{cal}|} \text{-th quantile of } \{ \text{ncf}_i : i \in D_{cal} \}。
\]

预测区域定义为:

\[
\Gamma_\alpha(x) = \{ y \in \{0,1\} : \text{ncf}(x,y) \le \tau_\alpha \}。
\]

在二分类中,Γ_α(x) 可能包含一个标签(自信预测)、两个标签(不确定性),或者罕见地,没有标签。*Mondrian* 共形预测为每个类别单独计算校准分数,从而提供类别条件覆盖保证[vovk2005algorithmic]。假设属于同一类别的校准和测试观测值之间是可交换的,则:

\[
\Pr_{(x,y)} (y \in \Gamma_\alpha(x)) \ge 1 - \alpha, \quad y \in \{0,1\},
\]

这意味着对于每个类别,预测集以至少 1-α 的概率包含真实标签。这些保证在有限样本中成立,并且不依赖于底层数据分布的假设[fontana2023conformal]。

## 3 方法

本节介绍我们用于拟合 D-vine copula 的可微波束搜索过程。我们解决了 D-vine 模型选择的两个关键挑战:可能族分配的组合增长以及贪心顺序拟合导致的误差传播。该方法将 pair-copula 参数的基于梯度最大似然估计与波束搜索策略相结合,在拟合过程中维护多个候选 D-vine 配置。

### 3\.1 拟合 D-Vine Copula

我们假设可以访问一个适合 copula 建模的连续变量数据集,其中每个观测值被标记为正常或异常。数据被划分为三个不相交的子集:训练集、校准集和测试集。我们用 \(X_r^y\) 表示对应于分割 \(r \in \{tr, ca, te\}\) 和标签 \(y \subset \{0,1\}\) 的子集,其中 0 表示正常观测值,1 表示异常观测值。因此,\(X_{tr}^{(0,1)}\) 用于模型拟合,\(X_{ca}^{(0,1)}\) 用于校准,\(X_{te}^{(0,1)}\) 用于评估。

给定一个数据集 \(X \equiv X_{tr}^0 \in \mathbb{R}^{n \times d}\)

相似文章

含污染观测的保形变点定位与根因分析

arXiv cs.LG

本文提出加权保形方法,用于变点定位与根因分析,通过降低可能受污染数据的权重,利用不确定性信号与元学习,在污染观测下缩减置信集大小。

在线局部化共形预测

arXiv cs.LG

本文提出了在线局部化共形预测(OLCP),旨在解决在线学习和时间序列设置中的协变量异质性问题。文章引入了用于带宽选择的 OLCP-Hedge 算法,并证明与现有基线相比,该方法在获得更窄预测集的同时,仍能保持有效的长期覆盖率。