通过XAI驱动的数据缩减实现时间序列分类的扩展

arXiv cs.LG 论文

摘要

本文介绍了drXAI,一种利用XAI归因减少时间序列分类数据大小的方法,在保持准确性的同时实现80-90%的数据缩减,使大型模型能够扩展。

arXiv:2607.15774v1 公告类型:新 摘要:时间序列的可解释人工智能(XAI)在算法上取得了显著进展,但其在下游任务中提供可衡量的性能提升的效用仍未得到充分探索。本文通过引入drXAI填补了这一空白,这是一种新颖的方法,将XAI归因方法重新用于时间序列分类(TSC)中的有效数据缩减。现代TSC的核心挑战是可扩展性;最先进的模型(如Transformer)在序列长度上呈二次复杂度,在通道数量上呈线性复杂度。这使得它们在处理大规模数据集时计算成本过高。drXAI通过使用快速的GPU加速分类器(Hydra)生成局部归因来解决这一问题。我们将这些归因聚合为全局特征重要性评分,并采用自动化肘部法则启发式方法选择最显著的特征,无需手动设置阈值。 我们在合成数据集和真实世界的单变量及多变量数据集上评估了我们的方法。在合成基准上,drXAI成功恢复了传统基线方法无法识别的真实特征。在真实世界数据上,drXAI实现了80%到90%的数据缩减,同时保持与在完整数据集上训练的模型相当的分类准确率。最重要的是,我们展示了drXAI使得像ConvTran这样的资源密集型模型能够扩展到以前由于内存限制而无法访问的数据集。我们的结果表明,使用XAI不仅是为了可解释性,更是作为时间序列分析中特征选择和可扩展性的强大工具。我们的所有代码和数据均已公开提供。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:31

# 通过基于XAI的数据缩减扩展时间序列分类规模
来源:https://arxiv.org/html/2607.15774
11institutetext:爱尔兰都柏林大学学院计算机科学学院
11email:davide\.serramazza@ucdconnect\.ie
11email:\{thach\.lenguyen,georgiana\.ifrim\}@ucd\.ie###### 摘要

时间序列的可解释人工智能(XAI)在算法层面已取得显著进展,但其为下游任务提供可测量性能增益的实际效用仍待深入探索。本文通过引入drXAI填补了这一空白,这是一种新颖的方法论,将XAI归因方法重新用于时间序列分类(TSC)中的有效数据缩减。现代TSC的核心挑战是可扩展性;最先进的模型(如Transformer)在序列长度上具有二次复杂度,在通道数量上具有线性复杂度。这使得它们在处理大规模数据集时在计算上成本过高。drXAI通过使用快速的GPU加速分类器(Hydra)生成局部归因来解决这个问题。我们将这些归因聚合成全局特征重要性分数,并采用自动肘部剪切启发式方法选择最显著的特征,无需手动设置阈值。我们在合成和真实世界的单变量及多变量数据集上评估了我们的方法。在合成基准上,drXAI成功恢复了传统基线方法无法捕捉的真实特征。在真实数据上,drXAI实现了80-90%的数据缩减,同时保持了与在全数据集上训练的模型相当的分分类精度。最重要的是,我们展示了drXAI允许像ConvTran这样的资源密集型模型扩展到以前因内存限制而无法处理的数据集。我们的结果表明,XAI不仅可用于解释性,还可作为时间序列分析中特征选择和可扩展性的稳健工具。我们的所有代码和数据均已公开。

## 1 引言

可解释人工智能(XAI)领域近年来经历了显著增长,尤其是在时间序列分类(TSC)领域。XAI的一个主要关注点是特征归因,它量化了输入特征对模型预测的重要性。该领域在时间序列数据归因方法的效率和效果方面取得了显著进展\[theissler2022\]。

尽管有这些算法上的进步,XAI作为实现其他计算任务中可测量性能增益的工具的实用性仍未得到充分探索。我们的工作提供了一种范式转变:将XAI不仅视为解释复杂模型的工具,而且作为增强模型效率和可扩展性的实用工具。本文通过引入drXAI(基于XAI的数据缩减)填补了这一空白,这是一种新颖的与归因无关的方法论,将归因方法重新用于TSC中的有效特征选择。对于许多最先进的TSC模型而言,时间复杂度随特征数量线性增长,甚至随序列长度二次增长(例如,transformer);此外,这些模型还需要大量内存。这种计算负担通常是训练大规模、高维度数据集的限制。扩展这些模型的一种方法是训练它们使用缩减但信息量高的特征集。我们的工作直接实现了这一点:通过使用XAI识别最重要的特征,从而在不牺牲关键信息的情况下降低数据维度。据我们所知,这是首个使用XAI进行特征选择以扩展时间序列分类方法的工作。

drXAI是一种包装器特征选择方法,分两个阶段运行:首先训练一个TSC模型,称为解释器分类器,然后为其预测生成解释。在本工作中,考虑到速度,我们使用Hydra\[dempster2024highly\]的GPU实现作为解释器分类器,将归因限制在解释器集(训练集的一个子集)上,并应用轻量级解释器,如特征消融。

对于多变量时间序列分类(MTSC)数据集,我们专注于*通道选择*。我们提出了一种快速的方法,通过聚合局部归因值、对通道进行排序并选择子集来计算全局通道重要性。然后,我们在缩减后的数据上重新训练SOTA分类器,并测量精度和计算增益。对于单变量TSC(UTSC)数据集,我们应用相同的算法计算全局时间点重要性,然后通过连续*时间点选择*进行数据缩减。这对于非常长的时间序列特别有效,因为由于需要大量计算资源,SOTA TSC方法在这些序列上难以扩展。

本文的主要贡献如下:

1. 1. 我们开发了drXAI,一个通用的框架,利用XAI归因从MTSC和UTSC数据集中选择特征。该算法与归因方法无关,并且足够通用以支持通道和时间点选择。作为其中一部分,我们还研究了用于模拟归因方法中数据缺失的*背景数据*,并提出了Proto,一种单实例背景,优于流行归因方法中常见的零基线\[kokhlikyan2020captum\]。
2. 2. 使用合成MTSC数据,我们展示了drXAI只选择信息通道,而基线方法则不然。在合成UTSC数据上,它成功选择了超过90%的相关特征,而基线方法最多只能达到33%。在真实数据集上,drXAI提供了数据缩减与精度之间的最佳权衡,在大多数情况下,在MTSC和UTSC实验中都能匹配使用所有特征训练的模型。
3. 3. 我们证明,通过使用快速分类器(Hydra)和归因方法(特征消融)进行数据选择,我们可以有效地训练更精确但资源密集型的模型(例如,ConvTran、MultiRocket-Hydra\[middlehurst2023bake\])。这使得计算成本高的模型能够成功训练,克服了在因内存限制而无法在整个数据集上训练模型的使用场景中的瓶颈。
4. 4. 为鼓励该领域的进一步研究和可重复性,我们公开了所有数据和代码111https://github.com/mlgig/drXAI。

## 2 背景

### 2.1 问题定义

我们将时间序列数据集DD表示为一个张量,维度为n×d×Ln×d×L,其中nn、dd和LL分别表示数据中的样本数、通道数和时间点数。在UTS情况下,d=1d=1。

一个(已训练的)分类模型clfclf预测时间序列实例DiDi(1≤i≤n1≤i≤n)的类别cici。解释器expexp通过生成一组归因图AA(一个与DD维度相同的归因张量,n×d×Ln×d×L)来解释clfclf在DD上的预测,其中Ai,j,kAi,j,k表示Di,j,kDi,j,k对于模型clfclf在实例DiDi上的预测的归因(即相关性)。

我们将特征集记为F={f1,f2,...,fm}F={f1,f2,...,fm},其中mm是特征总数。每个特征代表时间序列数据的一部分,例如,同一时间段内的数据、同一时间步或同一通道的数据。所有特征的并集构成完整的时间序列。我们专注于选择特征子集Fsel⊂FFsel⊂F的任务。我们非正式地将这个新集合称为*选定特征*,将DFselDFsel表示为仅包含这些特征的新数据集。

在本工作中,我们专注于TSC的数据缩减,组织为两个子任务:MTSC数据集的*通道选择*问题和UTSC数据集的*时间点选择*。对于前者,每个特征代表一个通道(m=dm=d);对于后者,每个特征代表一个时间点(m=Lm=L)。为避免混淆,在描述具体的数据缩减任务时,我们会明确指出关注的特征类型。

### 2.2 时间序列分类

近年来TSC方面的研究显著推进了大规模TSC基准\[uea-mtsc-archive,dempster2025monstermonashscalabletime\]以及TSC算法精度和效率的发展\[foumani2024improving,dempster2024highly\]。虽然许多算法在基准上达到了顶尖精度,但它们资源密集型,尤其是在大规模数据集或非常长的时间序列上\[middlehurst2023bake\]。我们讨论几个相关的SOTA分类器及其计算复杂度。

**解释器分类器。** 我们提出的方法drXAI是一种用于特征选择的包装器方法,需要有一个快速的分类器来解释。Hydra是一种TS转换算法,结合了基于卷积和基于字典的方面:gg组kk个卷积核在TS上滑动,每个组在每个时间点对最匹配的核进行计数。然后将特征输入岭分类器。Hydra的时间复杂度主要由卷积和竞争性计数过程决定。由于kk通常是固定常数,时间复杂度实际上是线性的O(ndL)O(ndL)。Hydra的内存复杂度为O(nk+kd)O(nk+kd)。在我们的实验中,我们使用了来自\[dempster2024highly\]的快速Hydra GPU实现,它可以很好地扩展到非常大的数据集。

**SOTA时间序列分类器。** 为了评估数据选择FselFsel的质量,我们在缩减后的数据集DFselDFsel上训练了以下三个SOTA分类器。

*   **MultiRocket-Hydra (MRH)**\[middlehurst2023bake\] 使用Hydra特征与MultiRocket\[tan2022multirocket\]特征的拼接。MultiRocket还将核应用于序列的一阶差分,并通过四个池化算子(MPV、MIPV、LSPV、PPV)提取特征。MultiRocket流水线比Hydra计算量更重。虽然对于输入仍然是线性的,但MultiRocket的常数更大,提取的特征数量也更多(默认约50,000个特征),这使得它在时间和内存方面都更昂贵,特别是对于长时间序列。此外,由于默认情况下每个核最多应用于8个随机通道,这两种算法也从少于8个通道的选择中受益。除了效率之外,将输入限制为信息特征可以进一步提高模型的鲁棒性和精度。
*   **ConvTran**\[foumani2024improving\] 是一种针对MTSC量身定制的最新transformer模型。它使用卷积层从原始序列中提取特征,然后在分词后输入transformer。与Hydra相比,ConvTran的复杂度显著增加。Hydra使用随机核和线性分类器,而ConvTran是一种完全可训练的Transformer-CNN混合体,利用自注意力机制。ConvTran的复杂度由注意力机制的二次性质和卷积嵌入层的参数决定。其成本相对于序列长度是二次的O(nL2dembedding)O(nL2dembedding),相对于通道数量是线性的。对于L>1000L>1000的非常长的序列,这将比Hydra的O(nL)O(nL)慢得多。
*   **InceptionTime**\[ismail2020inceptiontime\] 是另一种深度学习分类器,具体来说是一种由5个vanilla Inception网络(CNN)组成的集成方法。其复杂度主要由其深度Inception模块决定,这些模块通过瓶颈层应用不同核大小的并行卷积,捕获局部和长期的时间关系。与ConvTran不同,InceptionTime相对于序列长度和通道是线性的,但由于它需要反向传播,常数因子和硬件需求远高于Hydra。

### 2.3 时间序列分类的XAI方法

我们的方法与*归因方法无关*,即它只需要一个归因图作为输入,无论哪个算法计算了它。在本工作中,我们选择了两种已适应于TS并在该领域有效工作的基于*置换*的归因方法\[serramazza2024improving,turbe2023evaluation\]。这些方法需要*背景集*来模拟计算归因时的数据缺失。本研究中未考虑基于*梯度*的归因方法,主要是因为它们无法与非基于梯度的算法(如Hydra和MultiRocket)一起工作。在本文剩余部分,我们用*解释器*来指代XAI归因方法。

*   **Shapley值采样 (SVS)** 是对原始工作中描述的Shapley值\[lundberg2017unified\]的一种近似。它对SHAP公式应用采样,随机排列要解释的特征,并将它们依次添加到背景集中的每个样本。归因值是由这些替换导致的模型输出变化。尽管被证明在指出重要特征方面有效\[serramazza2023evaluating\],但由于需要大量的特征排列,该方法需要大量的计算时间。一些针对时间序列的适应方法,例如通过TS分段对特征进行分组,已被证明可以大幅减少计算时间,同时保持准确性\[serramazza2024improving\]。
*   **特征消融 (FA)**\[kokhlikyan2020captum\] 比SHAP简单且快得多。它顺序地将每个特征替换为背景数据集中样本的对应值。与SVS一样,归因值是替换特征值后模型输出的差异。

我们使用了\[serramazza2024short\]中为这两个解释器提供的实现。

### 2.4 TSC的特征选择

我们首先讨论近期关于*MTSC通道选择*的工作。在\[dhariyal2023scalable\]中,作者提出了一种监督算法,用于为MTSC数据集选择通道子集。该算法有两个变体,ECS和ECP,它们基于通道的判别能力进行选择,判别能力通过类质心之间的欧氏距离估计:距离越大,判别能力越强。根据原始论文,这种filter方法平均可以减少70%的数据,而不会损害分类器的准确性。另一个与ECS和ECP直接比较的近期工作是TSelect\[nuyts2025tselect\],它是一种wrapper方法,为每个通道训练一个逻辑回归分类器,该分类器基于每个通道提取的5个计算成本低的特征。然后,这些模型用于确定要重新训练哪些相关通道:基于这些模型精度、冗余预测等的各种过滤器,选择丢弃哪些通道。

时间序列数据的缩减也可以通过将高维时间序列投影到低维潜在空间来进行\[data-reduction-survey\]。已知的方法包括自编码器、主成分分析、奇异值分解、离散傅里叶/小波变换和降采样。然而,这些都是*降维技术*,将时间序列投影到不同的空间,从而丢失原始特征。对于许多应用,保持数据的原始表示以便于审计重要特征是很重要的,例如监测人类健康等医疗应用。因此,这些转换方法不在本文讨论范围之内。

对于UTSC的*时间点选择技术*,一种简单有效的方法(特别是对于长时间序列)是使用随机森林重要性(RFI),利用训练期间计算的每个特征的重要性(不纯度减少)。另一种替代方法是计算每个特征与TSC任务目标之间的互信息(MI)\[scikit-learn\]。

## 3 提出的方法
(原文到此结束,但根据翻译要求,我们只翻译了提供的部分。由于用户要求翻译给定的markdown文章内容,且提供的文本以“## 3 Proposed Methodology”章节标题结束,没有后续内容。但为了完整性,我们应翻译到提供的末尾。实际上用户提供了从摘要到第3节开头的内容。按照规则,我们只翻译用户提供的原文。原文在“## 3Proposed Methodology”后没有更多内容,所以翻译到此结束。但注意标题后有换行,我们保持格式。实际上标题“## 3Proposed Methodology”是单独一行,后面可能没有内容,但用户提供的文本就是以这个标题结束的。我们按原文翻译。

注意:原文中“## 3Proposed Methodology”没有空格,按原文保留。)

我们保持忠实于原文,只翻译所给文本。# 通过基于XAI的数据缩减扩展时间序列分类规模
来源:https://arxiv.org/html/2607.15774
11institutetext:爱尔兰都柏林大学学院计算机科学学院
11email:davide\.serramazza@ucdconnect\.ie
11email:\{thach\.lenguyen,georgiana\.ifrim\}@ucd\.ie###### 摘要

时间序列的可解释人工智能(XAI)在算法层面已取得显著进展,但其为下游任务提供可测量性能增益的实际效用仍待深入探索。本文通过引入drXAI填补了这一空白,这是一种新颖的方法论,将XAI归因方法重新用于时间序列分类(TSC)中的有效数据缩减。现代TSC的核心挑战是可扩展性;最先进的模型(如Transformer)在序列长度上具有二次复杂度,在通道数量上具有线性复杂度。这使得它们在处理大规模数据集时在计算上成本过高。drXAI通过使用快速的GPU加速分类器(Hydra)生成局部归因来解决这个问题。我们将这些归因聚合成全局特征重要性分数,并采用自动肘部剪切启发式方法选择最显著的特征,无需手动设置阈值。我们在合成和真实世界的单变量及多变量数据集上评估了我们的方法。在合成基准上,drXAI成功恢复了传统基线方法无法捕捉的真实特征。在真实数据上,drXAI实现了80-90%的数据缩减,同时保持了与在全数据集上训练的模型相当的分类精度。最重要的是,我们展示了drXAI允许像ConvTran这样的资源密集型模型扩展到以前因内存限制而无法处理的数据集。我们的结果表明,XAI不仅可用于解释性,还可作为时间序列分析中特征选择和可扩展性的稳健工具。我们的所有代码和数据均已公开。

## 1 引言

可解释人工智能(XAI)领域近年来经历了显著增长,尤其是在时间序列分类(TSC)领域。XAI的一个主要关注点是特征归因,它量化了输入特征对模型预测的重要性。该领域在时间序列数据归因方法的效率和效果方面取得了显著进展\[theissler2022\]。

尽管有这些算法上的进步,XAI作为实现其他计算任务中可测量性能增益的工具的实用性仍未得到充分探索。我们的工作提供了一种范式转变:将XAI不仅视为解释复杂模型的工具,而且作为增强模型效率和可扩展性的实用工具。本文通过引入drXAI(基于XAI的数据缩减)填补了这一空白,这是一种新颖的与归因无关的方法论,将归因方法重新用于TSC中的有效特征选择。对于许多最先进的TSC模型而言,时间复杂度随特征数量线性增长,甚至随序列长度二次增长(例如,transformer);此外,这些模型还需要大量内存。这种计算负担通常是训练大规模、高维度数据集的限制。扩展这些模型的一种方法是训练它们使用缩减但信息量高的特征集。我们的工作直接实现了这一点:通过使用XAI识别最重要的特征,从而在不牺牲关键信息的情况下降低数据维度。据我们所知,这是首个使用XAI进行特征选择以扩展时间序列分类方法的工作。

drXAI是一种包装器特征选择方法,分两个阶段运行:首先训练一个TSC模型,称为解释器分类器,然后为其预测生成解释。在本工作中,考虑到速度,我们使用Hydra\[dempster2024highly\]的GPU实现作为解释器分类器,将归因限制在解释器集(训练集的一个子集)上,并应用轻量级解释器,如特征消融。

对于多变量时间序列分类(MTSC)数据集,我们专注于*通道选择*。我们提出了一种快速的方法,通过聚合局部归因值、对通道进行排序并选择子集来计算全局通道重要性。然后,我们在缩减后的数据上重新训练SOTA分类器,并测量精度和计算增益。对于单变量TSC(UTSC)数据集,我们应用相同的算法计算全局时间点重要性,然后通过连续*时间点选择*进行数据缩减。这对于非常长的时间序列特别有效,因为由于需要大量计算资源,SOTA TSC方法在这些序列上难以扩展。

本文的主要贡献如下:

1. 1. 我们开发了drXAI,一个通用的框架,利用XAI归因从MTSC和UTSC数据集中选择特征。该算法与归因方法无关,并且足够通用以支持通道和时间点选择。作为其中一部分,我们还研究了用于模拟归因方法中数据缺失的*背景数据*,并提出了Proto,一种单实例背景,优于流行归因方法中常见的零基线\[kokhlikyan2020captum\]。
2. 2. 使用合成MTSC数据,我们展示了drXAI只选择信息通道,而基线方法则不然。在合成UTSC数据上,它成功选择了超过90%的相关特征,而基线方法最多只能达到33%。在真实数据集上,drXAI提供了数据缩减与精度之间的最佳权衡,在大多数情况下,在MTSC和UTSC实验中都能匹配使用所有特征训练的模型。
3. 3. 我们证明,通过使用快速分类器(Hydra)和归因方法(特征消融)进行数据选择,我们可以有效地训练更精确但资源密集型的模型(例如,ConvTran、MultiRocket-Hydra\[middlehurst2023bake\])。这使得计算成本高的模型能够成功训练,克服了在因内存限制而无法在整个数据集上训练模型的使用场景中的瓶颈。
4. 4. 为鼓励该领域的进一步研究和可重复性,我们公开了所有数据和代码111https://github.com/mlgig/drXAI。

## 2 背景

### 2.1 问题定义

我们将时间序列数据集DD表示为一个张量,维度为n×d×Ln×d×L,其中nn、dd和LL分别表示数据中的样本数、通道数和时间点数。在UTS情况下,d=1d=1。

一个(已训练的)分类模型clfclf预测时间序列实例DiDi(1≤i≤n1≤i≤n)的类别cici。解释器expexp通过生成一组归因图AA(一个与DD维度相同的归因张量,n×d×Ln×d×L)来解释clfclf在DD上的预测,其中Ai,j,kAi,j,k表示Di,j,kDi,j,k对于模型clfclf在实例DiDi上的预测的归因(即相关性)。

我们将特征集记为F={f1,f2,...,fm}F={f1,f2,...,fm},其中mm是特征总数。每个特征代表时间序列数据的一部分,例如,同一时间段内的数据、同一时间步或同一通道的数据。所有特征的并集构成完整的时间序列。我们专注于选择特征子集Fsel⊂FFsel⊂F的任务。我们非正式地将这个新集合称为*选定特征*,将DFselDFsel表示为仅包含这些特征的新数据集。

在本工作中,我们专注于TSC的数据缩减,组织为两个子任务:MTSC数据集的*通道选择*问题和UTSC数据集的*时间点选择*。对于前者,每个特征代表一个通道(m=dm=d);对于后者,每个特征代表一个时间点(m=Lm=L)。为避免混淆,在描述具体的数据缩减任务时,我们会明确指出关注的特征类型。

### 2.2 时间序列分类

近年来TSC方面的研究显著推进了大规模TSC基准\[uea-mtsc-archive,dempster2025monstermonashscalabletime\]以及TSC算法精度和效率的发展\[foumani2024improving,dempster2024highly\]。虽然许多算法在基准上达到了顶尖精度,但它们资源密集型,尤其是在大规模数据集或非常长的时间序列上\[middlehurst2023bake\]。我们讨论几个相关的SOTA分类器及其计算复杂度。

**解释器分类器。** 我们提出的方法drXAI是一种用于特征选择的包装器方法,需要有一个快速的分类器来解释。Hydra是一种TS转换算法,结合了基于卷积和基于字典的方面:gg组kk个卷积核在TS上滑动,每个组在每个时间点对最匹配的核进行计数。然后将特征输入岭分类器。Hydra的时间复杂度主要由卷积和竞争性计数过程决定。由于kk通常是固定常数,时间复杂度实际上是线性的O(ndL)O(ndL)。Hydra的内存复杂度为O(nk+kd)O(nk+kd)。在我们的实验中,我们使用了来自\[dempster2024highly\]的快速Hydra GPU实现,它可以很好地扩展到非常大的数据集。

**SOTA时间序列分类器。** 为了评估数据选择FselFsel的质量,我们在缩减后的数据集DFselDFsel上训练了以下三个SOTA分类器。

*   **MultiRocket-Hydra (MRH)**\[middlehurst2023bake\] 使用Hydra特征与MultiRocket\[tan2022multirocket\]特征的拼接。MultiRocket还将核应用于序列的一阶差分,并通过四个池化算子(MPV、MIPV、LSPV、PPV)提取特征。MultiRocket流水线比Hydra计算量更重。虽然对于输入仍然是线性的,但MultiRocket的常数更大,提取的特征数量也更多(默认约50,000个特征),这使得它在时间和内存方面都更昂贵,特别是对于长时间序列。此外,由于默认情况下每个核最多应用于8个随机通道,这两种算法也从少于8个通道的选择中受益。除了效率之外,将输入限制为信息特征可以进一步提高模型的鲁棒性和精度。
*   **ConvTran**\[foumani2024improving\] 是一种针对MTSC量身定制的最新transformer模型。它使用卷积层从原始序列中提取特征,然后在分词后输入transformer。与Hydra相比,ConvTran的复杂度显著增加。Hydra使用随机核和线性分类器,而ConvTran是一种完全可训练的Transformer-CNN混合体,利用自注意力机制。ConvTran的复杂度由注意力机制的二次性质和卷积嵌入层的参数决定。其成本相对于序列长度是二次的O(nL2dembedding)O(nL2dembedding),相对于通道数量是线性的。对于L>1000L>1000的非常长的序列,这将比Hydra的O(nL)O(nL)慢得多。
*   **InceptionTime**\[ismail2020inceptiontime\] 是另一种深度学习分类器,具体来说是一种由5个vanilla Inception网络(CNN)组成的集成方法。其复杂度主要由其深度Inception模块决定,这些模块通过瓶颈层应用不同核大小的并行卷积,捕获局部和长期的时间关系。与ConvTran不同,InceptionTime相对于序列长度和通道是线性的,但由于它需要反向传播,常数因子和硬件需求远高于Hydra。

### 2.3 时间序列分类的XAI方法

我们的方法与*归因方法无关*,即它只需要一个归因图作为输入,无论哪个算法计算了它。在本工作中,我们选择了两种已适应于TS并在该领域有效工作的基于*置换*的归因方法\[serramazza2024improving,turbe2023evaluation\]。这些方法需要*背景集*来模拟计算归因时的数据缺失。本研究中未考虑基于*梯度*的归因方法,主要是因为它们无法与非基于梯度的算法(如Hydra和MultiRocket)一起工作。在本文剩余部分,我们用*解释器*来指代XAI归因方法。

*   **Shapley值采样 (SVS)** 是对原始工作中描述的Shapley值\[lundberg2017unified\]的一种近似。它对SHAP公式应用采样,随机排列要解释的特征,并将它们依次添加到背景集中的每个样本。归因值是由这些替换导致的模型输出变化。尽管被证明在指出重要特征方面有效\[serramazza2023evaluating\],但由于需要大量的特征排列,该方法需要大量的计算时间。一些针对时间序列的适应方法,例如通过TS分段对特征进行分组,已被证明可以大幅减少计算时间,同时保持准确性\[serramazza2024improving\]。
*   **特征消融 (FA)**\[kokhlikyan2020captum\] 比SHAP简单且快得多。它顺序地将每个特征替换为背景数据集中样本的对应值。与SVS一样,归因值是替换特征值后模型输出的差异。

我们使用了\[serramazza2024short\]中为这两个解释器提供的实现。

### 2.4 TSC的特征选择

我们首先讨论近期关于*MTSC通道选择*的工作。在\[dhariyal2023scalable\]中,作者提出了一种监督算法,用于为MTSC数据集选择通道子集。该算法有两个变体,ECS和ECP,它们基于通道的判别能力进行选择,判别能力通过类质心之间的欧氏距离估计:距离越大,判别能力越强。根据原始论文,这种filter方法平均可以减少70%的数据,而不会损害分类器的准确性。另一个与ECS和ECP直接比较的近期工作是TSelect\[nuyts2025tselect\],它是一种wrapper方法,为每个通道训练一个逻辑回归分类器,该分类器基于每个通道提取的5个计算成本低的特征。然后,这些模型用于确定要重新训练哪些相关通道:基于这些模型精度、冗余预测等的各种过滤器,选择丢弃哪些通道。

时间序列数据的缩减也可以通过将高维时间序列投影到低维潜在空间来进行\[data-reduction-survey\]。已知的方法包括自编码器、主成分分析、奇异值分解、离散傅里叶/小波变换和降采样。然而,这些都是*降维技术*,将时间序列投影到不同的空间,从而丢失原始特征。对于许多应用,保持数据的原始表示以便于审计重要特征是很重要的,例如监测人类健康等医疗应用。因此,这些转换方法不在本文讨论范围之内。

对于UTSC的*时间点选择技术*,一种简单有效的方法(特别是对于长时间序列)是使用随机森林重要性(RFI),利用训练期间计算的每个特征的重要性(不纯度减少)。另一种替代方法是计算每个特征与TSC任务目标之间的互信息(MI)\[scikit-learn\]。

## 3 提出的方法

相似文章

Oxlo.ai

Product Hunt

Oxlo.ai 助您跨 AI 模型扩展,同时控制成本。