时间序列分类中可解释人工智能软件框架的系统综述
摘要
本文系统综述了时间序列分类中可解释人工智能的软件框架,并比较了其特性、评估实践和限制。
arXiv:2608.21449v1 公告类型:新
摘要:时间序列出现在广泛的应用领域中,并在关键决策环境中通过机器学习进行分析。时间序列分类(TSC)是研究最广泛和相关的任务之一。在此背景下,确保TSC模型的透明度和可信度已成为重要需求,推动了可解释人工智能(XAI)方法的使用。尽管兴趣日增,但针对TSC的XAI研究仍然分散,对可用软件框架在解释生成、评估实践和实际限制方面的系统性理解仍然缺乏。先前的工作主要集中在单个解释方法上,而跨框架一致性、时间序列特定评估和可重复性受到的关注较少。在本综述中,我们分析了现有用于TSC中解释生成和评估的软件框架。我们从多个维度进行比较,包括支持的XAI方法、评估指标、易用性、基准测试支持和可重复性,提供了首个针对时间序列的框架综述,包含实施比较和频率域支持的分析。我们识别出六个明确支持时间序列的框架,并揭示了共同限制:尽管频率域解释相关,但只有一种方法支持;只有两个评估指标是专门为时间序列开发的;相同的XAI方法在不同框架中可能产生显著不同的解释。基于这些发现,我们讨论了开放挑战并概述了未来研究的方向,强调了需要统一的、时间序列特定的XAI框架,以实现忠实、可重复且时间序列感知的解释。
查看缓存全文
缓存时间: 2026/08/25 04:17
# 时间序列分类可解释AI软件框架:系统性综述
来源:https://arxiv.org/html/2608.21449
Louis PeterOrcID:0009\-0001\-7478\-1888 (https://orcid.org/0009-0001-7478-1888)所属机构:Technische Hochschule Mittelhessen \- 应用科学大学,德国弗里德贝格所属机构:黑森州人工智能中心(hessian\.AI),德国达姆施塔特电子邮件[\{louis\.peter,nils\.gumpfer,jana\.fischer,jennifer\.hannig\}@kite\.thm\.de](mailto:{louis.peter,nils.gumpfer,jana.fischer,jennifer.hannig}@kite.thm.de)Nils GumpferOrcID:0000\-0001\-8644\-9885 (https://orcid.org/0000-0001-8644-9885)所属机构:Technische Hochschule Mittelhessen \- 应用科学大学,德国弗里德贝格所属机构:黑森州人工智能中心(hessian\.AI),德国达姆施塔特电子邮件[\{louis\.peter,nils\.gumpfer,jana\.fischer,jennifer\.hannig\}@kite\.thm\.de](mailto:{louis.peter,nils.gumpfer,jana.fischer,jennifer.hannig}@kite.thm.de)Jana FischerOrcID:0009\-0005\-0445\-0847 (https://orcid.org/0009-0005-0445-0847)所属机构:Technische Hochschule Mittelhessen \- 应用科学大学,德国弗里德贝格所属机构:黑森州人工智能中心(hessian\.AI),德国达姆施塔特电子邮件[\{louis\.peter,nils\.gumpfer,jana\.fischer,jennifer\.hannig\}@kite\.thm\.de](mailto:{louis.peter,nils.gumpfer,jana.fischer,jennifer.hannig}@kite.thm.de)Christin SeifertOrcID:0000\-0002\-6776\-3868 (https://orcid.org/0000-0002-6776-3868)所属机构:黑森州人工智能中心(hessian\.AI),德国达姆施塔特电子邮件[\{louis\.peter,nils\.gumpfer,jana\.fischer,jennifer\.hannig\}@kite\.thm\.de](mailto:{louis.peter,nils.gumpfer,jana.fischer,jennifer.hannig}@kite.thm.de)所属机构:马尔堡大学,德国马尔堡电子邮件[christin\.seifert@uni\-marburg\.de](mailto:[email protected])Jennifer Hannig (✉)OrcID:0000\-0002\-2789\-5540 (https://orcid.org/0000-0002-2789-5540)所属机构:Technische Hochschule Mittelhessen \- 应用科学大学,德国弗里德贝格所属机构:黑森州人工智能中心(hessian\.AI),德国达姆施塔特电子邮件[\{louis\.peter,nils\.gumpfer,jana\.fischer,jennifer\.hannig\}@kite\.thm\.de](mailto:{louis.peter,nils.gumpfer,jana.fischer,jennifer.hannig}@kite.thm.de)
###### 摘要
时间序列广泛存在于各个应用领域,并在关键决策场景中通过机器学习进行分析。时间序列分类是研究最广泛、最重要的任务之一。在此背景下,确保时间序列分类模型的透明度和可信度已成为一个重要要求,推动了可解释人工智能方法的应用。尽管相关研究兴趣日益增长,但针对时间序列分类的可解释人工智能研究仍然碎片化,对于可用的解释生成软件框架、其评估实践和实际限制,尚缺乏系统性的认识。先前的工作主要集中在单个解释方法上,而对跨框架一致性、时间序列特定评估和可重复性的关注甚少。在本综述中,我们分析了现有用于时间序列分类解释生成和评估的软件框架。我们从多个维度比较了它们,包括支持的可解释人工智能方法、评估指标、易用性、基准测试支持和可重复性,首次提供了针对时间序列的特定框架调查,包含实现比较和频域支持分析。我们确定了六个明确支持时间序列的框架,并揭示了常见局限性:只有一个方法支持频域解释,尽管其具有相关性;仅针对时间序列开发了两个评估指标;相同的可解释人工智能方法在不同框架中可能产生显著不同的解释。基于这些发现,我们讨论了开放挑战,并概述了未来研究方向,强调了需要统一的、针对时间序列的可解释人工智能框架,以生成忠实、可重复且具有时间序列感知能力的解释。
###### 关键词:
可解释人工智能 时间序列分类 XAI评估 XAI软件框架
## 1引言
时间序列数据是医疗保健、工业监控、金融和音频处理等众多现实应用的核心部分。深度学习模型在时间序列分类中的日益普及显著提升了预测性能,但这种提升往往以牺牲可解释性和透明度为代价。在高风险领域,理解和论证自动化决策至关重要,这既是为促进用户信任,也是为遵守欧盟《人工智能法案》等法规要求,特别是第14条要求的人类监督,确保用户能解释并有效监督AI输出[11 (https://arxiv.org/html/2608.21449#bib.bib11)]。这些法规发展进一步凸显了为时间序列分类提供可靠且忠实解释方法的必要性。
可解释人工智能因此成为一个重要的研究领域。然而,大多数现有的可解释人工智能研究主要是在图像数据的背景下开发和评估的[26 (https://arxiv.org/html/2608.21449#bib.bib26)]。因此,许多解释方法被应用于时间序列,但并未经过专门调整或系统评估[28 (https://arxiv.org/html/2608.21449#bib.bib28)],其在时间序列数据上的忠实性和实际可用性尚不清楚。
时间序列的解释比其他数据模态更不直观,增加了误导性解释的风险[27 (https://arxiv.org/html/2608.21449#bib.bib27)]。虽然图像分类任务通常允许即使是非专家也能直观地区分猫和狗等类别,但许多现实世界的时间序列缺乏明确的、可解释的组件概念。原始时间序列表现得嘈杂,即使对领域专家而言也缺乏直观可解释的结构。一个代表性的例子是语音数字的音频信号,它在时域中不可直观解释(见图4左侧部分[https://arxiv.org/html/2608.21449#S3.F4](https://arxiv.org/html/2608.21449#S3.F4))。在这种情况下,仅基于时域的解释通常不足,通常需要考虑频域和时频域的替代表示。这凸显了纳入这些表示以生成有意义解释的重要性。
图1:心电图信号是一种多变量时间序列,其中每个通道对应一个不同的测量位置。所有通道都反映相同的基础心脏过程,并具有强烈的时序和同步跨通道依赖性。一个右束支传导阻滞的示例在V1和V6导联中显示特征性模式,强调了多通道分析的必要性。相反,心电图是一种多变量时间序列,其有意义且具有临床解释性的模式在时域中定义明确且可见。病理性模式可以由领域专家(特别是心脏病专家)可靠地解释,并且通常源于复杂的跨通道依赖性,反映了心脏活动的时空交互(见图1[https://arxiv.org/html/2608.21449#S1.F1](https://arxiv.org/html/2608.21449#S1.F1))。因此,解释多变量时间序列需要明确考虑跨通道依赖性的可解释人工智能方法,这些依赖性可以是同步的(即通道间在同一时间步发生的依赖关系)或异步的。
总体而言,时间序列对可解释性提出了独特挑战。有意义的模式往往源于复杂的时间动态和跨通道依赖性,包括跨时间、频率或时频域的交互。因此,用于时间序列分类的可解释人工智能与基于图像的解释存在根本性差异,这促使我们有必要对针对时间序列独特属性定制的可解释人工智能方法进行系统性的比较、评估和开发。
先前的综述已经确定了时间序列数据可解释人工智能的关键挑战。Theissler等人[34 (https://arxiv.org/html/2608.21449#bib.bib34)]和Rojat等人[27 (https://arxiv.org/html/2608.21449#bib.bib27)]回顾了现有的可解释人工智能方法,并强调了系统评估的必要性,但主要关注方法本身,而非在实践中用于实现、评估和基准测试它们的框架[1]。尽管存在多个评估框架,但Le等人的综述[24 (https://arxiv.org/html/2608.21449#bib.bib24)]显示,截至2022年,仅有一个框架明确支持时间序列数据。与此同时,Theissler等人[34 (https://arxiv.org/html/2608.21449#bib.bib34)]呼吁建立统一框架,以实现时间序列可解释人工智能方法的比较性和可重复性评估。目前尚不清楚这一呼吁在多大程度上得到了回应。特别是,对于最近的可解释人工智能框架如何支持时间序列分类、它们在解释生成和评估方面有何不同,或者它们如何与新兴的监管要求保持一致,尚无统一的认识。
解决这一差距是本次综述的动机,本文首次对针对时间序列分类的最新可解释人工智能框架进行了系统性回顾和比较分析。与先前关注可解释人工智能方法[34 (https://arxiv.org/html/2608.21449#bib.bib34), 27 (https://arxiv.org/html/2608.21449#bib.bib27)]或跨不同数据分析框架[24 (https://arxiv.org/html/2608.21449#bib.bib24)]的综述不同,我们首次提供了针对时间序列分类可解释人工智能的框架中心分析。我们分析了现有框架如何支持时间序列分类解释的生成、评估和基准测试,并评估了它们的易用性和实际局限性。
1. 研究问题1:哪些可解释人工智能框架目前支持时间序列分类,它们在易用性和实际适用性上有何不同?(第3.1节[https://arxiv.org/html/2608.21449#S3.SS1](https://arxiv.org/html/2608.21449#S3.SS1))
2. 研究问题2:这些框架在多大程度上全面支持解释方法和评估指标,并且它们对单变量和多变量时间序列的支持程度如何?(第3.1节[https://arxiv.org/html/2608.21449#S3.SS1](https://arxiv.org/html/2608.21449#S3.SS1))
3. 研究问题3:当前框架在多大程度上依赖于重用通用可解释人工智能方法和评估指标,并且它们在多大程度上支持替代的信号表示?(第3.2节[https://arxiv.org/html/2608.21449#S3.SS2](https://arxiv.org/html/2608.21449#S3.SS2) - 3.3节[https://arxiv.org/html/2608.21449#S3.SS3](https://arxiv.org/html/2608.21449#S3.SS3))
4. 研究问题4:现有框架如何支持时间序列分类可解释人工智能方法的基准测试,特别是在数据集支持和可用基础信息方面?(第3.4节[https://arxiv.org/html/2608.21449#S3.SS4](https://arxiv.org/html/2608.21449#S3.SS4))
5. 研究问题5:框架设计和实现方面的差异在多大程度上影响表面上相同的可解释人工智能方法产生的解释和评估结果?(第3.5节[https://arxiv.org/html/2608.21449#S3.SS5](https://arxiv.org/html/2608.21449#S3.SS5))
通过回答这些问题,本综述提供了当前时间序列分类可解释人工智能框架格局的整合视图,突出了系统性优势和不足,并为构建健壮、可比较且具有时间序列感知能力的可解释人工智能框架确定了开放挑战。
## 2方法
我们对可用的时间序列分类可解释人工智能框架进行了系统性回顾。在这项工作中,可解释人工智能框架指任何软件——如库或工具——它支持解释的比较生成和/或可解释人工智能方法的评估。回顾过程如图2[https://arxiv.org/html/2608.21449#S2.F2](https://arxiv.org/html/2608.21449#S2.F2)所示。我们搜索了作为开源项目托管主导平台的GitHub,使用以下查询,得到750个条目[2]:"explainable\-ai time\-series"、"explainable\-ai evaluation"、"xai time\-series"、"xai evaluation"和"explanation time\-series"。
去除重复项后,剩下589个仓库。为排除未维护或不完整的仓库并确保社区相关性,我们过滤了少于四个星标[3]和少于四个分支[4]的仓库,结果得到115个仓库。然后我们手动评估了剩余仓库,并排除了那些1.\) 在相关出版物、README文件或文档中未声称支持时间序列的,或2.\) 包含少于两个可解释人工智能方法和少于两个评估指标的,或3.\) 无法作为python包安装的,或4.\) 没有相关出版物或README文件不足的[5]。
图2:选择和审查流程图。我们确定了六个候选仓库。我们进一步检查了这些框架的依赖项以识别其他框架,类似于对框架的反向搜索;然而,所有识别出的依赖项都至少满足一个排除标准。因此,最终调查包括六个可解释人工智能框架。对于每个框架,我们对源代码仓库、相关出版物、文档、支持的数据集(在可用的情况下)以及描述实现的可解释人工智能方法和评估指标的原始出版物进行了系统性回顾。分析围绕以下维度进行:
#### 框架。
对于每个框架,我们记录可解释人工智能方法和评估指标的数量、支持的机器学习后端、是否可在包索引中获取以及相应的GitHub仓库元数据(最后更新时间、星标和分支数)。为评估通用易用性,我们采用了Le等人[24 (https://arxiv.org/html/2608.21449#bib.bib24)]提出的易用性评分,该评分从三个维度评估框架的易用性:积极维护、社区互动和文档。每个维度根据预定义标准从0到5评分。
#### 可解释人工智能方法。
我们将可解释人工智能方法分为反事实、基于梯度和基于扰动的方法;不符合这些类别的方法归入其他。我们检查了方法是否明确声称支持时间序列。对于时间序列特定的方法,我们分析了它们适用于单变量还是多变量时间序列,以及在哪些域中生成解释(时间、频率或时频)。对于在多个框架中实现的方法,我们比较了产生的解释以评估跨框架的可重复性。
#### 评估指标。
我们调查了评估指标是否与时间序列兼容(如明确声明)或特定于时间序列(即,在相关出版物中最初为时间序列开发的)。对于特定于时间序列的指标,我们分析了可在哪些域中评估解释(时间、频率或时频)。我们将指标分为基于扰动和基于基础信息的指标;不符合这些类别的指标归入其他。对于在多个框架中实现的指标,我们比较了产生的分数以评估跨实现的可重复性。
#### 基准测试能力。
我们评估了框架是否支持用于比较和评估可解释人工智能方法的基准测试数据集。如果数据集可以从已安装的包中访问,则将其考虑在内。我们进一步检查了数据集是否提供基础信息(已知或预期的参考解释),并相似文章
使用大型语言模型从时间序列中生成可解释的、数据驱动的洞察
提出一个领域无关的框架,利用大型语言模型为时间序列预测生成基于事实的自然语言解释,通过约束到可验证证据来减少幻觉。在金融和货运定价案例研究中进行了评估。
面向欧盟解释权的可解释人工智能:法律-XAI转化差距的系统综述
针对欧盟解释权背景下的可解释人工智能(XAI)研究进行系统综述,分析GDPR与《人工智能法案》中法律要求与技术实施之间的差距。
可解释人工智能(XAI):从固有可解释性到大型语言模型
本文探讨了从人工智能中的固有可解释性到为大型语言模型开发和应用可解释方法的进展。
可解释人工智能中鲁棒性与保真度审计的形式化方法框架:从应用到信任认证
本文介绍了一个用于审计事后可解释人工智能工具(如SHAP和LIME)的鲁棒性与保真度的方法框架,将这些指标结合成一个信任评分。该框架应用于马达加斯加的粮食安全数据集,强调了在敏感领域中审计XAI输出对于可信赖决策的必要性。
电信行业客户流失预测的可解释人工智能:CRM集成框架
本文介绍了一个将可解释AI集成到CRM系统中用于电信客户流失预测的框架,通过基准测试分类器并利用SHAP和LIME进行可解释预测,以增强客户保留策略。