针对联合故障诊断与剩余使用寿命估计的注意力增强多任务学习的泄漏鲁棒评估与数据规模敏感性

arXiv cs.LG 论文

摘要

本文证明了在滑动窗口序列上使用简单的训练/测试分割会严重夸大或缩小预测性维护中多任务学习的性能指标,并提出了一种泄漏鲁棒的评估协议。

arXiv:2607.16493v1 公告类型:新 摘要:联合执行故障分类和剩余使用寿命(RUL)回归的多任务深度学习模型越来越多地用于预测性维护,但报告的性能会严重受到滑动窗口序列如何分割为训练集和测试集的影响。我们使用注意力增强的多任务架构AMTLNet在三个公开基准上研究这一问题:NASA C-MAPSS、NASA IMS和UCI液压系统数据集。我们表明,简单的分割可以将分类准确率从真实的20-60%膨胀到99.9%,或者由于退化的类别表示而降低到0%。为解决这一问题,我们提出了一种基于块(chunk-based)的泄漏审计分割协议,并使用五个种子、单因素方差分析和Tukey HSD检验评估所有模型。在C-MAPSS上,使用19,976个无泄漏训练窗口,AMTLNet在分类上匹配单任务CNN-LSTM基线,达到84.12 ± 0.96%的准确率,Tukey p = 1.0,并实现R2为0.86 ± 0.01,同时显著优于朴素多任务基线。在较小的轴承和液压数据集上,多任务训练不稳定,但失败模式不同:轴承的分类性能下降,而液压的回归性能下降。我们将这种不对称性与标签来源相关联,并提出了一个实用框架,用于在数据稀缺情况下决定何时适合联合训练。消融结果表明,多头注意力分支是回归稳定性的主要贡献者。移除它会使R2从0.861降至0.766,并使分类方差增加一倍以上,而卷积分支尽管使用了约三分之一的参数,但对回归贡献很小。本研究贡献了一个可复用的泄漏审计协议、种子透明的评估,以及证据表明任务特定稳定性更多依赖于标签来源而非任务类型。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:48

# 泄漏鲁棒评估与数据规模敏感性:用于联合故障诊断和剩余使用寿命估计的注意力增强多任务学习

**来源:** https://arxiv.org/html/2607.16493

Md. Nuruzzaman<[email protected]> (mailto:[email protected])  
Zannatul Ferdus<[email protected]> (mailto:[email protected])  
Md Rajib Ahmed<[email protected]> (mailto:[email protected])  
Abieer Nwshad Anwar<[email protected]> (mailto:[email protected])  
Mohammad Tooneer<[email protected]> (mailto:[email protected])  
Johir Uddin Khan<[email protected]> (mailto:[email protected])  
Khalid Hossen<[email protected]> (mailto:[email protected])

Manufacturing Engineering Technology, Western Illinois University, Macomb, IL-61455, USA  
Department of Mechanical and Production Engineering, Ahsanullah University of Science and Technology, 141-142 Love Road, Tejgaon Industrial Area, Dhaka, Bangladesh  
Master of Science in Industrial/Engineering Management, Trine University, 720 Thunder Dr, Angola, IN 46703, USA  
Department of Nano-technology Engineering, Sapienza University of Rome, Rome, Italy  
Department of Industrial and Production Engineering, Bangladesh University of Engineering and Technology, Dhaka, Bangladesh  
Department of Mechanical Engineering, Chittagong University of Engineering and Technology, Raozan, Chattogram 4349, Bangladesh  
Department of Mechatronics Engineering, Rajshahi University of Engineering & Technology (RUET), Kazla, Rajshahi, Bangladesh

###### 摘要

联合执行故障分类和剩余使用寿命(RUL)回归的多任务深度学习模型越来越多地被提出用于预测性维护(PdM),通常在全寿命传感器数据的滑动窗口分割上进行评估。我们证明,应用于这些窗口序列的训练/测试划分协议对报告的评估性能具有一阶影响,而这种影响在PdM文献中很少被审计。使用注意力增强的多任务架构(AMTLNet)在三个公开基准数据集(NASA C-MAPSS(涡扇发动机退化)、NASA IMS(轴承全寿命)和UCI液压系统数据集)上进行评估,我们通过实验证明,幼稚的划分策略可以将分类准确率从真实的约20-60%人为膨胀到99.9%,或者相反,由于退化类表示而将其降低到0%,具体取决于滑动窗口与训练/测试边界的交互方式。我们引入了一种基于块的、泄漏审计的划分协议,该协议消除了这两种失败模式,并在此协议下报告了所有三个数据集的完整种子级统计结果(5个种子,单因素方差分析,Tukey HSD事后检验)。在大规模C-MAPSS基准数据集(19,976个无泄漏训练窗口)上,AMTLNet在分类(准确率84.12%±0.96%,与CNN-LSTM的Tukey p=1.0)和回归(R²=0.86±0.01)方面均与最强的单任务基线(CNN-LSTM)相匹配,同时显著优于一个幼稚的多任务基线。在两个小型、单次运行的基准数据集(轴承:约4,000个原始样本;液压:约2,200个原始样本)上,多任务训练变得不稳定,值得注意的是,不稳定性以非对称方式表现:分类头是轴承的失败点,而回归头是液压的失败点。我们将这种非对称性与每个任务标签的来源(实测标签 vs. 派生/代理标签)联系起来,并提出了一个实用的决策框架,用于在给定可用样本量的情况下判断何时适合进行联合多任务训练。一项受控的架构消融实验进一步表明,AMTLNet的多头注意力分支是回归稳定性的主要贡献者(仅移除该分支就使R²从0.861降至0.766,并使不同种子的分类方差翻倍以上),而卷积分支尽管约占模型参数的三分之一,但对回归质量的贡献相对较小。本研究贡献了:(i) 一个经验证、可重复使用的窗口化PdM基准泄漏审计协议,(ii) 一个统计上严格、种子透明的多任务收益评估,既不夸大也不隐藏负面结果,以及(iii) 证据表明数据稀缺下特定任务的稳定性取决于标签来源而非仅任务类型。

###### 关键词: 预测性维护, 多任务学习, 剩余使用寿命, 故障诊断, 数据泄漏, 深度学习, 评估方法, 注意力机制

††期刊: Measurement / Advanced Engineering Informatics / Results in Engineering (取决于目标期刊)

## 1 引言

预测与健康管理(PHM)系统越来越多地依赖深度学习模型,这些模型在多元传感器时间序列的滑动窗口分割上训练,以联合估计机器的当前故障状况及其剩余使用寿命(RUL)[Qiu et al., 2023 (https://arxiv.org/html/2607.16493#bib.bib4), Li et al., 2021 (https://arxiv.org/html/2607.16493#bib.bib39), Sunal et al., 2022 (https://arxiv.org/html/2607.16493#bib.bib21)]。将故障诊断和RUL估计视为一个单一的多任务学习(MTL)问题,而不是两个独立训练的模型,具有吸引力:共享表示原则上可以在分类和回归目标之间传递退化相关信息,从而降低部署成本以及两个输出之间预测不一致的风险[Liu et al., 2020 (https://arxiv.org/html/2607.16493#bib.bib3), Behera et al., 2024 (https://arxiv.org/html/2607.16493#bib.bib13), Abdelsamie et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib25)]。结合卷积特征提取与循环或基于注意力的时间建模的架构——CNN-LSTM、CNN-BiLSTM以及注意力增强变体——已被报道在标准基准测试(如NASA C-MAPSS)上取得了强大的单任务RUL性能[Deng and Zhou, 2024 (https://arxiv.org/html/2607.16493#bib.bib8), Zhao et al., 2020 (https://arxiv.org/html/2607.16493#bib.bib9), Ghoneim et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib10), Han et al., 2024 (https://arxiv.org/html/2607.16493#bib.bib22), Wu et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib11)],并且已提出多任务扩展用于轴承和液压系统监测[Kim and Park, 2025 (https://arxiv.org/html/2607.16493#bib.bib14), Bisoyi et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib15), Wang et al., 2026 (https://arxiv.org/html/2607.16493#bib.bib20), Jafari and Farsangi, 2026 (https://arxiv.org/html/2607.16493#bib.bib18), Kim and Heo, 2022 (https://arxiv.org/html/2607.16493#bib.bib17)]。

然而,这些文献中很少明确解决一个方法论问题:用于分割全寿命序列的滑动窗口如何与训练/验证/测试划分相互作用。由于使用小步长生成的连续窗口具有大量重叠——通常除一个时间步外,所有时间步都与相邻窗口共享——在单个窗口层面而非连续时间段层面进行的训练/测试划分,可能将几乎重复的窗口同时置于划分两侧。这是时间序列和序列机器学习中一个更广泛、有充分记录的问题的具体实例:不恰当划分导致的数据泄漏会人为膨胀报告的性能,并破坏基准比较的有效性[Kapoor and Narayanan, 2023 (https://arxiv.org/html/2607.16493#bib.bib23), Sasse et al., 2023 (https://arxiv.org/html/2607.16493#bib.bib33), Geirhos et al., 2020 (https://arxiv.org/html/2607.16493#bib.bib38)]。这种效应已在一般时间序列和序列分类设置中被直接量化[Tampu et al., 2022 (https://arxiv.org/html/2607.16493#bib.bib26), Rosenblatt et al., 2024 (https://arxiv.org/html/2607.16493#bib.bib27), Yang et al., 2024 (https://arxiv.org/html/2607.16493#bib.bib37)],并且密切相关的失败模式——单次随机划分在小样本上产生不可靠估计,以及未计及的种子间方差膨胀或掩盖真实效应大小——已在生物医学成像、因果推断和一般机器学习基准测试中得到记录[An et al., 2021 (https://arxiv.org/html/2607.16493#bib.bib41), Schader et al., 2024 (https://arxiv.org/html/2607.16493#bib.bib29), Maleki et al., 2022 (https://arxiv.org/html/2607.16493#bib.bib42), Calle et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib49), Banerjee et al., 2024 (https://arxiv.org/html/2607.16493#bib.bib50)]。然而,在PdM文献中,已发表的用于C-MAPSS、IMS轴承和液压系统RUL估计的滑动窗口管道通常报告使用步长为1的窗口化单次训练/测试划分,并且不报告相邻领域现在被视为标准实践的那种泄漏审计[Hewamalage et al., 2022 (https://arxiv.org/html/2607.16493#bib.bib36), Lema et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib28)]。

第二个相关空白涉及将深度多任务架构应用于PdM基准测试时隐含的数据量假设。NASA C-MAPSS提供了来自100个模拟发动机单元的数万个样本,但许多其他广泛使用的PdM基准测试——包括本研究中使用的NASA IMS轴承数据集和UCI液压系统数据集——由少量连续的全寿命或条件标记试验组成,最多只能产生几千个原始样本。PHM领域的小数据文献已广泛证明,深度学习性能在这种数据稀缺条件下会下降,从而激发了少样本、元学习和迁移学习解决方案[Li et al., 2024 (https://arxiv.org/html/2607.16493#bib.bib24), Wang et al., 2021 (https://arxiv.org/html/2607.16493#bib.bib32), Zhang et al., 2019 (https://arxiv.org/html/2607.16493#bib.bib34), Wu et al., 2020 (https://arxiv.org/html/2607.16493#bib.bib35), Liang et al., 2023 (https://arxiv.org/html/2607.16493#bib.bib51)]。但尚待充分探索的是,*多任务*训练在数据量缩小时的具体表现如何,与相同数据上的单任务训练相比——是两个任务同向退化,还是一个任务通过共享表示学习保护另一个任务,还是退化是非对称的,如果是,什么因素预测哪个任务更脆弱。联合训练任务之间的负迁移已在一般的多任务学习中得到研究[Huang et al., 2022 (https://arxiv.org/html/2607.16493#bib.bib46), de Paula et al., 2026 (https://arxiv.org/html/2607.16493#bib.bib45), Wang et al., 2023 (https://arxiv.org/html/2607.16493#bib.bib47)],但很少与每个任务真实标签的来源(直接测量 vs. 派生/代理标签)建立明确联系,我们将在下文证明,这是基准测试中任务特定脆弱性的一个强预测因子。

基于合著者Hossen之前的工作,该工作确立了无泄漏窗口化和来源感知数据划分作为可部署振动诊断方法学要求的必要性[Hossen, 2026 (https://arxiv.org/html/2607.16493#bib.bib2)],以及他早期对经典机器学习算法在振动故障诊断中的比较评估[Hossen et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib1)],本文做出以下贡献:

1. 1. 我们在相同的架构和相同的原始数据上,通过实验证明三种不同的滑动窗口划分协议如何产生性质上不同、其中两种明显无效的性能估计(第4.1节 (https://arxiv.org/html/2607.16493#S4.SS1)),并引入一种基于块的、泄漏审计的协议,该协议避免了所有三种失败模式。
2. 2. 我们报告了在NASA C-MAPSS上,使用这种泄漏审计协议,对注意力增强多任务架构(AMTLNet)与单任务和幼稚多任务基线进行的统计严格评估,包括跨五个随机种子的单因素方差分析和Tukey HSD事后检验,并显示AMTLNet与最佳单任务基线相匹配,同时显著优于幼稚多任务训练。
3. 3. 我们以完全的种子级透明度,描述了相同的多任务架构如何在两个小型的、单次运行的PdM基准测试上变得不稳定,并证明这种不稳定性是任务非对称的,并且与每个任务的标签是直接测量还是派生代理相关。
4. 4. 我们将这些发现转化为一个实用的决策框架,帮助从业者在给定特定PdM资产的可用样本量时,选择是进行联合多任务训练还是单任务部署。

本文其余部分组织如下。第2节 (https://arxiv.org/html/2607.16493#S2)回顾了RUL/故障诊断深度学习、多任务PdM以及序列机器学习中数据泄漏的相关工作。第3节 (https://arxiv.org/html/2607.16493#S3)描述了数据集、泄漏审计划分协议、AMTLNet架构以及统计评估过程。第4节 (https://arxiv.org/html/2607.16493#S4)介绍了协议消融和主要结果。第5节 (https://arxiv.org/html/2607.16493#S5)讨论了数据规模敏感性的发现、其实际意义以及本研究的局限性。第6节 (https://arxiv.org/html/2607.16493#S6)进行总结。

## 2 相关工作

### 2.1 用于RUL预测和故障诊断的深度学习

CNN、LSTM以及混合CNN-LSTM/BiLSTM架构是NASA C-MAPSS上滑动窗口RUL估计的主导方法[Zhao et al., 2020 (https://arxiv.org/html/2607.16493#bib.bib9), Deng and Zhou, 2024 (https://arxiv.org/html/2607.16493#bib.bib8), Borst and Verhagen, 2023 (https://arxiv.org/html/2607.16493#bib.bib19), Han et al., 2024 (https://arxiv.org/html/2607.16493#bib.bib22)],注意力机制越来越多地用于对信息丰富的传感器或时间步进行加权[Ghoneim et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib10), Wu et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib11), Fan et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib12)]。并行工作将相同的架构家族应用于轴承全寿命数据[Kim and Park, 2025 (https://arxiv.org/html/2607.16493#bib.bib14), Bisoyi et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib15), Zhang et al., 2019 (https://arxiv.org/html/2607.16493#bib.bib34)]以及液压和泵状态监测[Kim and Heo, 2022 (https://arxiv.org/html/2607.16493#bib.bib17), Jafari and Farsangi, 2026 (https://arxiv.org/html/2607.16493#bib.bib18), Wang et al., 2026 (https://arxiv.org/html/2607.16493#bib.bib20), Sunal et al., 2022 (https://arxiv.org/html/2607.16493#bib.bib21)]。综合调查记录了这些文献的广度以及其在匹配训练/部署条件下对深度特征提取的持续依赖[Qiu et al., 2023 (https://arxiv.org/html/2607.16493#bib.bib4), Li et al., 2021 (https://arxiv.org/html/2607.16493#bib.bib39), Saeed et al., 2025 (https://arxiv.org/html/2607.16493#bib.bib6)]。

### 2.2 用于预测性维护的多任务学习

在共享编码器上联合训练故障分类和RUL回归头已被提出,以利用两个任务之间相关的退化信息[Liu et al., 2020 (https://arxiv.org/html/2607.16493#bib.bib3), Behera et al., 2024 (https://arxiv.org/html/2607.16493#bib.bib13)]。更广泛的多...

相似文章