基于对抗逆向强化学习的无标签工业故障检测:一种面向运行至失效预测的系统
摘要
本文提出了一种用于机械故障检测的对抗逆向强化学习框架,该框架从正常运行数据中学习健康奖励,无需故障标签,在多个基准测试中实现了一致的检测性能。
arXiv:2607.22987v1 Announce Type: new
摘要:机械故障检测(MFD)仍然严重依赖监督学习,但监督学习在实际场景中面临故障标签稀缺的问题。尽管强化学习(RL)提供了建模退化序列性质的框架,但当前的“基于RL”的MFD方法将问题简化为静态上下文赌博机(CB)形式:通过忽略状态转移并丢弃时间折扣因子,它们退化成了标准的监督分类。我们提出了一种对抗逆向强化学习(AIRL)框架,将MFD视为离线逆强化学习问题。与依赖静态误差边界的基于重建的方法或忽略动态变化的上下文赌博机不同,我们的方法直接从观测状态转移中恢复内在的“健康”奖励,既不需要手动设计奖励,也不需要故障标签。在三个运行至失效基准测试(HUMS2023、IMS、XJTU-SY)上,AIRL是唯一在所有数据集上实现非饱和检测后一致性的方法,而CB基线无法检测到逐渐退化,重建模型则陷入始终异常的状态。代码和数据:https://github.com/dhirajneupane/AIRL-MFD-DN。
查看缓存全文
缓存时间: 2026/07/28 06:24
# 无需标签的工业故障检测:基于对抗逆强化学习的退化全寿命预测系统
来源:https://arxiv.org/html/2607.22987
###### 摘要.
机械故障检测 (MFD) 仍然严重依赖监督学习,而监督学习在现实场景中难以应对故障标签稀缺的问题。尽管强化学习 (RL) 提供了一个建模退化序列特性的框架,但当前的“基于 RL”的 MFD 方法将问题简化为静态上下文赌博机 (CB) 形式:通过忽略状态转移并丢弃时间折扣因子,它们退化为标准的监督分类。我们提出了一种对抗逆强化学习 (AIRL) 框架,将 MFD 视为离线 IRL 问题。与依赖静态误差裕度的基于重构的方法或忽略动态特性的 CB 方法不同,我们的方法直接从观测到的状态转移中恢复内在的“健康”奖励,既不需要手动设计奖励,也不需要故障标签。在三个退化全寿命基准数据集 (HUMS2023, IMS, XJTU-SY) 上,AIRL 是唯一在所有数据集上实现非饱和后检测一致性的方法,而 CB 基线无法检测到渐进退化,重构模型则崩溃为始终异常状态。代码和数据:https://github.com/dhirajneupane/AIRL-MFD-DN。
## 1. 引言
机械故障检测 (MFD) 对于工业可靠性至关重要,但为每种故障类型、严重程度和部件获取带标签的故障数据成本过高。监督学习在该领域占主导地位 (约 81% 的研究,而 RL 仅占 1% (Neupane 等, 2024b (https://arxiv.org/html/2607.22987#bib.bib5))),但继承了标签瓶颈问题。半监督和无监督方法在一定程度上缓解了这一问题 (Ramírez-Sanz 等, 2023 (https://arxiv.org/html/2607.22987#bib.bib3); Neupane 等, 2025 (https://arxiv.org/html/2607.22987#bib.bib2); Zhao 等, 2021 (https://arxiv.org/html/2607.22987#bib.bib4); Nian 等, 2020 (https://arxiv.org/html/2607.22987#bib.bib8)),但在可变运行条件下鲁棒性较差。强化学习 (RL) 通过交互式、序列化决策成为一种有前景的替代方案,然而当前的应用忽视了故障演化的时间结构 (Neupane 等, 2024b (https://arxiv.org/html/2607.22987#bib.bib5))。
现有的“基于 RL”的 MFD 方法 (Ding 等, 2019 (https://arxiv.org/html/2607.22987#bib.bib6); Qian 和 Liu, 2022 (https://arxiv.org/html/2607.22987#bib.bib7); Li 等, 2025b (https://arxiv.org/html/2607.22987#bib.bib12), a (https://arxiv.org/html/2607.22987#bib.bib14)) 将故障检测简化为一个静态的上下文赌博机 (CB) 试验:每个传感器片段被视为独立状态,智能体发出一次性标签,折扣因子 γ 实际上为零,情节在单个动作后终止。因此,RL 的序列前提假设退化为监督分类。要超越这一点,需要多步交互 (γ > 0) 和反映长期结果的奖励,但设计这样的奖励很困难:故障演化是微妙的,系统动力学只有部分被理解,而且大多数工业数据集是预先录制的,这使在线 RL 不可行。即使是现有的离线 RL 方法仍然依赖于手动奖励设计。
这些挑战突显了逆强化学习 (IRL) (Ng 等, 2000 (https://arxiv.org/html/2607.22987#bib.bib15)) 的潜力,它通过离线方式直接从健康运行轨迹中学习,绕过了手动奖励指定。尽管 IRL 能够捕捉正常机械行为,但它在机械故障检测 (MFD) 中尚未被探索。为了填补这一空白,我们将对抗逆强化学习 (AIRL) (Fu 等, 2018 (https://arxiv.org/html/2607.22987#bib.bib49)) 引入 MFD,标志着其在本文领域的首次应用。AIRL 完全离线运行,学习正常序列模式的奖励模型,从而将异常检测为偏离这些动态的行为。该方法保留了 RL 的优势,同时提供了稳健、实用的解决方案。在多个退化全寿命数据集上的大量实验表明,我们的框架比传统的一类分类和基于重构的方法能实现更早的故障检测和更稳定的异常评分。
##### 应用贡献。
本文的公式化内容曾在 AAMAS 2026 (Neupane 等, 2026 (https://arxiv.org/html/2607.22987#bib.bib71)) 上以两页扩展摘要形式发表,并附有初步的 HUMS2023 结果。本完整论文将该前期工作大大扩展为一个综合性的预测系统。我们的具体贡献包括:(1) 一个无标签检测流水线,应用状态仅模仿学习 (SOIL) 方法 (Torabi 等, 2018 (https://arxiv.org/html/2607.22987#bib.bib36)) 于离线工业传感器序列;(2) 在三个不同的真实世界退化全寿命数据集 (HUMS2023, IMS, XJTU-SY) 上验证了泛化能力;(3) 扩展的基线比较,展示了为什么 AUROC 在结构上不适用,以及针对饱和失效的新型后检测一致性 (PDC) 分析;(4) 评估了七种自动阈值策略,并给出了实际部署建议;(5) 计算成本分析,验证了 AIRL 紧凑架构适用于边缘部署;(6) 一个消融研究,孤立地探讨了折扣因子在序列建模中的作用。
## 2. 背景与相关工作
### 2.1. 机械故障检测问题
工业机械通常在高强度条件下运行,导致磨损、裂纹、断齿等渐进式故障,这些故障在类型、严重程度和影响的部件上各不相同 (Nunes 等, 2023 (https://arxiv.org/html/2607.22987#bib.bib17))。如 Neupane 等人 (Neupane 等, 2025 (https://arxiv.org/html/2607.22987#bib.bib2)) 所示,大多数公开数据集反映了这种多样性,但这些数据集严格离线且专门为具有预定义标签的分类任务而设计。然而,在实际场景中,健康数据是丰富的,而为每种可能的故障模式获取和标记故障数据是一个重大挑战。因此,将 MFD 视为异常检测任务,利用大量正常数据进行训练以在测试时标记偏差,是一种令人信服且实用的方法。尽管当前研究趋势仍然严重偏向于监督学习下的故障分类,但稳健的故障检测仍然是工业应用中的基础需求。
### 2.2. 对抗逆强化学习
强化学习通过马尔可夫决策过程 (MDP) 对序列决策进行建模,优化策略以最大化累积奖励 (Sutton 和 Barto, 2020 (https://arxiv.org/html/2607.22987#bib.bib1))。然而,设计能够精确编码所需行为的奖励函数是具有挑战性的,特别是对于 MFD 这类复杂任务。逆强化学习通过直接从专家示范中推断潜在奖励来解决这个问题 (Deshpande 等, 2025 (https://arxiv.org/html/2607.22987#bib.bib18))。虽然传统 IRL 在高维环境下效果不佳,但 AIRL (Fu 等, 2018 (https://arxiv.org/html/2607.22987#bib.bib49)) 通过采用生成对抗框架实现了有效的扩展。AIRL 训练一个判别器来区分专家(健康)轨迹和策略生成的轨迹,同时更新策略以模仿专家行为。重要的是,AIRL 学习一个稳健的奖励函数,该函数与环境的具体动态解耦,使其非常适用于明确奖励制定不可行的异常检测。判别器的输出公式如下 (Fu 等, 2018 (https://arxiv.org/html/2607.22987#bib.bib49)):
(1) D(s, a, s′) = exp(r(s, a) + γV(s′) − V(s)) / (exp(r(s, a) + γV(s′) − V(s)) + π(a|s)),
其中 (s, a, s′) 是转移元组,包括当前状态 s、动作 a 和下一状态 s′,r(s, a) 是学习到的奖励,V(s) 是状态价值函数,π(a|s) 是随机策略,γ 是折扣因子。这种架构确保恢复的奖励对动态变化保持不变,为评估运行健康状态提供了稳定基础。
### 2.3. MFD 中的 RL 与上下文赌博机实践对比
自 2019 年以来,RL 在旋转机械故障检测中的应用逐渐流行,总结如表 1 (https://arxiv.org/html/2607.22987#S2.T1) 所示。然而,一个一致的模式显现出来:尽管采用了多样化的智能体和报告的情节长度,这些研究都将问题表述为单步分类任务,而不是真正的 MDP。具体来说:
- • 数据集通常被预先打乱,将每个传感器信号片段视为独立同分布 (iid) 的上下文。智能体预测一个标签,情节立即终止。
- • 由于忽略了转移 (s, a, s′),折扣因子 γ(即使非零)在信用分配中不起任何数学作用。
形式上,这些设置是单步上下文赌博机 (CB)。即使研究报告的情节长度为数百步(表 1),每一步仍然是一个独立的样本,与之前的动作没有依赖关系。贝尔曼方程退化为通过基于奖励的损失优化的监督分类器。虽然这种方法对于静态标记是有价值的,但使用 RL 术语歪曲了方法上的新颖性。更重要的是,它未能利用 RL 的核心优势:为故障进展和早期预警目标对序列系统演化进行建模。
表 1. 近期 MFD 研究中的 RL 表述。| 参考文献/年份 | 状态 | 动作 | γ | 情节长度 | 智能体 |
|---|---|---|---|---|---|---|
| (Ding 等, 2019 (https://arxiv.org/html/2607.22987#bib.bib6))/19 | 随机 | 标签 | 0 | 1 | SAE |
| (Li 等, 2021 (https://arxiv.org/html/2607.22987#bib.bib25))/21 | 随机 | 标签 | - | 1 | CapNet |
| (Qian 和 Liu, 2022 (https://arxiv.org/html/2607.22987#bib.bib7))/22 | 随机 | 标签 | 0 | 1 | CNN-GRU |
| (Yang 等, 2023 (https://arxiv.org/html/2607.22987#bib.bib26))/23 | 随机 | 标签 | 0.1* | 500† | ConvResAE |
| (Xiao 等, 2024 (https://arxiv.org/html/2607.22987#bib.bib27))/24 | 随机 | 标签 | 0.1* | 504† | 1D-CNN |
| (Li 等, 2025b (https://arxiv.org/html/2607.22987#bib.bib12))/25 | 随机 | 标签 | 0.99* | 1 | Eq. DQN |
| (Li 等, 2025a (https://arxiv.org/html/2607.22987#bib.bib14))/25 | 随机 | 标签 | 0.99* | 1 | ConvTrans |
| (Saied 等, 2025 (https://arxiv.org/html/2607.22987#bib.bib23))/25 | 随机 | 标签 | 0.1* | 1 | Duel-DQN |
注:* γ 未用于信用分配。† 样本预先打乱。
## 3. 用于 MFD 的 AIRL 框架
基于前述的问题阐述和相关工作,本节介绍所提出的用于机械故障检测的对抗逆强化学习框架。该框架使用预处理的振动序列自主学习表征正常运行行为及其偏差的奖励动态。它由三个主要部分组成:(i) 从振动信号构建转移,(ii) 用于奖励、价值和策略估计的神经网络架构,以及 (iii) 对抗训练和基于阈值的异常评分。
### 3.1. AIRL 的转移构建
设 X = {x₁, x₂, ..., xL} 表示长度为 L 个样本的振动记录,x̃t 表示 xt 的 z-归一化版本,其统计量完全从健康训练分区计算(以防止训练-测试泄漏)。记录按时间顺序排序,分为用于训练的健康专家集 D_exp 和包含退化阶段的保留测试集 D_test。数据集特定的分区、记录长度和采集细节在第 4 节 (https://arxiv.org/html/2607.22987#S4) 中报告。
为了构建 AIRL 输入,从每个归一化序列生成状态-动作-下一状态元组:
(2) s_t = x̃t, a_t = x̃_{t+1}, s_{t+1} = x̃_{t+1}.
由于数据是离线的且纯粹是观测性的,没有记录的控制动作可用。我们采用 SOIL 方法 (Torabi 等, 2018 (https://arxiv.org/html/2607.22987#bib.bib36)),将下一个观测值 x̃_{t+1} 视为代理动作,实际上学习一个逆动态模型,该模型对状态转移 (s_t, s_{t+1}) 的合理性进行评分,而不是最大化静态分类奖励。这与状态仅模仿和逆 RL 方法相一致,如 GAIfO (Torabi 等, 2019 (https://arxiv.org/html/2607.22987#bib.bib37))、Diffusion-IfO (Huang 等, 2024 (https://arxiv.org/html/2607.22987#bib.bib38)) 和 OPOLO (Zhu 等, 2020 (https://arxiv.org/html/2607.22987#bib.bib40)),这些方法优化了状态转移上的判别器,而不是显式控制动作。这种构建使得 AIRL 能够对健康和故障序列的时间演化进行建模,而无需引入人工控制变量。
### 3.2. 模型架构
所提出的 AIRL 框架包括三个神经网络组件:奖励网络 r(s, a)、价值网络 V(s) 和随机策略 π(a|s)。注意,虽然我们为了保持标准 RL 符号而将输入称为 a,但 a 对应于下一个状态 x̃_{t+1}。每个网络都是形式为 f(x) = W₂ φ(W₁ x + b₁) + b₂ 的两层 MLP,其中 φ(·) 是 ReLU 激活函数,隐藏层有 64 个单元,b₁, b₂ 是可学习的偏置。这些网络仅在其输入维度和输出角色上有所不同:
- • 奖励网络 (r):将连接的状态-动作向量 [s; a] ∈ ℝ² 映射到一个标量奖励,用于区分健康(专家)和故障(策略生成)的转移。
- • 价值网络 (V):接受标量状态 s ∈ ℝ 并输出预期的累积奖励,提供基于势能的塑形项以促进奖励泛化。
- • 策略网络 (π):接受标量状态 s ∈ ℝ 并输出高斯策略 π(a|s) = N(μ(s), σ²) 的均值 μ(s);状态无关的对数标准差 log σ 被单独学习。这种随机性在 rollout 期间鼓励探索,并缓解对记录示范的过拟合。
总参数数量为 644(奖励:257,价值:193,策略:194)。
### 3.3. 训练过程
每个 AIRL 训练周期包括两个阶段:(i) 判别器学习和 (ii) 策略改进。在判别器学习期间,抽取包含 128 个专家和策略生成转移的小批量数据,奖励和价值网络通过最小化标准 AIRL 交叉熵损失进行联合更新:
L_disc = − [ log σ(r_φ(s, a) + γ V_ψ(s′) − V_ψ(s)) (3)
+ log(1 − σ(r_φ(s, a_π) + γ V_ψ(s′_π) − V_ψ(s_π)) ) ]相似文章
数据稀缺下基于强化学习的数字孪生驱动自适应仿真到真实对齐方法用于振动轴承健康监测
本文提出了一种基于强化学习的自适应仿真到真实对齐方法,用于振动轴承健康监测,通过近端策略优化解决数据稀缺和异质故障类型差距问题。
通过自监督跨模态重构实现机械多模态时间序列的鲁棒故障检测
本文提出了一种用于机械系统故障检测的多模态异常检测框架,该框架采用自监督跨模态重构和自适应阈值设置,以提高在分布偏移下的鲁棒性。
针对联合故障诊断与剩余使用寿命估计的注意力增强多任务学习的泄漏鲁棒评估与数据规模敏感性
本文证明了在滑动窗口序列上使用简单的训练/测试分割会严重夸大或缩小预测性维护中多任务学习的性能指标,并提出了一种泄漏鲁棒的评估协议。
逆向自触发控制:针对稀疏拒绝服务攻击的对抗强化学习
本文提出了一种对抗强化学习代理,该代理学习通过稀疏拒绝服务攻击来干扰自触发控制器,在诸如 Pendulum 和 Quadrotor2D 等控制系统上超越了基线方法。
频谱混叠前置任务:旋转机械自监督故障诊断的新任务
本文介绍了频谱混叠前置任务(SAP),一种面向旋转机械故障诊断的自监督学习方法。通过有意对振动信号进行欠采样,并训练Transformer重建原始频谱,SAP学习到具有判别性的频域表示,从而在有限标注数据下实现强大的分类性能。