规划或学习:多资产维护中的可靠性与成本
摘要
本文通过实证比较了规划与强化学习方法在多资产工业系统中的维护调度,突出了可靠性与成本之间的权衡,并基于操作目标表明它们是互补的。
arXiv:2609.13566v1 公告类型:新
摘要:工业维护系统涉及多个相互作用的资产和共享资源,使得使用单一决策框架平衡可靠性和运营成本变得具有挑战性。虽然近期工作主要集中在强化学习 (RL) 用于维护调度,但在相同设置下与规划方法的直接比较仍然有限。本文中,我们使用运行至故障数据,实证比较了规划与RL在多资产轴承维护中的应用。我们研究了这些方法在平衡预防性维护与可容忍故障时,在不同故障惩罚场景下的行为。我们观察到由目标制定驱动的持续行为差异。规划将可靠性作为硬约束执行,并产生零故障策略,其总成本在很大程度上对故障惩罚的大小不敏感。RL代理优化期望成本,并随着惩罚变化经常在预防性维护与偶尔故障之间进行权衡,导致在低惩罚环境下成本较低,但在高惩罚时仍然存在持续的非零故障。我们还研究了轻量级约束机制,包括奖励塑造和动作掩码,以鼓励RL的可靠性。从实际角度来看,当需要严格可靠性且部署范围较短时,规划可能更合适,而当有限故障可接受且优先考虑长期运营效率时,RL可能提供成本有效的策略。总体而言,本研究阐明了多资产维护中可靠性与成本之间的权衡,并表明规划与RL是互补的方法。除了这些发现,统一环境、成本模型和跨范式评估的受控基准协议本身,为在其他维护环境中比较决策方法提供了可重用的模板。
查看缓存全文
缓存时间: 2026/09/15 08:57
# 规划还是学习:多资产维护中的可靠性与成本权衡
来源:https://arxiv.org/html/2609.13566
Chandrasekar Venkatraman所属机构:美国圣克拉拉;Ahmed Farahat所属机构:\{xian\.lee, chandrasekar\.venkatraman, ahmed\.farahat\}@hal\.hitachi\.com
###### 摘要
工业维护系统日益涉及多个相互作用的资产和共享资源,使得在单一决策框架下平衡可靠性与运营成本变得极具挑战。虽然近期研究聚焦于基于强化学习的维护调度,但在相同设置下与规划方法的直接比较仍然有限。本研究使用轴承的故障运行数据,对规划与强化学习在多资产轴承维护中的表现进行实证比较。我们考察了在不同故障惩罚场景下,这些方法在预防性维护与可接受故障之间的平衡行为。研究观察到由目标函数设定导致的一致行为差异:规划方法将可靠性作为硬性约束,产生零故障策略,其总成本对故障惩罚的大小基本不敏感;强化学习智能体则优化期望成本,常在惩罚变化时权衡预防性维护与偶发故障,导致在低惩罚环境下成本更低,但即使在高惩罚下也持续存在非零故障。我们还研究了轻量级约束机制,包括奖励塑形和动作掩码,以促进强化学习的可靠性。从实践角度看,当需要严格可靠性且部署周期较短时,规划可能更适用;而当可接受有限故障且优先考虑长期运营效率时,强化学习可能提供更具成本效益的策略。总体而言,本研究阐明了多资产维护中可靠性与成本的权衡,揭示了在强化学习中强制实现零故障行为的挑战,并表明规划与强化学习是互补方法,其适用性取决于运营目标。除了这些发现,本研究提出的受控基准协议——统一了不同范式下的环境、成本模型和评估标准——也为在其他维护场景中比较决策方法提供了可复用模板。
## 1引言
工业设备日益以机队形式运行,其中多个资产同时退化并共享维护资源,如技术员、工具和预定停机窗口(O'Neil等人,2025年,https://arxiv.org/html/2609.13566#bib.bib18)。例如,在风力发电场,将一台涡轮机下线进行维护可能需要重新分配团队并协调附近机组的停机,直接影响其余涡轮机的可用性和风险暴露。在旋转机械中也存在类似的协调挑战,多个轴承沿着独立的故障运行轨迹退化,但必须由共享的维护团队进行服务。在这种情况下,决策本质上是相互耦合的,维护计划成为机队级别的调度问题,而非一系列独立的资产级决策。
针对此类问题,已有两大类方法被应用。规划方法明确地制定调度任务,使用定义的目标函数在联合机队状态空间中进行搜索,并可选择对故障或停机设置硬性约束。强化学习方法则通过交互学习调度策略,将问题建模为马尔可夫决策过程,并优化折扣奖励总和。这些方法近期日益流行,部分原因是它们能够自然处理退化动态和决策结果中的不确定性,而无需显式建模所有系统状态转移(Siraskar等人,2023年,https://arxiv.org/html/2609.13566#bib.bib2)。两种方法在维护及相关序贯决策领域均已展现出价值。然而,即使在相邻的调度领域,在共享环境和成本结构下对规划与强化学习进行受控比较仍然罕见;唯一的例外是一项针对电厂调度机组组合的研究,该研究显示在相同条件下,混合整数规划始终能生成比强化学习成本更低、更可靠的调度方案(O’Malley等人,2022年,https://arxiv.org/html/2609.13566#bib.bib19)。
尽管两种方法有相似之处,但比较并非易事,因为它们解决的并非同一问题。带有硬性零故障约束的规划方法只要存在可行方案,就总会生成零故障的调度计划,使得故障惩罚的大小对其决策无关。相比之下,强化学习范式通常将故障视为一种软性成本,如果预防的折扣效益小于维护成本,它可能会接受故障。这种目标函数设定上的差异,即使在两种方法获得相同状态信息的情况下,也可能产生系统性不同的策略。
本文对规划与强化学习在多资产维护调度实例中的表现进行了系统性的实证比较,该实例使用了轴承故障运行数据集。本文做出以下贡献:
- • 一个受控的实证基准:将规划与强化学习置于统一的环境、成本结构和评估协议下进行多资产维护调度,提供了两种范式之间的直接比较,并为在其他维护和PHM场景中评估决策方法提供了可复用模板。
- • 揭示了由公式设定驱动的行为差距:规划将避免故障作为硬性约束,对故障惩罚大小不敏感;而强化学习优化折扣软成本,在资产寿命超过有效折扣时域时,表现出倾向于零维护的结构性偏差。
- • 评估了轻量级可靠性机制:表明奖励塑形对故障行为影响甚微,动作掩码能更显著地减少故障但带来显著的计算开销,但两者都未能弥合与规划方法在可靠性上的差距。
## 2相关工作
### 2.1维护调度规划
基于状态的维护(CBM)和预测性维护(PdM)利用健康状态估计在故障发生前安排干预(Sakib和Wuest,2018年,https://arxiv.org/html/2609.13566#bib.bib14)。对于多资产系统,调度涉及在具有不同退化状态的资产之间分配共享维护资源,这引入了单资产策略无法考虑的依赖关系(Petchrompo和Parlikad,2019年,https://arxiv.org/html/2609.13566#bib.bib15)。基于规则的策略,如固定间隔更换和状态阈值触发,在实践中因其简单性而常见,但它们不能适应联合机队状态,可能导致对个体资产维护过度或不足。
模型预测控制(MPC)类型的滚动时域规划方法也被应用于维护调度(Zhang等人,2025年,https://arxiv.org/html/2609.13566#bib.bib16)。这些方法将调度任务制定为在明确状态空间上的序贯决策问题,能够对所有资产进行联合优化。一种常见的执行策略是滚动时域控制,即只执行计划序列中的第一个动作,并在每一步根据更新状态重新计算计划。然而,在线重新规划的计算成本在大规模应用中是一个实际限制。
### 2.2强化学习用于维护调度
强化学习因其能够通过交互学习成本最小化策略而无需显式系统模型,在维护调度领域日益受到关注(Ong等人,2021年,https://arxiv.org/html/2609.13566#bib.bib3;Feng和Li,2022年,https://arxiv.org/html/2609.13566#bib.bib4;Siraskar等人,2023年,https://arxiv.org/html/2609.13566#bib.bib2)。针对共享人员或预算约束的多资产场景的扩展研究也日益增多,但在相同环境下与规划基线进行的系统性比较仍然稀缺(Zhang等人,2022年,https://arxiv.org/html/2609.13566#bib.bib13)。应用强化学习于维护领域的一个反复出现的挑战是奖励稀疏性:延迟维护(即故障)的后果可能在数百或数千步之后才显现,导致信用分配困难(Pignatelli等人,)。在多资产场景中,人员约束在动作后果之间引入了额外的依赖关系,使得这一挑战更为复杂。
有几种方法用于解决在学习策略中强制实施可靠性约束的问题。奖励塑形在训练过程中放大惩罚项,以引导策略满足约束,而不修改策略架构或评估协议(Hu等人,2020年,https://arxiv.org/html/2609.13566#bib.bib9)。动作掩码阻止选择违反手工制定的安全规则的动作,减少了训练和部署时的可行行为空间(Hou等人,2023年,https://arxiv.org/html/2609.13566#bib.bib10)。约束马尔可夫决策过程(CMDPs)提供了一个原则性框架,用于对期望累积成本施加不等式约束,拉格朗日松弛是标准解决方法(Altman,2021年,https://arxiv.org/html/2609.13566#bib.bib11);近期工作将这些保证扩展到训练过程中的安全探索和随机停止时间设置(Wachi和Sui,2020年,https://arxiv.org/html/2609.13566#bib.bib21;Mazumdar等人,2024年,https://arxiv.org/html/2609.13566#bib.bib22),以及专门针对检查和维护规划的约束POMDP公式(Andriotis和Papakonstantinou,2021年,https://arxiv.org/html/2609.13566#bib.bib20)。屏蔽方法在智能体和环境之间施加一个形式化安全监视器,根据规范在运行时覆盖不安全动作(Alshiekh等人,2018年,https://arxiv.org/html/2609.13566#bib.bib12)。在本研究中,我们评估了奖励塑形和动作掩码作为轻量级方法,而将CMDP和屏蔽留作未来研究。
除了CMDP和屏蔽,其他公式旨在缩小强化学习目标与可靠性导向规划之间的差距。平均奖励强化学习优化长期平均成本而非几何折扣回报,从而避免第6.4节讨论的折扣时域不匹配问题(https://arxiv.org/html/2609.13566#S6.SS4);在折扣强化学习中类似的时域相关偏差已在其他长期序贯决策领域被记录(Yang等人,2024年,https://arxiv.org/html/2609.13566#bib.bib24)。风险敏感强化学习则将显式风险度量(如条件风险价值或指数效用)纳入训练目标或作为约束,为将策略偏向罕见但代价高昂的故障事件提供了另一条途径(Prashanth和Fu,2022年,https://arxiv.org/html/2609.13566#bib.bib23)。我们在此未评估这些公式,但将其与CMDP一起视为缩小本研究中观察到的规划与强化学习可靠性差距的有希望方向。
图例标题 图1:(a)从原始振动信号到健康指标再到维护决策的流程。(b)轴承在早期阶段(第1行)、中期(第2行)和接近故障阶段(第3行)的原始水平(蓝色)和垂直(红色)加速度计信号。(c)所有六个轴承的综合RMS健康指标轨迹,每个轴承在故障前遵循不同的退化曲线。
## 3问题描述
### 3.1多轴承系统
我们考虑一组并行运行的N个轴承,每个轴承遵循独立的退化轨迹走向故障。为了具体化,我们在图1(https://arxiv.org/html/2609.13566#S2.F1)(a)中说明了典型流程,其中原始传感器信号如图1(https://arxiv.org/html/2609.13566#S2.F1)(b)所示,通常被处理成估计的剩余使用寿命(RUL)或离散健康指标。根据观测读数,维护计划通过手动、固定规则或本研究中的规划/强化学习算法生成。所有轴承共享一个维护团队,因此每个时间步最多只能维护一个轴承。当一个轴承接受维护时,它被恢复到全新等效状态或估计的新寿命。所有其他轴承在维护步骤中继续正常退化。
令\(s_t = (h_t^1, \dots, h_t^N)\)表示时间\(t\)时的机队状态,其中\(h_t^i\)是轴承\(i\)的健康状态或剩余有用寿命。令\(a_t \in \{0, 1, \dots, N\}\)表示动作,其中\(a_t = 0\)对应不进行维护,\(a_t = i\)表示对轴承\(i\)进行服务。系统演化为
\[h_{t+1}^i = \begin{cases} g(h_t^i), & \text{如果 } a_t \neq i \\ \tilde{h}_0^i, & \text{如果 } a_t = i \end{cases}\]
其中\(g(\cdot)\)表示退化动态,\(\tilde{h}_0^i\)是维护后状态,可能对应于新状态或估计的新寿命。多资产维护问题的目标是在团队可用性约束下,制定维护轴承的最优计划,同时使成本和故障最小化。
### 3.2映射到离散健康指标
维护调度的一个常见做法是将原始传感器数据映射到离散健康指标以简化方法。在本研究中,我们探索了两种变体,规划和强化学习算法或观测估计的连续RUL,或观测系统的离散状态。
为了将原始传感器数据映射到离散状态,我们执行以下步骤:对于每个轴承,我们根据水平和垂直振动加速度计信号计算一个综合健康指标。在每个10秒的记录窗口内,对每个通道的2560个可用样本计算均方根(RMS)幅值。然后定义综合健康指标为:
\[HI(t) = \sqrt{RMS_h(t)^2 + RMS_v(t)^2}\]
其中\(RMS_h\)和\(RMS_v\)分别表示水平和垂直通道的幅值。应用移动平均来抑制测量噪声。然后,使用真实剩余有用寿命标签将每个轴承的健康状态离散化为四类之一:健康、退化、临界或故障:如果轴承保留超过其初始寿命的75%,则为健康;在25%到75%之间为退化;低于25%为临界;剩余寿命为零时为故障。
### 3.3成本模型
我们将包含T个时间步的单个情节的运营成本定义为:
\[C = \sum_{t=1}^{T} \left[ c_{\text{op}} \cdot N_{\text{act}}(t) + c_{\text{m}} \cdot \mathbf{1}[a_t \neq \text{noop}] + c_{\text{f}} \cdot N_{\text{fail}}(t) \right]\]
其中\(c_{\text{op}} = 1.0\)是每个活跃轴承每步的运营成本,\(c_{\text{m}} = 25.0\)是维护动作的固定成本,\(c_{\text{f}}\)是故障惩罚(在不同实验中变化),\(N_{\text{act}}(t)\)是第\(t\)步活跃运行的非故障轴承数量,不包括当前正在维护的轴承(如有):正在接受服务的轴承被视为相似文章
何时规划:学会在响应式控制与深思熟虑的规划之间进行选择
本文介绍了一种强化学习方法,用于训练一个元推理策略,该策略基于响应式策略的不确定性,在快速的响应式控制与较慢的深思熟虑规划之间进行选择,从而在导航任务中实现更好的平衡与适应性。
针对联合故障诊断与剩余使用寿命估计的注意力增强多任务学习的泄漏鲁棒评估与数据规模敏感性
本文证明了在滑动窗口序列上使用简单的训练/测试分割会严重夸大或缩小预测性维护中多任务学习的性能指标,并提出了一种泄漏鲁棒的评估协议。
从求解器反馈到忠实计划:基于多角色强化学习的符号规划
本文提出了一种利用求解器反馈的多角色强化学习框架,用于将自然语言转换为PDDL规范以进行符号规划,与现有方法相比,提高了成功率和忠实度。
当规划正确执行却失败时:论基于LLM的多智能体系统的认知校准
本文识别了基于LLM的多智能体系统中的一种失败模式,即由于智能体错误判断自身知识(认知校准不当)而导致规划失败,并提出EPC-AW工作流,通过信息一致性和认知状态细化将系统级成功率提升9.75%。
基于可靠性的双目标投资组合优化的深度强化学习
本文提出了一种深度强化学习框架(MORP-DRL),用于多目标基于可靠性的投资组合优化,在实践约束下使用CVaR和EVaR联合优化期望收益和下行风险,并在不同市场体制下的全球股票指数上展示了性能。