多任务学习在预测过程监控中的潜力
摘要
本文首次对多任务学习在预测过程监控中的应用进行了全面的实证研究,展示了在下一活动预测和类不平衡缓解方面相较于单任务学习的改进。
arXiv:2609.13477v1 公告类型:新
摘要:预测过程监控(PPM)预测组织流程的展开过程,使信息系统能够超越执行支持,转向主动分析和监控。尽管深度学习提高了PPM的预测准确性,但大多数方法遵循单任务学习(STL)设置,为每个任务训练单独的模型。这增加了维护工作量,并忽视了潜在的协同效应。多任务学习(MTL)在一个模型中联合学习多个预测目标,提供了一种有前景的替代方案,但其在PPM中的有效性仍未得到充分探索。目前尚不清楚MTL在何种条件下优于STL,哪些预测任务从联合学习中获益最多,哪些任务组合特别具有协同效应,以及任务是否需要平衡以及如何平衡。为填补这一空白,我们首次对MTL在PPM中的应用进行了全面的实证研究,评估了各种任务组合、神经网络架构和优化方法。总体而言,我们的结果将MTL定位为PPM的一个强大范式:我们看到使用MTL在下一活动预测和内在类不平衡缓解方面有显著改进,而在低容量模型下任务平衡尤为关键。
查看缓存全文
缓存时间: 2026/09/15 08:39
# 多任务学习在预测性过程监控中的潜力
来源:https://arxiv.org/html/2609.13477
Lukas Kirchdorfer\*SAP Signavio,曼海姆大学lukas\.kirchdorfer@sap\.comKeyvan Amiri Elyasi\*曼海姆大学keyvan\.amiri@uni\-mannheim\.deHeiner Stuckenschmidt曼海姆大学heiner\.stuckenschmidt@uni\-mannheim\.de\*同等贡献
###### 摘要
预测性过程监控(PPM)预测组织中持续进行的过程如何展开,使信息系统能够从执行支持转向主动分析和监控。尽管深度学习提升了PPM的预测准确性,但大多数方法遵循单任务学习(STL)模式,为每个任务训练独立模型。这增加了维护工作量,并忽略了潜在的协同效应。多任务学习(MTL)在一个模型中联合学习多个预测目标,提供了一种有前景的替代方案,但其在PPM中的有效性仍未得到充分探索。目前尚不清楚MTL在何种程度上、何种设置下优于STL,哪些预测任务最受益于联合学习,哪些任务组合具有特别的协同效应,以及任务是否应平衡以及如何平衡。为填补这一空白,我们首次对PPM的MTL进行了全面的实证研究,评估了多种任务组合、神经架构和优化方法。总体而言,我们的结果将MTL定位为PPM的一个强大范式:我们看到使用MTL在下一个活动预测和类别不平衡方面有显著改善,而任务平衡在低容量模型下尤为关键。
#### 关键词:
预测性过程监控,多任务学习,深度学习,流程挖掘。
## 1引言
信息系统支持各领域组织流程的执行,并生成广泛的事件数据流,记录随时间推移的人类和机器活动序列\(van der Aalst,2016 (https://arxiv.org/html/2609.13477#bib.bib20)\)。预测这些流程将如何展开,对于优化资源分配、防止故障以及支持及时的运营决策至关重要。预测性过程监控(PPM)利用历史执行数据来预测正在进行案例的关键方面,例如下一个活动、下一个事件的时间、剩余周期时间或最终结果\(Di Francescomarino和Ghidini,2022 (https://arxiv.org/html/2609.13477#bib.bib19)\)。PPM的最新进展由深度学习模型驱动,这些模型通常在单任务学习(STL)范式下开发,专注于单一预测目标,例如估计正在进行案例的剩余时间。
尽管具有强大的预测性能,STL模型面临两个主要限制。首先,它们计算成本高昂\(Chen等人,2018 (https://arxiv.org/html/2609.13477#bib.bib9)\),阻碍了在现实工业环境中的部署。例如,像SAP Signavio、Celonis或Apromore这样的流程挖掘供应商需要为每个任务、流程和客户训练和维护单独的模型,导致运营开销增加和可扩展性有限。其次,STL模型孤立地处理预测任务,忽略了跨任务依赖性\(Kendall等人,2018 (https://arxiv.org/html/2609.13477#bib.bib2);Chen等人,2018 (https://arxiv.org/html/2609.13477#bib.bib9)\)。例如,在医院流程中,了解下一个活动可以支持剩余时间预测,反之亦然。忽略这种协同效应会阻止STL模型充分利用流程数据的结构。
为克服这些限制,多任务学习(MTL)提供了一种有前景的替代方案,使单个模型能够联合学习多个预测目标\(Caruana,1997 (https://arxiv.org/html/2609.13477#bib.bib15)\)。这种范式在计算机视觉等领域已被证明非常有效\(Kendall等人,2018 (https://arxiv.org/html/2609.13477#bib.bib2)\)。然而,在PPM的背景下,MTL的潜力在很大程度上仍未被充分探索。少数采用MTL设置的研究\(Tax等人,2017 (https://arxiv.org/html/2609.13477#bib.bib17);Camargo等人,2019 (https://arxiv.org/html/2609.13477#bib.bib16);Wuyts等人,2024 (https://arxiv.org/html/2609.13477#bib.bib26);Hennig和Schmidt,2025 (https://arxiv.org/html/2609.13477#bib.bib27)\)几乎没有提供MTL是否以及何时能提高预测性能的证据。尚不清楚各个任务在联合训练时表现如何,以及哪些PPM任务组合实际上是互补的。此外,现有工作均未采用任务平衡技术,而这通常是MTL成功的关键因素\(Kendall等人,2018 (https://arxiv.org/html/2609.13477#bib.bib2)\)。相反,它们依赖于任务损失的简单求和,这会导致主导任务抑制其他任务,并可能降低整体性能。
本文的主要贡献是通过首次对PPM的MTL进行系统且大规模的实证评估来解决这些开放性问题。我们的研究为MTL何时以及如何有益提供了可操作的见解。为此,我们在来自不同领域的九个真实世界事件日志、三种神经网络架构、三种常见预测任务(下一个活动、下一个时间和剩余时间预测)的所有成对和联合组合,以及十三种多任务优化(MTO)方法上进行了广泛的基准测试。我们的研究由以下研究问题指导:
- •RQ1:MTL是否优于STL,哪些神经网络架构最受益于多任务设置?
- •RQ2:哪些预测目标最受益/最不受联合学习的影响?
- •RQ3:性能在不同任务组合间如何变化?
- •RQ4:哪种MTO方法能产生最佳结果?
## 2背景与相关工作
本节介绍MTL的背景,并回顾MTL在PPM中应用的相关工作。
多任务学习。MTL是指在多个相关预测任务上联合训练模型的范式,旨在通过共享表示和归纳迁移来提高泛化能力\(Caruana,1997 (https://arxiv.org/html/2609.13477#bib.bib15)\)。MTL研究可大致分为三个主要领域。第一个方向专注于*网络架构*,特别是如何跨任务共享特征以最大化性能\(Liu等人,2019 (https://arxiv.org/html/2609.13477#bib.bib3)\)。第二个领域研究*任务亲和性*,探讨哪些任务应该分组一起学习以从联合训练中受益\(Standley等人,2020 (https://arxiv.org/html/2609.13477#bib.bib4)\)。第三个领域是*多任务优化*(MTO),专注于在训练过程中平衡任务,以缓解负迁移,即某些任务主导训练并降低其他任务性能的情况。这个问题可能源于梯度冲突,即特定任务的梯度在大小或方向上存在显著差异。当发生这种冲突时,使用平均梯度更新共享主干可能会损害一个或多个任务。
已有大量MTO方法被提出以缓解负迁移。损失加权方法旨在通过为任务特定损失分配单独的权重来平衡训练。这些权重可以通过学习任务不确定性(UW)\(Kendall等人,2018 (https://arxiv.org/html/2609.13477#bib.bib2)\)、计算损失变化率(DWA)\(Liu等人,2019 (https://arxiv.org/html/2609.13477#bib.bib3)\)、随机采样(RLW)\(Lin等人,2022 (https://arxiv.org/html/2609.13477#bib.bib6)\)、计算损失的(归一化)倒数作为权重(UW\-O和UW\-SO)\(Kirchdorfer等人,2024 (https://arxiv.org/html/2609.13477#bib.bib7)\),或者对不同可能的权重组合进行网格搜索(Scalarization)\(Xin等人,2022 (https://arxiv.org/html/2609.13477#bib.bib8)\)来获得。几何损失策略(GLS)\(Chennupati等人,2019 (https://arxiv.org/html/2609.13477#bib.bib5)\)提供了一种替代方案,通过几何平均来组合损失。基于梯度的方法则直接操作任务梯度,要么对其进行重新缩放,要么在聚合前强制对齐。梯度缩放方法包括Grad\-Norm\(Chen等人,2018 (https://arxiv.org/html/2609.13477#bib.bib9)\),它通过归一化梯度来平衡任务影响,以及Nash\-MTL\(Navon等人,2022 (https://arxiv.org/html/2609.13477#bib.bib10)\),它将MTL框架化为讨价还价问题并推导出相应的缩放因子。面向对齐的技术——如GradDrop\(Chen等人,2020 (https://arxiv.org/html/2609.13477#bib.bib12)\)、PCGrad\(Yu等人,2020 (https://arxiv.org/html/2609.13477#bib.bib13)\)和CAGrad\(Liu等人,2021a (https://arxiv.org/html/2609.13477#bib.bib14)\)——操作梯度向量以减少任务之间的冲突。最后,混合方法如IMTL\(Liu等人,2021b (https://arxiv.org/html/2609.13477#bib.bib11)\)结合了损失加权和梯度缩放,以利用两者的优势。
表1:应用MTL的现有PPM方法比较。架构:L = LSTM,T = Transformer,C = CNN。STL表示是否将MTL与其单任务基线进行比较。组合表示是否评估了所有任务组合。分析表示该研究是否分析了MTL何时以及为何有益。PPM中的MTL。MTL已被应用于PPM方法中,但仅在少数研究中,总结于表1 (https://arxiv.org/html/2609.13477#S2.T1)。早期工作主要依赖于基于LSTM的模型,联合预测下一个活动和时间,而最近的研究则探索了基于Transformer的多任务模型。先前研究主要集中于单一架构和特定任务组合,通常依赖于相等或静态的任务权重,很少与STL基线进行比较,并且不对MTL设置进行进一步分析。相比之下,我们的工作通过对(i)深入分析MTL何时以及如何有益,(ii)评估13种MTO方法而不仅仅是相等或静态加权,(iii)系统地研究三种预测任务的所有组合,以及(iv)在LSTM、CNN和Transformer上将MTL与STL进行比较,构成了PPM中MTL的首次全面基准测试。
## 3预备知识
本节正式介绍数据、PPM任务和MTL问题陈述。
事件日志、轨迹、事件前缀。我们假设流程执行数据记录在事件日志E\mathcal\{E\}中,定义为一组有限的轨迹。每条轨迹σ=\langle e_1,e_2,...,e_n\rangle表示单个流程实例(案例)的有序事件序列,每个事件是一个元组e=(c,a,t,r)。令π_A和π_T分别表示将事件映射到其活动和时间戳的函数,使得π_A(e)=a且π_T(e)=t。其余事件属性c和r分别对应案例标识符和负责资源。对于给定轨迹σ,其长度为m\in\[1,n-1]的事件前缀定义为σ^m=\langle e_1,...,e_m\rangle,表示该案例到第m个事件的部分执行。
PPM任务。PPM通常被表述为分类或回归问题,通常从特征提取步骤开始。在此步骤中,为每个已完成的轨迹生成不同长度的事件前缀,以表示处于不同执行阶段的过程。然后,将每个事件前缀编码为特征向量\Gamma(\sigma^m)=x\in\mathcal\{X\},并与一个或多个目标值y_k\in\mathcal\{Y\}关联,每个目标值对应一个特定的PPM任务。给定轨迹σ的事件前缀σ^m,我们考虑以下三个常见研究的PPM任务,每个任务都定义为特征向量上的预测函数:
- •下一个活动预测学习函数δ_a以预测下一个活动:\hat{y}_1=δ_a(x)≈π_A(e_{m+1})。
- •下一个时间预测学习函数δ_t以估计到下一个事件的时间间隔:\hat{y}_2=δ_t(x)≈π_T(e_{m+1})-π_T(e_m)。
- •剩余时间预测学习函数δ_rt以估计当前事件与轨迹最后一个事件之间的时间间隔:\hat{y}_3=δ_rt(x)≈π_T(e_n)-π_T(e_m)。
MTL问题陈述。我们考虑具有单一输入域和由共享主干与任务特定头组成的神经网络的监督多任务学习,如图1 (https://arxiv.org/html/2609.13477#S3.F1)所示。给定输入x\in\mathcal\{X\},模型为每个任务k\in\{1,...,K\}返回一个预测y_k。对于我们三个PPM任务,这对应于f_{\bm{\theta}}(x)=[δ_a(x),δ_t(x),δ_rt(x)],其中\bm{\theta}表示可训练参数(共享和任务特定的)。每个任务有自己的损失\mathcal\{L\}_k(f_{\bm{\theta}}(x),y_k)(例如,分类的交叉熵或回归的均方误差)。在训练期间,我们用加权和组合它们:\mathcal\{L\}=\sum_k\omega_k\mathcal\{L\}_k,其中\omega_k≥0是任务权重(例如,对于相等权重EW:\omega_k=1)。
事件前缀x共享主干(LSTM/CNN/Transformer)下一个活动预测头下一个时间预测头剩余时间预测头
图1:具有共享主干和任务特定头的多任务设置。
## 4实验设置
本节概述了用于评估多任务设置训练预测性过程监控模型有效性的实验设计。完整实现(使用Python和PyTorch开发)、补充材料和额外结果在我们的公开仓库中提供111https://github.com/lukaskirchdorfer/MTL4PPM。
评估数据。我们的评估使用了九个真实世界事件日志,222数据集来自https://data.4tu.nl/;在我们的仓库中可获取,如表2 (https://arxiv.org/html/2609.13477#S4.T2)所述。这些日志代表来自不同领域的各种组织流程,包括金融服务、医疗保健、教育和制造,所有这些都是PPM研究中常用的。
表2:所用事件日志的特征:ACT = 不同活动数,RES = 不同资源数,ALT = 流程实例的平均前置时间(天)。数据划分。每个事件日志按时间顺序划分为64%训练集、16%验证集和20%测试集。所有模型在每个案例的事件前缀上训练,长度从1到n-1,其中n表示案例中的总事件数。此外,我们使用Weytjens和Weerdt (2021) (https://arxiv.org/html/2609.13477#bib.bib31)提出的无偏划分策略评估我们发现的鲁棒性,该策略引入了更严格的数据泄露防护措施。相应的结果(在我们的仓库中提供)证实本文的主要观察结果在该划分策略下同样成立。
特征提取。对于每个前缀,我们构建一个固定长度的序列表示,覆盖最大案例长度n(此处略)。相似文章
针对联合故障诊断与剩余使用寿命估计的注意力增强多任务学习的泄漏鲁棒评估与数据规模敏感性
本文证明了在滑动窗口序列上使用简单的训练/测试分割会严重夸大或缩小预测性维护中多任务学习的性能指标,并提出了一种泄漏鲁棒的评估协议。
PEML:面向优化连续提示的参数高效多任务学习
PEML提出了一种参数高效的多任务学习方法,通过低秩自适应共同优化连续提示和模型权重。在多个基准测试上,平均准确率提升高达6.67%。
多任务贝叶斯优化的陷阱与补救措施
本文确定了两种结构机制,导致多任务高斯过程在贝叶斯优化迁移学习中错误估计跨任务相关性,即使对于仿射相关的任务也是如此。作者提出了三种保守的补救措施来缓解这些问题。
干扰感知的多任务机器遗忘
本文介绍了一种干扰感知的多任务机器遗忘框架,通过任务感知的梯度投影和实例级别的梯度正交化来解决任务级和实例级干扰,在多任务计算机视觉基准上实现了有效的遗忘。
用于多任务ADME性质预测的概率对比预训练
本文提出了一种用于分子图变换器的概率对比预训练框架,以改善药物发现中的多任务ADME性质预测,在三个基准上取得了显著提升。