统一粒子滤波LSTM用于数据驱动过程模拟
摘要
提出一种统一粒子滤波LSTM框架,用于数据驱动过程模拟,该框架维护加权递归状态假设以处理事件日志中的部分观测,并在重现路由和持续时间行为方面优于基线方法。
arXiv:2609.01967v1 公告类型:新
摘要:数据驱动过程模拟旨在从历史事件日志中生成真实的案例轨迹,而无需明确指定底层动力学的模型。深度序列模型可以通过下一活动概率和条件时间分布来捕获复杂的时间依赖关系。然而,事件日志仅提供底层过程状态的部分视图,通常记录活动完成情况而没有相应的服务开始时间。因此,相同的观测过程历史可能与多个合理的潜在过程条件一致,而标准递归模型将每个过程前缀压缩为单个确定性递归状态。我们提出了一种统一粒子滤波LSTM(Unified PF-LSTM),该框架维护并顺序更新一组加权的递归状态假设。我们使用其加权均值和基于矩生成函数学习到的特征来总结这种粒子信念。所得表示用于预测下一活动的类别分布和当前活动停留时间的条件分位数。该框架从事件日志数据中端到端训练,并在三个真实世界的急诊科数据集上进行评估。结果表明,所提框架在重现所有数据集的路由、持续时间和系统级行为方面始终优于所考虑的数据驱动基线方法,特别是在复杂过程动态仅部分反映在可用事件日志中的设置中,有显著提升。
查看缓存全文
缓存时间: 2026/09/03 06:13
# 用于数据驱动过程仿真的统一粒子滤波LSTM 来源:https://arxiv.org/html/2609.01967 Parvin Malekzadeh\*、Opher Baron、Dmitry Krass 所属机构:加拿大多伦多大学罗特曼管理学院 通讯作者所属机构:\*[p\.malekzadeh@rotman\.utoronto\.ca](mailto:[email protected]) ###### 摘要 数据驱动过程仿真旨在根据历史事件日志生成逼真的案例轨迹,无需显式建模底层动态过程。深度序列模型能够通过下一活动概率与条件时间分布捕捉复杂的时间依赖性。然而,事件日志仅能反映底层过程状态的部分信息,通常只记录活动完成时间而缺少相应的服务开始时间。因此,相同的历史观测可能对应多种合理的潜在过程状态,而标准循环模型会将每个过程前缀压缩为单一的确定性循环状态。本文提出一种统一粒子滤波LSTM(统一PF-LSTM),维护并序贯更新一组带权重的循环状态假设。我们利用粒子信念的加权均值及其基于矩生成函数学习到的特征来总结该粒子集合,所得到的表征用于预测下一活动的类别分布以及当前活动驻留时间的条件分位数。该框架通过事件日志数据端到端训练,并在三个真实急诊数据集上进行评估。结果表明,在复现路径选择、持续时间和系统层面行为方面,所提框架在所有数据集上均一致优于基线方法。当复杂过程动态仅部分体现在可用事件日志中时,框架性能提升尤为显著。 ††脚注:本文已被2026年INFORMS数据科学研讨会接收。 ## 1 引言 排队论与离散事件仿真模型广泛用于分析拥堵、评估运营策略并支持容量规划决策,同时为数字孪生和运营假设分析奠定基础(Tao等人, 2018 (https://arxiv.org/html/2609.01967#bib.bib12))。然而,构建高保真仿真器通常需要建模者指定系统结构、到达与服务过程、路由逻辑及资源交互,这需要大量领域知识与建模专长,尤其对于具有非平稳性、历史依赖性或部分观测动态的系统。此外,还需收集可能难以维护的新定制数据,并涉及建模者的许多主观决策——两位仿真专家很可能得出不同的模型规范。 现代信息系统日益将运营过程记录为包含事件序列、时间戳、案例属性及上下文系统信息的事件日志。数据驱动过程仿真直接利用这些记录从观测轨迹中学习生成模型,减少对底层动态过程的完全建模需求,提升建模透明度与可复现性。在每个事件处,此类模型必须捕捉两个相关机制:*路由*(决定案例下一步走向)和*驻留时间*(决定其在当前活动停留的时长)。这些结果依赖于案例历史、属性以及不断变化的系统状态(如拥堵程度)。 深度序列模型(包括长短期记忆LSTM网络)(Hochreiter与Schmidhuber, 1997 (https://arxiv.org/html/2609.01967#bib.bib19))是处理此类任务的自然选择,因为它们能够捕捉变长事件历史中的时间依赖性(Camargo等人, 2019 (https://arxiv.org/html/2609.01967#bib.bib14); Gunnarsson等人, 2023 (https://arxiv.org/html/2609.01967#bib.bib13))。然而,标准深度序列模型通常将每个观测到的过程前缀(即案例截至当前点的事件历史)压缩为单一确定性循环状态,即观测历史的学习数值表征。 事件日志数据仅能提供底层过程状态的部分视图。具体而言,许多现实事件日志每个活动仅记录一个时间戳(通常是完成时间),而服务开始时间不可得(Fracca等人, 2022 (https://arxiv.org/html/2609.01967#bib.bib16); Suriadi等人, 2015 (https://arxiv.org/html/2609.01967#bib.bib17))。因此,连续活动完成之间的耗时混合了等待时间与服务时间,相同观测间隔可能对应不同的底层运营条件。更一般地,相关案例特征可能缺失,系统测量可能存在噪声或延迟,而诸如有效资源可用性或未记录的工作负荷等因素可能无法观测。因此,相同观测历史可能与多种合理的潜在过程状态相容。单一循环状态仅代表观测历史的一种解释,无法明确保留这种潜在状态模糊性。该问题在递归生成阶段尤为重要,因为此时采样的活动和驻留时间将作为后续预测的输入。某一步的不准确循环表征会影响剩余轨迹,导致预测误差传播并累积。 **贡献** 为解决这一局限性,我们在粒子滤波LSTM(PF-LSTM)(Ma等人, 2020 (https://arxiv.org/html/2609.01967#bib.bib10))基础上进行改进。PF-LSTM不是维护单一循环状态,而是维护关于循环状态的加权粒子近似。它通过可微计算图实现的加权重要性粒子滤波过程来更新该信念。所得表征保留了观测历史的多种合理循环解释,并序贯更新其相对重要性。 直接使用完整粒子集进行预测较为困难,而仅使用其加权均值可能丢失关于信念形状的信息。因此,我们通过基于矩生成函数(MGF)(Bulmer, 1979 (https://arxiv.org/html/2609.01967#bib.bib11))学习到的特征来增强加权均值。这些特征具有置换不变性、计算高效、对许多排队表示具有统计充分性,且易于优化(尤其当粒子集较大时)(Johnson与Bhattacharyya, 2019 (https://arxiv.org/html/2609.01967#bib.bib1))。 所得固定维信念表征由两个预测头共享:路由头生成下一活动的类别分布,计时头估计当前活动驻留时间的条件分位数。我们的主要贡献包括: 1. 我们将基于MGF信念特征的PF-LSTM应用于数据驱动过程建模,表征由部分可观测性引起的潜在状态不确定性,同时建模路由和驻留时间结果的内在变异性。尽管使用LSTM实例化,但底层框架适用于其他序列架构。 2. 我们使用三个急诊科(ED)超过12万患者就诊和120万站点访问的数据,通过路由性能、时长校准和系统级保真度验证了该框架的有效性。我们观察到,尽管框架运行时间较长,但其精度显著提高,尤其对于事件日志提供底层系统状态信息有限的复杂流程。 **相关工作** 数据驱动过程建模研究包括等待时间预测、患者流预测、排队性能估计以及排队系统的生成建模(Ang等人, 2016 (https://arxiv.org/html/2609.01967#bib.bib3); Sharafat与Bayati, 2021 (https://arxiv.org/html/2609.01967#bib.bib4); Baron等人, 2024 (https://arxiv.org/html/2609.01967#bib.bib5); Ojeda等人, 2021 (https://arxiv.org/html/2609.01967#bib.bib6))。 随机森林和梯度提升等机器学习方法为过程结果提供了灵活的非参数模型。基于分位数的树集成还可估计条件结果分布与预测区间(Mehdiyev等人, 2025 (https://arxiv.org/html/2609.01967#bib.bib9))。然而,这些方法通常依赖固定维表征,无法直接捕捉变长事件历史中的依赖关系。 深度序列模型解决了这一局限性,包括LSTM等循环架构(Tax等人, 2017 (https://arxiv.org/html/2609.01967#bib.bib2); Camargo等人, 2019 (https://arxiv.org/html/2609.01967#bib.bib14); Camargo等人, 2021 (https://arxiv.org/html/2609.01967#bib.bib20); Gunnarsson等人, 2023 (https://arxiv.org/html/2609.01967#bib.bib13))以及基于Transformer的模型(Mittal等人, 2025 (https://arxiv.org/html/2609.01967#bib.bib8))。概率预测对仿真尤为重要:下一活动概率表征路由变异性,条件驻留时间分布表征活动持续时间变异性(Mittal等人, 2025 (https://arxiv.org/html/2609.01967#bib.bib8); Mehdiyev等人, 2025 (https://arxiv.org/html/2609.01967#bib.bib9))。然而,这些模型通常不表征由不完整事件日志观测引起的潜在状态不确定性。我们的工作通过粒子滤波机制(维护多个加权循环状态假设)弥补了这一差距。 ## 2 问题表述 运营数据通常以事件表形式提供,记录每个案例访问的活动序列及相应时间戳,以及静态案例属性(如年龄和性别)。我们将案例的活动轨迹表示为 σ=⟨\(A1,T1\),...,\(AN,TN\)⟩,\\sigma=\\big\\langle\(A\_\{1\},T\_\{1\}\),\\ldots,\(A\_\{N\},T\_\{N\}\)\\big\\rangle, 其中Ak∈AA\_\{k\}\\in\\mathcal\{A\}表示第kk步访问的活动,Tk≥0T\_\{k\}\\geq 0是直至转移到下一事件所花费的时间。 在每个事件处,我们用描述当前案例和系统状况的动态特征向量xk\\mathbf\{x\}\_\{k\}增强记录的过程历史。这些特征可能包括已流逝过程时间、系统中案例数量、活动级计数以及其他拥堵度量。令z\\mathbf\{z\}表示静态案例属性。我们将第kk步的观测(输入)定义为ok=\(Ak,Tk−1,xk\),\\mathbf\{o\}\_\{k\}=\\left\(A\_\{k\},T\_\{k\-1\},\\mathbf\{x\}\_\{k\}\\right\), 其中Tk−1T\_\{k\-1\}在首个事件时省略。截至第kk步可用的信息为 Hk=\(o1,...,ok,z\)=\(A1:k,T1:k−1,x1:k,z\)\.\\mathcal\{H\}\_\{k\}=\\left\(\\mathbf\{o\}\_\{1\},\\ldots,\\mathbf\{o\}\_\{k\},\\mathbf\{z\}\\right\)=\\left\(A\_\{1:k\},T\_\{1:k\-1\},\\mathbf\{x\}\_\{1:k\},\\mathbf\{z\}\\right\)\.\(1\) 给定每步k∈\{1,2,...,N\}k\\in\\\{1,2,\.\.\.,N\\\}的Hk\\mathcal\{H\}\_\{k\},目标是估计下一活动的条件分布 Pr\(Ak\+1=a∣Hk\),a∈A,withAN\+1=END,\\Pr\\\!\\left\(A\_\{k\+1\}=a\\mid\\mathcal\{H\}\_\{k\}\\right\),\\qquad a\\in\\mathcal\{A\},\\quad\\text\{with \}A\_\{N\+1\}=\\texttt\{END\},\(2\) 以及在该事件进入的活动的驻留时间分布。我们使用NqN\_\{q\}个分位数表示后者: Qτn\(Tk∣Hk\),τn=nNq\+1,n=1,...,Nq,Q\_\{\\tau\_\{n\}\}\\\!\\left\(T\_\{k\}\\mid\\mathcal\{H\}\_\{k\}\\right\),\\qquad\\tau\_\{n\}=\\frac\{n\}\{N\_\{q\}\+1\},\\qquad n=1,\\ldots,N\_\{q\},\(3\) 其中τn∈\(0,1\)\\tau\_\{n\}\\in\(0,1\)表示对应的分位数水平。基于分位数的表示避免了对事件持续时间分布强加特定参数族(该分布可能偏斜、重尾或存在异方差性)。 ## 3 方法论 事件日志数据仅提供底层过程状态的部分视图。尽管动态特征向量xk\\mathbf\{x\}\_\{k\}能捕捉可观测的系统状况,但影响案例路由和活动驻留时间的某些因素可能无法获取、存在测量误差或记录延迟。例如,由于仅提供活动完成时间戳,用作活动驻留时间的耗时无法区分等待时间与服务时间。资源可用性、未记录的工作负荷以及潜在案例特征也可能无法获取或测量不完善。因此,相同观测历史Hk\\mathcal\{H\}\_\{k\}可能对应多种合理的底层过程条件。 为表征由此产生的潜在状态不确定性,我们采用PF-LSTM架构;详见Ma等人(2020)(https://arxiv.org/html/2609.01967#bib.bib10)。我们首先简要概述PF-LSTM,然后介绍统一框架,该框架将粒子信念表征与路由和计时预测、端到端训练及递归仿真相结合。 ### 3.1 粒子滤波LSTM(PF-LSTM) 标准LSTM将Hk\\mathcal\{H\}\_\{k\}映射为单一循环状态。相比之下,PF-LSTM(Ma等人, 2020 (https://arxiv.org/html/2609.01967#bib.bib10))维护一组加权的循环状态假设。每个粒子是与观测历史相符的合理潜在过程条件的学习神经表征,而非物理过程状态的直接估计。这些粒子共同构成用于路由和计时预测任务的学习信念表征。 在处理观测ok=\(Ak,Tk−1,xk\)\\mathbf\{o\}\_\{k\}=\\left\(A\_\{k\},T\_\{k\-1\},\\mathbf\{x\}\_\{k\}\\right\)之前,粒子信念为 Bk−1=\{\(hk−1\(i\),ck−1\(i\),wk−1\(i\)\)\}i=1P,\\mathcal\{B\}\_\{k\-1\}=\\left\\\{\\left\(\\mathbf\{h\}\_\{k\-1\}^\{\(i\)\},\\mathbf\{c\}\_\{k\-1\}^\{\(i\)\},w\_\{k\-1\}^\{\(i\)\}\\right\)\\right\\\}\_\{i=1\}^\{P\},\(4\) 其中hk−1\(i\)\\mathbf\{h\}\_\{k\-1\}^\{\(i\)\}是粒子ii的隐藏状态,ck−1\(i\)\\mathbf\{c\}\_\{k\-1\}^\{\(i\)\}是其内部LSTM细胞状态,wk−1\(i\)w\_\{k\-1\}^\{\(i\)\}是其归一化权重。隐藏状态暴露于下游信念表征和预测头,而细胞状态作为粒子的内部循环记忆。因此,对(hk−1\(i\),ck−1\(i\)\)\\left\(\\mathbf\{h\}\_\{k\-1\}^\{\(i\)\},\\mathbf\{c\}\_\{k\-1\}^\{\(i\)\}\\right\)构成了粒子ii的循环状态,两个分量共同传播和重采样。此处PP表示粒子数量。 1. **随机粒子转移** 每个粒子通过共享的随机PF-LSTM转移进行传播: \((h~k\(i\),c~k\(i\)\)=gθtransit\(hk−1\(i\),ck−1\(i\),ok,εk\(i\)\),\) \\left\(\\widetilde\{\\mathbf\{h\}\}\_\{k\}^\{\(i\)\},\\widetilde\{\\mathbf\{c\}\}\_\{k\}^\{\(i\)\}\\right\)=g\_\{\\theta\}^\{\\mathrm\{transit\}\}\\left\(\\mathbf\{h\}\_\{k\-1\}^\{\(i\)\},\\mathbf\{c\}\_\{k\-1\}^\{\(i\)\},\\mathbf\{o\}\_\{k\},\\boldsymbol\{\\epsilon\}\_\{k\}^\{\(i\)\}\\right\),\(5\) 其中gθtransitg\_\{\\theta\}^\{\\mathrm\{transit\}\}是以θ\\theta为参数的可学习PF-LSTM转移映射,εk\(i\)\\boldsymbol\{\\epsilon\}\_\{k\}^\{\(i\)\}是独立采样的高斯噪声(其分布基于先前粒子状态和当前观测参数化)。随机项使粒子能够表征不同的循环状态假设,并有助于保持粒子
相似文章
Latent Block-Diffusion Temporal Point Processes: 一种用于异步事件序列生成的半自回归框架
提出一种半自回归框架,结合潜在块扩散和时间点过程用于生成异步事件序列,减少误差累积同时支持可变长度输出。
基于贝叶斯滤波的噪声测量下拉格朗日动力学学习方法
本文提出了一种基于贝叶斯滤波的方法,通过使用神经网络参数化动能和势能,并通过最大似然估计联合估计状态和参数,从部分且含噪声的测量中学习拉格朗日动力学。
多路径自适应门控瓶颈潜变量ODE与拉曼数据融合用于细胞培养过程预测
本文提出了一种门控瓶颈潜变量ODE结合多路径即时微调与拉曼数据融合的方法,以改进哺乳动物细胞培养过程的多日预测,在真实生物反应器数据上取得了更好的性能。
Show HN: Neural Particle Automata
介绍了 Neural Particle Automata,一种使用光滑粒子流体动力学感知来学习自组织粒子动力学的方法,使粒子能够拥有局部感知向量以执行更新规则,类似于神经细胞自动机,但在连续粒子位置上。
评估Transformer和LSTM框架在无资料流域中的预测能力
本文利用NOAA国家水模型模拟,评估了仅编码器Transformer和LSTM模型在无资料流域中的径流预测能力。结果显示,LSTM的表现优于Transformer,并且加入下游信息显著提升了两种架构的预测技能。