用于具有学习路由的过程系统的保守混合图网络

arXiv cs.LG 论文

摘要

本文介绍了保守混合图网络(CHGN),这是一种用于建模动态过程系统的方法,无需重新训练即可外推到未见过的更大图,并改进工业应用中的故障预测。

arXiv:2608.28896v1 公告类型:新 摘要:工业过程网络在运行时不保持单一有效拓扑:流被节流或旁路,单元在空闲、过渡和活动状态之间移动。此类系统的模型通常在测量的状态轨迹上训练,而生成这些轨迹的操作机制保持潜在,无约束的图网络可以拟合这样的轨迹而不为恢复的路由分配稳定的物理意义。我们用保守混合图网络(CHGN)解决了这两个问题,它学习路由、状态分配和移除率作为数据驱动的替代品,并将其插入到固定的传输方程中,使得质量平衡在构建时对于任何预测的路由都成立。在10-20个节点的网络上训练的CHGN零样本转移到未见过的25-40个节点的图上,无需重新训练,在相同协议下达到RMSE为2.1e-3,而GNN基线为6e-2到9e-2,门控MAE为7.9e-3,状态准确率为94.3%(在固定训练拓扑上分别为1.2e-2和96.4%)。在流体混合试验工厂上,CHGN在保留物理故障方面改进了持久性基线,但未预测手动干预,其控制阀动作未被观测。因此,该模型无需重新训练即可跨过程拓扑转移,并将控制工厂行为的潜在机制暴露于检查之下。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:58

# 面向过程系统的保守混合图网络与可学习路由
来源:https://arxiv.org/html/2608.28896
Paolo Guida  
隶属机构:物理科学与工程学部  
隶属机构:阿卜杜拉国王科技大学 (KAUST)  
隶属机构:沙特阿拉伯,图瓦勒  
邮箱:[[email protected]](mailto:)

###### 摘要

工业过程网络在运行期间不会保持单一的有效拓扑。物流流被节流或旁路,设备单元在空闲、过渡和活跃工况之间转换。此类系统的模型通常在测量的状态轨迹上进行训练,而生成这些轨迹的运行机制则保持潜在状态。无约束的图网络可以拟合此类轨迹,却无法为恢复的路由分配稳定的物理意义。本工作通过保守混合图网络 (CHGN) 同时解决这两个问题。该架构背后的理念是使用数据驱动的替代模型来建模路由、工况分配和移除速率,并将其添加到固定的传输方程中。替代模型允许将在小型过程网络(10至20个节点)上学习到的动力学,外推到未见过的、更大的图(25至40个节点),而无需重新训练。其他基于图神经网络 (GNN) 的方法产生的误差在 \(6 \times 10^{-2}\) 到 \(9 \times 10^{-2}\) 之间,而 CHGN 算法在相同的零样本协议下呈现 \(2.118 \times 10^{-3}\) 的 RMSE,阀门 MAE 为 \(7.9 \times 10^{-3}\),工况准确率为 \(94.3\%\)。在固定的训练拓扑上,相应的值为 \(1.2 \times 10^{-2}\) 和 \(96.4\%\)。该模型还在一个真实的流体混合中试装置上进行了测试,其中 CHGN 在预测未见物理故障方面优于持久性模型,但在预测手动操作(当控制阀门动作未被观测到时)方面表现不佳。因此,该模型的优势可总结为:无需重新训练即可用于各种过程拓扑,并允许检查支配工厂决策的底层机制。

## 1 引言

一种结构性亲缘关系表明,应将复杂系统(如化学过程和工业应用)建模为图。近来,这已引起广泛关注[1 (https://arxiv.org/html/2608.28896#bib.bib15), 2 (https://arxiv.org/html/2608.28896#bib.bib14), 3 (https://arxiv.org/html/2608.28896#bib.bib13)]。图上的学习模拟器通常假设静态拓扑[4 (https://arxiv.org/html/2608.28896#bib.bib20)],或假设拓扑的演化已预先提供给模型[5 (https://arxiv.org/html/2608.28896#bib.bib19), 6 (https://arxiv.org/html/2608.28896#bib.bib2)]。这些假设并未完全代表工业运行。在工厂中,设备单元之间的有效连接会因物流流被节流或旁路,以及设备因安全、经济或维护原因停机而发生变化[7 (https://arxiv.org/html/2608.28896#bib.bib12), 8 (https://arxiv.org/html/2608.28896#bib.bib7)]。测量的状态轨迹可能通过传感器反馈保持可用,但生成该轨迹的路由动作和运行工况仅被部分观测或完全未被记录[9 (https://arxiv.org/html/2608.28896#bib.bib1), 10 (https://arxiv.org/html/2608.28896#bib.bib10), 7 (https://arxiv.org/html/2608.28896#bib.bib12)]。

一个使用无约束图神经网络建模的网络可能遇到两种故障模式。第一个与拓扑可识别性有关,指的是观测到的轨迹是否为模型内部一个命名的路由变量分配了唯一的含义。例如,假设与边 \(e\) 关联的物流流通过乘积 \(\hat{w}_e \phi_e(\mathbf{x})\) 进入状态动力学,其中 \(\hat{w}_e\) 是学习到的路由权重,\(\phi_e\) 是自由学习的消息函数。如果引入一个正常数 \(\alpha\),则配对 \((\alpha \hat{w}_e, \alpha^{-1} \phi_e)\) 产生相同的乘积,因此产生相同的状态更新。更一般地,一个足够灵活的消息函数可以补偿不正确的路由权重。因此,微小的轨迹误差无法唯一识别预期的物理含义。

尽管简单,上述示例说明了为什么在没有额外结构的情况下,潜在机制是不可识别的[11 (https://arxiv.org/html/2608.28896#bib.bib11)]。恢复交互图需要对解码器施加限制、打破对称性的先验知识、直接的机制信息,或这些元素的组合[9 (https://arxiv.org/html/2608.28896#bib.bib1)]。这里提出的架构目标是消除直接的门控-消息重缩放路径,通过固定路由进入传输的形式来实现。

第二个问题是泄漏。后者指在预测过程中人工创建或丢失守恒量。对于内部过程网络,所有传输贡献的总和应为零,因为每条内部物流流离开一个单元并进入另一个单元。总库存只能通过明确的边界进料、移除或反应来改变。如果模型直接预测增量 \(\Delta \mathbf{x} = f_\theta(\mathbf{x})\),且其参数化中没有相应的平衡限制,则无法阻止材料在自回归展开过程中出现或消失。模型仍然可以最小化监督预测损失,但由此产生的状态演化不一定与传输结构兼容[12 (https://arxiv.org/html/2608.28896#bib.bib5)]。

本工作旨在解决这两个挑战。提出的过程网络公式包含两个可独立改变的机制:边上的开关控制路由和选定单元上的离散运行工况。内部传输不由无约束的学习消息表示。它从带符号的关联矩阵、已知的传输速率系数、当前源库存和预测的路由权重重建。提供给门控、工况和移除头的信息也是分开的,因此命名的机制不能在单个公共解码器内自由交换。共享的、排列等变的映射使得同一模型适用于具有不同数量单元的图。以下各节描述了动力系统和软件架构,并在受控的合成网络以及由真实传感器数据构建的物理不同系统上评估了该模型。

## 2 保守混合图网络

提出的公式结合了潜在图推理、混合动力系统、学习模拟和结构保持建模的思想。预期的区别在于,现有方法通常只考虑此处所考虑问题的一部分。潜在结构方法推断固定的分类边[9 (https://arxiv.org/html/2608.28896#bib.bib1)],通过记忆对变化图内容建模[13 (https://arxiv.org/html/2608.28896#bib.bib30)],并强调可解释因果表示所需的假设[11 (https://arxiv.org/html/2608.28896#bib.bib11)];混合系统方法表示全局模式转换[14 (https://arxiv.org/html/2608.28896#bib.bib16), 15 (https://arxiv.org/html/2608.28896#bib.bib17), 16 (https://arxiv.org/html/2608.28896#bib.bib18), 10 (https://arxiv.org/html/2608.28896#bib.bib10)];图模拟器和神经算子逼近高维动力学[5 (https://arxiv.org/html/2608.28896#bib.bib19), 6 (https://arxiv.org/html/2608.28896#bib.bib2), 17 (https://arxiv.org/html/2608.28896#bib.bib3), 18 (https://arxiv.org/html/2608.28896#bib.bib21), 19 (https://arxiv.org/html/2608.28896#bib.bib22), 20 (https://arxiv.org/html/2608.28896#bib.bib28), 21 (https://arxiv.org/html/2608.28896#bib.bib29)],包括连续时间[22 (https://arxiv.org/html/2608.28896#bib.bib38)];结构保持模型编码能量约束[23 (https://arxiv.org/html/2608.28896#bib.bib23)]、软物理残差[24 (https://arxiv.org/html/2608.28896#bib.bib24)]、局部守恒性和等变性[12 (https://arxiv.org/html/2608.28896#bib.bib5)]或离散算子一致性[25 (https://arxiv.org/html/2608.28896#bib.bib6)],尽管此类偏见并非普遍有益[26 (https://arxiv.org/html/2608.28896#bib.bib4)];而过程系统图模型解决监控、软传感、故障诊断[27 (https://arxiv.org/html/2608.28896#bib.bib32), 28 (https://arxiv.org/html/2608.28896#bib.bib35), 29 (https://arxiv.org/html/2608.28896#bib.bib37), 30 (https://arxiv.org/html/2608.28896#bib.bib36), 31 (https://arxiv.org/html/2608.28896#bib.bib34), 32 (https://arxiv.org/html/2608.28896#bib.bib33)]、设备设计[33 (https://arxiv.org/html/2608.28896#bib.bib31), 34 (https://arxiv.org/html/2608.28896#bib.bib8)]和操作阶段切换[35 (https://arxiv.org/html/2608.28896#bib.bib25), 36 (https://arxiv.org/html/2608.28896#bib.bib26), 37 (https://arxiv.org/html/2608.28896#bib.bib27)];而 CHGN 执行具有精确内部传输平衡的正向模拟,通过预测状态相关的连续边路由和局部单元工况作为不同的、可能出错的潜在机制,而不是假设固定的已知图、单一全局模式或自由学习的门控条件消息。

#### 过程图与控制动力学。

保守混合图网络的目标是学习在物流流路由和单元活动在运行过程中发生变化的过程演化。该过程由有向图 \(G = (\mathcal{V}, \mathcal{E})\) 表示,其中 \(n = |\mathcal{V}|\) 个单元和 \(m = |\mathcal{E}|\) 条内部物流流。其带符号的关联矩阵为:

\[
B \in \{-1, 0, +1\}^{n \times m}, \qquad B_{ie} =
\begin{cases}
-1, & i = \operatorname{src}(e), \\
+1, & i = \operatorname{dst}(e), \\
0, & \text{otherwise}.
\end{cases} \tag{1}
\]
因此,每条内部边在源点贡献一次负号,在目的地贡献一次正号。

标量状态 \(x_i(t) \in \mathbb{R}_{\geq 0}\) 表示单元 \(i\) 中跟踪数量的库存。在合成系统中,其演化遵循:

\[
\dot{x}_i(t) = \sum_{e \in \mathcal{E}} B_{ie} F_e(t) + [E \mathbf{u}(t)]_i - [\mathbf{1}_{\mathrm{sink}}]_i \, c_i(z_i(t)) \left[ \kappa_i x_i(t) + \rho \eta_i x_i(t)^2 \right]. \tag{2}
\]
第一项是进入或离开单元 \(i\) 的净内部传输。第二项代表外部进料。后者中 \(E \in \mathbb{R}^{n \times p}\) 是已知的进料关联矩阵,\(\mathbf{u}(t) \in \mathbb{R}^p\) 包含施加的边界输入。最后一项代表由静态掩码 \(\mathbf{1}_{\mathrm{sink}} \in \{0, 1\}^n\) 选择的节点处的物料移除或消耗。系数 \(\kappa_i\) 定义一阶贡献,\(\eta_i\) 定义二次贡献,\(\rho\) 全局缩放后者。乘数 \(c_i(z_i)\) 根据局部运行工况调整这些速率。对于没有工况变量的节点,此乘数固定。

内部流量不是任意的。对于每条边,

\[
F_e(t) = q_e w_e(t) x_{\operatorname{src}(e)}(t), \qquad q_e \geq 0, \tag{3}
\]
其中 \(q_e\) 是已知的传输速率系数,单位为时间的倒数,\(w_e(t)\) 是该边的路由权重。路由通过 \(S\) 个开关发生。开关 \(s\) 作用于两条出射边,记为 \(e_s^1\) 和 \(e_s^2\),并受控于:

\[
g_s(t) = \sigma\!\left( \beta_s \left[ \varphi_s(\mathbf{x}(t), \mathbf{u}(t)) - \theta_s^g \right] \right), \qquad \sigma(v) = \frac{1}{1 + e^{-v}}, \tag{4}
\]
其中

\[
w_{e_s^1}(t) = g_s(t), \qquad w_{e_s^2}(t) = 1 - g_s(t), \qquad w_e(t) = 1 \quad \text{对于未开关的边}. \tag{5}
\]
函数 \(\varphi_s\) 结合当前状态和输入,\(\theta_s^g\) 移位开关阈值,\(\beta_s > 0\) 控制响应的陡峭程度。Sigmoid 产生软路由权重,当输入远离阈值时趋近于零或一。

单元子集 \(\mathcal{M} \subseteq \mathcal{V}\),其中 \(M = |\mathcal{M}|\),也经历局部工况变化。每个单元 \(j \in \mathcal{M}\) 可以是空闲、过渡或活跃状态,由 \(z_j(t) \in \{0, 1, 2\}\) 表示。模拟器通过一个由 \(\theta_j^z\) 参数化的局部阈值规则分配这些状态。条件向量

\[
\boldsymbol{\mu} = (\boldsymbol{\theta}^g, \boldsymbol{\theta}^z, \rho) \tag{6}
\]
包含开关阈值、局部工况阈值和全局二次缩放。这些量作为运行条件提供。瞬时门 \(g_s(t)\) 和工况 \(z_j(t)\) 不提供给状态预测器,必须从观测历史中恢复。

#### 算法架构。

CHGN 并未用黑盒神经算子替换完整的向量场,而是学习四个模块:

\[
\{\Phi_{\theta_{\Phi}}, \Gamma_{\theta_{\Gamma}}, Z_{\theta_{Z}}, R_{\theta_{R}}\}, \qquad \boldsymbol{\Theta} = \{\theta_{\Phi}, \theta_{\Gamma}, \theta_{Z}, \theta_{R}\}, \tag{7}
\]
其中 \(\boldsymbol{\Theta}\) 表示它们的可训练参数。第一个模块 \(\Phi_{\theta_{\Phi}}\) 是一个共享的空间 GNN,将状态历史和单元信息映射到加维潜在空间。在时间索引 \(\tau\),与节点 \(i\) 关联的输入为:

\[
\mathbf{a}_{i, \tau} = H_{\tau, i, :}^{\top} \| \mathbf{e}(\mathrm{type}_i) \| \mathbf{u}_{\tau} \in \mathbb{R}^{h + d_e + p}, \tag{8}
\]
其中 \(\|\) 表示连接,\(\mathbf{e}(\mathrm{type}_i) \in \mathbb{R}^{d_e}\) 是学习的单元类型嵌入,\(\mathbf{u}_{\tau} \in \mathbb{R}^p\) 收集外部输入,而

\[
H_{\tau} = [\mathbf{x}_{\tau-h+1}, \ldots, \mathbf{x}_{\tau}] \in \mathbb{R}^{n \times h} \tag{9}
\]
是变量历史矩阵。完整的节点特征矩阵为:

\[
A_{\tau} = H_{\tau} \| \mathcal{T} \| \mathbf{1}_n \mathbf{u}_{\tau}^{\top} \in \mathbb{R}^{n \times (h + d_e + p)}, \tag{10}
\]
其中 \(\mathcal{T} \in \mathbb{R}^{n \times d_e}\) 的第 \(i\) 行是 \(\mathbf{e}(\mathrm{type}_i)^{\top}\)。然后空间编码器给出:

\[
\boldsymbol{\nu}_{i, \tau}^{\top} = \left[ \Phi_{\theta_{\Phi}}(A_{\tau}, G, \mathbf{q}) \right]_{i, :}, \qquad \boldsymbol{\nu}_{i, \tau} \in \mathbb{R}^{d}, \tag{11}
\]
其中 \(G\) 是静态过程图,\(\mathbf{q}\) 包含静态边特征,包括传输速率系数 \(q_e\)。一个排列不变的池化层会进一步处理这些特征(原文在此处中断)。

相似文章

基于角色感知聚类的异构图压缩

arXiv cs.LG

本文提出了一种基于角色感知的异构图压缩框架HGC-RC,该框架利用轻量级传播和混合聚类策略生成紧凑的异构图,从而在不牺牲性能的情况下实现大规模图上的高效HGNN训练。

概率化学反应网络的简化

arXiv cs.LG

本文提出了一种通过利用因子图约简技术来缩小实现概率推理的化学反应网络(CRN)规模的方法,从而在保留存活变量上信念传播不动点的同时,获得更小的CRN。

基于图控制的异构道路网络交通信号接口

arXiv cs.LG

本文提出一种基于图的交通信号控制接口,使用共享图神经网络为各个交通流向分配分数,并通过关联矩阵确定性地构造相位。实验评估了在合成和城市道路网络上的迁移效果,结果表明可行性,但对分布偏移敏感。

用于学习路由的混合量子-经典神经网络

arXiv cs.LG

本文研究了用于车辆路径问题的混合量子-经典神经网络,发现编码器前馈替代可以将模型参数减少56.6%,同时在中小规模实例上保持接近基线性能。