基于强化学习与不确定性量化的配电网最优运行风险与异常识别
摘要
本文提出了一种用于配电网风险与异常识别的深度强化学习框架,利用不确定性量化来区分固有风险和分布外异常。
arXiv:2609.03308v1 公告类型:新
摘要:现代配电网的可靠运行需要在普遍不确定性下及时识别运行风险和异常事件。实际上,操作员必须识别在随机但分布内的条件下固有的风险,以及对应于分布外行为的异常,如异常负荷模式、极端天气或网络物理攻击。本文针对配电网最优运行的联合风险与异常识别问题,提出了一种明确具有不确定性意识的深度强化学习框架。我们集成了分布式和贝叶斯深度强化学习,实现了二阶不确定性量化方案,将总不确定性分解为偶然性和认知性成分,分别用于表征固有风险和分布外异常。由此产生的认知性估计驱动训练期间的探索和部署期间带有回退控制的分布外检测,而偶然性估计用于表征固有运行风险。仿真结果展示了我们的深度强化学习代理的性能和不确定性量化的有效性。
查看缓存全文
缓存时间: 2026/09/04 06:24
# 基于强化学习与不确定性量化配电网最优运行的风险与异常识别
来源:https://arxiv.org/html/2609.03308
Ziqi Zhang††thanks:Z\. Zhang 现于南京航空航天大学自动化工程学院,南京 211100,中国 \(E\-mail: 1124562662@qq\.com \)\。
###### 摘要
现代配电网的可靠运行需要在普遍存在不确定性的情况下,及时识别运行风险和异常事件。在实践中,运营商必须识别在随机但属于分布内的条件下固有的风险,以及对应于分布外行为的异常,例如异常负荷模式、极端天气或网络物理攻击。本文针对最优配电网运行中的这一联合风险与异常识别问题,提出了一种明确感知不确定性的深度强化学习框架。我们结合了分布式和贝叶斯深度强化学习,实现了二阶不确定性量化方案,将总不确定性分解为偶然不确定性和认知不确定性,分别用于表征固有风险和分布外异常。由此产生的认知估计在训练期间驱动探索,在部署期间驱动具有回退控制的分布外检测,而偶然估计用于表征内在运行风险。仿真结果表明了我们 DRL 智能体的性能以及不确定性量化的有效性。
###### 索引术语:异常检测、深度强化学习、配电网运行、能量管理系统、不确定性量化。
## I 引言
现代配电网(DN)运行正日益受到可再生能源(RES)的影响,例如太阳能光伏(PV)、分布式储能系统(ESS)和分布式柴油发电机(DGs)。这些因素使运行呈现随机性、高维性和时间耦合性。无模型深度强化学习(DRL)[1 (https://arxiv.org/html/2609.03308#bib.bib1)]为非线性配电网提供了实时策略。然而,尽管 DRL 具有优势,但将原始 DRL 技术应用于现实世界的配电网时,面临着可信度问题,即缺乏不确定性量化(UQ)能力。在 UQ 领域,不确定性通常分为两类:(1) 认知不确定性(EU),源于对当前情况缺乏知识或信息;(2) 偶然不确定性(AU),是环境固有的,无法通过收集更多信息来减少。两者的结合称为总不确定性。对于 DRL 智能体,高 EU 可能由分布外(OOD)场景引起,其中运行环境与训练数据显著偏离,这与分布内(InD)场景形成对比,在 InD 场景中运行环境接近训练数据。这种分布偏移可能由各种配电网异常引起,包括:(1) 非典型的负荷曲线,例如电动汽车的可变充电模式、由于热浪和寒潮导致的空调需求激增,或由于计划外公共活动引起的负荷尖峰,这些都引入了复杂且非平稳的模式,难以检测;(2) 意外的 RES 行为,例如风暴引起的损坏、逆变器故障,或光伏系统上不规则的云遮蔽,其中云层移动的时空动态在分布式光伏阵列上产生了非均匀遮蔽模式的组合爆炸[2 (https://arxiv.org/html/2609.03308#bib.bib2)];(3) 基础设施的老化,例如变压器绝缘的缓慢退化、导体和连接器的腐蚀,以及老化电缆中增加的阻抗,这些共同导致整个系统物理参数的小但累积的偏移,通常与随机噪声难以区分。在这些训练期间未见过条件的 OOD 场景中,基于神经网络(NN)的 DRL 智能体可能无法鲁棒地泛化[3 (https://arxiv.org/html/2609.03308#bib.bib3)]。这可能导致自信但次优或不安全的动作,例如不适当的电压调节、过度的无功功率补偿或低效的柴油发电机调度。这些动作可能导致能源管理效率低下、支路过载、节点电压越限、严重的负荷不平衡,潜在地导致运行成本增加、大面积停电甚至关键电网组件的物理损坏。训练数据有限的情况会使情况恶化,特别是在配电网中,这可能是由于隐私问题(例如智能电表和电动汽车的隐私)或基础设施限制(例如稀疏的监测设备)造成的。更糟糕的是,时间序列数据与大量配电网母线的组合导致了场景的高维性,带来了维数灾难现象,即大多数点之间的距离趋于相似[4 (https://arxiv.org/html/2609.03308#bib.bib4)]。这种现象,加上神经网络复杂的插值和外推能力,可能使得传统的 OOD 检测方法(例如基于度量或密度估计的方法)[5 (https://arxiv.org/html/2609.03308#bib.bib5)]效果降低。与 OOD 问题相关的一个挑战是对抗样本的存在[6 (https://arxiv.org/html/2609.03308#bib.bib6)]。这些样本与训练数据分布更接近,它们与某些训练样本的差异通常类似于微小的扰动。尽管存在这些细微差别,对抗样本仍然可能导致神经网络进行错误分类[6 (https://arxiv.org/html/2609.03308#bib.bib6),7 (https://arxiv.org/html/2609.03308#bib.bib7)]。在电力系统的背景下,恶意攻击者可以通过虚假数据注入攻击(FDIA)[8 (https://arxiv.org/html/2609.03308#bib.bib8),9 (https://arxiv.org/html/2609.03308#bib.bib9)]故意向电网网络物理系统注入此类扰动,这可能规避 SCADA 系统中的传统异常检测。上述困难使得寻求先进的 EU 估计方法成为必要。在配电网领域,AU 代表电网不可约的随机性,包括 RES[10 (https://arxiv.org/html/2609.03308#bib.bib10)]、电价或负荷行为的波动,这些无法通过进一步收集数据来减少。感知 AU 的方法对回报的完整分布进行建模,而不仅仅是标量期望[11 (https://arxiv.org/html/2609.03308#bib.bib11)]。有效捕捉这种固有随机性是有益的,因为它使系统能够避免那些基于期望回报可能看似最优、但可能导致有害最坏情况结果的高风险动作。通过对比 AU 和 EU 的特性,可以明显看出这两种不确定性需要不同的处理策略。然而,大多数先前的方法集中在减少约束违规的概率上[12 (https://arxiv.org/html/2609.03308#bib.bib12),13 (https://arxiv.org/html/2609.03308#bib.bib13)],或者主要估计合并的总不确定性而不区分其来源。现有研究仅解决了不确定性感知控制问题的一部分。约束和安全的 DRL 方法提高了配电网运行的可行性,但主要是在分布内的随机性下,并且没有识别学习控制器何时在认知上变得不可靠[14 (https://arxiv.org/html/2609.03308#bib.bib14),15 (https://arxiv.org/html/2609.03308#bib.bib15)]。风险敏感和分布式 RL 方法捕捉回报的变异性及尾部风险,但它们没有明确区分不可约的环境随机性与模型不确定性[16 (https://arxiv.org/html/2609.03308#bib.bib16),17 (https://arxiv.org/html/2609.03308#bib.bib17)]。贝叶斯 DRL 和概率 OPF 方法在决策中引入了预测不确定性,但通常将不确定性视为一个聚合量,而不是将其分解为具有不同操作作用的 AU 和 EU[18 (https://arxiv.org/html/2609.03308#bib.bib18),19 (https://arxiv.org/html/2609.03308#bib.bib19)]。贝叶斯 UQ 也已用于电力系统预测和风险评估,但主要是在离线预测或评估设置中,而不是在具有 OOD 触发回退的闭环 DRL 控制中[20 (https://arxiv.org/html/2609.03308#bib.bib20),21 (https://arxiv.org/html/2609.03308#bib.bib21)]。原始 DRL 中缺乏 UQ 成为其部署在现实世界安全关键配电网运行中的障碍。为了弥合上述差距,我们的目标是开发一个感知不确定性的框架来处理 OOD 情况并管理风险,将先前的分布式 DRL 和贝叶斯 DRL 方法包含在内作为子模块。主要贡献总结如下:
- (1) 我们将配电网运行中的风险和异常识别表述为一个*回报定律不确定性量化*问题。先前的方法只考虑单一类型的不确定性,而我们的方法允许将总不确定性进一步分为 AU 和 EU。具体来说,我们采用二阶 UQ 方法来区分表征风险和异常。
- (2) 我们开发了一种基于 critic 端回报空间的实例化距离二阶 UQ,超越了原始的有限标签分类实例化。通过使用一维分位数表示和 Wasserstein 重心,我们将原始的距离定义转换为可用于 critic 端 AU 和 EU 的易于处理的形式。我们建立了这些形式与原始定义的等价性,并证明了其经验估计器的蒙特卡洛一致性。
- (3) 我们提出了一种认知可靠性门控部署方案,将 critic 端 EU 转换为在线回退指示器。当 actor 的动作在认知上变得不可靠时,控制从快速 DRL 推理切换到基于保守 MISOCP 的 OPF 控制器。因此,EU 不是作为被动的异常分数使用,而是作为一个操作切换信号,将熟悉环境下的数据驱动控制与分布偏移下基于优化的恢复耦合起来。
本文其余部分组织如下。第二节严格表述了配电网运行问题。第三节提出了主要框架。第四节进行了数值仿真以证明所提方法的有效性。第五节给出了结论,附录提供了详细的证明。
## II 最优配电网运行表述
我们首先将配电网运行问题转化为约束马尔可夫决策过程(CMDP),然后具体说明配电网的物理模型和运行约束。
### II-A CMDP 预备知识
我们考虑一个带折扣的约束马尔可夫决策过程(CMDP)⟨S,A,P,R,C,γ⟩\\langle\\mathcal\{S\},\\mathcal\{A\},P,R,C,\\gamma\\rangle, 其中 S\\mathcal\{S\} 是状态空间,A\\mathcal\{A\} 是动作空间,P:S×A×S→\[0,1\]P:\\mathcal\{S\}\\times\\mathcal\{A\}\\times\\mathcal\{S\}\\to\[0,1\] 是转移核,R:S×A→RR:\\mathcal\{S\}\\times\\mathcal\{A\}\\to\\mathbb\{R\} 是奖励函数,C:S×A→RmC:\\mathcal\{S\}\\times\\mathcal\{A\}\\to\\mathbb\{R\}^\{m\} 是一个约束代价向量,γ∈\[0,1\)\\gamma\\in\[0,1\) 是折扣因子。一个平稳策略 π:S→Δ\(A\)\\pi:\\mathcal\{S\}\\to\\Delta\(\\mathcal\{A\}\) 将每个状态映射到动作上的分布 π\(⋅∣s\)\\pi\(\\cdot\\mid s)(在实践中我们通常使用确定性策略,写作 at=π\(st\)a\_\{t\}=\\pi\(s\_\{t\}))。对于初始状态 s0s\_\{0\},策略 π\\pi 的折扣回报和约束回报为:
JRπ\(s0\)\\displaystyle J\_\{R\}^\{\\pi\}\(s\_\{0\}\)=Eπ\[∑t=0∞γtR\(st,at\)\],\\displaystyle=\\mathbb\{E\}^\{\\pi\}\\\!\\left\[\\sum\_\{t=0\}^\{\\infty\\}γ^\{t\}R\(s\_\{t\},a\_\{t\}\)\\right\],(1)
JCiπ\(s0\)\\displaystyle J\_\{C\_\{i\}\}^\{\\pi\}\(s\_\{0\}\)=Eπ\[∑t=0∞γtCi\(st,at\)\],i=1,...,m\.\\displaystyle=\\mathbb\{E\}^\{\\pi\}\\\!\\left\[\\sum\_\{t=0\}^\{\\infty\\}γ^\{t\}C\_\{i\}\(s\_\{t\},a\_\{t\}\)\\right\],\\quad i=1,\\dots,m\.(2)
CMDP 目标是:
maxπ\\displaystyle\\max\_\{\\pi\}\\quad JRπ\(s0\),\\displaystyle J\_\{R\}^\{\\pi\}\(s\_\{0\}\),(3)
s\.t\.JCiπ\(s0\)≤di,i=1,...,m\.\\displaystyle J\_\{C\_\{i\}\}^\{\\pi\}\(s\_\{0\}\)\\leq d\_\{i\},\\quad i=1,\\dots,m\.(4)
我们采用拉格朗日松弛来处理约束优化。我们不是为每个约束维护单独的乘子,而是将所有运行限制聚合为一个统一的标量代价 C\(s,a\)C\(s,a),与单个乘子 λ≥0\\lambda\\geq 0 相关联,并将拉格朗日目标表述为:
L\(π,λ\)=JRπ\(s0\)−λ\(JCπ\(s0\)−d\),L\(\\pi,\\lambda\)=J\_\{R\}^\{\\pi\}\(s\_\{0\}\)\-\\lambda\\bigl\(J\_\{C\}^\{\\pi\}\(s\_\{0\}\)\-d\\bigr\),
其中 JCπ\(s0\)J\_\{C\}^\{\\pi\}\(s\_\{0\}) 表示期望折扣累积聚合代价,dd 是容忍限值。这产生了一个极小极大点问题:
maxπminλ≥0L\(π,λ\),\\max\_\{\\pi\}\\min\_\{\\lambda\\geq 0\}L\(\\pi,\\lambda\),
我们通过原始-对偶更新来求解。在第 k 次迭代,给定策略 πk\\pi\_\{k\},我们通过对偶的投影梯度上升更新拉格朗日乘子(LM):
λk\+1=ΠR\+\(λk\+ηλ\(JCπk\(s0\)−d\)\),\\lambda\_\{k\+1\}=\\Pi\_\{\\mathbb\{R\}\_\{\+\}\}\(\\lambda\_\{k\}\+\\eta\_\{\\lambda\}\\bigl\(J\_\{C\}^\{\\pi\_\{k\}\}\(s\_\{0\}\)\-d\\bigr\)\),
其中 ηλ\>0\\eta\_\{\\lambda\}\>0 是步长,ΠR\+\(x\)=max\{0,x\}\\Pi\_\{\\mathbb\{R\}\_\{\+\}\}\(x\)=\\max\\\{0,x\\\} 强制 λ≥0\\lambda\\geq 0。对于固定的 λ\\lambda,这等价于求解具有拉格朗日奖励的无约束 MDP:
Rλ\(s,a\)=R\(s,a\)−λC\(s,a\)\.R\_\{\\lambda\}\(s,a\)=R\(s,a\)\-\\lambda C\(s,a\)\.(5)
对应的状态-动作值函数为:
Qλπ\(s,a\)=Eπ\[∑t=0∞γtRλ\(st,at\)|s0=s,a0=a\],Q\_\{\\lambda\}^\{\\pi\}\(s,a\)=\\mathbb\{E\}^\{\\pi\}\\\!\\left\[\\sum\_\{t=0\}^\{\\infty\\}γ^\{t\}R\_\{\\lambda\}\(s\_\{t\},a\_\{t\}\)\\,\\Big\\|\\,s\_\{0\}=s,a\_\{0\}=a\\right\],(6)
满足贝尔曼方程:
Qλπ\(s,a\)=Rλ\(s,a\)\+γEs′∼P\(⋅∣s,a\)\[Qλπ\(s′,π\(s′\)\)\]\.Q\_\{\\lambda\}^\{\\pi\}\(s,a\)=R\_\{\\lambda\}\(s,a\)\+\\gamma\\,\\mathbb\{E\}\_\{s^\{\\prime\}\\sim P\(\\cdot\\mid s,a\)\}\\bigl\[Q\_\{\\lambda\}^\{\\pi\}\(s^\{\\prime\},\\pi\(s^\{\\prime\}\)\)\\bigr\]\.(7)
分布强化学习建模完整的回报分布,而不是标量值 Qλπ\(s,a\)Q\_\{\\lambda\}^\{\\pi\}\(s,a)。令 Zπ\(s,a\)Z^\{\\pi\}\(s,a) 表示一个随机变量,其分布与从 \(s,a\)\(s,a) 出发,在 RλR\_\{\\lambda\} 下的折扣回报相同。它满足分布贝尔曼方程:
Zπ\(s,a\)=dRλ\(s,a\)\+γZπ\(s′,a′\),Z^\{\\pi\}\(s,a\)\\;\\stackrel\{\{\\scriptstyle d\}\}\{\{=\}\}\\;R\_\{\\lambda\}\(s,a\)\+\\gamma\\,Z^\{\\pi\}\(s^\{\\prime\},a^\{\\prime\}\),(8)
其中 =d\\stackrel\{\{\\scriptstyle d\}\}\{\{=\}\} 表示分布相等,s′∼P\(⋅∣s,a\)s^\{\\prime\}\\sim P\(\\cdot\\mid s,a),a′∼π\(⋅∣s′\)a^\{\\prime\}\\sim\\pi\(\\cdot\\mid s^\{\\prime\})。
### II-B 物理模型和运行约束
我们通过径向配电网模型实例化 CMDP 元组,该模型确定了状态和动作空间、转移核、运行成本和运行约束。物理模型规定了控制动作下状态如何演变,经济目标定义了奖励,工程限制则在 (1 (https://arxiv.org/html/2609.03308#S2.E1))–(4 (https://arxiv.org/html/2609.03308#S2.E4)) 中诱导了 CMDP 约束。相似文章
基于频谱图神经网络强化学习的自愈智能电网故障检测
本文提出了一种频谱图强化学习框架,用于自愈智能电网的故障检测和电力恢复,在IEEE测试系统上实现了接近最优的实时性能。
通过分位数贝叶斯风险MDP实现在线强化学习中鲁棒性与探索的动态权衡
本文提出了一种用于在线强化学习的分位数贝叶斯风险感知MDP框架,该框架能够随时间自适应地平衡鲁棒性与探索,提供了理论遗憾界并展示了强大的实证性能。
基于强化学习的时延容忍网络中无人机飞行与机会路由联合优化
本文提出了JUROR,一种基于强化学习的框架,在集中训练与分散执行的模式下,联合优化时延容忍网络中的无人机飞行路径和分散式机会路由。
马氏距离引导的时变系统混合ES-DRL控制潜在OOD检测
本文提出了一种基于马氏距离的潜在异常检测方法,利用VAE在时变系统中切换强化学习控制器和极值搜索控制器,并在粒子加速器控制中进行了验证。
交易信心:算法交易中的全面不确定性估计
提出了一种面向算法交易的不确定性感知强化学习框架,通过SHAP加权重构、MC Dropout和LSTM共识机制,整合了分布性、认知性和偶然性不确定性。在五大美国股票指数上,其表现优于传统模型。