学习运行电力网络:基于AlphaZero启发的有效拓扑控制
摘要
本文评估了基于AlphaZero启发的强化学习在电力网络拓扑控制中的应用,实现了98.43%的生存率,并强调了与领域启发式最小化集成的有效性。
arXiv:2608.14114v1 公告类型:新
摘要:随着波动性可再生能源的集成增加了现代电网的压力,使用强化学习(RL)进行自主拓扑重构已成为一个有前景的研究领域,以保持紧张电网的稳定和运行。与传统的重新调度措施相比,拓扑行动提供了一种更便宜、更经济有效的方式来管理电网拥堵。然而,它们的实施受到庞大组合动作空间和严格操作约束的阻碍。本文研究了基于模型的AlphaZero启发方法的有效性,这些方法利用蒙特卡洛树搜索(MCTS)进行主动电网管理。我们系统评估了奖励函数、观察密度和搜索指导如何影响代理的生存率。我们的结果表明,优化的AlphaZero方法实现了98.43%的峰值生存率,显著优于近端策略优化(PPO)变体。我们发现,在没有先验学习策略或价值函数指导的情况下进行MCTS可以提高训练效率,并且简单的二元生存奖励比复杂的多目标函数提供更有效的搜索指导。我们的发现表明,虽然AlphaZero是拓扑控制的强大框架,但纯强化学习并不足够;相反,一个有效可靠的系统需要领域特定启发式、二元奖励和线路负载的受限观察空间的“最小化”集成。
查看缓存全文
缓存时间: 2026/08/17 10:20
# 学习运行电力网络:有效的AlphaZero启发式拓扑控制 来源:https://arxiv.org/html/2608.14114 ## 学习运行电力网络:有效的AlphaZero启发式拓扑控制CCS:计算方法 强化学习CCS:硬件 智能电网 ###### 摘要\. 随着波动性可再生能源并网给现代电网带来更大压力,利用强化学习 \(RL\) 进行自主拓扑重构已成为一个有前景的研究领域,旨在保持压力下的电网稳定运行。与传统的再调度措施相比,拓扑操作为管理电网拥堵提供了一种更经济、更具成本效益的方式。然而,其实施受到庞大的组合动作空间和严格运行约束的阻碍。本文研究了基于模型的、受AlphaZero启发的方法的有效性,该方法利用蒙特卡洛树搜索 \(MCTS\) 进行主动式电网管理。我们系统地评估了奖励函数、观测密度和搜索引导如何影响智能体的生存率。我们的结果表明,优化的AlphaZero方法达到了98.43%的峰值生存率,显著优于近端策略优化 \(PPO\) 变体。我们发现,在不借助先前学习策略或价值函数引导的情况下进行MCTS可以提高训练效率,并且简单的二值生存奖励比复杂的多目标函数提供更有效的搜索引导。我们的研究结果表明,尽管AlphaZero是拓扑控制的强大框架,但纯粹的强化学习并不足够;一个有效可靠的系统需要“极简主义”地整合领域特定的启发式规则、二值奖励以及线路负载的受限观测空间\. ###### 关键词: 学习运行电力网络 \(L2RPN\),深度强化学习,蒙特卡洛树搜索 \(MCTS\),AlphaZero,拓扑控制 数据与材料可用性: ## 1\.引言 全球向碳中和的转型推动了电力系统动态的根本性变化。虽然这对实现气候目标至关重要,但波动性可再生能源 \(RES\)(如太阳能和风能)的并网给电网带来了两个主要挑战:首先,这些发电机具有波动性,威胁供需平衡,进而影响电网稳定性。其次,发电通常远离负荷中心(如海上风电场),增加了输电系统的压力,导致线路拥堵和潜在过载。这些情况可能引发连锁故障和灾难性停电,使关键基础设施瘫痪,正如最近在西班牙和葡萄牙所展示的那样\(33 (https://arxiv.org/html/2608.14114#bib.bib6)\)\。 传统上,使用强化学习 \(RL\) 进行自主拓扑重构已成为一个有前景的研究领域,旨在保持压力下的电网稳定运行。历史上,电网拥堵通过再调度(即调整发电机设定点)\(11 (https://arxiv.org/html/2608.14114#bib.bib12)\),或削减可再生能源发电或馈电管理\(10 (https://arxiv.org/html/2608.14114#bib.bib14);28 (https://arxiv.org/html/2608.14114#bib.bib15)\)来管理。虽然这些方法有效,但经济成本高昂,且常常未能充分利用现有基础设施。拓扑操作,如母线重构和线路切换,通过将电力重新路由到电网负载较轻的部分,提供了一种更具成本效益的替代方案。然而,拓扑控制的实际实施受到可能的电网配置组合爆炸的阻碍,这超出了传统穷举搜索或人工干预的能力范围\(17 (https://arxiv.org/html/2608.14114#bib.bib26)\)\。 为了解决这种复杂性,学习运行电力网络 \(L2RPN\) 挑战赛被设立为一个多年竞赛系列,旨在真实电网环境中对自主智能体进行基准测试\(22 (https://arxiv.org/html/2608.14114#bib.bib8)\)\。这些挑战促进了从传统再调度向拓扑控制作为电网管理主要工具的范式转变。虽然无模型强化学习 \(RL\) 智能体,如近端策略优化 \(PPO\),设立了强大的反应式基线,但它们本质上缺乏显式的前瞻能力\(25 (https://arxiv.org/html/2608.14114#bib.bib22)\)\。在安全关键的电力系统中,纯粹的反应式智能体难以处理连锁热故障,因为它无法在执行拓扑操作前评估其下游的多步后果。 因此,研究兴趣日益转向基于模型的框架,特别是那些受AlphaZero启发的框架,它们将深度神经网络与蒙特卡洛树搜索 \(MCTS\) 相结合,以主动规划稳定的电网配置\(11 (https://arxiv.org/html/2608.14114#bib.bib12)\)\。AlphaZero通过利用MCTS对离散组合动作空间进行系统性、非参数化的探索来独特地弥合了这一鸿沟,同时神经网络逐步学习引导搜索,减轻了计算密集型的完整树搜索的需要。虽然现实世界的输电网络包含数千个节点,但系统地分析这些基于模型控制器的架构敏感性需要一个受控环境。在这项工作中,我们使用了标准的IEEE-14节点系统。尽管其物理规模相对较小,但其变电站和线路的组合仍然产生了庞大的、非平凡的组合动作空间,包含405个原始动作(通过对称性约束减少到203个)。这种配置为在部署到更大规模之前,隔离奖励结构、搜索引导和观测配置如何影响MCTS性能提供了一个理想的、计算可行的测试环境。 此外,我们对文献\(11 (https://arxiv.org/html/2608.14114#bib.bib12)\)中提出的受AlphaZero启发的方法进行了系统评估。虽然AlphaZero已经彻底改变了棋盘游戏\(26 (https://arxiv.org/html/2608.14114#bib.bib13)\),但它在电力系统等物理领域中对设计因素的敏感性仍然有待探索。我们通过分析三个关键设计维度的影响来弥合这一研究差距:观测密度、奖励塑形和动作空间剪枝。此外,我们研究了MCTS引导变体的影响,范围从基于启发式的叶节点评估到学习的Q函数,并调整超参数以平衡计算效率和电网生存率。我们的研究结果有助于更深入地理解自主电网管理中搜索深度与训练稳定性之间的权衡,并有助于更有效地实施AlphaZero方法。 本文其余部分组织如下:第2节 (https://arxiv.org/html/2608.14114#S2) 回顾了L2RPN的先前文献;第3节 (https://arxiv.org/html/2608.14114#S3) 详细介绍了方法,包括受AlphaZero启发的方法的实现和评估的设计选择;第4节 (https://arxiv.org/html/2608.14114#S4) 呈现实验设置和结果;第5节 (https://arxiv.org/html/2608.14114#S5) 讨论研究发现及其意义;第6节 (https://arxiv.org/html/2608.14114#S6) 总结贡献并概述未来研究方向。 ## 2\.相关工作 深度强化学习 \(DRL\) 在电力系统中的应用已通过L2RPN挑战赛得到规范化,该系列赛于2019年至2023年间每年举行\(22 (https://arxiv.org/html/2608.14114#bib.bib8)\)\。这些竞赛利用真实电网环境对自主智能体通过拓扑控制维持稳定性的能力进行基准测试,重点关注实时运行窗口以防止连锁故障\(30 (https://arxiv.org/html/2608.14114#bib.bib7)\)\。 ### 2\.1\.L2RPN挑战赛的演变 2019年首届IJCNN挑战赛采用了IEEE 14节点系统,确立了仅使用母线分裂和线路切换操作来运行电网的核心目标。这第一次竞赛的获胜方案引入了几个基础概念,这些概念后来已成为该领域的默认标准: - •动作空间缩减:A3C-2019方案首先认识到需要消除冗余的母线对称动作,这一策略现在默认包含在Grid2op包中以管理组合复杂度\(24 (https://arxiv.org/html/2608.14114#bib.bib9)\)\。 - •课程学习\(2 (https://arxiv.org/html/2608.14114#bib.bib10)\):为了提高训练效果,早期的优胜者采用了课程策略,先在更简单的任务上训练神经网络,然后再过渡到完整的电网复杂度。 - •激活阈值:DDQN-2019方案引入了基于线路负载水平的“警告标志”\(16 (https://arxiv.org/html/2608.14114#bib.bib11)\)。该阈值决定了智能体何时应进行干预,而非选择“不操作”动作,此机制在所有后续的L2RPN解决方案中都有使用。 - •引导式搜索和模拟:早期的智能体开始使用引导式探索和对前N个预测动作的模拟来选择最佳移动\(21 (https://arxiv.org/html/2608.14114#bib.bib31)\)。这建立了一种原始的前瞻形式,是我们工作中更先进的蒙特卡洛树搜索 \(MCTS\) 的概念前身。 ### 2\.2\.无模型专家系统范式 当前L2RPN解决方案的格局主要由两种范式主导。首先,大量研究集中在无模型RL,特别是近端策略优化 \(PPO\)\(6 (https://arxiv.org/html/2608.14114#bib.bib29);19 (https://arxiv.org/html/2608.14114#bib.bib30);30 (https://arxiv.org/html/2608.14114#bib.bib7)\)\。这些方法已经通过启发式和课程框架(如教师-导师-初级-高级 \(TTJS\) 框架)\(12 (https://arxiv.org/html/2608.14114#bib.bib28)\)进行了迭代改进。显著的例子包括2023年的获胜者,La Javaness\(7 (https://arxiv.org/html/2608.14114#bib.bib27)\)和Artelys\(15 (https://arxiv.org/html/2608.14114#bib.bib25)\),他们使用了优化的PPO变体。 其次,几种成功的方法利用专家系统或将其与暴力方法相结合。这些非RL解决方案已被证明非常有竞争力,在最近的挑战中多次进入前三名\(23 (https://arxiv.org/html/2608.14114#bib.bib24);1 (https://arxiv.org/html/2608.14114#bib.bib1);13 (https://arxiv.org/html/2608.14114#bib.bib2)\)\。虽然这些发现为反应式智能体建立了强大的基准,但它们仍然局限于无模型或基于规则的范式,并未考虑树搜索方法固有的前瞻能力。 ### 2\.3\.向基于模型方法的过渡 反应式智能体的局限性促使了基于模型框架的兴趣增长,特别是那些受AlphaZero框架启发的框架,它利用蒙特卡洛树搜索 \(MCTS\)\(11 (https://arxiv.org/html/2608.14114#bib.bib12)\)。通过模拟潜在的动作序列,这些智能体可以主动规划稳定的电网配置。表1 (https://arxiv.org/html/2608.14114#S2.T1)总结了顶级方法的演进。这种方法在最近的挑战迭代中成为主导力量,分别在2021年ICAPS和2022年WCCI竞赛中获得第三名和第一名。 表 1\.\.学习运行电力网络 \(L2RPN\) 挑战赛中顶级智能体和方法的历史演变。进展显示从早期的无模型RL转向涉及课程学习和基于模型的树搜索的专门架构。虽然2022年WCCI获胜者成功使用了MCTS,但关于此类智能体对特定设计因素的敏感性方面仍存在重大研究空白。目前,缺乏公开可用的受AlphaZero启发的电网控制器代码库,并且在基于模型的智能体对奖励塑形、MCTS引导方法和观测空间配置等设计因素的敏感性方面存在重大研究差距。本文在这些基础上,提供了一个系统指南,以在安全关键电网环境中有效实施AlphaZero控制器。 ## 3\.方法论 在这项工作中,我们使用Grid2op\(22 (https://arxiv.org/html/2608.14114#bib.bib8)\)框架,这是L2RPN竞赛的预定用途。实验在IEEE-14节点电网上进行,该电网是挑战赛首次迭代中使用的标准基准\(22 (https://arxiv.org/html/2608.14114#bib.bib8);30 (https://arxiv.org/html/2608.14114#bib.bib7)\)\。该电网包含14个变电站、20条线路、3个变压器和5台发电机。我们使用1004组时间序列数据,每组包含8064个时间步长。为确保泛化性,Rainbow-PPO和AlphaZero的性能在10%10\%的保留时间序列数据集上进行衡量。 ### 3\.1\.非AlphaZero基线 我们回顾了L2RPN智能体的演进以建立一系列基线变体: - •DQN和PPO:通过Stable-Baselines3库\(25 (https://arxiv.org/html/2608.14114#bib.bib22)\)实现。PPO在再调度(连续)和拓扑(离散)两种范式下进行评估。 - •课程学习 \(TTJS\):集成了教师-导师-初级-高级框架\(27 (https://arxiv.org/html/2608.14114#bib.bib23);17 (https://arxiv.org/html/2608.14114#bib.bib26)\)。智能体通过模仿学习初始化,然后过渡到主动RL。(参见附录A\.1 (https://arxiv.org/html/2608.14114#A1.SS1)) - •Rainbow PPO:利用RLlib库\(30 (https://arxiv.org/html/2608.14114#bib.bib7)\)的优化PPO智能体。这包括适应的奖励函数和支持启发式规则,作为我们最先进的无模型基线。 ### 3\.2\.AlphaZero和MCTS方法 我们的主要方法采用了AlphaZero框架,利用蒙特卡洛树搜索 \(MCTS\) 来导航电网的组合拓扑结构\(26 (https://arxiv.org/html/2608.14114#bib.bib13);11 (https://arxiv.org/html/2608.14114#bib.bib12)\)\。在搜索树中,节点代表电网负载超过激活阈值的关键状态。 MCTS引导与配置:选择这三种特定的搜索引导变体,其明确动机在于需要隔离物理、受物理规律支配领域内控制智能的根本来源: 1. \(1\)\.模仿学习 \(IL\) 变体(无先验引导):评估纯粹前瞻搜索深度和结构发现的基线有效性,独立于学习到的价值景观。 2. \(2\)\.原始启发式方法:考察狭窄的、领域特定的物理启发式规则(作为评估叶状态的硬编码规则)所带来的性能提升。 3. \(3\)\.学习的Q函数设置:测试经典的AlphaZero范式,以确定参数化神经网络是否比硬编码规则能更有效地逼近电网稳定性的高度非线性、随机驱动的边界。 阈值和搜索限制的具体设置详见附录A (https://arxiv.org/html/2608.14114#A1)。 ##### 动作空间消融实验 为了保持可控的搜索空间,我们评估了三种动作缩减策略:对称性 \(SYM\)、\(N-0\)\(29 (https://arxiv.org/html/2608.14114#bib.bib34)\) 和 \(N-1\)\(9 (https://arxiv.org/html/2608.14114#bib.bib34)\)\。
相似文章
拓扑引导
拓扑引导是一种新框架,利用拓扑数据分析捕获激活空间中的全局结构,以控制大型语言模型行为,实现更稳健的行为控制。
用强化学习削减AI数据中心能耗:从单GPU到整个集群的LLM训练实测功率控制
一篇新的arXiv论文探索使用强化学习,通过动态控制大语言模型训练工作负载的功率,在从单个GPU到整个集群的规模上降低AI数据中心的能耗。
面向智能电网分布式稳定控制的联合物理强化学习
本文提出FedPPO-PG,一种面向智能电网暂态稳定控制的联合多智能体强化学习框架。该方法在仿真中实现100%稳定,稳定时间减少72.4%,控制功率相比集中式基线降低7-14倍。
稀疏奖励游戏中AlphaZero的局限性与辅助监督
本文以四子棋和Chomp为测试平台,研究了AlphaZero在稀疏奖励游戏中强对弈与完美对弈之间的差距,并提出了一种辅助损失(AZAL)以提高最优对弈中的Oracle一致性。
基于强化学习与不确定性量化的配电网最优运行风险与异常识别
本文提出了一种用于配电网风险与异常识别的深度强化学习框架,利用不确定性量化来区分固有风险和分布外异常。