面向分布式能源资源协调的监督强化学习
摘要
本文提出了一种监督强化学习(SRL)框架,用于协调分布式能源资源,通过在演示数据上预训练并通过强化学习微调,以提高样本效率和性能。
arXiv:2606.24947v1 公告类型:新
摘要:分布式能源资源(DERs)的日益集成对于电力系统脱碳至关重要,但释放DERs的灵活性因其固有的不确定性和建模复杂性而面临挑战。由于传统的优化方法难以应对DERs的不确定性和复杂性,强化学习(RL)已成为DER管理的一种有前景的替代方案。然而,标准RL方法在从零开始训练时存在样本效率低下和次优性问题。受大语言模型训练范式的启发,本文提出了一种监督强化学习(SRL)框架,用于学习DER协调策略。该框架首先以监督学习的方式在演示数据上预训练策略,然后使用RL进一步微调。此外,我们提出一个两步微调过程:离线微调以增强策略性能,在线微调以适应真实世界动态。实验表明,基于所提框架的RL实现显著优于所有基准,即使在低质量演示数据下也能实现高成本效益。
查看缓存全文
缓存时间: 2026/06/25 05:07
# 面向分布式能源资源协调的监督强化学习 来源:https://arxiv.org/html/2606.24947 \\old@ps@headings ###### 摘要 分布式能源资源的日益集成对电力系统脱碳至关重要,然而,挖掘分布式能源的灵活性面临着其固有不确定性和建模复杂性的挑战。由于传统优化方法难以应对分布式能源的这种不确定性和复杂性,强化学习已成为分布式能源管理领域一种有前景的替代方案。然而,标准强化学习方法在从零开始训练时存在样本效率低下和次优性问题。受大语言模型训练范式的启发,本文提出了一种监督强化学习框架,用于学习分布式能源协调策略。该框架首先以监督学习的方式在示范数据上预训练一个策略,随后使用强化学习进行微调。此外,我们提出了一种两步微调过程:离线微调用于提升策略性能,在线微调用于使其适应现实世界动态。实验表明,基于所提框架的强化学习实现显著优于所有基准方法,即使在低质量示范数据下也能实现高成本效益。 \\thanksto 本工作部分受国家自然科学基金(U25B6016)、香港特别行政区研究资助局(HKU 17201225)、高级研究与发明署(ARIA)项目SAGEflex:面向电网边缘灵活性的安全人工智能代理,以及工程与物理科学研究理事会(EPSRC)项目FleXEdge:面向可扩展近实时本地灵活性市场的数据驱动云边计算支持。 ## I 引言 全球电力系统脱碳正在推动更高比例的分布式能源资源集成,例如分布式可再生能源、储能和温控负荷。这些分布式能源具有宝贵的功率灵活性,其规模相当于多个大型发电厂,预计到2040年全球价值将达到2700亿美元[21 (https://arxiv.org/html/2606.24947#bib.bib1)]。然而,分布式能源固有的不确定性及其建模复杂性对其灵活性的释放构成了重大挑战[26 (https://arxiv.org/html/2606.24947#bib.bib3)]。准确的分布式能源建模通常是非线性和非凸的。例如,储能系统的充放电效率与充放电功率呈非线性非凸关系[3 (https://arxiv.org/html/2606.24947#bib.bib4)],而准确的温控负荷模型则是一组微分方程[22 (https://arxiv.org/html/2606.24947#bib.bib6)]。为了计算上的可行性,传统优化方法通常对这些分布式能源模型采用凸甚至线性近似,这可能导致实际运行中的次优结果。强化学习已成为一种有前景的替代方案,可以学习适应复杂的非凸环境[25 (https://arxiv.org/html/2606.24947#bib.bib5)]。早期尝试利用传统Q-learning完成电动汽车智能充电[4 (https://arxiv.org/html/2606.24947#bib.bib18)]和灵活负荷管理[13 (https://arxiv.org/html/2606.24947#bib.bib19),15 (https://arxiv.org/html/2606.24947#bib.bib20)]等任务,但受限于其在连续动作空间中的操作能力。因此,研究焦点已转向更先进的基于策略的算法,例如深度确定性策略梯度在智能家居能源管理[24 (https://arxiv.org/html/2606.24947#bib.bib21)]、近端策略优化在微电网能源管理[23 (https://arxiv.org/html/2606.24947#bib.bib22)]以及软演员-评论家在风光储系统最优调度[11 (https://arxiv.org/html/2606.24947#bib.bib23)]中的应用。然而,上述大多数研究采用从零开始训练的标准强化学习算法,并未深入探究其内在局限性,例如样本效率低下以及所学策略的次优性。具体而言,针对复杂系统从零开始训练智能体的困难和稳定性问题,是其实际应用的主要障碍。 大语言模型中基于人类反馈的强化学习[10 (https://arxiv.org/html/2606.24947#bib.bib10)]的成功为分布式能源控制提供了宝贵见解。标准大语言模型训练遵循“监督预训练加强化学习微调”的范式,包括两个阶段:1) 通过(自)监督学习进行预训练,随后2) 通过基于人类反馈的强化学习进行微调[1 (https://arxiv.org/html/2606.24947#bib.bib11)]。这一范式转变——使用强化学习进行微调而非从零开始训练——对其成功的实际应用至关重要。分布式能源的控制问题与大语言模型具有相似的关键特征:两者都使用强化学习解决复杂问题,并且有大量数据可用于预训练(存在充足的历史分布式能源运行经验,尽管可能是非最优或基于规则的)。这促使我们将大语言模型训练的两阶段范式迁移到分布式能源控制问题中。 一些现有工作尝试利用示范数据来训练分布式能源控制策略。参考文献[6 (https://arxiv.org/html/2606.24947#bib.bib24)]开发了一个多智能体模仿学习框架,其中单个智能体被训练来模拟优化求解器在管理微电网中多个储能系统时的最优控制动作。参考文献[5 (https://arxiv.org/html/2606.24947#bib.bib25)]提出一种基于模仿学习的方法,模拟MILP求解器进行微电网的经济调度。然而,这些研究局限于有监督的模仿,忽略了通过后续基于交互环境的微调所能获得的性能提升。此外,一些工作尝试利用历史分布式能源运行数据来提升强化学习算法的性能。例如,参考文献[2 (https://arxiv.org/html/2606.24947#bib.bib8)]在历史数据上进行离线凸优化,假设对所有变量有完美了解,从而生成专家示范用于初始化经验回放缓冲区。相比之下,参考文献[12 (https://arxiv.org/html/2606.24947#bib.bib7)]并未一次性准备示范数据,而是通过使用优化器不断改进由强化学习智能体收集的轨迹,建立了一个连续的专家数据流。然而,这些研究主要依赖离线强化学习方法,先验数据仅存储在经验回放缓冲区中,以促进从零开始的训练。 近期工作还探索了多步训练框架以增强智能体在线部署的性能。例如,参考文献[17 (https://arxiv.org/html/2606.24947#bib.bib26)]提出了一种两阶段方法,首先从离线数据中训练一个经校准的保守值函数,然后在线微调策略以避免性能下降。参考文献[20 (https://arxiv.org/html/2606.24947#bib.bib27)]引入了一个中间在线训练阶段,以训练一个新的在线值函数,该函数随后与冻结的离线值函数联合作用来细化策略网络。然而,这些研究侧重于改进值函数的估计,而忽视了离线数据集的质量问题。次优数据可能破坏值函数,导致策略高估数据集中劣质行为,并削弱策略对在线环境的适应性。此外,这些研究没有考虑在在线微调之前先在高保真模拟环境中细化策略,而这是向具有复杂随机动态的真实世界环境平稳过渡的关键步骤。 从根本上说,当前的方法并未遵循“监督预训练加强化学习微调”的范式,即使用先验数据进行预训练,再使用强化学习进行微调。鉴于该范式在大语言模型中的成功以及分布式能源控制问题的相似性,将两阶段范式迁移到分布式能源控制可能带来额外的性能提升。因此,本文针对分布式能源控制问题提出了监督强化学习框架,包括:1) 监督预训练阶段,用于实现基线运行性能;2) 基于强化学习的微调阶段,用于提升性能。本文做出以下贡献: 1. 1.受当前大语言模型训练范式成功的启发,我们提出了一种监督强化学习框架,该框架结合了监督预训练和基于强化学习的微调,用于分布式能源控制问题。具体而言,策略先在示范数据上进行预训练,然后使用强化学习方法进行微调。所提出的框架能够有效提升分布式能源控制策略的性能。 2. 2.针对基于强化学习的微调阶段,我们提出了一种两步微调方法,包括在模拟环境中进行的离线微调步骤和在真实环境中进行的在线微调步骤。这进一步提高了控制策略的最优性,并在真实环境中提供了更高的起始性能。 3. 3.我们进行了全面的数值实验,以验证所提框架的有效性和优越性。具体而言,我们评估了其在预训练示范数据质量变化情况下的性能。结果表明,即使使用低质量示范数据,也能实现性能提升。 本文其余部分结构如下:第二节 (https://arxiv.org/html/2606.24947#S2)介绍待解决问题及相应的马尔可夫决策过程形式化。第三节 (https://arxiv.org/html/2606.24947#S3)阐述所提出的监督强化学习框架。第四节 (https://arxiv.org/html/2606.24947#S4)进行案例研究,第五节 (https://arxiv.org/html/2606.24947#S5)总结全文。 ## II 问题形式化 我们考虑一个连接到外部电网的微电网的最优能源管理问题。该微电网集成了异构的分布式能源资源,包括光伏板、风力发电机、柴油发电机、温控负荷和储能系统。我们假设一个集中控制设置,即单个控制器管理所有分布式能源的运行。主要目标是在满足供需平衡的前提下最小化运行成本。 本节首先给出微电网控制问题的完整精确数学建模。随后,该问题被近似为马尔可夫决策过程,以应用强化学习范式。 ### II-A 精确数学模型 微电网中分布式能源控制的目标是最小化总体运行成本: min∑t∈T\(λbuy,tPbuy,t\+λsell,tPsell,t\+∑g∈Gcg,tPg,t\), (1) 其中,λbuy,t 和 λsell,t 分别为向外部电网购电/售电的价格;Pbuy,t 和 Psell,t 为与外部电网交易的电量;Pg,t 为发电机 g 的发电量,cg,t 为相应的发电成本(假设为线性成本模型)。本文侧重于精确(非线性)的分布式能源运行模型。为简化起见,不考虑电池退化成本和温控负荷的磨损成本,但这些成本可以直接纳入。 微电网分布式能源运行的第一组约束是功率平衡: ∑g∈G,W,PPg,t\+∑m∈BPm,tdis\+PtUPG=PtD\+∑l∈HPl,t\+∑m∈BPm,tch,∀t∈T, (2) PtUPG=Pbuy,t−Psell,t,∀t∈T, (3) 其中,Pm,tdis/ch 表示储能系统 m 的放电/充电功率;PtUPG 为与外部电网交易的电量;PtD 为微电网的本地用电需求;Pl,t 为温控负荷 l 的功率需求;G 表示柴油发电机组;W 表示风力发电机组;P 表示光伏发电机组;H 表示温控负荷组;B 表示储能系统组。 精确的分布式能源运行模型构成了微电网分布式能源运行问题的另一部分约束: #### II-A1 分布式发电机 分布式发电机,包括柴油发电机、光伏和风力发电机,可建模为: P ̄g ≤ Pg,t ≤ P ̄g, ∀g ∈ G ∪ W ∪ P, ∀t ∈ T, (4) 其中,P ̄g 和 P ̄g 分别是发电机 g 输出功率的上限和下限。 #### II-A2 储能系统 储能系统可建模为: Sm,t+1 = Sm,t + (Pm,tch Δt ηmch) / Em − (Pm,tdis Δt) / (ηmdis Em), ∀m ∈ B, ∀t ∈ T, (5) S ̄m ≤ Sm,t ≤ S ̄m, ∀m ∈ B, ∀t ∈ T, (6) 0 ≤ Pm,tch ≤ P ̄m Im,t, ∀m ∈ B, ∀t ∈ T, (7) 0 ≤ Pm,tdis ≤ P ̄m (1 − Im,t), ∀m ∈ B, ∀t ∈ T, (8) 其中,式 (5 (https://arxiv.org/html/2606.24947#S2.E5)) 表示能量容量为 Em 的储能系统的荷电状态动态过程,考虑了充电效率 ηmch 和放电效率 ηmdis。式 (6 (https://arxiv.org/html/2606.24947#S2.E6)) 表示储能系统荷电状态的边界约束。式 (7 (https://arxiv.org/html/2606.24947#S2.E7)) 和 (8 (https://arxiv.org/html/2606.24947#S2.E8)) 给出了充电和放电功率的上下限,其中二进制变量 Im,t 区分储能系统处于充电状态 (Im,t=1) 或放电状态 (Im,t=0)。 尽管在传统储能系统模型中通常假设充放电效率为常数,但实际上效率是荷电状态和充放电功率的非线性函数[3 (https://arxiv.org/html/2606.24947#bib.bib4)]。为了考虑充电效率、荷电状态和充电功率之间的非线性关系,我们采用稳态等效电路模型。
相似文章
可扩展的约束多智能体强化学习:通过状态增强与一致性实现可分离动力学
本文提出了一种分布式方法,用于约束多智能体强化学习,该方法采用状态增强策略学习和对偶变量上的邻居间一致性,以在满足全局资源约束的同时实现智能体数量线性扩展。在智能电网需求响应上的实验表明,一致性协调对可行性至关重要:与集中式训练方法不同,它能够扩展到数千个智能体。
用强化学习削减AI数据中心能耗:从单GPU到整个集群的LLM训练实测功率控制
一篇新的arXiv论文探索使用强化学习,通过动态控制大语言模型训练工作负载的功率,在从单个GPU到整个集群的规模上降低AI数据中心的能耗。
LLM增强的多智能体强化学习用于公共充电系统中统一的电动汽车-充电站-电网优化
本文提出了一种LLM增强的多智能体强化学习框架,用于同时优化电动汽车充电调度、站点盈利性和电网稳定性,使用LLM进行特征选择和自适应加权,在减少训练时间的同时超越了最先进的方法。
电动汽车大规模车队的智能充电:独立多智能体强化学习方法
本文比较了上下文组合赌博机和策略梯度算法在大型电动汽车车队分散式智能充电中的应用,使用了包含动态定价和可再生能源数据的真实模拟环境。
Co-RL: 多智能体强化学习中多样化群体涌现的无监督推理
Co-RL是一个合作多智能体框架,通过对等推导的奖励,实现语言和视觉语言模型的无监督推理改进,减少对ground-truth标签的依赖,并通过增加群体多样性缓解训练崩溃。