强化学习与基于规则的点对点定价在住宅光伏-电池储能社区中的应用
摘要
本文比较了住宅光伏社区中点对点电力交易的基于规则和强化学习的定价机制,结果显示基于规则的方法具有竞争力,且电池储能提升了强化学习的性能。
arXiv:2609.01680v1 公告类型:新
摘要:本文比较了基于规则和基于学习的定价机制在住宅光伏社区中的点对点(P2P)电力交易中的应用。基于规则的基准包括作为事后分配机制的账单共享、中间市场价格和供需比定价。强化学习(RL)公式通过深度Q网络实现,并在基于乘数的和可学习的SDR形状定价下进行评估,其中固定参数的SDR变体作为非学习对照。性能通过社区储蓄以及补充的财务和运营指标来评估。在基础仅光伏配置中,基于规则的基准优于最佳RL策略。在仅评估RL策略的电池储能情况下,最佳RL策略下的社区储蓄从EUR 734.23增加到EUR 978.52。在基于学习的模式以及两种配置中,SDR形状定价优于所考虑的基于乘数的参数化。结果表明,只要直接比较两个系列,基于规则的定价仍然具有高度竞争力,并且储能在此核算下显著改善了基于学习的结果,而收益的分布在家庭之间仍然异质。
查看缓存全文
缓存时间: 2026/09/03 06:08
# 基于强化学习与规则化的点对点定价机制在住宅光伏-电池储能社区中的应用 来源:https://arxiv.org/html/2609.01680 期刊:arXiv Pablo Benalcazar https://orcid.org/0000-0001-9578-8299 邮箱:[[email protected]](mailto:[email protected]) 通讯作者:通讯作者。 所属机构:波兰克拉科夫波兰科学院矿物与能源经济研究所能源经济部,波兰 Maciej Kalka https://orcid.org/0000-0002-4020-1582 所属机构:波兰克拉科夫波兰科学院矿物与能源经济研究所能源经济部,波兰 Wilian Guamán https://orcid.org/0000-0002-9905-8231 Jacek Kamiński https://orcid.org/0000-0001-7514-8761 所属机构:波兰克拉科夫波兰科学院矿物与能源经济研究所能源经济部,波兰 ###### 摘要 本文比较了基于规则和基于学习的定价机制在住宅光伏社区点对点电力交易中的应用。基于规则的基准机制包括作为事后分配机制的账单分摊、中市价以及供需比定价。基于强化学习的方案通过深度Q网络实现,并在基于乘数的定价和可学习的供需比结构化定价下进行评估,同时采用固定参数的供需比变体作为非学习控制组。性能通过社区储蓄以及补充的财务和运营指标进行评估。在基础的纯光伏配置中,基于规则的基准机制优于最佳强化学习策略。仅针对强化学习策略评估了电池储能后,最佳强化学习策略下的社区储蓄从734.23欧元增加到978.52欧元。在基于学习的模式中以及两种配置下,供需比结构化定价均优于所考虑的基于乘数的参数化方法。结果表明,在直接比较这两类机制的场合,基于规则的定价仍然极具竞争力;并且在此类核算下,储能显著提升了基于学习的成果,但收益在家庭之间的分配仍然不均衡。 ###### 关键词: 点对点电力交易,强化学习,点对点定价机制,本地能源市场,住宅光伏社区,电池储能系统 ## 术语表 **缩写** BES 电池储能系统 BS 账单分摊机制 DQN 深度Q网络 MMR 中市价 P2P 点对点 PV 光伏 RL 强化学习 RL-M RL-乘数:基于乘数的定价 RL-SDR-F RL-SDR-固定:固定参数的供需比结构化定价,非学习控制组 RL-SDR-L RL-SDR-可学习:可学习的供需比结构化定价 SDR 供需比 SOC 荷电状态 SSI 自给自足指数 **索引与集合** $t$ 结算间隔(小时) $i$ 家庭索引;同时也是算法1 (https://arxiv.org/html/2609.01680#alg1) 中的小批量样本索引 $k$ 动作索引,$k=1,...,K$ $\mathcal{A}$ 强化学习智能体的离散动作集 $K$ $\mathcal{A}$ 中的动作数量 $\mathcal{D}$ 包含每小时光伏、负荷和电网价格剖面数据的日期数据集 $\mathcal{T}^{\mathrm{tr}}$ 具有内部交易的间隔集合 $\mathcal{R}$ 经验回放缓冲区 $\mathcal{B}$ 从 $\mathcal{R}$ 中采样的小批量 **能量数量(kWh)** $E_t^{\mathrm{sup}}$ 可用于内部交易的聚合本地盈余 $E_t^{\mathrm{sup,pv}}$ 聚合本地盈余中的光伏份额 $E_t^{\mathrm{dem}}$ 聚合的剩余内部需求 $E_t^{\mathrm{tr}}$ 内部交易量,$E^{\mathrm{tr}}$ 为年度总量 $E_t^{\mathrm{buy}}$ 买方内部购买的能量 $E_t^{\mathrm{sell}}$ 卖方内部出售的能量 $E_t^{\mathrm{pv}}$ 社区光伏发电量 $E_t^{\mathrm{load}}$ 社区家庭用电量 $E_t^{\mathrm{grid,in}}$ 电网输入,$E^{\mathrm{grid,in}}$ 为年度总量 $E_t^{\mathrm{grid,out}}$ 电网输出 $b_t$ 社区净平衡,$b_t = E_t^{\mathrm{pv}} - E_t^{\mathrm{load}}$ $\mathrm{SDR}_t$ 供需比,$E_t^{\mathrm{sup}} / E_t^{\mathrm{dem}}$ (无量纲) **价格(€/kWh)** $p_t^{\mathrm{buy}}$ 电网输入价格 $p_t^{\mathrm{sell}}$ 电网输出价格 $p_t^{\mathrm{MMR}}$ 中市价内部价格 $p_t^{\mathrm{SDR,sell}}$ 供需比基准内部出售价格 $p_t^{\mathrm{SDR,buy}}$ 供需比基准平均购买价格 $p_t^{\mathrm{p2p,sell}}$ 强化学习智能体报价的内部出售价格 $p_t^{\mathrm{p2p,buy}}$ 强化学习智能体报价的内部购买价格 $p_t^{\mathrm{tr}}$ 实现的内部交易价格,$\bar{p}^{\mathrm{tr}}$ 为其平均值 **成本与经济指标(€)** $C^{\mathrm{ref}}$ 无内部交易的社区成本,$C_i^{\mathrm{ref}}$ 为每户成本 $C^{\mathrm{pool}}$ 内部交易后的社区成本 $C_i^{\mathrm{BS}}$ 在账单分摊下分配给家庭 $i$ 的成本 $B^{\mathrm{comm}}$ 社区收益,$C^{\mathrm{ref}} - C^{\mathrm{pool}}$ (不同于小批量大小 $B$) $\omega_i$ 分配给家庭 $i$ 的社区收益份额,$\sum_i \omega_i = 1$ (无量纲) $C^{\mathrm{usr}}$ 用户成本 $R^{\mathrm{pro}}$ 产消者收入 $S^{\mathrm{comm}}$ 社区储蓄 $J_t^{\mathrm{base}}$ 无点对点参考的每小时社区成本 $J_t^{\mathrm{p2p}}$ 经点对点清算和电网结算后的每小时社区成本 **定价机制参数** $\mu_k^{\mathrm{buy}}, \mu_k^{\mathrm{sell}}$ 动作 $k$ 下的买入和卖出乘数,在RL-M中(无量纲) $\alpha, \beta$ 供需比结构化规则的卖出和买入价格敏感度,$0 \leq \alpha \leq 1$, $\beta \geq 1$ (无量纲) $C_{\mathrm{ctrl}}$ 电网价格通道半宽(€/kWh) $C_{\mathrm{bal}}$ 电网价格通道中点(€/kWh) $\delta$ 对数参数稳定性常数(无量纲) **强化学习参数** $s_t$ 间隔 $t$ 的状态向量 $\tilde{b}_t$ 离散化的社区净平衡,九个区间(无量纲) $\overline{\mathrm{SOC}}_t$ 家庭间平均电池荷电状态,占容量的比例(无量纲) $a_t$ 在间隔 $t$ 选择的动作 $r_t$ 奖励,$J_t^{\mathrm{base}} - J_t^{\mathrm{p2p}}$ (€) $h_t$ 一天中的小时数 $Q_\theta$ 具有参数 $\theta$ 的动作价值网络 $Q_{\hat{\theta}}$ 具有参数 $\hat{\theta}$ 的目标网络 $\pi^*$ 训练后获得的贪心策略 $\gamma$ 折扣因子(无量纲) $\eta$ Adam学习率(无量纲) $B$ 小批量大小(无量纲) $T$ 目标网络同步周期(步数) $E$ 训练回合数(无量纲)(不同于能量数量 $E_t^{\bullet}$) $\varepsilon$ 探索率,从 $\varepsilon_0$ 到 $\varepsilon_{\min}$ (无量纲) $\lambda$ 每步探索衰减率(无量纲) ## 1 引言 点对点电力交易允许产消者和消费者在当地交换电力,而不是完全依赖外部电网[1 (https://arxiv.org/html/2609.01680#bib.bib1)]。它是更广泛的本地能源市场发展的一部分,其中参与规则、治理结构和结算机制仍在不断演变[2 (https://arxiv.org/html/2609.01680#bib.bib2)]。在此背景下,定价变得尤为重要,因为它既决定了内部交易的价值,也影响了经济收益在参与者之间的分配方式。在为点对点电力交易提出的定价机制中,供需比和中市价是讨论最广泛的[3 (https://arxiv.org/html/2609.01680#bib.bib3)]。选择并非中立,先前的研究表明,不同的定价规则可能对消费者支付和产消者收入产生实质性影响[4 (https://arxiv.org/html/2609.01680#bib.bib4)]。在住宅环境中,这些影响还取决于可用技术、费率设计和光伏发电条件[5 (https://arxiv.org/html/2609.01680#bib.bib5),6 (https://arxiv.org/html/2609.01680#bib.bib6)]。强化学习正越来越多地被用于电力系统运行和规划[7 (https://arxiv.org/html/2609.01680#bib.bib7)]。在点对点电力市场中,强化学习已被应用于变化运行条件下的价格调整和交易协调[8 (https://arxiv.org/html/2609.01680#bib.bib8)]。这一点尤其重要,因为基于学习的策略可能会改善整体经济结果。然而,它们相对于更简单的基于规则的基准机制的优势尚不清楚[9 (https://arxiv.org/html/2609.01680#bib.bib9)]。在具有光伏发电的本地社区中,点对点交易的经济表现取决于可用于交换的本地盈余以及社区的技术配置,因为光伏输出的变化会影响自给自足、经济储蓄和交易收入[5 (https://arxiv.org/html/2609.01680#bib.bib5),10 (https://arxiv.org/html/2609.01680#bib.bib10)]。在此背景下,电池储能通过影响内部交换条件和最终经济成果发挥着关键作用。文献中已探讨了基于规则和基于学习的机制[2 (https://arxiv.org/html/2609.01680#bib.bib2),9 (https://arxiv.org/html/2609.01680#bib.bib9)],但针对其财务结果的比较证据仍然有限[11 (https://arxiv.org/html/2609.01680#bib.bib11)]。本文在点对点电力市场中研究了基于规则和基于学习的定价方案。基于规则的基准是账单分摊、中市价和供需比,而基于强化学习的方案则通过三种运行模式进行评估。基于规则的机制在基础的纯光伏框架下进行评估,而强化学习策略则在纯光伏和光伏-电池储能两种配置下进行评估。比较基于平均交易价格、用户成本、产消者收入、社区储蓄以及内部交易和自给自足的补充指标。 ## 2 市场框架与定价机制 ### 2.1 点对点市场框架 考虑一个本地电力社区由具有光伏发电的产消者和没有现场发电的消费者组成[2 (https://arxiv.org/html/2609.01680#bib.bib2),1 (https://arxiv.org/html/2609.01680#bib.bib1)]。在每个间隔内,内部交换的能量受限于聚合本地盈余与聚合内部需求之间的平衡。令 $E_t^{\mathrm{sup}}$ 表示可用于本地交易的总盈余,令 $E_t^{\mathrm{dem}}$ 表示间隔 $t$ 的总剩余内部需求,两者均为净自消费量。交易量定义为 $$E_t^{\mathrm{tr}} = \min\left(E_t^{\mathrm{sup}}, E_t^{\mathrm{dem}}\right). \tag{1}$$ 方程(1)给出了内部可匹配的量。基于规则的基准在每个间隔内全额结算该量,内部价格受电网输入和输出价格限制,这确保了当输出价格低于输入价格时,任何一方与电网结算时都不会处于更差的境地。相反,基于强化学习的机制预先报价,内部交换仅在报价严格位于电网价格通道内且内部买卖价差非负的间隔内结算。否则,在该间隔内不发生内部交换,双方直接与电网结算。在输出价格超过输入价格的间隔中,全额基于规则的结算会减少社区收益,而基于强化学习的机制则不在那些间隔内进行内部结算。因此,实现的年度交易量取决于定价机制,即使方程(1)本身并不依赖于此。剩余需求由电网输入覆盖,而未被内部吸收的盈余则输出到电网。在每个间隔内,交易量按卖方的盈余比例和买方的剩余需求比例分配给卖方和买方。 ### 2.2 基准定价与结算机制 #### 2.2.1 账单分摊机制 账单分摊代表了通过社区收益再分配的集体结算[12 (https://arxiv.org/html/2609.01680#bib.bib12)]。令 $C^{\mathrm{ref}}$ 表示无内部交易的总社区成本,令 $C^{\mathrm{pool}}$ 表示本地交易后的总成本。社区收益为 $$B^{\mathrm{comm}} = C^{\mathrm{ref}} - C^{\mathrm{pool}}. \tag{2}$$ 则参与者 $i$ 分配的成本为 $$C_i^{\mathrm{BS}} = C_i^{\mathrm{ref}} - \omega_i B^{\mathrm{comm}}, \qquad \sum_i \omega_i = 1, \tag{3}$$ 其中 $\omega_i$ 表示分配的社区收益份额,根据每个家庭在内部匹配能量中的份额设定。 #### 2.2.2 中市价定价 中市价机制将内部价格定义在电网输入和输出价格之间[13 (https://arxiv.org/html/2609.01680#bib.bib13)]。令 $p_t^{\mathrm{buy}}$ 和 $p_t^{\mathrm{sell}}$ 分别表示间隔 $t$ 的电网输入和输出价格。中市价为 $$p_t^{\mathrm{MMR}} = \frac{p_t^{\mathrm{buy}} + p_t^{\mathrm{sell}}}{2}. \tag{4}$$ 此基准保持了与外部电网价格通道的直接关系。 #### 2.2.3 供需比定价 在供需比规则中,内部价格取决于本地市场平衡[14 (https://arxiv.org/html/2609.01680#bib.bib14),4 (https://arxiv.org/html/2609.01680#bib.bib4)]。间隔 $t$ 的供需比为 $$\mathrm{SDR}_t = \frac{E_t^{\mathrm{sup}}}{E_t^{\mathrm{dem}}}. \tag{5}$$ 相应的内部出售和购买价格遵循[15 (https://arxiv.org/html/2609.01680#bib.bib15)]的统一定价模型,其中当本地供应稀缺时,两个价格从电网购买价格单调下降到供应满足需求时的电网出售价格,得到 $$p_t^{\mathrm{SDR,sell}} = \begin{cases} \dfrac{p_t^{\mathrm{buy}} \, p_t^{\mathrm{sell}}}{\left(p_t^{\mathrm{buy}} - p_t^{\mathrm{sell}}\right) \mathrm{SDR}_t + p_t^{\mathrm{sell}}}, & 0 \leq \mathrm{SDR}_t \leq 1, \\[4.0pt] p_t^{\mathrm{sell}}, & \mathrm{SDR}_t > 1, \end{cases} \tag{6}$$ $$p_t^{\mathrm{SDR,buy}} = \begin{cases} p_t^{\mathrm{SDR,sell}} \, \mathrm{SDR}_t + p_t^{\mathrm{buy}} \left(1 - \mathrm{SDR}_t\right), & 0 \leq \mathrm{SDR}_t \leq 1, \\ p_t^{\mathrm{sell}}, & \mathrm{SDR}_t > 1, \end{cases} \tag{7}$$ 因此价格在电网价格界限内对本地稀缺和盈余状况做出反应。内部交易以单一价格 $p_t^{\mathrm{SDR,sell}}$ 执行,每个买方以电网输入价格覆盖其剩余缺口。因此,方程(7)中的购买价格是买方在其内部和剩余购买中支付的平均价格,而非单独执行的价格,这使得该机制
相似文章
电动汽车大规模车队的智能充电:独立多智能体强化学习方法
本文比较了上下文组合赌博机和策略梯度算法在大型电动汽车车队分散式智能充电中的应用,使用了包含动态定价和可再生能源数据的真实模拟环境。
基于实际约束的点对点能源市场中,用于能源贫困公平的接地、计算高效的LLM策略智能体
本文提出了EqGrid,这是一个闭环仿真系统。在该系统中,一个LLM策略智能体在受物理约束的点对点能源市场中设定价格和碳排放上限,以促进能源贫困的公平性,并通过计算高效的模型展示了负担不平等的减少。
深度强化学习用于自主订单拣选机器人的动态电池管理
本文提出了一种基于近端策略优化(PPO)的深度强化学习框架,用于仓库中自主移动机器人的动态电池充电,与基线方法相比,最高可实现6%的订单完成率提升。
Multi-Agent Deep Reinforcement Learning 用于奶牛场多目标电池管理
本文提出了一种多目标控制系统,利用差分进化和多智能体深度强化学习对奶牛场的电池进行管理,与基于规则的模型相比,能源套利利润最高可提高18%。
面向分布式能源资源协调的监督强化学习
本文提出了一种监督强化学习(SRL)框架,用于协调分布式能源资源,通过在演示数据上预训练并通过强化学习微调,以提高样本效率和性能。