物理感知ACOPF代理学习的缩放定律

arXiv cs.LG 论文

摘要

本文研究物理感知代理模型在交流最优功率流(ACOPF)中的缩放定律,证明了物理信息训练目标在规模上改善约束满足,并具有与标准损失函数不同的缩放率。

arXiv:2609.16282v1 Announce Type: new 摘要: 基于学习的交流最优功率流(ACOPF)代理有望比经典求解器实现大幅加速,但其操作价值在很大程度上取决于物理可行性和预测准确性。物理感知目标,如增广拉格朗日(AL),以额外的每步成本改善约束满足,然而,这种权衡在规模上的表现尚未被表征。我们在MSE和AL训练下扫过模型和数据集大小,并表征约束违反如何随网络规模在不同电网中变化。两个目标都以幂律改善,但速率不同:MSE主要由模型容量决定,而AL在两者之间平衡。在MSE下,违反随网络规模增长的速度大约是AL下的两倍。在匹配的硬件上,AL以近30倍的减少违反,代价是高出一个数量级的训练时间,内存增加可忽略不计。训练目标不仅决定了代理的落脚点,还决定了其质量如何随规模演变。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:46

# 面向物理感知ACOPF代理学习的缩放定律
来源:https://arxiv.org/html/2609.16282
Yijiang Li\*††致谢:\*这些作者对本文贡献相同\. Emon Dey\*所属机构:阿贡国家实验室 Lemont, USA edey@anl\.gov Stefano Fenu所属机构:阿贡国家实验室 Lemont, USA sfenu@anl\.gov Massimiliano Lupo Pasini所属机构:橡树岭国家实验室 Oak Ridge, USA lupopasinim@ornl\.gov Teja Kuruganti所属机构:橡树岭国家实验室 Oak Ridge, USA kurugantipv@ornl\.gov Kibaek Kim所属机构:阿贡国家实验室 Lemont, USA kimk@anl\.gov

###### 摘要

基于学习的交流最优潮流(ACOPF)代理模型相比传统求解器有望实现显著加速,但其实际应用价值不仅取决于预测精度,更在于物理可行性。诸如增广拉格朗日(AL)等物理感知目标函数能够以额外的每步计算成本来提升约束满足度,然而这种权衡关系如何随规模变化尚未明确。本文在均方误差(MSE)和增广拉朗日(AL)两种训练目标下,系统研究了模型与数据集规模的影响,并表征了跨电网规模下约束违背量的变化规律。两种目标函数的性能均符合幂律提升,但变化速率不同:MSE主要受模型容量支配,而AL则在模型容量与数据规模间保持平衡。在MSE训练下,约束违背量随网络规模的增长速度约为AL训练下的两倍。在相同硬件配置下,AL能以近30倍的训练时间代价减少近30倍的约束违背,且内存增加可忽略不计。训练目标不仅决定了代理模型的最终性能定位,更影响了其质量随规模演化的规律。

###### 关键词:

缩放定律,交流最优潮流,图神经网络,物理信息机器学习,高性能计算

## I引言

电力网是现代社会最关键的基础设施系统之一。其运行模式正在经历深刻变革:可变可再生能源、分布式能源资源以及电气化交通与供暖负荷的快速接入,使得系统运行人员需要管理的运行工况在数量和波动性上均持续增长。同时,极端天气事件和不断演进的可靠性要求提高了运行决策的风险,需要对日益增多的应急和规划场景进行更快速、更频繁的分析。满足这些需求需要计算工具能够在远超传统工作流设计能力的速度与规模下评估电网运行决策,这使得电网成为高性能科学机器学习极具潜力的应用领域。

交流最优潮流(ACOPF)是电力系统运行中的基础优化问题,用于确定在满足非线性物理约束和运行限值下的经济最优发电机调度方案[1 (https://arxiv.org/html/2609.16282#bib.bib46), 2 (https://arxiv.org/html/2609.16282#bib.bib47), 3 (https://arxiv.org/html/2609.16282#bib.bib48), 4 (https://arxiv.org/html/2609.16282#bib.bib49)]。现代电网分析日益要求进行大规模的假设分析,这需要在经典非线性求解器变得难以承受的规模下反复求解ACOPF,从而催生了通过离线训练来分摊求解器成本的基于学习的代理模型[5 (https://arxiv.org/html/2609.16282#bib.bib14), 6 (https://arxiv.org/html/2609.16282#bib.bib25), 7 (https://arxiv.org/html/2609.16282#bib.bib21)]。与典型的机器学习场景不同,这些代理模型的评估不仅依据预测精度,还需考量物理可行性。存在较大功率平衡或热限值违背的预测,无论其与参考解的匹配程度如何,其运行实用价值都有限[8 (https://arxiv.org/html/2609.16282#bib.bib30), 9 (https://arxiv.org/html/2609.16282#bib.bib31)]。因此,减少约束违背是首要目标。随着这些代理模型开始向跨多种拓扑和运行工况的基础模型式部署发展[10 (https://arxiv.org/html/2609.16282#bib.bib23)],两个问题对负责其训练的高性能计算社区变得至关重要:代理模型的质量如何随模型规模、数据集规模和计算预算增长而变化,以及训练目标的选择——纯回归与物理感知损失——如何改变这种缩放行为。

缩放定律已成为刻画语言和视觉领域学习系统的标准工具[11 (https://arxiv.org/html/2609.16282#bib.bib1), 12 (https://arxiv.org/html/2609.16282#bib.bib2)],它们预测模型性能如何随模型规模、数据集规模和训练计算量呈幂律改善。其价值在于预测性:通过在较小规模下拟合少量运行结果,可以在投入训练之前预测更大模型能达到的性能,并确定在特定运行点下,容量或数据哪种资源是约束瓶颈。

这种预测作用对于电网代理模型尤为重要。训练基础规模的ACOPF代理模型需要在旗舰级系统上投入大量资源,若缺乏基于经验的性能预测依据,关于模型规模和数据生成的决策只能依赖小规模试点的外推。在科学机器学习,尤其是约束代理学习领域,这一图景远未完善。诸如增广拉格朗日(AL)方法等物理感知目标以额外的每步计算为代价来提升可行性[13 (https://arxiv.org/html/2609.16282#bib.bib5)],但这种权衡如何与规模相互作用仍不明确,使得扩展规模和优化目标这两个决策缺乏将其联系起来的经验基础。

本工作呈现了针对ACOPF代理学习的缩放定律研究,直接比较物理感知训练(AL)与MSE回归。基于LUMINA套件[14 (https://arxiv.org/html/2609.16282#bib.bib4), 15 (https://arxiv.org/html/2609.16282#bib.bib3)],我们拟合了预测误差和拓扑归一化约束违背的经验缩放关系,并表征了每种训练制度的缩放行为。这为不同计算预算下未来电网基础模型的设计决策,以及具有与ACOPF相同约束结构的电网优化问题提供了指导。同时,我们的部分发现可为在固定计算预算下决定何时以及如何部署物理感知训练的实践者提供参考。

本文的贡献如下:

- •约束ACOPF代理学习的缩放定律。我们表征了在MSE和AL训练下,预测误差和约束违背如何随模型规模和数据集规模缩放,为每种目标拟合了单轴和联合缩放关系,并将该表征扩展到跨越三个数量级的不同电网的物理网络规模。
- •物理感知训练的收益与代价。物理感知训练提升了可行性,但增加了每步成本。我们在通用平台上通过匹配的MSE和AL运行量化了这一权衡,报告了训练时间、内存占用,以及在相同训练样本数和匹配预测损失下获得的可行性增益。
- •对电网基础模型设计的启示。我们将这些结果综合成在固定计算预算下构建电网基础模型的设计考量,包括目标选择和模型-数据分配,这同样可为在资源受限环境中部署物理感知训练的实践者提供参考。

## II相关工作

### II\-A神经网络的缩放定律

经验缩放定律刻画模型性能如何随模型规模、数据集规模和训练计算量呈幂律改善。早期工作确立了泛化误差在不同领域和架构下遵循可预测的幂律趋势[16 (https://arxiv.org/html/2609.16282#bib.bib6)],而[11 (https://arxiv.org/html/2609.16282#bib.bib1)]将其形式化应用于自回归语言模型,表明损失随参数、数据和计算量在数个数量级上平滑缩放。[12 (https://arxiv.org/html/2609.16282#bib.bib2), 17 (https://arxiv.org/html/2609.16282#bib.bib45)]随后通过等FLOP扫描和损失关于模型与数据规模的联合拟合,重新审视了模型与数据间的计算最优分配,得出结论认为模型和数据应大致按相同比例扩展。类似的缩放行为已在视觉[18 (https://arxiv.org/html/2609.16282#bib.bib7)]和多种生成建模模态[19 (https://arxiv.org/html/2609.16282#bib.bib8)]中被记录。

缩放分析最近已扩展到科学机器学习。[20 (https://arxiv.org/html/2609.16282#bib.bib9)]刻画了神经算子在偏微分方程族上的缩放和迁移行为,发现预训练算子能以优异的数据效率在物理系统间迁移。缩放行为也在化学[21 (https://arxiv.org/html/2609.16282#bib.bib10)]和分子模型中被报道。对于电力网络的自然表示——图结构数据,其缩放行为的表征相对较少,尽管近期工作已开始建立图神经网络的神经缩放定律[22 (https://arxiv.org/html/2609.16282#bib.bib11), 23 (https://arxiv.org/html/2609.16282#bib.bib12)]。

有两个空白与我们的情境相关。首先,现有的科学缩放研究绝大多数考虑纯监督目标;当物理约束被嵌入训练目标时,缩放行为如何变化在很大程度上尚未检查。其次,科学代理模型面临语言和视觉领域不存在的一个维度:物理系统本身的规模。对于ACOPF代理模型,网络规模决定了必须满足的约束数量,然而约束满足度如何随网络规模下降,以及训练目标是否影响这种下降,尚未被系统表征。本工作拟合两种目标下的模型-数据缩放定律以解决第一个空白,并分别表征每种目标下约束违背随网络规模的经验趋势,作为针对第二个空白的互补性测量。

### II\-B基于学习的ACOPF代理模型

基于学习的代理模型通过在离线解决的实例上进行训练,并在推理时预测解决方案,从而分摊重复求解ACOPF的成本。早期方法使用全连接深度神经网络学习从运行工况到最优调度或部分决策变量的直接映射[5 (https://arxiv.org/html/2609.16282#bib.bib14), 24 (https://arxiv.org/html/2609.16282#bib.bib15), 25 (https://arxiv.org/html/2609.16282#bib.bib16)]。虽然这些方法相比迭代求解器实现了显著加速,但它们将学习到的映射绑定到固定网络,限制了跨拓扑的复用。

图神经网络通过消息传递利用电网的图结构解决了这一局限性,允许单一模型在不同规模和连接性的网络上运行[26 (https://arxiv.org/html/2609.16282#bib.bib17), 27 (https://arxiv.org/html/2609.16282#bib.bib18), 28 (https://arxiv.org/html/2609.16282#bib.bib19), 29 (https://arxiv.org/html/2609.16282#bib.bib20), 7 (https://arxiv.org/html/2609.16282#bib.bib21), 30 (https://arxiv.org/html/2609.16282#bib.bib22)]。电力网络本质上是异构的。同质架构[31 (https://arxiv.org/html/2609.16282#bib.bib43), 32 (https://arxiv.org/html/2609.16282#bib.bib44), 33 (https://arxiv.org/html/2609.16282#bib.bib50)]统一处理所有节点和边,无法显式表示这种结构,而异构架构引入了类型特定的投影和关系特定的注意力机制,以匹配电网的物理语义。其中,异构图Transformer(HGT)[34 (https://arxiv.org/html/2609.16282#bib.bib41)]将类型化消息传递与多头注意力相结合,使用依赖于节点和边类型的投影来区分组件角色。本研究采用HGT作为架构。大规模数据集如OPFData[35 (https://arxiv.org/html/2609.16282#bib.bib24), 36 (https://arxiv.org/html/2609.16282#bib.bib13)]提供了跨多个代表性拓扑、具有扰动工作点的已解决ACOPF实例,使得跨网络的系统性评估成为可能。

越来越多的研究从基础模型的角度构建这些代理模型,在跨拓扑的数据上预训练单一模型,并迁移到新电网[10 (https://arxiv.org/html/2609.16282#bib.bib23)]。实现这一方向需要理解代理模型质量如何随模型容量和训练数据缩放,这正是本工作要解决的问题。

### II\-C物理感知学习

在许多科学和工程问题中,物理定律和运行要求被数学表达为有效解必须满足的约束。对于ACOPF,这些约束包括编码交流潮流物理的等式约束,以及编码发电、电压和热限值的不等式约束。ACOPF的详细公式化请参见第III节[https://arxiv.org/html/2609.16282#S3]。在已解决实例上进行纯监督回归优化了与参考解的相似度,但并未提供强制执行这些约束的机制。因此,大量工作将约束直接纳入学习过程。

最直接的方法是在训练损失中加入惩罚约束残差的项。物理信息神经网络将控制方程嵌入作为软惩罚[37 (https://arxiv.org/html/2609.16282#bib.bib26)],这一思想已通过将潮流残差和KKT条件纳入目标函数应用于最优潮流[38 (https://arxiv.org/html/2609.16282#bib.bib27), 39 (https://arxiv.org/html/2609.16282#bib.bib28)]。拉格朗日方法不是固定惩罚权重,而是在训练过程中自适应调整它们。[6 (https://arxiv.org/html/2609.16282#bib.bib25)]引入了一种基于违背的拉格朗日(VBL)公式,其中对偶变量通过与观测违背成比例的上升步进行更新,而增广拉格朗日(AL)方法[13 (https://arxiv.org/html/2609.16282#bib.bib5)]将乘子更新与二次惩罚项相结合。[40 (https://arxiv.org/html/2609.16282#bib.bib29)]将这一思路扩展为基于深度增广拉格朗日方法的约束优化学习通用框架。这些目标相比纯回归提升了可行性。

另一条互补的工作路线通过模型架构或可微分过程来强制可行性,而非仅通过损失函数。[8 (https://arxiv.org/html/2609.16282#bib.bib30)]预测部分决策变量,并通过求解等式约束补全剩余部分,然后应用展开的基于梯度的校正步骤来减少不等式违背。相关方法包括用于ACOPF的面向可行性的架构[9 (https://arxiv.org/html/2609.16282#bib.bib31), 41 (https://arxiv.org/html/2609.16282#bib.bib32)]以及应用于已训练代理模型的推理后校正与标定程序[42 (https://arxiv.org/html/2609.16282#bib.bib33)]。

在这些不同类别中,约束处理始终被框架化为一个关于在给定训练规模下方法能实现*多少*可行性的问题。尚未被审视的是这些目标*随规模增长*时如何表现。我们研究这一问题

相似文章

奖励模型过度优化的标度律

OpenAI Blog

OpenAI 研究人员通过实验研究了奖励模型过度优化对性能的影响,建立了标度律来说明代理奖励优化与真实性能之间的关系如何随优化方法变化,并与模型规模成可预测的关系。

数据受限训练的规定性缩放定律

Hugging Face Daily Papers

一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。