基础模型用于电价预测和电池套利:它们能否替代市场特定预测模型?

arXiv cs.LG 论文

摘要

本文比较了基础模型与市场特定基准在电价预测方面的表现,发现只有TabPFN在统计上始终优于基准,但经济价值因策略和风险承受能力而异,表明基础模型无法普遍替代定制模型。

arXiv:2609.00089v1 Announce Type: new Abstract: 基础模型承诺在很少或没有特定任务训练的情况下提供准确的预测,但它们能否替代专为电价设计的模型仍不清楚。我们比较了来自五个基础模型家族的九个变体,以零样本模式进行评估,与两个最先进的电价预测基准在德国、波兰和西班牙的2021-2025年间进行对比。它们的性能通过点预测和概率预测准确性以及电池储能套利中的经济价值进行评估。只有TabPFN模型在所有三个市场和所有统计指标上始终且显著优于基准。然而,这种统计主导地位并未直接转化为经济主导地位:TabPFN在无限制竞标和更高风险的分位数策略下表现最佳,而分布深度神经网络基准在风险承受能力较低时更为盈利。因此,基础模型无法普遍替代市场特定模型,其价值取决于模型架构和决策问题。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:08

# 用于电价预测与电池套利的基础模型:能否替代特定市场的预测模型?  
来源:https://arxiv.org/html/2609.00089  
Arkadiusz Lipiecki https://orcid.org/0000-0003-1118-0388  
地址:波兰弗罗茨瓦夫科技大学计算社会科学系  
地址:波兰弗罗茨瓦夫科技大学运筹学与商业智能系  
Rafał Weron https://orcid.org/0000-0003-1619-5239  
地址:波兰弗罗茨瓦夫科技大学运筹学与商业智能系  
地址:丹麦奥胡斯大学能源研究中心 (CoRE),8000 Aarhus C,丹麦  
通讯作者:通讯作者;邮箱:[email protected]  

###### 摘要  
基础模型有望在极少或无需特定任务训练的情况下提供准确预测,但其能否替代专门为电价预测设计的模型尚不明确。本文比较了来自五个基础模型家族的九种变体(以零样本模式评估)与两个最先进的电价预测基准模型,在2021-2025年期间于德国、波兰和西班牙市场的表现。评估维度包括点预测和概率预测的准确性,以及在电池储能套利中的经济价值。只有TabPFN模型在所有三个市场的所有统计指标上均持续显著优于基准模型。然而,这种统计优势并未直接转化为经济优势:TabPFN在无限竞标和更高风险的分位数策略下表现最佳,而在风险容忍度较低时,分布深度神经网络基准模型更具盈利性。因此,基础模型不能普遍替代特定市场模型,其价值取决于模型架构和决策问题。  

###### 关键词:电价预测;基础模型;概率预测;经济评估;电池储能运行;交易策略  

###### 目录  
1. [引言](https://arxiv.org/html/2609.00089#S1)  
   1.1 [我们的贡献](https://arxiv.org/html/2609.00089#S1.SS1)  
2. [文献综述](https://arxiv.org/html/2609.00089#S2)  
   2.1 [基于基础模型的点预测](https://arxiv.org/html/2609.00089#S2.SS1)  
   2.2 [基于基础模型的概率预测](https://arxiv.org/html/2609.00089#S2.SS2)  
   2.3 [大型预测系统的组件](https://arxiv.org/html/2609.00089#S2.SS3)  
   2.4 [结论](https://arxiv.org/html/2609.00089#S2.SS4)  
3. [数据集](https://arxiv.org/html/2609.00089#S3)  
4. [基础模型](https://arxiv.org/html/2609.00089#S4)  
   4.1 [时间序列模型](https://arxiv.org/html/2609.00089#S4.SS1)  
       4.1.1 [Chronos-2](https://arxiv.org/html/2609.00089#S4.SS1.SSS1)  
       4.1.2 [Moirai-2](https://arxiv.org/html/2609.00089#S4.SS1.SSS2)  
       4.1.3 [TimesFM-2.5](https://arxiv.org/html/2609.00089#S4.SS1.SSS3)  
   4.2 [表格模型](https://arxiv.org/html/2609.00089#S4.SS2)  
       4.2.1 [TabPFN](https://arxiv.org/html/2609.00089#S4.SS2.SSS1)  
       4.2.2 [基于保形预测的Mitra](https://arxiv.org/html/2609.00089#S4.SS2.SSS2)  
   4.3 [上下文数据](https://arxiv.org/html/2609.00089#S4.SS3)  
5. [基准模型](https://arxiv.org/html/2609.00089#S5)  
   5.1 [基于保形预测的LEAR](https://arxiv.org/html/2609.00089#S5.SS1)  
   5.2 [DDNN-JSU](https://arxiv.org/html/2609.00089#S5.SS2)  
6. [实证分析](https://arxiv.org/html/2609.00089#S6)  
   6.1 [统计误差度量与条件预测能力](https://arxiv.org/html/2609.00089#S6.SS1)  
   6.2 [基于电池储能系统交易的经济评估](https://arxiv.org/html/2609.00089#S6.SS2)  
   6.3 [结果](https://arxiv.org/html/2609.00089#S6.SS3)  
       6.3.1 [预测准确性](https://arxiv.org/html/2609.00089#S6.SS3.SSS1)  
       6.3.2 [电池储能套利收益](https://arxiv.org/html/2609.00089#S6.SS3.SSS2)  
7. [结论](https://arxiv.org/html/2609.00089#S7)  
8. [参考文献](https://arxiv.org/html/2609.00089#bib)  

## 1 引言  
电价预测是电力公司决策过程的基本输入\[2,5\]。由于对未来结果的预期塑造了大多数运营决策\[36\],即使预测精度的微小改进也可能带来巨大的经济价值\[17,49\]。然而,预测电价绝非易事。日前电价表现出明显的日和周季节性、突变尖峰、厚尾,且在许多市场中存在负值\[35\]。它们不仅取决于自身近期历史,还受天气驱动的需求、可再生能源发电、燃料和排放价格、电厂可用性、输电约束以及市场设计的影响\[10,39\]。此外,次日所有负荷时段的价格使用相同的信息集同时确定。因此,它们不应被视为无关的单变量时间序列\[62\]。任何成功的预测方法都必须考虑电价的复杂时间依赖性和预测时点可获得的市场相关信息。  

另一个挑战在于未来价格应如何呈现。点预测(如条件均值或中位数)易于理解,可直接纳入许多运营流程。然而,它们不提供预测不确定性的信息,可能造成精度的误导印象\[44\]。当预测误差具有不对称后果、极端价格实现成本高昂或决策受风险约束时,这一局限性尤为重要\[8,51\]。在此类情况下,以分位数\[34\]或完整预测分布\[7\]表示的概率预测更具信息量,因为它们既描述预期结果也描述其周围的不确定性\[42\]。  

基础模型(FM)在大型、多样的经验数据集、纯合成数据或两者上进行预训练,然后无需重新训练即可在所谓的零样本模式\[9\]下应用。原则上,此类模型可跨时间序列传递信息,减少对人工特征工程的需求,即使历史数据较短也能提供有用的点预测或概率预测。  

基础模型最近在电价预测领域引起了越来越多的关注。Hornek等人\[19\]考虑了五个欧洲日前市场和六个时间序列基础模型,但他们仅基准测试了点预测性能,未考虑外生预测变量,且测试期仅限于一年。Marchesi等人\[37\]超越了点预测,评估了四个市场中概率设置下的预测性能,但仅针对Moirai模型和一年的测试期。Lettner等人\[25\]考虑了Moirai和Chronos模型的概率预测,但仅限于德国市场、一年测试期,且未评估预测的经济价值。Yu等人\[59\]引入了一个用于日前电力市场的基础模型,并在包含24个欧洲国家的数据集上与三个通用时间序列基础模型家族进行了基准测试。然而,测试期同样限于一年,且未考虑预测在市场相关决策问题中的表现。Ponyuenyong等人\[45\]评估了大量时间序列基础模型的点预测,但仅在新加坡市场,测试期不到半年。基准模型的强度在各项研究中也各不相同。Hornek等人\[19\]主要将基础模型与通用统计方法和相对简单的机器学习模型进行比较。Ponyuenyong等人\[45\]考虑了更复杂的深度学习基准模型(基于长短期记忆和卷积神经网络),但缺乏与电价预测特定模型的比较。相比之下,Marchesi等人\[37\]包含了由Marcjasz等人\[38\]开发的用于概率电价预测的模型。  

关键问题是广泛的预训练是否比特定市场的电价预测模型更具优势。现有研究尚未确定零样本基础模型是否能在不同日前市场和较长的测试期内持续优于此类模型,也未确定统计预测精度的提升是否能转化为更大的经济价值。我们通过一个共同评估来填补这一空白,该评估包括:(i) 点预测,(ii) 概率预测,(iii) 预测精度的经济评估,(iv) 时间序列和表格基础模型,以及 (v) 已建立的电价预测基准模型。  

### 1.1 我们的贡献  
本研究对用于概率日前电价预测的基础模型进行了大规模实证比较。我们考虑了来自五个基础模型家族的九种变体:Chronos-2、Chronos-2-synth、Chronos-2-small、Mitra、Moirai-2、TabPFN-2、TabPFN-3、TabPFN-TS-3和TimesFM-2.5。将这些模型与两个最先进的电价预测基准模型进行比较。实证分析涵盖2021年至2025年的五年共同测试期,在三个结构不同的欧洲电力市场:德国、波兰和西班牙。这一设置使我们能够检验模型的相对性能在不同发电结构、可再生能源渗透水平和价格动态的市场中是否稳健。  

与电价预测文献的最新发展一致\[51,15\],我们从统计和经济两个角度评估模型。点预测准确性使用平均绝对误差和均方根误差评估,而概率性能则使用连续排序概率得分评估,这是概率预测的严格恰当评分规则\[12,42\]。作为统计评估的补充,我们在电池储能系统套利应用中评估预测的经济价值,使用基于分位数的决策和无限竞标设置\[38,15\]。  

该研究产生两个主要发现。首先,预训练的基础模型在支持外生变量方面具有竞争力,与市场特定的电价预测基准模型相当,但只有TabPFN家族在所有考虑的市场中均实现了优越的统计准确性。其次,经济评估提供了更细致的图景:TabPFN在更高风险的电池交易策略下占主导地位,而在风险容忍度较低时,分布深度神经网络基准模型是最盈利的模型。  

本文的其余部分结构如下。第2节回顾了基础模型的新兴文献。第3节简要描述了数据集。第4节介绍了时间序列和表格基础模型,并解释了它们的输入结构和预测设置,而第5节介绍了两个基准模型。第6节展示了统计和经济评估。最后,第7节进行了总结。  

## 2 文献综述  
根据Maciejowska等人\[35\]的研究,近期电价预测研究有三个广泛趋势:向高维统计和机器学习方法的转变、对概率预测日益增长的兴趣,以及对经济评估的日益重视。下面的文献综述侧重于第一个趋势和基础模型的新兴应用,而我们的实证研究则涵盖了所有三个趋势。  

### 2.1 基于基础模型的点预测  
Hornek等人\[19\]在点预测设置中比较了六个模型(Chronos-Bolt、Chronos-T5、TimesFM、Moirai、Time-MoE和TimeGPT)。测试期为每个五个欧洲日前市场(奥地利、比利时、法国、德国和荷兰)的一年(2024年)。Chronos-Bolt和Time-MoE是最强的基础模型,但均未显著优于MSTL,这是一个相对简单的多重季节性分解基准模型\[4\]。作者得出结论,零样本预测是可行的,但仅靠预训练并不能保证优越的准确性。  

在实时新加坡市场(使用半小时负荷时段)的点预测研究中报告了更令人鼓舞的结果。Ponyuenyong等人\[45\]将Tiny Time Mixers、Moirai、MOMENT和TimesFM(零样本和微调版本)与旨在提高价格尖峰期间性能的正则化策略相结合。基础模型在2021-2024年样本的10%测试集上,平均绝对百分比误差最高改进了37.4%;请注意,在电价预测中应避免使用平均绝对百分比误差\[58,23\]。作者认为,当价格过程高度非线性且传统模型难以适应极端观测值时,基础模型可能特别有用。然而,该研究考虑的是通用基准模型,而非第5节讨论的电价预测特定模型,并使用了实时市场数据。因此,其结论可能无法直接适用于日前市场。  

Sayghe等人\[48\]提出了GridFM,这是一个物理信息基础模型,用于使用纽约独立系统运营商的11年实时数据(五分钟分辨率)联合预测电力负荷、节点边际价格、碳排放和可再生能源发电。测试集涵盖2023-2024年的最后两年,预测范围从1到24小时。该模型结合了基础模型、频域适配层、基于图的电网拓扑表示、物理约束、多任务学习和可解释性工具。该研究更广泛地关注实时多任务电力系统预测,而非特定的电价预测问题。

相似文章

评估基础模型在时间序列预测中的运行可行性

arXiv cs.LG

本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。