时空预测基准数据集与基线的批判性审查
摘要
本文批判性审查了时空预测的基准数据集与基线,表明经典线性模型常与图神经网络 (GNNs) 相媲美,突出了区分可靠性问题,并倡导更严格的评估。
arXiv:2608.20980v1 公告类型:新
摘要:图神经网络 (GNNs) 常被用于具有空间图结构的多元时间序列的短期预测。尽管存在许多替代数据集,该领域的创新方法主要针对一组相当有限的基准数据集进行评估,最著名的包括 Chickenpox、PedalMe、WikiMaths、METR-LA 和 PEMS-BAY。评估协议包含从历史平均值到经典机器学习方法的基线。这些基线常常表现出与 GNNs 相媲美的性能。在本研究中,我们退一步,通过经典时间序列方法分析基准数据集,以揭示为什么空间无关的线性模型比之前报告的更具竞争力,进一步质疑上述广泛采用的数据集的区分可靠性。我们的统计分析提供了一套工具,用于识别显著的空间和时间相关性,同时揭示了由一阶差分数据集引入的结构偏差。因此,我们建议减少对这类数据集在方法比较上的过度依赖,转而倡导更严格的统计评估。通过将我们的分析结果应用于一个简单的混合模型,我们展示了我们的方法如何能够引领开发 GNN 模型的新途径。
查看缓存全文
缓存时间: 2026/08/24 04:34
# 时空预测基准数据集与基线方法的批判性审计 来源:https://arxiv.org/html/2608.20980 Kenneth Martin<sup>1*</sup>, Simon Heilig<sup>1*</sup>, Asja Fischer<sup>2</sup>, Michel F. C. Haddad<sup>3</sup>, Adam M. Sykulski<sup>1</sup>, Moshe Eliasof<sup>4</sup> <sup>1</sup>Imperial College London,London,United Kingdom,[[email protected]](mailto:) <sup>2</sup>Ruhr University Bochum,Bochum,Germany <sup>3</sup>Queen Mary University of London,London,United Kingdom <sup>4</sup>Ben-Gurion University of the Negev,Beersheba,Israel ###### 摘要 图神经网络(GNNs)通常被用于具有空间图结构的多变量时间序列的短期预测。尽管有许多备选数据集可用,该领域的创新方法评估主要还是依赖于相当有限的基准数据集,尤其是 Chickenpox、PedalMe、WikiMaths、METR-LA 和 PEMS-BAY。评估协议中的基线方法涵盖了从历史平均到经典机器学习方法的多种方法。这些基线方法通常显示出与GNNs相竞争的性能。在本文中,我们退一步,通过经典时间序列方法分析这些基准数据集,揭示为何空间无关的线性模型构成比之前报告的更强劲的竞争者,从而进一步质疑上述广泛采用数据集的区分可靠性。我们的统计分析提供了一套识别显著空间和时间相关性的工具,同时揭示了一阶差分数据集引入的结构偏差。因此,我们建议减少对此类数据集在方法比较上的过度依赖,并倡导更严格的统计评估。通过将我们分析的结果应用于一个简单的混合模型,我们展示了该方法如何能够引导开发GNN模型的新途径。 ## 1 引言 图神经网络(GNNs)因其源自消息传递机制的归纳偏差,在需要空间信息处理的应用中展现出巨大前景[37, 6, 9]。随着图上信号滤波器的发展[7, 19, 26],将卷积神经网络(CNN)推广到网格结构数据之外,以及最近神经ODE启发的GNNs的发展[29, 4],一种处理分布在空间和时间上的数据的自然联系已经出现[21, 43, 20, 11, 10, 3]。常见的分类区分静态图(即固定的空间结构)和动态图(即空间交互允许随时间变化)[15]。在本文中,我们关注配备时间序列特征的静态图,这代表了一个基于数据场景中给定的稀疏空间交互(例如交通拥堵或电网负载预测)[5]的多变量预测问题。 评估协议的核心部分,多项研究调查了由历史平均、线性回归或核机器学习给出的简单基线[21, 25, 44]。本应被非线性模型超越的DLinear[44]——一种基于趋势和季节性分解的方法——提出了一个能够在性能上与Transformer竞争的基线。类似地,[13]针对连续时间数据,提出了一种基于状态空间的强基线方法,该方法建立在经典的移动平均和持续预测之上。除了基线方法,标准化的协议在可靠推进方法发展并在基准数据集上展示进展方面起着至关重要的作用。借助流行的库(<sup>1</sup>在PyTorch Geometric Temporal中重新发布并可用。),如Chickenpox、PedalMe、WikiMaths、METR-LA和PEMS-BAY[31, 21]等数据集,来源于包括互联网和道路交通以及公共卫生在内的多种现实世界预测问题,经常被用作基准数据集[46, 12, 22, 16, 3, 5]。 特别是,许多研究使用这些基准数据集直接比较时空GNNs与基线模型。例如,[25]评估了一个常数均值预测器和节点级岭回归,这提供了早期证据,表明非线性模型在Chickenpox、PedalMe和WikiMaths上表现不佳。在METR-LA和PEMS-BAY上第一个简单但性能良好的方法基于时间和空间标识符[34]。虽然[21]包含了ARIMA(自回归积分移动平均)、季节性历史平均、线性支持向量回归和LSTM(长短期记忆网络)作为基线方法,但它们在超参数调整消融方面存在不足,并且自那以后就落后于非线性GNNs[5]。考虑到对这些数据集的巨大兴趣,我们退一步,更深入地审视数据来源、其评估协议和所使用的基线方法。 主要贡献: - • 对所有五个广泛采用的基准数据集:Chickenpox、PedalMe、WikiMaths、METR-LA和PEMS-BAY,进行了滞后时间和空间相关性的统计分析。 - • 分析了现有评估协议,揭示了重要缺陷,例如在差分时间序列而非原始时间序列上运行模型和进行比较,这导致整体预测性能较差。 - • 重新评估了基线方法,推动了在Chickenpox和WikiMaths上使用空间无关模型(如SARIMA(季节性ARIMA))。 - • 受到这些重新评估的启发,我们提出在SARIMA残差上训练GNNs作为训练目标,这可以将预测性能提升到METR-LA和PEMS-BAY上最先进方法的水平。 - • 一项合成实验表明,线性模型性能的提升部分来自于更好地适应节点级时间序列特性的异质性。 ## 2 基准数据集和评估协议 基准数据集——Chickenpox、WikiMaths、PedalME、METR-LA、PEMS-BAY——的数据摘要显示在表1中。我们首先将在第2.1节对这些数据集进行相关性分析,以理解其关键特性,然后在第2.2节更深入地研究不同数据集的评估协议,其中特别指出Chickenpox和PedalME数据集在PyTorch Geometric Temporal库中默认是差分的(显示周差异而非绝对数值),我们研究这对预测方法比较的影响。但首先,我们为本文建立一些符号表示。 #### 符号 令\(\mathcal{G}=(\mathcal{V},\mathcal{E},\mathbf{A})\)是一个具有\(N=|\mathcal{V}|\)个节点和\(|\mathcal{E}|\)条边的带权无向图,其中\(\mathbf{A}\in\mathbb{R}^{N\times N}\)是邻接矩阵,如果\((i,j)\in\mathcal{E}\)则\(A_{ij}>0\),否则为零。每个节点\(i\in\mathcal{V}\)在离散时间\(t\in\{1,\ldots,T\}\)关联一个标量观测值\(y_{t}^{(i)}\in\mathbb{R}\)。在节点上堆叠,我们将时间\(t\)的系统状态写为\(\mathbf{y}_{t}\in\mathbb{R}^{N}\),整个数据集写为\(\mathbf{Y}\in\mathbb{R}^{T\times N}\)。 表1:时空预测基准数据集统计信息。预测任务定义如下。给定长度为\(H\)的历史窗口,即\(\mathbf{Y}_{t-H+1:t}\in\mathbb{R}^{H\times N}\),以及图\(\mathcal{G}\),目标是预测接下来的\(k\)步\(\mathbf{Y}_{t+1:t+k}\in\mathbb{R}^{k\times N}\)。我们将节点\(i\)的邻域表示为\(\mathcal{N}(i)=\{j:(i,j)\in\mathcal{E}\}\),并将节点\(i\)的单变量时间序列写为\(\mathbf{y}^{(i)}=(y_{1}^{(i)},\ldots,y_{T}^{(i)})^{\top}\in\mathbb{R}^{T}\)。 ### 2.1 相关性分析 #### 设置 基于既定的统计工具[38],我们分析了空间和时间相关性,探究的时间滞后等于每个数据集中输入窗口的\(3\times\),以检验默认窗口大小是否覆盖了季节性等属性。空间相关性指的是节点\(i\)在时间\(t\)与其邻居\(j\in\mathcal{N}(i)\setminus\{i\}\)在时间\(\tau\le t\)之间的线性关系,由(归一化的)邻接矩阵\(A_{ij}\)加权。为计算此相关性,我们首先定义加权邻域信号 \[\bar{y}_{\tau}^{(i)}=\sum_{j\in\mathcal{N}(i)\setminus\{i\}}A_{ij}y_{\tau}^{(j)},\tag{1}\] 然后计算(皮尔逊)空间相关性 \[\rho_{i}^{\mathrm{sp}}(\tau)=\mathrm{Corr}\!\left(y_{t}^{(i)},\,\bar{y}_{t-\tau}^{(i)}\right),\quad\tau=0,1,2,\ldots.\tag{2}\] 时间相关性指的是每个节点时间序列的自相关,即 \[\rho_{i}^{\mathrm{temp}}(\tau)=\mathrm{Corr}\!\left(y_{t}^{(i)},\,y_{t-\tau}^{(i)}\right),\quad\tau=0,1,2,\ldots.\tag{3}\] 此外,我们通常预期在时空数据集中,节点\(i\)在时间\(t\)的状态与其邻居共享互信息。为了分解这种同时的空间关系,并受到偏自相关函数标准用法[38]的启发,我们执行了一个我们称为偏空间相关性的过程,其中我们估计在控制节点\(i\)在时间\(t-\tau\)的状态条件下,其邻居在时间\(t-\tau\)的状态与节点\(i\)在时间\(t\)的当前状态之间剩余的相关性。这允许估计滞后空间信息在(线性意义上)的预测能力,相较于仅时间模型。形式化地,令\(\hat{y}_{t}^{(i)}=\alpha y_{t-\tau}^{(i)}+\beta\)和\(\hat{\bar{y}}_{t-\tau}^{(i)}=\gamma y_{t-\tau}^{(i)}+\delta\)分别为\(y_{t}^{(i)}\)和\(\bar{y}_{t-\tau}^{(i)}\)在\(y_{t-\tau}^{(i)}\)上的最小二乘投影,其中\(\bar{y}_{t-\tau}^{(i)}\)是滞后\(\tau\)的加权邻域信号,如(1)中所定义。偏空间相关性则为 \[\rho_{i}^{\mathrm{psp}}(\tau)=\mathrm{Corr}\!\left(y_{t}^{(i)}-\hat{y}_{t}^{(i)},\;\bar{y}_{t-\tau}^{(i)}-\hat{\bar{y}}_{t-\tau}^{(i)}\right),\quad\tau=1,2,\ldots.\tag{4}\] 每个感兴趣基准数据集(在整个时间序列上计算)的时间、空间和偏空间相关性观察结果分别显示在图1(Chickenpox、PedalMe、WikiMaths)和图2(METR-LA、PEMS-BAY)中。对于考虑的每个滞后\(\tau\),我们报告了所有节点\(i\in\mathcal{V}\)的\(\rho_{i}^{\mathrm{temp}}(\tau)\)、\(\rho_{i}^{\mathrm{sp}}(\tau)\)和\(\rho_{i}^{\mathrm{psp}}(\tau)\)的中位数和第5/95百分位数。 #### 局限性 上述指标的局限性在于它们仅限于捕捉线性依赖结构。尽管如此,由于我们的重点在于第3节中重新评估线性基线方法对基准数据集的能力,这些统计信息为我们提供了关于适当基线模型和评估协议的充分信息。 图注:(a) 图注:(b) 图注:(c) 图1:Chickenpox (a)、PedalMe (b) 和 WikiMaths (c) 数据集的滞后时间(蓝色)、空间(橙色)和偏空间(绿色)相关性。线表示节点上的中位数相关性,阴影区域表示第5和第95百分位数。 #### 发现(Chickenpox) 检查图1(a),Chickenpox数据集在考虑的所有滞后上显示出非常弱的相关性,除了滞后1的时间相关性,它强烈为负。在时间序列分析中,这种模式通常表示过度差分——对时间序列进行超过实现平稳性所需的差分。确实,该数据集在PyTorch Geometric Temporal库中默认以差分时间序列形式发布(给出每周报告病例的差异而非绝对数量),我们将在第2.2节进一步研究其影响。偏空间相关性的中位数在所有滞后上都非常接近零,表明几乎没有空间信息。 #### 发现(PedalMe) 如其少量时间步长所预期的那样,相关性估计非常不稳定,如图1(b)所示。因此,很难确定地评估任何一致的属性。与Chickenpox一样,考虑到滞后1观察到的负时间相关性,数据似乎确实存在过度差分,而且该数据集在PyTorch Geometric Temporal库中也以显示需求的每周差异而非绝对数值的形式发布。然而,与Chickenpox不同的是,它似乎在控制时间后可能保留了更多空间信息,尽管很难确定地提出这样的主张。特别是,当应用Ljung-Box检验[24]时...
相似文章
SynopticBench:评估视觉语言模型生成未来天气预报讨论的能力
本文介绍了SynopticBench,这是一个包含130万份以上天气预报讨论及其对应气象图像的数据集;同时提出了SPACE,一个用于评估VLM生成天气预报质量的全新评估框架。
TS-Fault:针对结构性故障的时间序列预测器基准测试
本文介绍了TS-Fault,这是一个用于评估时间序列预测模型在结构化故障场景(如依赖关系断裂和机制变化)下的基准测试。研究发现,干净数据上的准确性通常与鲁棒性呈负相关,且基础模型特别脆弱。
智能电表能源预测的深度时间序列模型实证基准测试
本文对九种深度学习模型在智能电表数据上的能源预测进行了基准测试,揭示了随着历史输入的增加,准确率会饱和;随着预测时间范围的延长,准确率下降;轻量级模型提供了成本效益高的替代方案。
超越MSE:重新思考不规则时间序列预测的评估指标与基准测试
论文提出连续时间平方误差(CSE)作为不规则时间序列预测的偏差较小的评估指标,并引入了一个系统基准来评估模型的连续时间性能。
嵌套时空时间序列预测
本文提出一种嵌套时空预测框架,利用谱聚类构建语义一致的宏观区域,为细粒度的微观预测提供自上而下的指导。在高维数据集上的实验表明,该方法始终优于最先进的基线模型。