超越MSE:重新思考不规则时间序列预测的评估指标与基准测试
摘要
论文提出连续时间平方误差(CSE)作为不规则时间序列预测的偏差较小的评估指标,并引入了一个系统基准来评估模型的连续时间性能。
arXiv:2608.17293v1 公告类型:新
摘要:现有不规则时间序列预测研究主要关注模型设计,而评估指标研究不足。现有基准通常使用均方误差(MSE)作为评估指标。我们表明,在不规则预测中,MSE不仅由模型预测决定,还受样本特定的时间戳采样分布影响,导致对模型连续时间预测性能的评估产生偏差。为解决此问题,我们提出连续时间平方误差(CSE),采用重要性加权消除时间戳采样分布的影响。我们进一步从理论上证明,CSE相对于连续时间风险的渐近估计误差不大于MSE。最后,我们构建了一个涵盖合成、半合成和八个真实世界数据集的系统基准,以验证CSE的有效性,并系统评估模型的连续时间预测性能。实验表明,CSE能比MSE更准确地恢复连续时间风险,而仅依赖MSE可能无法完全反映模型在真实场景中的连续时间预测性能。我们的代码可在 https://github.com/hnu-vis/ITS-Bench 获取。
查看缓存全文
缓存时间: 2026/08/19 10:26
# 不规则时间序列预测的评估指标与基准测试再思考 来源:https://arxiv.org/html/2608.17293 李荣文 机构:湖南大学计算机科学与电子工程学院,湖南长沙 谢海鑫 机构:湖南大学计算机科学与电子工程学院,湖南长沙 王潇 机构:湖南大学计算机科学与电子工程学院,湖南长沙 陈长健 机构:湖南大学计算机科学与电子工程学院,湖南长沙 通讯作者:[changjianchen@hnu\.edu\.cn](mailto:[email protected]) ###### 摘要 现有关于不规则时间序列预测的研究主要集中在模型设计,而评估指标的研究尚不充分。现有基准测试通常使用均方误差(MSE)作为评估指标。我们发现,在不规则预测中,MSE不仅由模型预测结果决定,还受样本特定的时间戳采样分布影响,导致对模型连续时间预测性能的评估产生偏差。为解决此问题,我们提出了连续时间平方误差(CSE),该指标采用重要性加权来消除时间戳采样分布的影响。我们进一步从理论上证明,CSE相对于连续时间风险的渐近估计误差不大于MSE。最后,我们构建了一个涵盖合成、半合成和八个真实世界数据集的系统性基准测试,以验证CSE的有效性并系统性评估模型的连续时间预测性能。实验表明,与MSE相比,CSE能更准确地恢复连续时间风险,而仅依赖MSE可能无法在真实场景中充分反映模型的连续时间预测性能。我们的代码可在 https://github\.com/hnu\-vis/ITS\-Bench\ 获取。 ###### 关键词: 机器学习,ICML ## 1引言 不规则时间序列在医疗保健、环境监测和人类活动分析等现实应用中无处不在(7 (https://arxiv.org/html/2608.17293#bib.bib21);6 (https://arxiv.org/html/2608.17293#bib.bib22);1 (https://arxiv.org/html/2608.17293#bib.bib23))。与规则采样的时间序列不同,其观测发生在非均匀的时间戳上,且不同样本可能表现出不同的采样模式。近年来,大量研究致力于建模这种非均匀的时间过程,推动了连续时间(2 (https://arxiv.org/html/2608.17293#bib.bib13))、基于注意力(20 (https://arxiv.org/html/2608.17293#bib.bib5))、基于图(23 (https://arxiv.org/html/2608.17293#bib.bib8))和基于块(15 (https://arxiv.org/html/2608.17293#bib.bib17))模型的发展。然而,与模型设计的快速进展相比,不规则时间序列预测的评估指标研究仍显不足。 图 1:非均匀采样下的评估偏差示例。尽管模型B的连续时间误差更低,但由于在时间区间\[0\.0,0\.4\]内过度密集的采样,模型A获得了更低的MSE。对于时间序列预测,一个理想的评估指标是预测轨迹与真实轨迹在整个未来时间区间的连续时间差异。给定时间跨度 T\\mathcal\{T\},令 l\(t,X\)\\ell\(t,X\)表示模型在时刻 t 的预测误差。此连续时间差异定义为连续时间风险: Rct=EX\[1\|T\|∫Tl\(t,X\)dt\]\.R\_\{\\mathrm\{ct\}\}=\\mathbb\{E\}\_\{X\}\\left\[\\frac\{1\}\{\|\\mathcal\{T\|\}\\int\_\{\\mathcal\{T\}\}\\ell\(t,X\)\\,dt\\right\]\.(1)该风险直接表征了模型在整个未来区间的连续时间预测性能。 现有研究通常采用均方误差(MSE)和平均绝对误差(MAE),这些指标广泛应用于规则采样预测。我们认为在不规则设置下,MSE和MAE会受样本特定的时间戳采样分布影响,可能无法准确反映模型性能。如图1 (https://arxiv.org/html/2608.17293#S1.F1) 所示,尽管模型B的连续时间误差低于模型A(即模型B的橙色线在整个时间跨度上更接近黑色真实值线),但由于在时间区间\[0\.0,0\.4\]内过度密集的采样,模型A获得了更低的MSE。通过理论分析,我们发现MSE对连续时间风险 RctR\_\{ct\} 的估计存在偏差,因为它实际测量的是观测时间风险 Robs=EX\[∫Tl\(t,X\)p\(t∣X\)dt\]R\_\{\\mathrm\{obs\}\}=\\mathbb\{E\}\_\{X\}\[\\int\_\{\\mathcal\{T\}\}\\ell\(t,X\)p\(t\\mid X\)\\,dt\],其中 p\(t∣X\)p\(t\\mid X) 是时间戳的条件采样分布。此分布是样本特定的,因此导致模型性能评估受到样本特定采样模式的混淆。 为消除时间戳采样分布对评估结果的影响,我们直接从 RctR\_\{\\mathrm\{ct\}\} 出发,通过重要性采样构建其经验估计量,称为连续时间平方误差(CSE)。CSE根据观测时间密度 p\(t∣X\)p\(t\\mid X) 对误差进行重新加权,降低密集采样区域的贡献,同时增加稀疏采样区域的贡献,从而缓解由时间戳采样分布引起的评估偏差。回到图1 (https://arxiv.org/html/2608.17293#S1.F1),CSE正确识别出模型B具有更低的连续时间误差。我们进一步证明CSE相对于连续时间风险的渐近估计误差不大于MSE。最后,我们进一步将MSE与CSE之间的差异分解为采样依赖性差距和时间分布差距,以研究它们在真实世界设置中的各自影响。类似地,我们可以推导出连续时间绝对误差(CAE)作为MAE的去偏对应物。 为评估CSE的有效性,我们需要获取每个数据集的真实轨迹 X。为此,我们构建了一个涵盖合成、半合成和真实世界数据集的系统性不规则时间序列预测基准。合成和半合成数据集均具有真实的连续或规则轨迹。基于对该基准的全面评估,我们得出以下结论:(1) 在合成和半合成数据集上,CSE在非均匀采样下能比MSE更准确地恢复连续时间风险;(2) 在真实世界数据集上,仅依赖MSE可能无法完全反映模型的连续时间预测性能;(3) MSE与CSE之间的差异受采样依赖性和时间分布差距的共同影响。 主要贡献总结如下: - •揭示MSE对模型连续时间预测性能评估的偏差。我们表明MSE估计的是观测分布风险而非连续时间风险,从而将模型评估与采样机制耦合。 - •具有理论保证的连续时间评估指标。我们提出连续时间平方误差(CSE),通过重要性加权从不规则时间戳估计连续时间风险,并证明其渐近估计误差不大于MSE。 - •用于连续时间评估的系统性基准。我们构建了一个涵盖合成、半合成和真实世界数据集的基准,以验证CSE的有效性,系统性评估模型的连续时间预测性能,并分析MSE与CSE差异的来源。 ## 2相关工作 ### 2\.1不规则时间序列预测 不规则时间序列通常具有稀疏、异步和非均匀采样的特点。现有研究主要集中在从有限观测中建模连续时间动态。一项工作明确描述了潜在状态的连续演变。例如,Latent ODE、Neural CDE和连续循环单元分别基于常微分方程、控制微分方程和连续状态转换处理任意时间间隔(18 (https://arxiv.org/html/2608.17293#bib.bib1);10 (https://arxiv.org/html/2608.17293#bib.bib2);19 (https://arxiv.org/html/2608.17293#bib.bib3))。另一项工作直接对不规则观测及其时间信息进行建模。SeFT将时间序列表示为观测集合,mTAN采用多时间注意力聚合异步观测,Raindrop使用图结构捕获变量间的动态依赖关系(8 (https://arxiv.org/html/2608.17293#bib.bib4);20 (https://arxiv.org/html/2608.17293#bib.bib5);26 (https://arxiv.org/html/2608.17293#bib.bib6))。更新的方法进一步将多尺度表示与图结构相结合。例如,Warpformer通过时间扭曲建模不同尺度的时间模式,而GraFITi将不规则预测表述为图上的信息传播过程(24 (https://arxiv.org/html/2608.17293#bib.bib7);23 (https://arxiv.org/html/2608.17293#bib.bib8))。 尽管有这些进展,现有研究主要集中在模型设计上,通常使用在观测到的未来时间戳上的MSE或MAE评估预测。相比之下,我们研究评估协议本身,并检查不规则采样如何影响模型比较和选择。 ### 2\.2不规则时间序列的基准测试与评估 随着对不规则时间序列兴趣的增长,先前研究已从数据资源、软件框架和标准化实验设置的角度开发了相关基准。MIMIC\-IV基准为稀疏和不规则的临床时间序列组织了统一任务,并比较了一系列代表性模型(3 (https://arxiv.org/html/2608.17293#bib.bib20))。PYRREGULAR提供统一的数据结构和分析工具,以及涵盖多个数据集和分类方法的标准化基准(21 (https://arxiv.org/html/2608.17293#bib.bib9))。Time\-IMM进一步为不规则多模态多变量时间序列引入了新的数据集和评估基准(4 (https://arxiv.org/html/2608.17293#bib.bib10))。对于预测任务,Physiome\-ODE从生物ODE构建控制数据集,为比较不规则预测模型提供更具挑战性和区分性的环境(11 (https://arxiv.org/html/2608.17293#bib.bib11))。 现有基准主要改进数据集、任务和实验标准化,而非评估目标本身。Physiome\-ODE是最相关的工作:它提供控制的ODE生成轨迹以提高模型区分度,但仍使用在采样查询时间上的MSE评估预测(11 (https://arxiv.org/html/2608.17293#bib.bib11))。因此,它没有检查模型结论是否依赖于查询时间分布,或是否恢复整个未来区间的风险。相比之下,我们以连续时间风险为评估目标,提出CSE进行估计,并将产生的评估差异分解为采样依赖性和时间分布差距。 ## 3预备知识 ### 3\.1不规则时间序列预测 数据集包含 SS 个不规则时间序列。对于第 ss 个序列,其历史观测表示为 Os=\{\(qs,i,xs,i\)\}i=1Hs\\mathcal\{O\}\_\{s\}=\\\{\(q\_\{s,i\},\\mathbf\{x\}\_\{s,i\}\)\\\}\_\{i=1\}^\{H\_\{s\}\},其中 qs,i∈Rq\_\{s,i\}\\in\\mathbb\{R} 和 xs,i∈RD\\mathbf\{x\}\_\{s,i\}\\in\\mathbb\{R\}^\{D} 分别表示不规则时间戳和对应的多变量观测。给定历史观测 Os\\mathcal\{O\}\_\{s\},预测模型 fθf\_\{\\theta\} 旨在估计未来时间区间 T\\mathcal\{T} 上的潜在过程。对于任何查询时间 t∈Tt\in\\mathcal\{T},模型输出由 X^s\(t\)=fθ\(Os,t\)\\hat\{\\mathbf\{X\}\}\_\{s\}\(t\)=f\_\{\\theta\}\(\\mathcal\{O\}\_\{s\},t\) 给出。令 Xs\(t\)\\mathbf\{X\}\_\{s\}\(t) 表示真实潜在过程,并定义时刻 t 的预测误差为 l\(t,Xs\)=L\(Xs\(t\),X^s\(t\)\)\\ell\(t,X\_\{s\}\)=\\mathcal\{L\}\(\\mathbf\{X\}\_\{s\}\(t\),\\hat\{\\mathbf\{X\}\}\_\{s\}\(t\)\)。在实际测试数据集中,真实值仅在有限未来时间戳集合 \{ts,j\}j=1Ls\\\{t\_\{s,j\}\\\}\_\{j=1\}^\{L\_\{s\}\} 上可用,这些时间戳由条件采样分布 p\(t∣Xs\)p\(t\\mid X\_\{s\}) 生成。 ### 3\.2不规则采样下的MSE和MAE 不规则时间序列预测的现有研究通常在实际观测到的未来时间戳上计算MSE和MAE。以下,我们以MSE为例说明,即 l\(t,Xs\)=‖Xs\(t\)−X^s\(t\)‖2\\ell\(t,X\_\{s\}\)=\\left\\\|\\mathbf\{X\}\_\{s\}\(t\)\-\\hat\{\\mathbf\{X\}\}\_\{s\}\(t\)\\right\\\|^\{2\}。相应地,测试集上的MSE可写为 MSE=1S∑s=1S1Ls∑j=1Lsl\(ts,j,Xs\)\.\\mathrm\{MSE\}=\\frac\{1\}\{S\}\\sum\_\{s=1\}^\{S\}\\frac\{1\}\{L\_\{s\}\\sum\_\{j=1\}^\{L\_\{s\}\}\\ell\(t\_\{s,j\},X\_\{s\}\).(2)该指标首先对每条轨迹的未来观测预测误差取平均,然后对不同轨迹赋予相等权重。当未来时间戳被视为从 p\(t∣X\)p\(t\\mid X) 中抽取的条件样本时,上述表达式本质上是以下观测分布风险的蒙特卡洛估计量: Robs=EX\[∫Tl\(t,X\)p\(t∣X\)dt\]=EX\[ET\|X\[l(T,X)\]\]\.R\_\{\\mathrm\{obs\}\}=\\mathbb\{E\}\_\{X\}\\left\[\\int\_\{\\mathcal\{T\}\}\\ell\(t,X\)p\(t\\mid X\)\\,dt\\right\]=\\mathbb\{E\}\_\{X\}\\left\[\\mathbb\{E\}\_\{T\\mid X}\[\\ell\(T,X\)\]\\right\].(3)因此,MSE根据未来时间戳的经验频率聚合预测误差:密集观测的时间区域在评估中获得更高权重,而稀疏观测的区域获得更低权重。换句话说,MSE的整体评估目标不仅由模型的预测误差决定,还由条件采样分布 p\(t∣X\)p\(t\\mid X) 决定。 ## 4不规则预测的连续时间风险 在本节中,我们首先定义与连续时间预测目标直接对应的连续时间风险。然后使用重要性采样构建其经验估计量CSE,并分析CSE相对于MSE的渐近特性。最后,我们引入全局时间风险,并将评估差异分解为与样本依赖采样和总体时间非均匀性相关的两个组成部分。 ### 4\.1连续时间风险 如上所述,MSE对应的观测分布风险受条件采样分布 p\(t∣X\)p\(t\\mid X) 影响,从而将模型评估与样本特定采样机制耦合。减少此依赖性的一种自然方法是采用跨所有轨迹的共同目标时间度量。对于连续时间预测,理想的评估目标还应衡量整个未来区间内预测轨迹与真实过程之间的差异。因此,我们采用均匀时间度量并定义 Rct=EX\[1\|T\|∫Tl\(t,X\)dt\]\.R\_\{\\mathrm\{ct\}\}=\\mathbb\{E\}\_\{X\}\\left\[\\frac\{1\}\{\|\\mathcal\{T\|\}\\int\_\{\\mathcal\{T\}\}\\ell\(t,X\)\\,dt\\right\].(4)
相似文章
重新思考多模态时间序列预测评估
介绍了TimesX,这是一个新的多模态时间序列预测基准,包含多样化的真实世界数据和文本上下文,解决了泛化、数据泄露和上下文多样性问题。
时空预测基准数据集与基线的批判性审查
本文批判性审查了时空预测的基准数据集与基线,表明经典线性模型常与图神经网络 (GNNs) 相媲美,突出了区分可靠性问题,并倡导更严格的评估。
超越整体模型:深度多元时间序列预测的系统组件级基准测试
本文介绍了TSCOMP,一个大规模基准测试,系统地将深度多元时间序列预测方法分解为细粒度组件,以实现自动化模型选择,性能优于复杂的整体架构。
时间序列基础模型基准测试是否隐藏了依赖状态的失败?来自交通速度预测的证据
本文提出了面向时间序列基础模型的状态分层评估方法,揭示出聚合指标会掩盖交通状态转换期间的严重失败,并提出了双峰混合增强方法,在保持整体准确性的同时改善覆盖范围。
TS-Fault:针对结构性故障的时间序列预测器基准测试
本文介绍了TS-Fault,这是一个用于评估时间序列预测模型在结构化故障场景(如依赖关系断裂和机制变化)下的基准测试。研究发现,干净数据上的准确性通常与鲁棒性呈负相关,且基础模型特别脆弱。