时间序列基础模型基准测试是否隐藏了依赖状态的失败?来自交通速度预测的证据
摘要
本文提出了面向时间序列基础模型的状态分层评估方法,揭示出聚合指标会掩盖交通状态转换期间的严重失败,并提出了双峰混合增强方法,在保持整体准确性的同时改善覆盖范围。
arXiv:2606.18367v1 公告类型: 新
摘要:标准基准测试使用聚合指标来评估时间序列基础模型(TSFMs),但这可能掩盖关键运行状态下的严重失败。我们引入状态分层评估,并将其应用于两个标准交通速度基准测试中的三个TSFMs。交通在自由流和拥堵状态之间表现出突发的状态切换,在转换期间产生双峰速度分布。当我们按交通状态进行分层时,在转换期间准确性和预测区间覆盖都会急剧下降:转换状态的平均绝对误差(MAE)达到11 mph(而总体为3 mph),90%预测区间的经验覆盖率降至55%。这些失败在聚合指标中是不可见的,因为自由流观测占样本主导。一个简单的历史条件基线(从每个传感器训练分布中采样)实现了比任何TSFM更好的转换覆盖率,但总体准确性却差得多。我们提出了双峰混合增强(BMA),这是一种事后方法,将TSFM预测与历史分布知识相结合,在保持TSFM准确性的同时接近历史基线的转换覆盖率。我们的结果表明,TSFM基准测试应纳入状态感知评估,以揭示聚合指标隐藏的失败。
查看缓存全文
缓存时间: 2026/06/18 05:42
# 时间序列基础模型基准测试是否隐藏了状态依赖的失败?来自交通速度预测的证据
来源:https://arxiv.org/html/2606.18367
孙宪、孔令东、高伟、李延航、范志超、庄泽新
###### 摘要
标准基准测试使用聚合指标评估时间序列基础模型(TSFMs),但这些指标可能掩盖关键运行状态下的严重失败。我们引入了**状态分层评估**,并将其应用于两个标准交通速度基准测试上的三个TSFM。交通在自由流和拥堵状态之间表现出突然的状态切换,在过渡期间产生双峰速度分布。当我们按交通状态分层时,准确性和预测区间覆盖率在过渡期间急剧下降:过渡状态的平均绝对误差(MAE)达到11英里/小时(而整体为3英里/小时),90%预测区间的经验覆盖率低至55%。这些失败在聚合指标中不可见,因为自由流观测值在样本中占主导地位。一个简单的历史条件基线(从每个传感器训练分布中采样)在过渡覆盖率上优于任何TSFM,但整体准确性差得多。我们提出了**双峰混合增强**(BMA),这是一种事后方法,将TSFM预测与历史分布知识相结合,在接近历史基线的过渡覆盖率的同时,保留了TSFM的准确性。我们的结果表明,TSFM基准测试应纳入状态感知评估,以揭示聚合指标隐藏的失败。
时间序列基础模型,概率预测,状态切换,基准评估
## 1 引言
交通速度预测在自由流和拥堵之间的过渡期间最为重要。在稳定条件下,实时数据就足够了;在拥堵发生或消散期间,交通可能崩溃或恢复,而消耗未来速度的系统(预计到达时间、货运窗口、紧急调度)需要具有可靠不确定性的预测。这是预测体现其价值的地方。
时间序列基础模型(TSFMs)被定位为通用概率预测器(Ansari 等人,2024;Woo 等人,2024)。TSFM-Bench(Li 等人,2025)和 GIFT-Eval(Aksu 等人,2025)包括 METR-LA(207个环路检测器,洛杉矶)和 PEMS-BAY(325个检测器,旧金山湾区)(Li 等人,2018),这些是 DCRNN(Li 等人,2018)、STGCN(Yu 等人,2018)及后续图神经网络模型使用的标准基准测试。这些排行榜按领域和频率分层,但不按领域内的运行状态分层。一个模型可能在平均情况下表现准确,但在最重要的状态下失败。Adler 等人(2025)研究了TSFM在六个通用数据集上的预测区间覆盖率,发现基础模型“一致校准更好”,但未包含高频交通数据。5分钟分辨率的交通数据表现出自由流(~65英里/小时)和拥堵状态(~10-20英里/小时)之间的**突然状态切换**(Greenshields,1935),这是由尖锐的容量阈值驱动的。这是交通物理的特性,并非任何特定传感器的特性。在过渡期间,真实的未来速度分布是双峰的(图1):速度要么保持高位,要么急剧下降。TSFM产生位于两个峰值之间(~30-45英里/小时)的单峰区间,这个范围是瞬态的,很少持续。
#### 相关工作。
共形方法已被扩展到非平稳序列:Gibbs 和 Candès(2021)引入了自适应共形推断(ACI);最近的工作处理状态切换(Lu 等人,2025)和相关序列(Cini 等人,2025)。所有方法都调整区间**宽度**,但无法纠正分布**形状**。在交通方面,Wu 等人(2023)和 Zheng 等人(2025)提出了用于深度交通模型的不确定性量化,但从头开始训练特定领域的架构,并且不评估零样本TSFM。加宽以40英里/小时为中心的单峰区间仍然会遗漏15或65英里/小时附近的结果;需要一种不同的方法。
我们提出了在标准交通速度基准测试上对TSFM进行的首次**状态分层**评估。我们的贡献是:(1) 我们展示了聚合指标在交通状态转换期间掩盖了**准确性**和**预测区间覆盖率**方面严重的状态依赖失败。(2) 我们展示了一个简单的历史条件基线在过渡覆盖率上优于任何TSFM,但整体准确性较差,揭示了互补的优势。(3) 我们提出了**双峰混合增强**(BMA),它将TSFM预测与历史分布知识相结合,在不重新训练的情况下将过渡覆盖率提高3-19个百分点。
## 2 实验设置
#### 数据集。
我们使用 METR-LA(207个传感器,洛杉矶高速公路,2012年3月至6月)和 PEMS-BAY(325个传感器,旧金山湾区,2017年1月至5月)(Li 等人,2018),这是时空交通预测的标准基准测试。两者均以5分钟间隔记录速度。我们使用标准的70/10/20训练/验证/测试分割。
#### 传感器选择。
为了聚焦于覆盖率失败最重要的状态,我们根据训练集的拥堵频率(低于25英里/小时的读数比例)对传感器进行排序,并为每个数据集形成前50个传感器的池。然后每个随机种子从该池中抽取30个传感器,在多次运行中引入变异性。这仅使用训练数据,避免了测试集泄漏。
#### 模型。
我们以零样本模式评估三个TSFM:Chronos-T5-Base(Ansari 等人,2024),一种基于T5的编码器-解码器,对时间序列值进行分词并生成100个分布样本;Chronos-Bolt-Small(Ansari 等人,2024),一种高效的分位数变体,我们通过插值从中抽取伪样本;以及 Moirai-1.1-R-Base(Woo 等人,2024),它使用任意变量注意力与混合输出,并生成100个样本。基线包括ACI-LR(线性回归结合自适应共形推断(Gibbs 和 Candès,2021))和一个**历史条件**基线,该基线直接从训练数据计算出的每传感器经验分布 P(速度_{t+h} | 速度_t) 中抽取100个样本,不涉及任何预测模型。历史条件基线测试了BMA的TSFM锚点是否在其使用的历史查找表之外增加了价值。
#### 评估协议。
从50个易拥堵传感器的池中,我们抽取三个不同的随机子集,每个子集30个传感器(使用种子42、43、44),以便均值和标准差反映传感器选择之间的变异性。对于每个子集,我们在50个测试窗口上评估,预测步长 h ∈ {3, 6, 12}(未来15、30、60分钟),为基础模型提供14小时的上下文。我们报告**平均绝对误差**(MAE)和**经验覆盖率**:真实观测值落在模型90%预测区间内的比例。覆盖率之间的差异以百分点(pp)报告。
#### 状态检测。
我们使用《道路通行能力手册》(Transportation Research Board,2022)阈值对每个(窗口,传感器)的目标周期进行分类:**自由流**(所有步长 > 55英里/小时,LOS A/B),**拥堵**(所有步长 < 25英里/小时,LOS E/F),或**过渡**(混合/中间,LOS C/D)。这些阈值与图1中的双峰速度分布一致:单个易拥堵传感器显示模式接近~18和~65英里/小时,在30-40英里/小时处有一个谷值。
参见图注
图1:来自训练数据的速度分布。**顶部**:所有传感器汇总后,分布呈单峰状,接近60-65英里/小时。**底部**:单个易拥堵传感器显示强烈的双峰性,模式接近~18英里/小时和~64-66英里/小时。红线和绿线标记状态阈值(25和55英里/小时);阴影区域表示拥堵(红色)和自由流(绿色)状态。
#### 事后校正方法。
我们比较了四种事后校正策略,所有策略均应用于缓存的TSFM样本,无需重新训练:
*全局 ACI (G-ACI)*:自适应共形推断(Gibbs 和 Candès,2021)跟踪一个按顺序更新的错误覆盖率α_t:当最近的观测值落在区间之外时,α_t缩小,从而加宽未来的区间。由于α_t在所有状态之间共享,自由流观测值(接近名义值)稀释了过渡状态信号。
*状态条件 ACI (R-ACI)*:为每个状态维护独立的α参数,因此过渡状态的误差会推动过渡区间的加宽,而不影响自由流。两个ACI变体仅调整区间**宽度**,无法将概率质量向缺失的模态转移。
*双峰混合增强 (BMA)*:我们提出的方法。从训练数据中,我们预先计算每传感器的历史转换概率:P(速度_{t+h} ∈ R | 速度_t),针对每个状态R和预测步长h。在测试时,我们将TSFM的100个预测样本中的一部分替换为从该历史条件分布中抽取的样本,并按转换概率缩放。这注入了缺失的模态(例如,拥堵速度~15英里/小时),当历史数据表明存在非平凡的状态切换机会时。混合权重 w ∈ [0.1, 0.5] 在10个保留窗口上选择,并在所有剩余数据上进行评估。
*BMA + ACI*:BMA通过注入缺失模态来修复分布**形状**,但可能留下残余的过覆盖或欠覆盖,因为混合权重w是每个配置固定的。然后,全局ACI顺序调整区间**宽度**以弥补任何剩余的覆盖差距。两种校正是互补的:先形状,后宽度。
## 3 结果
### 3.1 聚合指标隐藏了状态依赖的失败
表1报告了在h=12时按交通状态分层的MAE。TSFM的整体MAE远低于历史条件基线(METR-LA上为5.8 vs 12.9英里/小时),证实了TSFM提供了真正的预测价值。但在过渡期间,所有方法的误差都收敛到类似水平(~10-11英里/小时),因为无论是TSFM还是历史查找表都无法预测交通将朝哪个方向移动。自由流在样本中占主导地位,因此聚合值被拉向容易的状态。
表1:在h=12时按交通状态分层的MAE(英里/小时)。TSFM的整体MAE远低于历史条件基线,但所有方法在过渡期间的表现类似地差。
### 3.2 校准失败集中在过渡期
我们为每个模型构建90%预测区间(TSFM基准测试的标准操作点(Adler 等人,2025;Aksu 等人,2025)),这意味着区间应该以90%的概率包含真实速度,并测量它实际包含真实值的频率(经验覆盖率)。然后我们按交通状态进行分层。图2揭示了一个引人注目的模式。在**自由流**(>55英里/小时)期间,TSFM的覆盖率接近90%目标(柱状图接近零)。在**拥堵期**(<25英里/小时),覆盖率中等程度下降。**过渡**状态(25-55英里/小时)是最差的:Chronos-Bolt在PEMS-BAY上h=12时仅达到54.9%,差距为35个百分点。ACI-LR基线(线性回归结合自适应共形推断)在PEMS-BAY过渡期更差,尽管在自由流期间过度覆盖,这证实了仅调整宽度无法解决这个问题。
参见图注
图2:三个预测步长下按交通状态划分的覆盖率差距。每个柱状图表示经验覆盖率减去90%名义目标;零线表示模型的区间恰好达到90%覆盖率。负值柱状图表示欠覆盖(区间太窄)。所有模型在**过渡**期间均失败,在PEMS-BAY上差距达到-35个百分点(Chronos-Bolt)和-48个百分点(ACI-LR)。ACI-LR在自由流期间过度校正(柱状图高于零线),但过渡覆盖率最差,说明仅加宽区间无法解决形状不匹配问题。
过渡状态的严重欠覆盖在操作人员需要采取行动时最为重要。考虑一个高速公路路段,早上6:45速度为55英里/小时,随着早高峰需求的增加:它将要么保持接近自由流,要么一旦下游瓶颈激活就崩溃到15英里/小时。在稳定条件下,实时观测就足够了,但在崩溃的边缘,只有前瞻性预测才能区分4分钟和16分钟的通行时间。根本原因是形状不匹配:过渡期间真实的未来速度分布是双峰的(图1),但在零样本模式下,所有三个TSFM都产生有效的单峰预测区间,位于两个峰值之间。拥堵状态本身是单峰的(集中在10-20英里/小时附近),所以那里的问题仅仅是区间宽度;过渡状态本质上是双峰的,这使得这是一个分布**形状**的问题。
### 3.3 事后覆盖校正
表2比较了在h=12时过渡状态覆盖率的四种事后方法。
**全局 ACI** 几乎没有改变:过渡覆盖率仅提高+0.5-1.2个百分点。这在意料之中:加宽一个中心位置错误的单峰区间无法恢复缺失的模态。
**状态条件 ACI** 做得稍好一些(PEMS-BAY上+2.3-2.9个百分点),因为特定于过渡状态的α更积极地适应。但它仍然只调整宽度,而不是形状。
**BMA** 产生了最大的改进,范围从+2.6个百分点(Moirai,PEMS-BAY)到+16.3个百分点(Chronos-Bolt,PEMS-BAY)。Chronos-Bolt的改进最大,因为它本机覆盖率最差:BMA将其PEMS-BAY过渡覆盖率从54.9%提高到71.2%。**BMA + ACI** 通过调整残余宽度,在BMA的基础上进一步增加了1-2个百分点,取得了最佳的整体结果。这两种方法是互补的:BMA纠正了分布**形状**(注入缺失的模态),而ACI纠正了残余**宽度**(缩放区间以补偿剩余的覆盖不足)。我们在组合中使用全局ACI而不是状态条件ACI,因为一旦BMA纠正了形状不匹配,残余的覆盖误差在不同状态之间足够均匀,每个状态的宽度调整不再提供额外的好处。
表2:h=12时过渡状态覆盖率(%),90%名义水平。历史条件基线(Hist.)通过从训练数据中抽样实现了较高的过渡覆盖率。BMA接近这一水平,同时保留了TSFM优越的点准确性。历史条件基线(表2,“Hist.”)达到81-82%的过渡覆盖率相似文章
时间序列基础模型在行人流量预测中的表现如何?一项跨数据集比较研究
本文对时间序列基础模型在不同数据集上的行人流量预测进行了基准测试,发现基础模型在数据丰富、具有季节性的场景中表现优异,而在数据有限的情况下,简单模型也能保持竞争力。
评估基础模型在时间序列预测中的运行可行性
本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。
TS-Fault:针对结构性故障的时间序列预测器基准测试
本文介绍了TS-Fault,这是一个用于评估时间序列预测模型在结构化故障场景(如依赖关系断裂和机制变化)下的基准测试。研究发现,干净数据上的准确性通常与鲁棒性呈负相关,且基础模型特别脆弱。
时间序列基础模型的因果分析
本文提出了一种因果分析框架,用于识别时间序列基础模型中的偏差,并应用于 Chronos-2 和 TimesFM-2.5,揭示了特定的失败模式,如对持续性的过度估计以及对 regime switch 模式的失败。
时间序列基础模型中的预测坍缩
该论文识别了时间序列基础模型在每小时股票收益预测中的预测坍缩现象,并引入了CalibRank来平衡校准和排名,显著提高了截面相关性。