时间序列基础模型在行人流量预测中的表现如何?一项跨数据集比较研究
摘要
本文对时间序列基础模型在不同数据集上的行人流量预测进行了基准测试,发现基础模型在数据丰富、具有季节性的场景中表现优异,而在数据有限的情况下,简单模型也能保持竞争力。
arXiv:2609.16415v1 Announce Type: new
摘要:行人计数预测支持面向行人的智能交通系统(ITS),包括人群监控、行人交通人员配置和路线规划,以及在人流高峰时的主动风险缓解。近期的时间序列基础模型(FMs)在异构预测基准测试中报告了强大的零样本准确性,但尚不清楚这些改进是否能可靠地转移到行人感知部署中。我们对七种单变量预测方法进行了基准测试,涵盖四种范式:Seasonal Naive、梯度提升树(LightGBM、CatBoost)、深度学习模型(N-HiTS、PatchTST)和两个预训练FMs(TimesFM、Chronos-2)。实验覆盖了两个互补的场景:(i)一个为期五天的特殊事件数据集SAIL2025,以3分钟为分辨率,域内历史数据有限;以及(ii)Melbourne行人传感器数据集,作为多年小时级数据集(2010-2017),具有强季节性。我们比较了不同数据集和多个预测时段下每个传感器的MAE和RMSE结果。结果显示三个一致的发现。首先,当历史数据有限时,Seasonal Naive对于高流量传感器的长期预测仍然是一个强大的基准,而训练过的模型在当第二天与先前日子差异显著时可能会性能下降。其次,提升树在低流量传感器上可能具有竞争力,但在事件驱动变化下对高流量传感器表现出更高的敏感性。第三,FMs在长上下文配置下的季节性和数据丰富场景中表现突出。这些发现强调了根据基础数据条件和预测时段选择行人预测模型的重要性。
查看缓存全文
缓存时间: 2026/09/16 08:51
# 时间序列基础模型在行人流量预测中表现如何?一项跨数据集比较研究 来源:https://arxiv.org/html/2609.16415 作者:Theivaprakasham Hari*, Ziteng Li*, Yanan Xin, Winnie Daamen, Serge Hoogendoorn†† †† 作者单位:荷兰代尔夫特理工大学土木工程与地球科学学院交通与规划系,2628 CN 代尔夫特 * 这些作者对工作贡献均等 †† 通讯作者:Theivaprakasham Hari,邮箱:[email protected] ###### 摘要 行人计数预测为面向行人的智能交通系统(ITS)提供支持,包括人群监测、行人交通人员调度与路径规划,以及突发人流高峰时的主动风险缓解。近期的时间序列基础模型(FMs)在异构预测基准测试中报告了较强的零样本准确率,但尚不清楚这些优势能否可靠地迁移至行人感知部署场景。本文评估了七种单变量预测方法,涵盖四种范式:季节性朴素法、梯度提升树(LightGBM、CatBoost)、深度学习模型(N-HiTS、PatchTST)以及两个预训练基础模型(TimesFM、Chronos-2)。实验覆盖两种互补场景:(i)为期五天、3分钟分辨率的特别活动数据集SAIL2025,其领域内历史数据有限;(ii)墨尔本行人传感器多年小时级数据集(2010–2017),具有强季节性特征。我们比较了不同数据集和多个预测时长下每个传感器的平均绝对误差(MAE)和均方根误差(RMSE)结果。研究揭示三个一致发现:第一,在历史数据有限的情况下,季节性朴素法在高人流量传感器的长期预测中仍是强基线,而训练模型可能在后续日期与前期差异显著时性能下降;第二,提升树模型在低人流量传感器上具有竞争力,但在事件驱动偏移的高人流量传感器上敏感性更高;第三,基础模型在季节性强且数据丰富的场景下,配合长上下文配置表现优异。研究强调根据数据条件和预测时长选择行人预测模型的重要性。 ###### 索引术语 行人计数、时间序列预测、分布偏移、零样本学习、基础模型 ## I 引言 行人感知网络在智能交通系统(ITS)中的应用日益广泛,为运营管理规划提供支持,包括人群管理、人员调度和路径规划[1,2]。该领域的预测面临挑战,因为实践中常同时存在三个因素:(i)短期部署(如公共活动)期间有限的本地历史数据;(ii)由日程、天气和运营干预引起的日常分布偏移[3];以及(iii)高短期波动性——行人流可能因交通到站、瓶颈或局部事件在几分钟内变化,使得短期轨迹外推比许多车辆计数场景更困难[4]。ITS中的传统时间序列预测依赖于基于本地历史数据训练的监督机器学习(ML)和深度学习(DL)模型,常见基线包括季节性朴素法[5]、直接多时域梯度提升树模型(LightGBM和CatBoost)[6,7],以及用于长期预测的专用深度架构(PatchTST和N-HiTS)[8,9]。 随着基础模型(FMs)和大语言模型(LLMs)的发展,时间序列基础模型已成为一种潜在的替代方案。Google的TimesFM和Amazon的Chronos-2[10,11]等模型在大规模跨领域序列数据上预训练,旨在学习通用时间表征,从而支持零样本或少样本预测。在行人感知中,这一能力最适用于临时或新部署的地点、临时活动基础设施以及快速重构的行人管理方案——在这些场景中,预测需要在积累足够的站点特定历史数据以进行稳定监督训练之前完成。 尽管时间序列基础模型理论上具有优势,但关于其在行人计数预测中相对于经典ML/DL模型的实际增益,系统性证据仍然有限。其在分布偏移下的鲁棒性以及计算和延迟影响对部署同样重要,尤其是在长上下文推理场景下。由于人群监测系统通常运行在适中的本地硬件上,并且必须在每个控制周期内为数十个传感器刷新预测,延迟、内存和重训练成本与准确性同等重要,但该领域的基准测试几乎只报告误差指标。现有文献缺乏统一、可复现且工程可用的基准,覆盖多样化的数据条件,往往将结论局限于单一数据分布或特定实验设置。 为填补这一空白,我们构建并评估了跨数据条件的对比实验,采用统一的数据处理流程和评估指标,涵盖代表两种部署场景的两个数据集:(i)事件驱动、历史数据有限的行人部署(SAIL2025);(ii)长期运行、季节性强的城市传感部署(Melbourne)。通过与经典ML/DL基线的系统比较,我们提供了关于时间序列基础模型在何种情况下对行人计数预测有用、以及何时更简单方法仍更优的实证证据。除准确性排名外,我们还强调与部署相关的因素,包括分布偏移、可用历史数据,以及短上下文与长上下文推理。我们的主要贡献如下: - •评估两个最先进的时间序列基础模型TimesFM和Chronos-2,与ML(直接多时域LightGBM和CatBoost)和DL(PatchTST和N-HiTS)基线进行对比。 - •使用SAIL2025数据集(5天,3分钟分辨率),通过扩展的滚动预测评估基础模型在有限历史事件条件下的零样本能力。 - •通过使用最大支持输入长度(Chronos-2为8,192个token,TimesFM为16,000个时间步),并在多年墨尔本数据集上评估基础模型的上下文窗口容量,研究扩展上下文如何影响长达720小时的长期预测。 - •量化每个模型在相同CPU硬件上的部署成本,包括训练时间、推理延迟、内存占用和模型大小。 本文其余部分组织如下:第II节回顾相关工作。第III节定义数据集、任务形式、模型和实验协议。第IV节报告结果与讨论。第V节以影响、局限性和未来方向作结。 ## II 相关工作 本节回顾行人计数预测、时间序列多时域深度预测模型和时间序列基础模型的先前工作,突出启发我们评估的研究空白。 ### II-A 行人计数预测 行人计数预测已通过回归模型、树集成和基于序列的架构进行研究,这些方法均利用了城市行人流中观察到的强周期性和特定位置动态[12,13,14]。然而,现有文献的一个反复出现的局限是,结论通常基于单一数据集或狭窄的模型集得出。这使得难以评估所报告的增益是否在不同数据场景中泛化,例如仅有几天观测的事件驱动数据限制场景与具有稳定季节结构的多年部署场景。 ### II-B 多时域深度预测模型 行人管理需要跨多个操作时域的预测,从分钟级干预到小时级人员调度及更长期规划。现代深度学习架构通过比经典方法更有效地表示长时间上下文和周期结构来应对这些时域。时序融合Transformer(Temporal Fusion Transformers)引入多时域注意力和静态协变量[15]。Informer通过稀疏注意力降低了长序列建模的计算复杂度[16]。Autoformer引入季节性-趋势分解和基于自相关的注意力来捕获长程依赖[17]。PatchTST通过将输入序列分割为块并应用通道独立Transformer编码来提高长期预测准确性[18]。若干不使用注意力机制的替代架构也具有竞争力。例如,TiDE使用密集多层感知机(MLP)编码器-解码器,推理开销较低[19]。这些方法通常依赖于充足的领域内历史数据和稳定的周期模式,因此在特殊事件中行人流快速变化且仅有短本地观测窗口可用时,其多时域预测性能可能下降。总之,尽管这些架构在存在稳定周期性和充足训练数据时具有前景,但在短而偏移强烈的行人事件窗口下的益处仍不确定。这一空白尤为相关,因为行人事件部署是ITS中最关键的操作用例之一,恰恰提供了这些模型最缺乏测试的条件。因此,需要一个受控基准来评估模型在数据丰富和历史有限两种场景下的表现。 ### II-C 时间序列基础模型 时间序列基础模型旨在通过大规模异构语料库预训练学习可迁移的时间表征,并以最少的任务特定适配支持零样本或少样本预测。受LLM启发的方法将预测视为序列补全或重新编程冻结的语言模型骨干以进行时序预测[20,21]。Lag-Llama引入了一个单变量概率预测基础模型,在来自多个领域的大量时间序列语料库上预训练[22]。TimesFM是一个预训练的纯解码器Transformer,专为通用预测设计,支持长上下文窗口[10]。Chronos-2将预测表述为将实值序列离散化为固定词汇后的token预测,并在多样基准数据集上报告了强大的零样本性能[11]。尽管这些模型在Monash[23]和M4[24]等标准基准上报告了有竞争力的结果,但它们在行人传感器数据上的评估仍然有限。特别是,特殊事件期间的行人预测需要在严重的领域内历史数据限制和强日常分布偏移条件下进行可靠预测,而现有基础模型基准套件并未涵盖这些条件。因此,基础模型为行人感知提供了无需训练的有吸引力的部署路径,特别是对于临时安装和无站点特定历史的新部署活动通道。然而,它们在这些条件下的可靠性,以及当存在稳定周期性时长上下文推理的实际价值,仍未充分记录。建立这一证据是本研究的核心目标。 ## III 方法与实验 本节定义预测任务,描述两个数据集,并指定评估的模型族及其配置。 ### III-A 问题形式化 对于每个传感器,我们将其读数建模为以固定周期Δ采样的行人计数单变量时间序列{yt}t=1T。传感器独立评估。在事件场景中,短期部署窗口和偶尔的缺失或低活动期限制了可用的有信息量的领域内历史数据量。给定长度为L(以时间步计)的上下文窗口,任务是预测接下来的H个值: y^t+1:t+H=f(yt−L+1:t), 其中f(·)表示预测模型。我们评估多个预测时长H。对于基础模型,我们还改变L以量化预测准确率对推理时可用上下文量的敏感性。 ### III-B 数据集 我们在两个反映互补部署场景的数据集上评估单变量行人计数预测。SAIL2025代表历史数据有限且日常偏移显著的事件驱动场景。Melbourne代表数据丰富、季节性强的场景,适合长期评估。我们将每个传感器通道视为独立单变量序列,并报告每个传感器的结果。这一选择符合常见部署实践(每个传感器必须作为独立单元运行),并避免了对空间元数据的需求。建模跨传感器依赖性是超出本研究范围的互补扩展。 #### III-B1 墨尔本行人数据集 墨尔本行人计数系统从分布在墨尔本中央商务区的自动传感器提供小时级行人计数[25](表I,图1)。我们选择16个在2010年至2017年间具有连续小时观测且无缺失值的传感器,每个传感器产生70,128个时间戳。数据表现出强烈的日周期和周周期,以及传感器位置间的显著尺度差异,平均小时计数范围从147(传感器T8)到1,508(传感器T4)。这些特征使墨尔本数据集成为比较模型在长达720小时长期预测中性能的合适基准。 #### III-B2 SAIL2025事件数据集 我们使用阿姆斯特丹人群监测系统111https://maps.amsterdam.nl/lvma/的11个传感器,包括部署在主要行人通道和渡轮码头的传感器。五天事件期间以3分钟分辨率记录,每天产生480个样本,每个传感器2,400个时间戳。值得注意的是,开幕日和闭幕日的时间模式与中间日期系统不同(图1),加剧了在滚动预测评估中观察到的日常分布偏移。
相似文章
评估基础模型在时间序列预测中的运行可行性
本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。
时间序列基础模型基准测试是否隐藏了依赖状态的失败?来自交通速度预测的证据
本文提出了面向时间序列基础模型的状态分层评估方法,揭示出聚合指标会掩盖交通状态转换期间的严重失败,并提出了双峰混合增强方法,在保持整体准确性的同时改善覆盖范围。
GlucoFM-Bench: 血糖预测的时间序列基础模型基准测试
GlucoFM-Bench 评估了用于血糖预测的时间序列基础模型,在15个数据集上展示了Chronos-2和TimesFM在零样本/少样本迁移方面的强劲表现,但指出当完整训练数据可用时,轻量级LSTM的性能更优。
评估基础模型在极端环境事件中的泛化能力:以加州野火PM2.5为例
本文系统评估了时间序列基础模型(TSFMs)在预测野火烟雾导致的极端PM2.5浓度方面的表现,使用了加州12年的数据集。结果表明,像BiLSTM这样完全训练的循环基线模型优于TSFMs,挑战了更大预训练模型主导环境预测的假设。
时空预测基准数据集与基线的批判性审查
本文批判性审查了时空预测的基准数据集与基线,表明经典线性模型常与图神经网络 (GNNs) 相媲美,突出了区分可靠性问题,并倡导更严格的评估。