一个102M参数的Transformer如何预测多元时间序列?
摘要
本文通过可视化方式介绍了t0-alpha——一个1.016亿参数的基础模型,用于多元时间序列预测。该模型将时间注意力与跨变量组注意力分离,在GIFT-Eval上取得了具有竞争力的CRPS分数,与TimesFM 2.5和Chronos-2等更大模型相当。
我最近深入研究了t0-alpha的架构,这是一个1.016亿参数的时间序列预测基础模型。其中最令我感兴趣的设计选择是它将两种推理方式分离:时间注意力学习每个变量如何随时间演变;组注意力允许相关变量交换信息。架构的其他部分简要介绍如下:输入被分割成32个时间步的补丁;每个补丁被嵌入到512维表示中;模型使用24个Transformer块:16个时间注意力块和8个组注意力块;它采用时间感知的旋转位置编码、RMSNorm和SwiGLU;预测九个分位数用于概率预测;支持最大1024个时间步的上下文窗口。其在GIFT-Eval上报告的聚合CRPS为0.4941,大致与TimesFM 2.5和Chronos-2处于同一范围,尽管其只有约1.02亿参数。我撰写了一篇从基本原理出发的可视化讲解,详见:https://towardsdatascience.com/time-series-llms-explained-with-t0-alpha/ 我对两个问题很感兴趣,希望听到其他观点:将时间注意力与跨变量注意力分离是否提供了有用的归纳偏置?较小而专业的基础模型能否与更大的预测模型保持竞争力?此外,我正在进行一个等参数条件下的GIFT-Eval对比,与竞品基础模型和经典基线进行比较,并计划后续撰写相关文章。
相似文章
TimesFM-3:一种用于多变量预测的零样本基础模型
谷歌推出了TimesFM-3,这是一种最先进的零样本基础模型,专为多变量时间序列预测设计,可在单次前向传播中处理多个目标和协变量,无需进行微调。
基于语义结构化分区的多元时间序列预测的重新思考
本文提出了SCPaT,一个基于Transformer的多元时间序列预测框架,它使用语义结构化分区来解决现有基于块方法的局限性,并在真实数据集上展示了有效性。
Toto-2.0:时间序列多变量预测终于像LLM一样可扩展
Datadog发布了Toto-2.0,一个像LLM一样可扩展的时间序列模型,采用连续补丁掩码和Arcsinh归一化以改进预测。
google-research/timesfm
Google Research 发布了 TimesFM 2.5,这是一个开源的时序基础模型,用于预测,拥有2亿参数、16000上下文长度,并支持最多1000步的分位数预测。该模型可在 PyPI 和 Hugging Face 上获取,支持通过 LoRA 进行微调,并集成到 Google 产品如 BigQuery ML、Google Sheets 和 Vertex Model Garden 中。
面向电网层级的电力负荷预测基准:时间序列Transformer优于传统方法
本文提出了面向电网层级的电力负荷预测综合基准,评估了十种方法,发现基于Transformer的方法持续优于传统方法,将预测误差降低了6.6%–10.7%。标准Transformer的性能优于一种新颖的灵活架构,基础模型Chronos-2在某些数据集上展现出具有竞争力的零样本性能。