一个102M参数的Transformer如何预测多元时间序列?

Reddit r/artificial 模型

摘要

本文通过可视化方式介绍了t0-alpha——一个1.016亿参数的基础模型,用于多元时间序列预测。该模型将时间注意力与跨变量组注意力分离,在GIFT-Eval上取得了具有竞争力的CRPS分数,与TimesFM 2.5和Chronos-2等更大模型相当。

我最近深入研究了t0-alpha的架构,这是一个1.016亿参数的时间序列预测基础模型。其中最令我感兴趣的设计选择是它将两种推理方式分离:时间注意力学习每个变量如何随时间演变;组注意力允许相关变量交换信息。架构的其他部分简要介绍如下:输入被分割成32个时间步的补丁;每个补丁被嵌入到512维表示中;模型使用24个Transformer块:16个时间注意力块和8个组注意力块;它采用时间感知的旋转位置编码、RMSNorm和SwiGLU;预测九个分位数用于概率预测;支持最大1024个时间步的上下文窗口。其在GIFT-Eval上报告的聚合CRPS为0.4941,大致与TimesFM 2.5和Chronos-2处于同一范围,尽管其只有约1.02亿参数。我撰写了一篇从基本原理出发的可视化讲解,详见:https://towardsdatascience.com/time-series-llms-explained-with-t0-alpha/ 我对两个问题很感兴趣,希望听到其他观点:将时间注意力与跨变量注意力分离是否提供了有用的归纳偏置?较小而专业的基础模型能否与更大的预测模型保持竞争力?此外,我正在进行一个等参数条件下的GIFT-Eval对比,与竞品基础模型和经典基线进行比较,并计划后续撰写相关文章。
查看原文

相似文章

google-research/timesfm

GitHub Trending (daily)

Google Research 发布了 TimesFM 2.5,这是一个开源的时序基础模型,用于预测,拥有2亿参数、16000上下文长度,并支持最多1000步的分位数预测。该模型可在 PyPI 和 Hugging Face 上获取,支持通过 LoRA 进行微调,并集成到 Google 产品如 BigQuery ML、Google Sheets 和 Vertex Model Garden 中。