线性模型在时间序列预测中能有多好?

Hugging Face Daily Papers 论文

摘要

本文表明,精心的预处理——尤其是上下文长度选择、归一化和正则化——可以使简单的线性模型(如 Ridge 回归)在时间序列预测基准测试中与大型 Transformer、MLP 和 CNN 模型相竞争或更优。

时间序列预测研究一直在稳步向更大的架构发展,从专门的 Transformer 到通用的基础模型,其假设是容量决定了准确性。我们持相反立场:通过调整预处理而非扩展模型,大部分差距可以在更低的成本下缩小。我们使用 Ridge 回归作为测试平台,因为它具有闭合解和可解释的权重,从而可以直接从搜索中读取最优超参数。我们在八个标准基准上搜索了上下文长度、局部归一化、正则化和数据增强,并发现了三种模式。(1)最优回看长度具有很强的序列特异性,且通常随预测窗口呈非单调变化,拟合的幂律指数范围从 ETTm2 上的 +0.46 到 Exchange 和 Traffic 上的 -0.19,挑战了更长预测窗口需要更长历史数据的惯例。(2)在上下文的学习尾部比例上而非整体上进行归一化几乎是普遍偏好的。(3)同一数据集内的序列在超参数上往往不一致;跨序列共享的最优程度从完全共享到完全独立不等。由此产生的模型在大多数数据集-预测窗口组合上超越了先前的线性预测器,并在八个基准中的六个上超过了 Transformer、MLP 和 CNN 基线。优化后的超参数还可作为数据本身的诊断工具,揭示出更大模型在其学习参数中静默吸收的结构。
查看原文
查看缓存全文

缓存时间: 2026/06/30 03:33

论文页面 - 线性模型在时间序列预测中能有多好?

来源:https://huggingface.co/papers/2606.27282

摘要

研究表明,预处理优化——特别是在上下文长度、归一化和正则化方面——能够比扩展模型架构更有效地显著提升时间序列预测的准确性。

时间序列预测(https://huggingface.co/papers?q=Time-series%20forecasting)研究一直在稳步向更大规模的架构发展,从专门的转换器(https://huggingface.co/papers?q=transformers)到通用的基础模型(https://huggingface.co/papers?q=foundation%20models),其假设是容量决定了准确性。我们持相反立场:通过调整预处理而非扩展模型,可以以更低的成本缩小大部分差距。我们使用岭回归(https://huggingface.co/papers?q=Ridge%20regression)作为测试平台,因为它具有封闭形式的解和可解释的权重,使得最优超参数(https://huggingface.co/papers?q=hyperparameters)可以直接从搜索中读出。我们在八个标准基准上搜索了上下文长度(https://huggingface.co/papers?q=context%20length)、局部归一化(https://huggingface.co/papers?q=local%20normalization)、正则化(https://huggingface.co/papers?q=regularization)和数据增强(https://huggingface.co/papers?q=augmentation),发现了三种模式。(1) 最优回溯长度具有强烈的序列特异性,且通常随预测范围(https://huggingface.co/papers?q=forecast%20horizon)呈非单调变化,拟合的幂律指数从 ETTm2 的 +0.46 到 Exchange 和 Traffic 的 -0.19,挑战了“更长的预测范围需要更长的历史”这一惯例。(2) 在上下文的一个学习到的尾部分数上进行归一化(而非对整个上下文归一化)几乎普遍被偏好。(3) 同一数据集内的序列常常在超参数(https://huggingface.co/papers?q=hyperparameters)上存在分歧;最优的跨序列共享(https://huggingface.co/papers?q=cross-series%20sharing)程度从完全共享到每个序列独立不等。由此产生的模型在大多数数据集-预测范围组合上超越了先前的线性预测器,并在八个基准中的六个上超过了 Transformer、MLP 和 CNN 基线。优化后的超参数(https://huggingface.co/papers?q=hyperparameters)还可作为数据本身的诊断工具,揭示出更大模型会悄然吸收到其学习参数中的结构。

查看arXiv页面(https://arxiv.org/abs/2606.27282)查看PDF(https://arxiv.org/pdf/2606.27282)项目页面(https://sakanaai.github.io/SearchCast/)GitHub2(https://github.com/SakanaAI/SearchCast)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.27282)

在你的代理中获取这篇论文:

hf papers read 2606\.27282

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本篇论文的模型0

暂无模型链接到本篇论文

请在模型 README.md 中引用 arxiv.org/abs/2606.27282 以将其链接到此页面。

引用本篇论文的数据集0

暂无数据集链接到本篇论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.27282 以将其链接到此页面。

引用本篇论文的Spaces0

暂无Space链接到本篇论文

请在Space README.md 中引用 arxiv.org/abs/2606.27282 以将其链接到此页面。

包含本篇论文的收藏集0

暂无收藏集包含本篇论文

将此论文添加到一个收藏集(https://huggingface.co/new-collection)以将其链接到此页面。

相似文章

时间序列预测的不合理难度

Hacker News Top

本文探讨了时间序列预测相比其他机器学习任务为何更具挑战性,展示了基准测试结果,表明简单的统计模型和零样本基础模型在许多序列上往往优于复杂的深度学习模型。

一个102M参数的Transformer如何预测多元时间序列?

Reddit r/artificial

本文通过可视化方式介绍了t0-alpha——一个1.016亿参数的基础模型,用于多元时间序列预测。该模型将时间注意力与跨变量组注意力分离,在GIFT-Eval上取得了具有竞争力的CRPS分数,与TimesFM 2.5和Chronos-2等更大模型相当。

评估基础模型在时间序列预测中的运行可行性

arXiv cs.LG

本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。