检索机制在时间序列预测中超越长上下文缩放

arXiv cs.LG 论文

摘要

这篇学术论文挑战了长上下文缩放在时间序列预测中的有效性,证明基于检索的方法优于 PatchTST 等标准架构以及 Chronos 和 Moirai 等基础模型。

arXiv:2605.08217v1 宣布类型:新论文 摘要:时间序列基础模型(TSFMs)从自然语言处理中借用了长上下文范式,其前提是将更多历史数据输入模型可以提高预测质量。但在随机领域中,遥远的历史往往只是高频噪声,而非有效信号。因此,本工作通过 ETTh1 基准测试了连续上下文架构(包括 PatchTST)以验证该前提是否实际成立。所得结果与该前提相悖:出现了明显的逆缩放规律,即随着上下文长度增加,预测误差反而上升。3000 步的窗口导致性能下降超过 68%,证明注意力机制在忽略无关的历史波动方面表现不佳。检索增强预测(RAFT)被评估为一种替代方案。RAFT 在使用固定 720 步窗口和选择性检索的情况下,实现了 0.379 的均方误差(MSE),优于长上下文配置和零样本基础模型(Chronos、Moirai),尽管其计算需求远低于后者。此外,检索步骤仅注入最相关的历史片段作为动态外生变量,这为模型提供了一种从原始序列中无法自行建立的、受上下文启发的归纳偏置。因此,未来的基础模型需要在架构上转向选择性检索。
查看原文
查看缓存全文

缓存时间: 2026/05/12 07:06

# 检索机制在时间序列预测中超越长上下文扩展
来源:https://arxiv.org/html/2605.08217
Rishi Ahuja†Kumar Prateek†Simranjit Singh†⊠\{\}^\{\\dagger\\,\\boxtimes\}Vijay Kumar†

†印度旁遮普邦贾兰达尔 B.R. Ambedkar 国立理工学院信息技术系, 邮编 144008\. \{rishia\.it\.24, kumarprateek,⊠singhsimranjit, vijayk\}@nitj\.ac\.in

###### 摘要

时间序列基础模型(TSFMs)从自然语言处理中借用了长上下文范式,其前提认为向模型输入更多的历史数据可以提高预测质量。但在随机性领域中,遥远的历史往往只是高频噪声,而非信号。因此,本研究通过在 ETTh1 基准测试上运行连续上下文架构(包括 PatchTST),检验这一前提是否成立。所得结果与该前提相悖:出现了一种明显的逆缩放定律,即随着上下文变长,预测误差反而上升。3,000 步的窗口导致性能下降超过 68%,这证明注意力机制在忽略无关的历史波动方面表现不佳。作为替代方案,评估了检索增强预测(RAFT)。RAFT 在使用固定的 720 步窗口和选择性检索的情况下,实现了 0.379 的均方误差(MSE),优于所有长上下文配置和零样本基础模型(如 Chronos、Moirai),尽管其计算需求要少得多。此外,检索步骤仅将最相关的历史片段作为动态外生变量注入,为模型提供了一种仅从原始序列中无法自行建立的上下文感知归纳偏置。因此,未来的基础模型需要在架构上转向选择性检索。

††脚注:⊠通讯作者。## 1引言

时间序列基础模型(TSFMs)近期的流行很大程度上归功于“缩放假设”,即拥有更长输入窗口的更大模型会产生单调改进的预测结果。Moirai\(Wooet al\.,2024 (https://arxiv.org/html/2605.08217#bib.bib1)\)和 Chronos\(Ansariet al\.,2024 (https://arxiv.org/html/2605.08217#bib.bib2)\)强化了这一观点:两者都通过利用规模,在多个预测领域实现了强大的零样本效果。但一个更难解决的问题仍未解决。大语言模型(LLMs)的“长上下文”逻辑能否直接移植到时间序列的随机世界中?有充分的理由对此表示怀疑。语言标记即使在文档中靠前数千个位置出现,仍保留语义内容。数值时间序列并非如此。随机过程中的旧值通常只是噪声,它们与未来值的统计关系会随时间急剧减弱。因此,本研究提出以下假设:当时间序列预测中的上下文窗口无差别地扩展时,一种称为“随机噪声累积”的失效模式会占据主导。无关的历史值涌入注意力计算,导致机制无法适当加权重要的近期模式,从而降低预测准确性。Williamset al\.\(2025 (https://arxiv.org/html/2605.08217#bib.bib3)\)表明,伴随数值输入的简短文本描述能带来巨大的精度提升,突显了原始数值上下文的贫乏。Pineda Arangoet al\.\(2025 (https://arxiv.org/html/2605.08217#bib.bib4)\)发现外生变量对于下游任务适应至关重要。本研究认为,**选择性检索**,而非盲目的窗口扩展,才是注入有用上下文的正确机制。

本研究使用 ETTh1 基准进行实证验证,并比较了三类模型:普通 Transformer、PatchTST\(Nieet al\.,2023 (https://arxiv.org/html/2605.08217#bib.bib5)\)(当前最先进方法)以及检索增强预测(RAFT)基线。实验得出了随机时间序列的**逆缩放定律**:a)**长上下文失效**:当上下文从 720 增加到 3,000 个标记时,PatchTST 的准确率下降了 68%。即使是先进的分块技术也无法过滤掉长历史窗口中的噪声。b)**检索获胜**:RAFT\(Hanet al\.,2025 (https://arxiv.org/html/2605.08217#bib.bib6)\)使用 720 步窗口加上选择性检索,获得了最佳的 MSE(0.379),优于所有长上下文和零样本基础模型基线。检索到的片段作为**动态外生变量**,提供了上下文感知的归纳偏置,且没有长连续窗口所附带的噪声惩罚。

## 2相关工作

### 2.1时间序列基础模型与上下文扩展

Moirai\(Wooet al\.,2024 (https://arxiv.org/html/2605.08217#bib.bib1)\)和 Chronos\(Ansariet al\.,2024 (https://arxiv.org/html/2605.08217#bib.bib2)\)通过在大型异构语料库上进行训练,在多个预测领域实现了强大的零样本迁移,证明了可以在大规模上捕捉通用的时间模式。PatchTST\(Nieet al\.,2023 (https://arxiv.org/html/2605.08217#bib.bib5)\)通过通道独立分块推进了监督式长上下文预测,在减少二次注意力开销的同时,支持非常长的输入序列。然而,这些架构共享的一个前提,即更长的回溯窗口意味着更高的准确率,在随机环境中并不成立。输入序列的随机部分主要由预测价值极低的高频波动主导。因此,盲目扩展上下文会创建噪声累积瓶颈,这是一种在这些设计起源的文本任务中不存在的失效模式。

### 2.2上下文感知预测与检索

辅助信息已被证明对预测的鲁棒性有价值。Williamset al\.\(2025 (https://arxiv.org/html/2605.08217#bib.bib3)\)表明,对预测进行文本接地能大幅减少基础模型中的歧义,并指出上下文是“关键”。此外,Pineda Arangoet al\.\(2025 (https://arxiv.org/html/2605.08217#bib.bib4)\)通过 ChronosX 展示了互补的观点:外生变量使预训练模型能够针对特定的下游任务进行专业化。两者共同的教训是,当模型接收经过策划的上下文而非原始数据时,预测效果会更好。然而,自回归模型缺乏基于相关性过滤其输入历史的内置机制。RAFT 填补了这一空白。它将历史记录视为一个池,仅通过余弦相似度检索最相似的片段。随机噪声在检索阶段被拒绝,进入模型的数据具有高信息密度。其净效应是一种动态的归纳偏置,其根源与外生信号注入的理念相同,但通过检索机制实现。

## 3方法论与分析

### 3.1实验框架

本研究选择 ETTh1(电力变压器温度)基准\(Zhouet al\.,2021 (https://arxiv.org/html/2605.08217#bib.bib7)\),因为其高频随机波动对任何依赖长历史上下文的模型都构成挑战。在此数据集上,将真实信号与随机波动分开十分困难,使其成为“长上下文”假设的天然压力测试。整个实验固定预测地平线为H=96H=96步。回溯窗口LL在\{720,1440,3000\}\\\{720,1440,3000\\\}之间变化,以便孤立地测量上下文扩展的影响。使用均方误差(MSE)和平均绝对误差(MAE)作为评估指标。实验将**连续上下文**模型与**检索上下文**模型进行对比:a)**普通 Transformer(基线)**:使用 d\_model=512 和 n\_heads=8 的编码器-解码器架构,以观察标准注意力机制在上下文增长时的行为。b)**PatchTST(SOTA 长上下文)**:采用 Nieet al\.\(2023 (https://arxiv.org/html/2605.08217#bib.bib5)\)提出的通道独立和分块(P=16,S=8)。它代表了最强形式的缩放假设:长上下文,低计算成本。c)**RAFT(检索基线)**:保持回溯较短(L=720),并通过 top-k 余弦相似度检索拉取相关历史\(Hanet al\.,2025 (https://arxiv.org/html/2605.08217#bib.bib6)\)。这测试了小窗口中的高质量上下文是否优于大窗口中的噪声上下文。

### 3.2逆缩放定律

实验结果与自然语言处理(NLP)的缩放定律相反。图A1 (https://arxiv.org/html/2605.08217#A2.F1)显示了一个清晰的逆缩放定律:更长的上下文并不能减少误差。随着窗口变大,MSE 在每一步都上升。该定律在H=96H=96以外的预测地平线上也成立;(见附录H (https://arxiv.org/html/2605.08217#A8)中H=336H=336和H=720H=720的结果)。普通 Transformer 的崩溃最为严重。从 720 步增加到 3,000 步,MSE 上升了约200%。自注意力机制由于需要关注的位点太多,权重分布过广,无法恢复相关信号。PatchTST 处理该问题的情况稍好,但依然失败。在 3,000 步时,其 MSE 增加了68%(从0.3850.385增至0.6470.647)。分块技术虽然专为长序列设计,但在扩展历史上无法有效拒绝噪声。因此,认为分块能消除噪声的实践者应重新考虑这些结果。

### 3.3跨领域泛化

本研究还测试了另外两个基准 ETTh2\(Zhouet al\.,2021 (https://arxiv.org/html/2605.08217#bib.bib7)\)(电力领域)和汇率(金融领域),以验证逆缩放定律并非 ETTh1 特有的怪癖。

表 1:跨领域验证:长上下文的退化Table1 (https://arxiv.org/html/2605.08217#S3.T1)显示在两个额外数据集上都出现了严重的退化。在金融波动性高的汇率数据上,长上下文配置的性能下降了276%。噪声累积并非特定于某个数据集;它是随机时间序列的一个结构性问题,并且随着底层过程波动性的增加而恶化。

### 3.4机制分析:随机噪声累积

本研究将观察到的退化归因于**随机噪声累积**。NLP 标记在序列中较远的位置通常携带高信息密度。然而,ETTh1 时间序列不具有相同的特性,因为遥远的点大多是不相关的随机波动,没有预测效用。因此,softmax 分母随着LL增大而增大,将概率质量分散到那些没有任何有用贡献的位置上,导致分配给真正信息丰富的近期时间步的份额递减。因此,内部表示被过度平滑:模型失去了准确预测所需的高频细节。这一观察与Williamset al\.\(2025 (https://arxiv.org/html/2605.08217#bib.bib3)\)一致,他们发现当信噪比低时,上下文质量远比上下文体积重要。

注意力熵的定量测量进一步证实了这一机制。随着上下文从L=336L=336(42 个补丁)增长到L=3000L=3000(375 个补丁),PatchTST 的归一化注意力熵从 0.952 上升到 0.989,接近理论最大值 1.0,这对应于均匀分布。在L=3000L=3000时,有效注意力秩崩溃为 0.1:没有单个补丁获得有意义的差异化权重。在实践中,注意力机制退化为对数百个无关位置的均匀平均。完整的逐层熵测量见附录G (https://arxiv.org/html/2605.08217#A7)。

### 3.5选择性检索的优越性

RAFT 优于基于缩放的模型,因为其上下文感知的归纳偏置在注意力机制起作用之前就对历史进行了预过滤。

参见标题图 1:性能退化趋势。错误率(Y轴)随着上下文长度(X轴)从 720 增加到 3000 而单调上升,说明了随机噪声累积。Figure1 (https://arxiv.org/html/2605.08217#S3.F1)显示 RAFT 在仅 720 步直接上下文的情况下,MSE 为 0.379。PatchTST 在 720 步时的得分为 0.385,因此即使没有缩放优势,RAFT 也略好。在 3,000 步时,PatchTST 退化到 0.647,使 RAFT 成为明显的赢家。此外,RAFT 通过注入检索到的片段作为动态外生变量\(Pineda Arangoet al\.,2025 (https://arxiv.org/html/2605.08217#bib.bib4)\)稳定了其预测,并避免了缩放所施加的噪声惩罚。因此,对于随机数据,检索比窗口扩展更有效地拒绝噪声。

零样本基础模型,包括 Chronos-T5-Small\(Ansariet al\.,2024 (https://arxiv.org/html/2605.08217#bib.bib2)\)(MSE 0.483)和 Moirai-1.1-R-Small\(Wooet al\.,2024 (https://arxiv.org/html/2605.08217#bib.bib1)\)(MSE 0.553),尽管在更大的语料库上进行了预训练,但都远低于 RAFT 的 0.379,这表明优势超出了长上下文扩展的范围。这一发现促使本研究在 ETTh1 测试集上评估零样本设置下的 Chronos-T5-Small 和 Moirai-1.1-R-Small,以评估预训练的基础模型是否能绕过逆缩放定律。具体而言,Chronos 以自回归滚动方式(块大小 64)单变量运行,而 Moirai 为了与 PatchTST 公平比较,以通道独立的方式进行评估。表2 (https://arxiv.org/html/2605.08217#S3.T2)详细比较了 ETTh1 上H=96H=96时零样本基础模型与训练模型的表现。

表 2:ETTh1 上基础模型零样本 vs. 训练模型(H=96H=96)。两个基础模型均无法匹敌 RAFT,甚至无法匹敌L=720L=720时的 PatchTST。Chronos 在最佳状态(L=720L=720, MSE 0.483)下仍比 RAFT 高出 27%,而 Moirai(L=720L=720, MSE 0.553)高出 46%。因此,零样本的通用性无法弥补随机数据上针对性检索的不足。

## 4讨论

### 4.1随机上下文困境

NLP 缩放定律预测更多的上下文会产生更好的输出。此处记录的逆缩放定律与此预测相矛盾;原因在于两种数据类型的基本差异。无论语言标记和事实主张出现在多远的位置,它们都保持信息量。相对于预测目标,2,000 步前的 ETTh1 测量值本质上是不相关的噪声。此外,在 3,000 个位置中,注意力 Softmax 不可避免地将在不带有任何预测信息的输入上分配概率质量。本研究将这种效应特征化为**注意力熵**膨胀。具体而言,测量的归一化熵从 0.952(L=336L=336)上升到 0.989(L=3000L=3000),证实了在极端上下文长度下接近完全的熵饱和(第3.4节 (https://arxiv.org/html/2605.08217#S3.SS4))。相关的近期信号被淹没。只有当历史携带高语义密度时,更多的历史才有帮助;随机波动性按定义违反了这一条件。

### 4.2效率-准确性权衡

训练成本使反对长上下文的论点更加有力:a)**长上下文(低效)**:3,000 步的普通 Transformer 需要 83.47 分钟的训练时间,并产生了 1.323 的 MSE,这是本研究中最差的结果。b)**检索(高效)**:RAFT 训练仅耗时 2.13 分钟(大约快 40 倍),并产生了 0.379 的 MSE,这是最佳结果。NLP 缩放定律背后的期望是投入更多的计算量会产生更高质量的模型。在时间序列预测

相似文章

时间序列预测的不合理难度

Hacker News Top

本文探讨了时间序列预测相比其他机器学习任务为何更具挑战性,展示了基准测试结果,表明简单的统计模型和零样本基础模型在许多序列上往往优于复杂的深度学习模型。

语义增强的检索增强时间序列预测

arXiv cs.AI

提出SERAF,一种用于时间序列预测的多模态检索增强框架,该框架同时利用数值相似性和自生成的文本描述来检索历史模式,从而改善非平稳条件下的预测。在七个真实世界数据集上的实验表明,其效果优于最先进的基线模型。