深度时间序列模型中的记忆

arXiv cs.LG 论文

摘要

本文提出了深度时间序列模型中记忆机制的统一分类体系,将方法从内部记忆到外部记忆进行分类,并识别研究空白以解决时间依赖挑战。

arXiv:2609.06006v1 公告类型:新 摘要:深度学习在时间序列领域通过连续的架构范式取得了进展,从循环网络和变压器到结构化状态空间模型、检索增强预测器、基础模型以及工具使用智能体。这些发展通常被孤立地研究,按架构或建模时代组织。我们认为,它们可以通过一个共同的问题来审视:\emph{时间序列模型如何保留和访问超出其即时输入的信息?}这个问题源于传统时间序列建模的一个根本局限:与预测相关的信息可能远远超出可行的输入窗口,而将历史压缩为固定大小的状态可能会丢弃日后可能有用的信息。我们将这一挑战表述为一个\emph{记忆}问题,并沿着从内部记忆(编码在参数和固定大小状态中)到外部记忆(可寻址、可检索,并越来越多地由智能体维护)的频谱组织现有的时间序列方法。然后,我们开发了一个统一的记忆机制分类体系,并在共同的框架下回顾了三类外部记忆,包括显式模块、检索增强和智能体存储,该框架涵盖了保留什么、如何写入和访问以及如何持久化。一项交叉分析将这些机制映射到时间序列任务,并识别出方法和评估方面的空白。我们最后概述了构建记忆系统的开放问题,这些系统能够在时间环境演变时选择性地保留、检索、修订和遗忘信息。结果是一个将记忆作为时间序列建模的一等维度进行研究的框架,独立于底层骨干网络。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:30

# 深度时间序列模型中的记忆机制
来源:https://arxiv.org/html/2609.06006  
Minh Hoang Nguyen  
Huu Hiep Nguyen  
隶属机构:迪肯应用人工智能倡议,迪肯大学,吉朗,维多利亚州,澳大利亚  
Manh Nguyen  
隶属机构:迪肯应用人工智能倡议,迪肯大学,吉朗,维多利亚州,澳大利亚  
Van Dai Do  
隶属机构:迪肯应用人工智能倡议,迪肯大学,吉朗,维多利亚州,澳大利亚  
Dung Nguyen  
隶属机构:迪肯应用人工智能倡议,迪肯大学,吉朗,维多利亚州,澳大利亚  
Hung Le  
隶属机构:迪肯应用人工智能倡议,迪肯大学,吉朗,维多利亚州,澳大利亚

###### 摘要
时间序列深度学习已通过一系列架构范式取得进展,从循环网络和Transformer,到结构化状态空间模型、检索增强预测器、基础模型和工具使用智能体。这些发展通常被孤立地研究,按架构或建模时代进行组织。我们主张,它们可以被置于一个共同的问题下进行审视:*时间序列模型如何保留和访问超出其即时输入的信息?*这个问题的提出源于传统时间序列建模的一个根本局限:与预测相关的信息可能远超可行的输入窗口范围,而将历史压缩为固定大小的状态又可能丢弃掉后期可能有用的信息。我们将这一挑战构建为一个*记忆*问题,并将现有时间序列方法沿一个谱系进行组织,该谱系从内部记忆(编码在参数和固定大小状态中)到外部记忆(可寻址、可检索,并越来越多地由智能体维护)。随后,我们开发了一个统一的记忆机制分类法,并在共同的框架下回顾了三类外部记忆,包括显式模块、检索增强和智能体存储,涉及保留的内容、写入与访问方式以及持久化方式。一项交叉分析将这些机制映射到时间序列任务,并识别了方法和评估方面的差距。我们最后概述了构建记忆系统所面临的开放性问题,该系统能够随着时间环境的演变选择性地保留、检索、修正和遗忘信息。最终成果是一个将记忆作为时间序列建模的一级维度进行研究的框架,独立于底层骨干网络。配套的论文集合可在 https://github.com/DA2I2-SLM/Time-series-memory 获取。

## 1 引言
图1:时间序列建模中记忆机制的演变(2015年至2026年)。代表性方法按时间轴组织,并根据四种日益显式的记忆范式进行分类。  
时间序列支撑着从能源[129, 47]、材料科学[63]、金融[112]到医疗保健[146, 118]和工业监控[3]等领域的应用,其核心建模挑战是超出任何便捷输入窗口范围的时间依赖性。十年的深度学习产生了连续的架构范式,包括循环[43]、注意力[131]、结构化状态[37, 36]、检索[78, 41],以及最近的基础模型和智能体[29, 124]。这些范式通常被分别综述,仿佛各自代表了时间序列建模演进中的独立阶段。我们认为,它们可以通过一个共同的*记忆*概念(即模型保留过去或更广泛上下文信息并在产生输出时访问这些信息的机制)来理解。循环机制将历史压缩为隐藏状态,状态空间模型维护一个结构化的有限维摘要,显式记忆模块保留可寻址的表示,检索系统将观测集合作为外部记忆使用,而智能体系统则主动构建和维护持久化存储。这些机制占据了一个共同谱系的不同点,而非形成互不相连的架构家族。图1总结了这一演进,追溯了从基于内部状态的记忆向日益显式、可检索和主动维护的记忆形式的进展。它们的主要区别在于记忆是内部的还是外部的,容量是固定的还是随累积数据增长的,信息如何被写入和读取,以及生成的状态能持续多久。

虽然记忆架构在自然语言处理领域已被广泛研究[167, 8, 163],但在时间序列领域的综述仍然相对不足。至关重要的是,记忆并非可以无缝从语言建模中迁移过来的一个简单视角,因为连续时间数据施加的要求使得记忆成为一个根本上不同的建模问题。与预测相关的信息通常远超任何计算上可行的回顾窗口范围。例如,冬季的峰值能源需求可能完全取决于上一个冬季的情况,而一台新部署的机器可能几乎没有自己的历史数据。简单地扩展上下文窗口并非总是可行的解决方案,因为更长的序列会使注意力成本呈指数增长,同时淹没重要但稀有的观测(考虑到大量无关历史)。相反,将过去压缩为固定大小的隐藏状态则会造成相反的问题。它迫使模型丢弃那些后期可能变得重要的信息,尤其是当有用信号微弱、稀有或与当前观测之间存在长时间间隔时。因此,时间记忆被保留、检索、更新和丢弃的具体机制必须被视为时间序列建模中一个独特而核心的挑战。这促使我们将焦点放在外部记忆上,我们将其定义为模型可以从学习参数之外的某个存储中读取(在某些情况下写入)的信息。我们将内部记忆作为这一区别的概念基线,将循环和基于状态的方法与此基线联系起来,而将详细的架构比较留给现有的综述[138, 42]。因此,我们的综述聚焦于记忆如何变得显式、可检索和被主动维护,以及这些机制如何支持下游的时间序列任务。我们围绕预测、分类、异常检测和插补来组织文献,同时研究新兴的推理和决策场景,其中记忆可能不仅保留历史信号,还保留证据、行动、结果和不断变化的上下文。

我们并非按骨干网络或检索机制来组织方法,而是根据它们保留什么以及该信息如何被写入和访问来进行分类。这一视角揭示了使用不同术语的系统之间共同的记忆机制。例如,PatchTST[96]保留历史块作为单独可寻址的条目,而PM-MemNet存储有代表性的历史模式并检索那些与当前窗口相关的条目[65]。尽管术语不同,但两者都将过去信息保留为可寻址的条目,并根据当前输入选择性地访问它们。它们的主要区别在于存储的内容和条目构建方式,而非记忆的底层作用。

这一视角也改变了我们对现有综述的定位。先前的综述大多围绕架构或更广泛的建模范式进行组织。对循环、Transformer和图模型的综述通常将记忆视为骨干网络的一个隐式属性。相比之下,关于基础模型和智能体的综述则关注更广泛的建模或系统范式。这些视角很有价值,但它们覆盖了记忆谱系的不同部分,且很少在共同框架内将它们联系起来。如表1所述,现有综述对参数化和架构方法提供了大量覆盖,而显式的、基于检索的和基于智能体的记忆则得到有限或零散的关注。我们的综述则将记忆作为组织原则,提供了记忆的统一视图。它通过关注信息如何持久化、如何被写入和检索、以及何时被修正或丢弃,来补充而非取代以架构为中心和以智能体为中心的论述。

表1:与代表性的时间序列和记忆综述的定位对比。记忆谱系的覆盖情况:✓ 大量覆盖,(∼) 部分覆盖,空白 表示很少/无覆盖。  
我们的贡献如下:  
- • **时间序列记忆的形式化框架**:我们根据保留什么信息、如何访问以及持续多久来定义记忆,并引入四个维度来比较记忆机制:表示、容量、访问机制和持久性。  
- • **统一的记忆机制分类法**:我们沿着从隐式参数记忆到显式、基于检索和基于智能体记忆的谱系来组织现有方法,并提供了一个问题-架构矩阵,突出跨方法的常见设计选择。  
- • **对外部记忆的系统性综述**:我们在共同的框架下审视了三大类外部记忆,涵盖其机制、子类、写入和集成策略以及局限性。一个正式的读/写表述将显式、基于检索和基于智能体的记忆置于一个共同的生命周期中。  
- • **以任务为中心的记忆视角**:我们分析了记忆机制在预测、分类、异常检测、插补、推理和决策中的应用,突出显示了哪些记忆机制得到了充分研究,以及对于每项任务,哪些仍基本未被探索。  
- • **评估与资源的批判性分析**:我们回顾了现有的数据集、基准和评估协议,并认为当前的评估主要测量下游任务准确性,而非记忆操作本身。我们确定了四个用于评估记忆保留、检索质量、时间有效性和记忆管理的测量维度。  
- • **开放的研究方向**:我们确定了构建可靠的未来时间序列记忆系统的七个具体挑战,重点在于记忆如何在数据和环境演变时保持有用、高效和可信。

本综述其余部分的组织如下:第2节形式化记忆并引入贯穿综述使用的维度。第3节讨论记忆对时间序列为何特别重要,而第4节则提出所建议的分类法和问题-架构矩阵。第5节提供了内部记忆的背景知识,第6至8节回顾了三类外部记忆。第9节提供了以任务为中心的视角,随后是第10节的资源与基准,以及第11节的开放挑战。综述中引入的术语表,包括四类记忆、其子类型、四种问题设置以及第10节的评估指标,收集在补充材料S1的术语表中。

## 2 预备知识
### 2.1 通用的记忆增强模型  
令 $\mathbf{x}_{1:T} = (\mathbf{x}_{1}, \ldots, \mathbf{x}_{T})$ 表示一个多变量时间序列,其中 $\mathbf{x}_{t} \in \mathbb{R}^{d}$,$d$ 是变量或通道的数量。在操作步骤 $t$,标准模型接收一个观测上下文 $\mathbf{o}_{t}$,例如一个输入窗口如 $\mathbf{o}_{t} = \mathbf{x}_{t-L+1:t}$,而记忆增强模型则额外访问在此即时上下文之外的观测所保留的信息。我们将此保留的信息表示为记忆状态 $\mathcal{M}_{t}$。因此,一个通用的记忆增强模型可以表达为:

$$
\begin{aligned}
\mathcal{M}_{t} &= \mathcal{W}_{\phi}(\mathcal{M}_{t-1}, \mathbf{o}_{t}, Q), \\
\mathbf{r}_{t} &= \mathcal{R}_{\psi}(\mathcal{M}_{t}, \mathbf{o}_{t}, Q), \\
\hat{\mathbf{y}}_{t} &= \mathcal{P}_{\theta}(\mathbf{o}_{t}, \mathbf{r}_{t}, Q).
\end{aligned}
$$

其中 $\mathcal{W}_{\phi}$ 将信息写入记忆,$\mathcal{R}_{\psi}$ 从记忆中读取信息,而 $\mathcal{P}_{\theta}$ 产生任务输出。这里 $Q$ 表示一个可选的任务或查询规范。这种分解分离了贯穿本综述的三个角色:保留什么,如何访问,以及如何使用检索到的信息。

### 2.2 什么是记忆?一个工作定义  
我们使用*时间序列记忆*来表示被结构化并保留的信息,使其在超出即时输入时间序列上下文时仍保持有条件可访问。至关重要的是,记忆与标准参数知识之间的区别在于*表示与访问*的维度(参见定义1)。

###### 定义 1(模型的记忆)  
时间序列模型的*记忆*是指任何使历史信息对预测器可用的机制,这些信息超出了其当前预测目标所包含的信息。这可以通过直接访问有限的上下文窗口、动态维护的状态或单独维护的存储来实现。因此,记忆机制在如何表示、访问、更新和持久化历史信息方面存在差异,也在于其记忆容量。隐式编码在静态模型参数(训练后固定)中的信息不被视为记忆。相比之下,动态更新的参数存储——例如在推理过程中适应以保留近期历史的快速权重——作为可访问的信息起作用,并包含在我们的定义中。在整个综述中,我们称这一广泛构建为“时间序列记忆”。

在定义1下,训练后的参数 $\theta$(例如网络的卷积滤波器或投影矩阵)不构成记忆。它们编码了在训练期间学习的统计规律,而非保留特定历史信息以供后续访问。例如,参数优化根据以下公式更新模型:$\theta \leftarrow \theta - \eta \nabla_{\theta} \mathcal{L}$,

相似文章

大语言模型的记忆

arXiv cs.CL

本综述系统性地提出了大型语言模型中记忆机制的分类法,从表示、更新动态和持久性三个维度进行分类,并形式化了底层机制组件。

用于扩散世界模型的记忆专家组合

arXiv cs.LG

一种新的基于扩散的世界模型框架,利用专门记忆专家(短期、长期情境和空间)的组合,实现更好的时间一致性和长上下文建模,且无二次成本。