LLM智能体在时间序列中的应用:综述

arXiv cs.AI 论文

摘要

本综述将基于LLM的智能体用于时间序列任务分为四类,并提供了面向任务的设计指南和未来研究方向。

arXiv:2608.26226v1 Announce Type: new 摘要:基于LLM的智能体越来越多地被开发用于时间序列问题,但它们的设计选择在不同任务设置中存在显著差异。本综述采用问题驱动的分类法,按时间序列问题而非孤立的技术组件来组织这些系统。我们将现有系统分为四类:预测与推理、增强与合成、异常检测与诊断以及决策支持。在每个类别中,我们研究了任务需求如何影响智能体架构、工具使用和记忆设计。我们进一步总结了代表性数据集和环境,并在共享或密切相关的设置下比较了报告的模型性能。总体而言,本综述为设计用于时间序列问题的基于LLM的智能体提供了面向任务的指南,并指出了未来工作的开放差距。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:33

# 面向时间序列的LLM智能体:综述  
来源:https://arxiv.org/html/2608.26226  
Yilong Chen, Xiao Qin, Chenghao Liu\*\*\*(本研究完成于加入Datadog之前),Liang Wu, Noelle I. Samia, Kaize Ding  
所属机构:西北大学,诺基亚†通讯作者  

###### 摘要  
基于LLM的智能体正越来越多地被开发用于解决时间序列问题,但其设计选择在不同任务场景中差异显著。本综述采用问题驱动的分类体系,根据时间序列问题本身而非孤立的技术组件来组织这些系统。我们将现有系统归纳为四类:预测与推理、增强与合成、异常检测与诊断、以及决策支持。在每个类别中,我们探讨任务需求如何影响智能体架构、工具使用和记忆设计。我们进一步总结了代表性数据集和环境,并在相同或密切相关的设置下比较了报告的模型性能。总体而言,本综述为面向时间序列问题的LLM智能体设计提供了任务导向的指南,并指出了未来工作的开放缺口。  

## 1 引言  
时间序列分析Hamilton (2020) ([https://arxiv.org/html/2608.26226#bib.bib1](https://arxiv.org/html/2608.26226#bib.bib1)) 在许多现实领域扮演着重要角色,包括金融Tsay (2005) ([https://arxiv.org/html/2608.26226#bib.bib2](https://arxiv.org/html/2608.26226#bib.bib2))、交通运输Xu et al. (2016) ([https://arxiv.org/html/2608.26226#bib.bib3](https://arxiv.org/html/2608.26226#bib.bib3)) 和气候科学Kim et al. (2025) ([https://arxiv.org/html/2608.26226#bib.bib42](https://arxiv.org/html/2608.26226#bib.bib42))。代表性任务包括预测Chatfield (2000) ([https://arxiv.org/html/2608.26226#bib.bib4](https://arxiv.org/html/2608.26226#bib.bib4)); De Gooijer and Hyndman (2006) ([https://arxiv.org/html/2608.26226#bib.bib5](https://arxiv.org/html/2608.26226#bib.bib5))、数据增强Wen et al. (2020) ([https://arxiv.org/html/2608.26226#bib.bib117](https://arxiv.org/html/2608.26226#bib.bib117))、异常检测Blázquez-García et al. (2021) ([https://arxiv.org/html/2608.26226#bib.bib6](https://arxiv.org/html/2608.26226#bib.bib6)); Schmidl et al. (2022) ([https://arxiv.org/html/2608.26226#bib.bib7](https://arxiv.org/html/2608.26226#bib.bib7)),以及决策支持。这些任务长期以来使用统计和经典机器学习模型解决,例如ARIMAShumway and Stoffer (2017) ([https://arxiv.org/html/2608.26226#bib.bib8](https://arxiv.org/html/2608.26226#bib.bib8))、自助法Efron (1992) ([https://arxiv.org/html/2608.26226#bib.bib119](https://arxiv.org/html/2608.26226#bib.bib119)) 和LOFBreunig et al. (2000) ([https://arxiv.org/html/2608.26226#bib.bib118](https://arxiv.org/html/2608.26226#bib.bib118)),最近则使用深度模型,如循环神经网络Medsker and Jain (2000) ([https://arxiv.org/html/2608.26226#bib.bib12](https://arxiv.org/html/2608.26226#bib.bib12)) 和TransformerVaswani et al. (2017) ([https://arxiv.org/html/2608.26226#bib.bib16](https://arxiv.org/html/2608.26226#bib.bib16))。  
图1:47篇被调研的LLM智能体论文在时间序列任务中的覆盖范围与发布时间线。  
然而,应用这些方法通常严重依赖专家知识来设计分析流程和解释结果。大语言模型(LLMs)Zhao et al. (2026) ([https://arxiv.org/html/2608.26226#bib.bib17](https://arxiv.org/html/2608.26226#bib.bib17)) 的最新进展提供了另一种途径,即利用通用的语言推理能力来辅助时间序列分析,例如作为编码和解释时间模式的模块。超越仅提示词的使用,LLMs可以被部署为*智能体*Wang et al. (2024a) ([https://arxiv.org/html/2608.26226#bib.bib21](https://arxiv.org/html/2608.26226#bib.bib21)),它们能规划行动、调用工具并在多步操作中维护记忆。此类智能体系统特别适用于时间序列应用,因为许多时间序列任务需要根据新观察进行更新、在变化条件下做出决策,以及通过工具增强整合异构证据,而非遵循固定流程Cheng et al. (2026) ([https://arxiv.org/html/2608.26226#bib.bib57](https://arxiv.org/html/2608.26226#bib.bib57)); Tao et al. (2026) ([https://arxiv.org/html/2608.26226#bib.bib58](https://arxiv.org/html/2608.26226#bib.bib58)); Zhang et al. (2025c) ([https://arxiv.org/html/2608.26226#bib.bib19](https://arxiv.org/html/2608.26226#bib.bib19))。  
受此转变驱动,本综述回顾了面向时间序列任务的基于LLM的智能体系统的最新进展。近期的时间序列排行榜进一步表明,智能体系统通过利用强大的时间序列模型而非取代它们,正变得具有与最先进方法的竞争力Aksu et al. (2024) ([https://arxiv.org/html/2608.26226#bib.bib157](https://arxiv.org/html/2608.26226#bib.bib157))。通过在特定任务工作流中协调基础模型、检索、验证和领域工具,这些系统将实际问题从使用哪个模型转向了如何为每个任务设计智能体架构、工具和记忆。这驱动了我们的问题驱动的时间序列智能体系统分类体系。  
定位。现有的LLM用于时间序列综述Chang et al. (2026) ([https://arxiv.org/html/2608.26226#bib.bib18](https://arxiv.org/html/2608.26226#bib.bib18)); Zhang et al. (2025c) ([https://arxiv.org/html/2608.26226#bib.bib19](https://arxiv.org/html/2608.26226#bib.bib19)) 通常按单个LLM能力(例如规划、推理、记忆和工具使用)来组织方法,而不是按这些能力如何集成以完成具体时间序列任务。相反,领域通用的LLM智能体综述Wang et al. (2024a) ([https://arxiv.org/html/2608.26226#bib.bib21](https://arxiv.org/html/2608.26226#bib.bib21)); Guo et al. (2024) ([https://arxiv.org/html/2608.26226#bib.bib22](https://arxiv.org/html/2608.26226#bib.bib22)); Li et al. (2024) ([https://arxiv.org/html/2608.26226#bib.bib23](https://arxiv.org/html/2608.26226#bib.bib23)); Ferrag et al. (2025) ([https://arxiv.org/html/2608.26226#bib.bib25](https://arxiv.org/html/2608.26226#bib.bib25)) 很少涉及时间序列特定的挑战,如流式输入、时间依赖性、分布漂移和行动-数据耦合。因此,我们采用了一种*问题驱动的分类体系*,按目标任务分组方法,并分析架构、工具使用和记忆中的常见设计模式。与相关综述的详细比较见附录A ([https://arxiv.org/html/2608.26226#A1](https://arxiv.org/html/2608.26226#A1))。  
本综述的其余部分将在第2-3节介绍必要的背景和核心设计维度,在第4节介绍问题驱动的分类体系,并在第5-6节回顾实用资源和未来研究方向。  

## 2 背景与基础  
时间序列数据与表示。时间序列可能源于连续时间过程,但实际系统通常在观测或分词化的索引上操作。令{τt}t=1T\{\tau\_{t\}\}\_{t=1\}^{T} 满足 τ1<⋯<τT\tau\_{1\}<\cdots<\tau\_{T\},并记 Xτ1:τT=(xτ1,...,xτT), xτt∈Rd,\mathbf\{X\}\_{\tau\_{1\}:\tau\_{T\}}=(\mathbf\{x\}\_{\tau\_{1\}},\dots,\mathbf\{x\}\_{\tau\_{T\}}),\quad\mathbf\{x\}\_{\tau\_{t\}}\in\mathbb\{R\}^\{d\},其中 d 覆盖观测通道、协变量或空间分布的传感器。对于不规则、有噪声或部分观测的数据,系统通常构造 zτt=φ(Xτ1:τt)\mathbf\{z\}\_{\tau\_{t\}}=\phi(\mathbf\{X\}\_{\tau\_{1\}:\tau\_{t\}}) 以总结历史上下文。  
时间序列建模。时间序列建模将时间观测转换为预测、异常分数、学习到的表示或解释性摘要。统计模型(例如,ARIMA, ARCH/GARCH, HMMs)编码了关于依赖性、平稳性、潜在状态和不确定性的假设Shumway and Stoffer (2017) ([https://arxiv.org/html/2608.26226#bib.bib8](https://arxiv.org/html/2608.26226#bib.bib8)); Engle (1982) ([https://arxiv.org/html/2608.26226#bib.bib9](https://arxiv.org/html/2608.26226#bib.bib9)); Bollerslev (1986) ([https://arxiv.org/html/2608.26226#bib.bib10](https://arxiv.org/html/2608.26226#bib.bib10)); Rabiner (1989) ([https://arxiv.org/html/2608.26226#bib.bib11](https://arxiv.org/html/2608.26226#bib.bib11))。深度模型(例如,LSTM, TCN, DeepAR)学习时间模式Hochreiter and Schmidhuber (1997) ([https://arxiv.org/html/2608.26226#bib.bib13](https://arxiv.org/html/2608.26226#bib.bib13)); Bai et al. (2018) ([https://arxiv.org/html/2608.26226#bib.bib14](https://arxiv.org/html/2608.26226#bib.bib14)); Salinas et al. (2020) ([https://arxiv.org/html/2608.26226#bib.bib15](https://arxiv.org/html/2608.26226#bib.bib15)),而基于LLM的模型(例如,Time-LLM, LSTPrompt)通过分词或多模态输入来表示序列,用于基于语言的推理或解释Jin et al. (2024) ([https://arxiv.org/html/2608.26226#bib.bib84](https://arxiv.org/html/2608.26226#bib.bib84)); Liu et al. (2024a) ([https://arxiv.org/html/2608.26226#bib.bib85](https://arxiv.org/html/2608.26226#bib.bib85))。然而,作为独立组件,这些模型通常不选择工作流、调用工具或基于中间反馈修改记忆和假设。  
从推理到智能体系统。静态分析流程通常不足以处理需要证据收集、反馈整合或自适应行动选择的交互式时间序列任务。我们将LLM智能体视为结合推理、规划、工具使用和记忆的观察-行动-更新系统Wang et al. (2024a) ([https://arxiv.org/html/2608.26226#bib.bib21](https://arxiv.org/html/2608.26226#bib.bib21)); Zhang et al. (2025c) ([https://arxiv.org/html/2608.26226#bib.bib19](https://arxiv.org/html/2608.26226#bib.bib19)),并使用这一区别将智能体系统与仅使用提示词的LLM应用区分开来。  

## 3 基本设计维度  
在任务分类体系之前,我们总结时间序列智能体系统的三个设计维度:架构、工具和记忆。  
### 3.1 架构  
我们区分单智能体和多智能体架构;对于多智能体系统,我们进一步描述其架构模式为合作式、竞争式或混合式Zhu et al. (2024) ([https://arxiv.org/html/2608.26226#bib.bib24](https://arxiv.org/html/2608.26226#bib.bib24))。  
参见图注 图2:时间序列智能体系统主要架构模式的示意图。  
单智能体系统。单智能体系统使用一个智能体来规划推理步骤、调用工具、维护记忆,并根据当前观察产生输出或行动Yao et al. (2023) ([https://arxiv.org/html/2608.26226#bib.bib86](https://arxiv.org/html/2608.26226#bib.bib86))。  
合作式多智能体系统。合作式系统为智能体分配互补的角色或子任务,这些角色或子任务不能直接互换,例如顺序阶段或规划-执行结构,因此智能体们协调以达成共同输出Li et al. (2024) ([https://arxiv.org/html/2608.26226#bib.bib23](https://arxiv.org/html/2608.26226#bib.bib23)); Wooldridge (2009) ([https://arxiv.org/html/2608.26226#bib.bib87](https://arxiv.org/html/2608.26226#bib.bib87))。  
竞争式多智能体系统。竞争式系统实例化智能体或智能体生成的候选方案作为备选:它们产生相互竞争的假设、预测、解释、规则或行动,然后通过评分、排序、投票、辩论或明确的裁判来解决Zhu et al. (2024) ([https://arxiv.org/html/2608.26226#bib.bib24](https://arxiv.org/html/2608.26226#bib.bib24))。  
混合式多智能体系统。混合式系统在同一工作流中结合合作式的角色分解与竞争式的比较、辩论或选择Zhu et al. (2024) ([https://arxiv.org/html/2608.26226#bib.bib24](https://arxiv.org/html/2608.26226#bib.bib24))。  

### 3.2 工具  
工具是LLM智能体调用的外部程序的可调用接口Wang et al. (2024c) ([https://arxiv.org/html/2608.26226#bib.bib20](https://arxiv.org/html/2608.26226#bib.bib20))。在时间序列智能体中,它们支持访问时间数据、专门计算以及无法仅靠参数知识可靠获得的可验证反馈。常见的工具家族包括*(i) 数据库API*,提供对存储数据的结构化访问;*(ii) 搜索与检索API*,返回相关外部信息或历史记录;*(iii) 数据处理工具*,将原始输入转换为更有用的表示,例如通过对齐或动态时间规整(DTW);*(iv) 统计与机器学习模型*,产生预测、分数或学习到的表示;以及*(v) 模拟器、求解器与优化器*,在结构化环境中评估行动、执行约束或计算解决方案。  

### 3.3 记忆  
时间序列智能体中的记忆有助于在推理步骤间保持连贯性,特别是在时间演变的设置中Zhang et al. (2024d) ([https://arxiv.org/html/2608.26226#bib.bib88](https://arxiv.org/html/2608.26226#bib.bib88))。我们按功能角色总结记忆:*(i) 证据日志*,记录决策过程的中间痕迹,例如中间预测、检索到的证据、工具输出、候选行动和验证结果;*(ii) 模式库*,存储可检索的历史案例或典型数据片段,例如重复出现的市场模式、故障特征或类似过去情况;以及*(iii) 分析策略*,捕捉关于如何分析情况的可重用经验,例如使用哪些工具、关注哪些特征或在行动前如何解释信号。  

## 4 分类体系  
我们将*面向时间序列的LLM智能体*定义为一种系统,其中LLM必须做出至少一个能改变多步时间序列工作流的决策,例如选择一个行动或工具、更新记忆、修改假设或协调阶段。当只有一个LLM承担此角色时,我们将系统分类为单智能体;当两个或多个LLM承担不同的决策角色并通过合作、竞争或两者兼有的方式互动时,则分类为多智能体。我们排除(i)一次性提示,(ii) LLM仅作为静态编码器或事后解释器的流程,以及(iii) 未针对时间序列约束或时间基础评估设计的领域通用智能体。  
我们采用问题驱动的分类体系,根据系统所解决的时间序列问题对其进行分组,并在每种设置中讨论设计维度。这一选择以用户为导向:读者通常更关心针对给定时间序列问题适合何种设计,而非孤立地看待设计维度。因此,问题驱动的视角在实践中有助于更清晰地指导选择和理解智能体设计。  
在此分类体系下,我们识别出四个问题类别:*预测与推理*、*增强与合成*、*异常检测与诊断*以及*决策支持*。在每个类别内,我们进一步区分几个子问题。表3 ([https://arxiv.org/html/2608.26226#A6.T3](https://arxiv.org/html/2608.26226#A6.T3)) 总结了代表性方法;图3 ([https://arxiv.org/html/2608.26226#S4.F3](https://arxiv.org/html/2608.26226#S4.F3)) 展示了完整的分类体系。  
图3:面向时间序列任务的LLM智能体分类体系。  
### 4.1 时间序列预测与推理  
时间序列预测与推理有一个共同要求:智能体必须产生不仅在语言上合理,而且基于明确数值或上下文证据的输出。在这两种场景中,固定的上下文窗口或粗糙的全局摘要通常是不够的,因为正确的结论可能依赖于局部时间模式、历史类比、可重用原型或对齐的外部上下文(如新闻)Zhang et al. (2025e) ([https://arxiv.org/html/2608.26226#bib.bib33](https://arxiv.org/html/2608.26226#bib.bib33))。因此,有效的系统通常不将上下文视为静态输入。相反,它们主动构建上下文窗口之外的证据,例如按需检索相关片段Jalori et al. (2025) ([https://arxiv.org/html/2608.26226#bib.bib35](https://arxiv.org/html/2608.26226#bib.bib35)) 或查询原型记忆Jiang et al. (2025) ([https://arxiv.org/html/2608.26226#bib.bib31](https://arxiv.org/html/2608.26226#bib.bib31))。  
时间序列预测。时间序列预测智能体旨在在非平稳性、噪声和依赖预测时界的不确定性下,从历史观测中预测未来值。在预测中,智能体系统主要受以下因素影响:(i) 多阶段工作流,和(ii) 竞争性假设。*多阶段工作流*在预测中至关重要,因为预测很少是单一步骤的任务。此类工作流可能涉及数据诊断、预处理、模型选择、上下文分析、预测和验证,因此早期阶段的错误可能使后续结论无效。因此,常见的设计是将每个阶段都建立在明确的中间证据上,而不仅仅依赖自由形式的推理。时间序列科学家Zhao et al. (2025) ([https://arxiv.org/html/2608.26226#bib.bib30](https://arxiv.org/html/2608.26226#bib.bib30)) 是一个代表性示例:它使用统计模型和其他工具生成诊断结果、验证结果和配置记录,并将其存储为证据日志以供审查、溯源和修正。NexusDas et al. (2026) ([https://arxiv.org/html/2608.26226#bib.bib36](https://arxiv.org/html/2608.26226#bib.bib36)) 使用上下文化、双分辨率宏观/微观展望生成以及综合/校准阶段,而CastFlowPan et al. (2026) ([https://arxiv.org/html/2608.26226#bib.bib37](https://arxiv.org/html/2608.26226#bib.bib37)) 将预测组织为规划、行动、预测和反思,并配备记忆和多视角诊断工具。  
*竞争性假设*是预测的另一个显著特征。

相似文章

智能体交易:当LLM智能体遇上金融市场

arXiv cs.AI

本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。