EVOTS: 用于时间序列预测的进化Transformer搜索
摘要
提出了一种进化神经架构搜索框架(EvoTS),用于发现任务自适应的类Transformer模型,用于多变量时间序列预测。该方法使用模块化基因组表示,并在ETT基准数据集上取得了竞争性的性能。
查看缓存全文
缓存时间: 2026/07/02 05:35
# 时间序列预测的进化Transformer搜索
来源:https://arxiv.org/html/2607.00154
AbdElRahman ElSaidDamir Pulatovelsaida@uncw\.edupulatovd@uncw\.edu
北卡罗来纳大学威尔明顿分校,美国北卡罗来纳州威尔明顿
###### 摘要
针对多变量时间序列预测的进化神经架构设计仍鲜有探索,现有方法大多依赖固定的Transformer架构,尽管不同任务和预测场景存在显著差异。本文提出了一种进化神经架构搜索框架,用于发现任务自适应的类Transformer时间序列预测模型(EvoTS)。架构采用模块化基因组表示,能够灵活组合注意力、前馈和投影组件,同时通过修复机制确保进化过程中结构的有效性。这种设计能在不依赖手工规则的情况下,有效探索多样化的架构空间。
该方法在ETT家族的四个基准数据集(ETTh1、ETTh2、ETTm1和ETTm2)上进行了评估,涵盖了单变量到单变量、多变量到单变量以及多变量到多变量等预测场景,预测时域分别为96、192、336和720。在多变量到多变量场景中,进化的架构取得了有竞争力的结果,且在多个情况下均方误差优于基于Transformer的强基线方法。附加分析考察了不同预测场景下的性能差异,并报告了训练时间,以粗略指示计算成本。
总体而言,实验结果表明,进化搜索能在实际运行时间约束下,有效发现灵活且高性能的类Transformer架构用于多变量时间序列预测。
## 1 引言
准确的时间序列预测是许多实际系统(包括能源管理、工业监控和大型基础设施控制)的关键组成部分。近年来,基于Transformer的架构通过灵活建模长程时间依赖和复杂的跨变量交互,显著提升了预测性能。因此,Transformer及其变体已成为多变量时间序列预测领域的主流范式。
尽管取得了成功,大多数基于Transformer的预测模型仍依赖精心手工设计的架构。诸如分词策略、注意力机制、块组成和网络深度等选择通常事先固定,并通过大量手动实验来调整。虽然有效,但这一过程劳动密集,且往往产生仅在狭窄任务范围或预测时域内表现良好的架构,限制了跨数据集和预测场景的适应性。
进化计算为手动架构设计提供了一种原则性替代方案。通过将神经架构视为可进化的结构,并借助基于种群的搜索进行优化,进化方法可以探索多样化的架构组成,而无需固守单一设计模板。这一范式特别适合设计空间高度结构化且评估成本高昂的神经架构搜索问题。
在本文中,我们提出EvoTS111https://github.com/a-elsaid/EVOTS.git,一个针对类Transformer时间序列预测模型的进化架构搜索框架。该框架将架构表示为由Transformer启发处理块组成的模块化基因组,并使用具有权重继承的稳态进化算法进化其组成。不同于引入新注意力机制或训练目标的方法,我们的方法专注于在固定且广泛采用的训练协议下自动化架构组成。所有实验均遵循iTransformer研究[17 (https://arxiv.org/html/2607.00154#bib.bib1)]引入的评估设置,从而实现与先前的基于Transformer基线的直接公平比较。
我们在四个广泛使用的ETT基准数据集(ETTh1、ETTh2、ETTm1和ETTm2)上,跨多个预测时域评估了该方法。进化的架构在多变量到多变量预测场景中持续取得强性能,并在相同实验条件下匹配或超越了先前工作中最强结果。在长预测时域(固定架构设计面临最大挑战)上,性能提升尤为显著。
本文的主要贡献如下:i) 我们引入了一个针对类Transformer时间序列预测模型的模块化进化架构搜索框架;ii) 我们证明了进化搜索可以自动发现混合架构组成,其在标准预测基准上优于手工设计的Transformer变体;iii) 我们通过实证分析表明,进化架构搜索的优势在长时域和多变量预测场景中被放大。
## 2 相关工作
#### 基于Transformer的时间序列预测。
Transformer架构因能够建模长程时间依赖和变量间复杂交互,已被广泛用于时间序列预测[27 (https://arxiv.org/html/2607.00154#bib.bib19),33 (https://arxiv.org/html/2607.00154#bib.bib20)]。早期方法主要对时间令牌应用自注意力,将每个时间步视为聚合所有变量的令牌[15 (https://arxiv.org/html/2607.00154#bib.bib21),33 (https://arxiv.org/html/2607.00154#bib.bib20)]。后续模型引入了针对时间序列结构的架构修改。Autoformer融入序列分解,并用自相关机制替代自注意力以强调周期模式[30 (https://arxiv.org/html/2607.00154#bib.bib22)]。Crossformer引入了分段嵌入,同时保留时间和跨变量信息[32 (https://arxiv.org/html/2607.00154#bib.bib10)]。最近,iTransformer提出反转注意力机制,将变量视为令牌,从而直接建模跨变量关系[17 (https://arxiv.org/html/2607.00154#bib.bib1)]。
继基于Transformer架构的大型预训练基础模型取得成功之后,另一个研究方向是构建处理时间序列而非自然语言的基础模型。这类方法的优势在于预训练模型可以直接用于任何时间序列数据,无需最终用户训练。时间序列预训练模型的研究范围包括:对现有通用基础模型进行简单提示[12 (https://arxiv.org/html/2607.00154#bib.bib37),31 (https://arxiv.org/html/2607.00154#bib.bib38)]和微调[34 (https://arxiv.org/html/2607.00154#bib.bib39),14 (https://arxiv.org/html/2607.00154#bib.bib40)],以及训练专门模型(其架构经过修改以适应时间序列)[22 (https://arxiv.org/html/2607.00154#bib.bib41),11 (https://arxiv.org/html/2607.00154#bib.bib42),4 (https://arxiv.org/html/2607.00154#bib.bib43),29 (https://arxiv.org/html/2607.00154#bib.bib44),2 (https://arxiv.org/html/2607.00154#bib.bib35),1 (https://arxiv.org/html/2607.00154#bib.bib36)]。这类方法的一个缺点是用于训练如此规模模型的数据量有限。像Chronos[2 (https://arxiv.org/html/2607.00154#bib.bib35)]这样的预训练模型借助数据增强和使用合成数据集以及真实世界数据集,而像ForecastPFN[5 (https://arxiv.org/html/2607.00154#bib.bib45)]和TabPFN-v2[13 (https://arxiv.org/html/2607.00154#bib.bib46)]这样的模型则完全在合成数据上训练。
这些工作突显了架构选择(如分词策略、注意力公式和块组成)的重要性。然而,这些选择通常事先固定并针对特定数据集和预测时域手动调整[9 (https://arxiv.org/html/2607.00154#bib.bib30)],限制了跨预测场景的适应性。
#### 神经架构搜索与神经进化。
神经架构搜索(NAS)旨在自动化神经网络架构设计,并已通过多种优化范式进行了探索[9 (https://arxiv.org/html/2607.00154#bib.bib30)]。进化和神经进化方法,包括NEAT[26 (https://arxiv.org/html/2607.00154#bib.bib3)]、EXAMM[20 (https://arxiv.org/html/2607.00154#bib.bib23)]、EXA-GP[19 (https://arxiv.org/html/2607.00154#bib.bib24)]、ANTS[8 (https://arxiv.org/html/2607.00154#bib.bib25)]、CANTS[7 (https://arxiv.org/html/2607.00154#bib.bib27),6 (https://arxiv.org/html/2607.00154#bib.bib26)]和NSGA-Net[18 (https://arxiv.org/html/2607.00154#bib.bib28)],将架构表示为可变结构,并通过基于种群的搜索进行优化。这些方法特别适合离散且结构化的设计空间,通过突变、重组和继承等机制支持架构变化、重用和逐步改进[26 (https://arxiv.org/html/2607.00154#bib.bib3),20 (https://arxiv.org/html/2607.00154#bib.bib23),23 (https://arxiv.org/html/2607.00154#bib.bib29)]。
其他NAS范式包括基于强化学习的方法,例如由控制器驱动和权重共享的方法(以ENAS[21 (https://arxiv.org/html/2607.00154#bib.bib31)]为例),以及基于梯度的技术如DARTS[16 (https://arxiv.org/html/2607.00154#bib.bib32)],其依赖于对离散架构选择的连续松弛。虽然这些方法提供了更好的搜索效率,但它们通常作用于受限的架构模板,不太自然适用于涉及异构模块和离散结构变化的设计空间。
#### 针对Transformer架构的NAS。
NAS也已应用于Transformer架构,主要集中在自然语言处理[24 (https://arxiv.org/html/2607.00154#bib.bib33)]和计算机视觉领域。先前的工作,如Evolved Transformer及后续面向视觉[3 (https://arxiv.org/html/2607.00154#bib.bib34)]的方法,将搜索空间限制在固定Transformer模板的变体上,关注于嵌入维度、注意力头数或层深度等参数。其他方法将搜索空间扩展到包括自注意力和卷积操作[10 (https://arxiv.org/html/2607.00154#bib.bib14)],从而实现混合设计,同时仍然强制预设的分段结构和分词方案。
这些研究证明了自动化Transformer设计的可行性,但通常侧重于超参数优化或在预定义模块间进行选择,而不是在固定训练和评估协议下进化类Transformer架构的内部组成[24 (https://arxiv.org/html/2607.00154#bib.bib33),10 (https://arxiv.org/html/2607.00154#bib.bib14)]。
#### 本文定位。
与先前的NAS和Transformer-NAS方法不同,本文聚焦于针对时间序列预测中对类Transformer架构内部组成的进化搜索。架构被表示为模块化基因组[26 (https://arxiv.org/html/2607.00154#bib.bib3),20 (https://arxiv.org/html/2607.00154#bib.bib23)],由Transformer启发块(包含多种注意力变体和卷积令牌混合操作)组成,并使用稳态[28 (https://arxiv.org/html/2607.00154#bib.bib4)]进化算法结合权重继承[23 (https://arxiv.org/html/2607.00154#bib.bib29),20 (https://arxiv.org/html/2607.00154#bib.bib23)]进行进化。该框架没有引入新的注意力机制或任务特定启发式方法,而是在固定且广泛采用的训练协议[17 (https://arxiv.org/html/2607.00154#bib.bib1)]下运行,使得能够在自动化架构组成的同时,与现有的基于Transformer的预测模型直接比较。
## 3 方法论
本节描述EvoTS框架,包括基因组表示、进化动态和评估。
### 3.1 问题设定
我们研究时间序列预测的三种标准场景:单变量到单变量(S→S)、多变量到单变量(M→S)和多变量到多变量(M→M)预测。给定长度为L的历史输入窗口,目标是预测未来时域H∈{96,192,336,720}的值。模型性能使用均方误差(MSE)评估。
虽然为完整性考虑了所有三种场景,但我们主要强调多变量到多变量场景,因为它反映了近期基于Transformer的时间序列预测基准采用的标准评估协议。
### 3.2 进化架构搜索框架
我们提出了一个进化神经架构搜索框架,用于发现针对时间序列预测任务量身定制的类Transformer架构。该框架不依赖固定的手动设计架构,而是按照既定的神经进化原理[25 (https://arxiv.org/html/2607.00154#bib.bib2)],使用基于种群的进化优化探索结构化的架构空间。
进化过程遵循稳态范式[28 (https://arxiv.org/html/2607.00154#bib.bib4)],其中新的候选架构被生成、评估,并立即考虑是否加入种群。与世代进化不同,稳态进化允许对种群进行持续改进和候选解决方案的增量优化,使其特别适合计算代价高昂的评估场景,如神经架构搜索。
### 3.3 基因组表示
种群中的每个个体由一个模块化基因组表示,该基因组编码了一个类Transformer预测架构。模块化和间接基因组表示已被证明支持深度神经网络的可扩展神经进化[26 (https://arxiv.org/html/2607.00154#bib.bib3)]。在我们的框架中,基因组指定了(i)输入分词策略,(ii)有序的处理块序列,以及(iii)输出投影头。
架构超参数——包括嵌入维度、注意力头数、卷积核大小和块顺序——被显式编码在基因组中,从而在进化过程中实现精细的结构变化。
#### 输入和输出头的进化
输入分词模块和输出投影头都作为基因组的一部分进行编码,并通过进化进行优化。输入头确定如何将原始时间序列观测映射为共享令牌表示,而输出头定义了如何将学习到的令牌序列投影到预测目标。
进化控制所选择的头的类型及其内部架构参数,包括编码器变体、核大小、池化策略和投影维度。然而,头受结构约束:网络输入处恰好应用一个分词模块,末端恰好应用一个输出投影。它们的p相似文章
Evolution Fine-Tuning: 跨371个优化任务学习发现
本文介绍了Evolution Fine-Tuning (EFT),这是一种中期训练范式,通过将进化搜索轨迹转化为监督信号,教会大语言模型跨优化任务进化解决方案。作者构建了包含156K条轨迹、涵盖371个任务的Finch Collection数据集,并证明微调后的模型能够泛化到保留任务,并在多个基准测试上达到最先进性能。
EvoTest:面向自我改进智能体系统的进化式测试时学习
EvoTest 引入了 J-TTL,一个衡量智能体测试时学习能力的基准,并提出了一个进化框架,其中 Actor 智能体玩游戏,而 Evolver 智能体在不进行微调的情况下迭代改进系统的提示、记忆和超参数。该方法在基于复杂文本的游戏中表现出优于基于反思和记忆的基线方法的性能。
结构化数据的进化特征工程
介绍进化特征工程(EFE),一种利用基于LLM的进化来自动发现结构化数据预处理变换的框架,在保持可解释性的同时提高时间序列预测和表格预测的准确性。
面向电网层级的电力负荷预测基准:时间序列Transformer优于传统方法
本文提出了面向电网层级的电力负荷预测综合基准,评估了十种方法,发现基于Transformer的方法持续优于传统方法,将预测误差降低了6.6%–10.7%。标准Transformer的性能优于一种新颖的灵活架构,基础模型Chronos-2在某些数据集上展现出具有竞争力的零样本性能。
EvtGraph:多模态时间序列中稀疏时序图学习的事件自适应压缩
本文介绍了EvtGraph,一个高效的多模态时序图学习框架,在预算约束下将序列压缩为事件级令牌,在临床和跨领域基准上展示了相较于Transformer和循环基线更好的性能与效率。