TS2TabPFN:通过特征提取和表格基础模型进行时间序列分类与外部回归
摘要
本文介绍了TS2TabPFN,这是一个将显式特征提取与TabPFN 2.5表格基础模型相结合用于时间序列分类和外部回归的框架。实验表明,它在TSER任务上优于最先进的模型,并在TSC任务上取得了具有竞争力的结果。
arXiv:2608.04174v1 公告类型:新
摘要:时间序列数据在实际应用中无处不在,其中分类(TSC)和外部回归(TSER)已成为从时间序列中获取价值的基本任务。尽管基于特征和深度学习模型的文献已经取得了显著进展,但现有方法往往只关注特征提取的质量,或者关注应用于原始数据的复杂架构的内在预测能力。这种划分在特征工程所提供的控制与端到端模型的自动化性能之间造成了鸿沟。本文提出TS2TabPFN,一个通过将显式特征提取与TabPFN 2.5(一种用于表格数据的前沿基础模型)相结合来弥合这一鸿沟的框架,以利用其预测能力。我们的大量实验评估表明,TS2TabPFN在TSER任务上显著优于最先进的模型,具有统计显著性,为TSC提供了稳健且高效的替代方案,并超越了大多数当前性能最佳的算法。这些结果表明,将基础模型与结构化特征相结合能够克服单一范式的局限性,确立了新的时间序列最先进水平。
查看缓存全文
缓存时间: 2026/08/06 07:46
# TS2TabPFN: 通过特征提取与表格基础模型进行时间序列分类与外在回归
来源:https://arxiv.org/html/2608.04174
11institutetext:圣保罗大学(USP),圣卡洛斯,巴西11email:\{gabrielcmerlin,diegofsilva\}@usp\.br
###### 摘要
时间序列数据在实际应用中无处不在,其中分类(TSC)和外在回归(TSER)已成为从时间序列中获取价值的关键任务。尽管相关文献通过基于特征的方法和深度学习模型取得了显著进展,但现有方法往往要么侧重于特征提取的质量,要么侧重于对原始数据应用的复杂架构的内在预测能力。这种划分在特征工程所提供的可控性与端到端模型的自动化性能之间造成了鸿沟。本文提出 TS2TabPFN,一种通过将显式特征提取与 TabPFN 2.5(一种前沿的表格数据基础模型)相结合来弥合这一鸿沟的框架,以利用其预测能力。我们的大量实验评估表明,TS2TabPFN 在 TSER 任务中以统计显著性显著优于最先进模型,为 TSC 提供了一种鲁棒且高效的替代方案,并超越了大多数当前表现最佳的算法。这些结果表明,将基础模型与结构化特征相结合克服了单一范式的局限性,确立了新的时间序列最先进水平。
## 1 引言
时间序列数据在从医疗保健到活动识别等应用中无处不在。虽然文献历来侧重于预测,但时间序列分类(TSC)和外在回归(TSER)的重要性正日益得到认可。TSC 将序列映射到分类标签,例如根据音频识别物种 [dau2019ucr]。相比之下,TSER 旨在预测与序列外在相关的连续标量值,例如根据生理信号预测血糖水平 [tan2021time]。尽管输出不同,这两个任务都共享从有序观测序列中学习复杂关系的核心挑战。
为了解决这些任务,文献演化为不同的类别,包括基于特征的、基于卷积的和深度学习。像 InceptionTime [ismail2020inceptiontime] 这样的深度模型通过直接从原始数据学习特征,达到了与昂贵方法相当的结果 [middlehurst2024bake]。虽然这些架构提供了高预测能力,但往往缺乏可解释性。相反,基于特征的算法依赖于来自 tsfresh [christ2018time] 或 catch22 [lubba2019catch22] 等工具包的显式属性,提供了更好的可控性,使更简单的模型也能取得有竞争力的结果。
第三个重要类别涉及基于卷积的技术,最著名的是 ROCKET(RandOm Convolutional KErnel Transform)[dempster2020rocket] 家族。这些方法利用大量随机、未调整的核来提取简单特征,优先考虑计算效率而非复杂的架构调优。虽然标准的基于 ROCKET 的方法使用线性分类器或回归器,但文献中没有明确证据表明更精细的判别器能持续取得更优的效果。
或者,诸如 HIVE-COTE 2.0 (HC2) [middlehurst2021hive] 这样的元集成方法通过在层次化集成方法中整合不同的归纳偏置,展示了卓越的 TSC 性能。然而,这种高预测精度带来了巨大且往往具有挑战性的计算负担。HC2 的每个组成模块本身都是昂贵的集成,且复杂的决策加权机制需要对训练数据进行密集的优化调优。因此,这类方法由于其极端的耗时要求,尤其是在处理大型数据集时,可能变得完全不可行。
我们提出 TS2TabPFN,一个用于 TSC 和 TSER 的两步框架,它将显式特征提取与现代基础模型相结合,以缓解现有范式的缺点。如图1 (https://arxiv.org/html/2608.04174#S1.F1) 所示,第一步使用 tsfresh、catch22 或 ROCKET 家族提取特征。然后由 TabPFN 2.5 [grinsztajn2025tabpfn] 处理这些特征,这是一个在合成数据上预训练、针对最多 50,000 个样本和 2,000 个特征的数据集进行优化的表格基础模型,尽管这些是建议值而非严格限制。单次前向传播限制为 500 个特征,当超过此阈值时模型会自动采用特征子采样集成,我们的框架能够容纳这种行为,尤其是在使用 tsfresh 和 MultiROCKET 等通常产生高维表示的穷举式提取器时。
参见图说明
图 1:TS2TabPFN 框架流程。原始数据集 SS 由模块化函数 ψ\\psi 处理,将序列转换为固定维度向量(训练用 dd,测试用 xx)。这些特征通过拼接带标签的上下文 DD 和未标签的查询 XX 形成联合表格 D∪XD\\cup X。最后,预训练的 TabPFN 模型处理该输入,为分类或外在回归任务生成预测。
通过大量实验,我们证明 TS2TabPFN 在 TSER 上以统计显著性显著优于最先进模型。对于 TSC,与其他基于特征和深度学习的集成方法相比,我们的模型是一种高质量且计算成本相对较低的替代方案。最后,我们承认 TS2TabPFN 继承了其底层基础模型的某些约束,例如由于 Transformer 的内存复杂度,在样本量和特征维度上存在固定限制。虽然这些限制导致排除了超出可用 VRAM 的数据集,但该框架在绝大多数标准基准档案中仍然非常有效,在这些操作边界内提供了可预测且高效的工作流程。
本研究的主要贡献总结如下:
- •新颖整合:我们开展了关于表格基础模型在时间序列上应用的大规模实证研究,证明基于 ICL 的架构可有效扩展至 TSER。通过将特征提取与预测头解耦,我们弥合了结构化特征工程与基础模型自动化推理之间的鸿沟。
- •广泛评估:我们提供了涵盖 189 个数据集的全面实验分析,证明 TS2TabPFN 在 TSER 中达到了最先进性能,并在 TSC 中取得了有竞争力的结果。
- •计算效率:我们表明,与 HC2 和 DrCIF 等成熟的最先进方法相比,我们免训练、上下文内推理的方法可实现高达两个数量级的加速。
- •操作特征化:我们识别并讨论了将基础模型应用于时间序列的实际边界,提供了关于硬件约束和模型架构如何影响大规模基准中数据集选择的透明评估。
## 2 背景与相关工作
在本节中,我们介绍必要的定义和符号,并介绍与我们的提案相关的主要文献。我们首先正式定义我们要处理的数据类型。长度为 TT 的时间序列 ss 是 TT 个有序值的序列 s=(s1,s2,...,sT)s=(s_{1},s_{2},\dots,s_{T}),其中 si∈RCs_{i}\in\mathbb{R}^{C},CC 表示该时间序列的通道数,C∈N+C\in\mathbb{N}^{+}。因此,如果 C=1C=1,时间序列被分类为单变量;如果 C>1C>1,则为多变量。
本文涉及两个任务:时间序列分类(TSC)和时间序列外在回归(TSER)。在 TSC 中,目标是学习映射 f:S→Yf:\mathcal{S}\rightarrow\mathcal{Y},其中 Y={c1,c2,...,ck}\mathcal{Y}=\{c_{1},c_{2},\dots,c_{k}\} 是有限的离散类标签集合。相比之下,TSER 旨在学习输出连续标量的映射 g:S→Rg:\mathcal{S}\rightarrow\mathbb{R}。虽然这两个任务都涉及从时间序列中学习,但它们在目标空间的性质上有所不同。我们还注意到,尽管两个任务都有实值输出,但 TSER 不同于时间序列预测。预测旨在预测同一序列中的未来观测值,而 TSER 专注于估计一个不是输入序列未来值的外部目标。
所提出的 TS2TabPFN(详见第3节 (https://arxiv.org/html/2608.04174#S3))与现有的 TSC 和 TSER 算法密切相关,尤其是基于特征提取的算法。本节其余部分首先描述构成相关 TSC 和 TSER 算法基础的、成熟且广泛使用的特征套件。随后讨论这些任务的最先进算法,最后解释表格基础模型 TabPFN。
### 2.1 时间序列的特征提取
特征套件的选择是基于特征的时间序列分类(TSC)和时间序列外在回归(TSER)方法的核心组成部分 [middlehurst2021hive]。最广泛使用的方法之一是基于可扩展假设检验的时间序列特征提取(tsfresh)[christ2018time],它自动从时间序列中提取数百个统计和信号处理特征。为了控制由此产生的高维特征空间,tsfresh 应用可扩展假设检验,仅保留与目标变量统计相关的特征。该库提供不同的提取配置,其中高效配置在实践中被普遍采用,因为它在计算成本和预测性能之间提供了有利的权衡。
CAnonical time series CHaracteristics(catch22)[lubba2019catch22] 是该领域的另一个重要贡献。与穷举式库不同,catch22 提供了从 hctsa 工具箱中数千个可用特征中选出的紧凑的 22 个特征集合。这些特征通过严格的过程选出,以确定一个冗余最小、计算高效且在 93 个不同分类数据集上具有高度判别力的子集。由于 catch22 与尺度无关,且避免了较大特征库的沉重计算开销,它可能特别适合资源有限的场景。
我们还将基于 ROCKET 的方法视为特征提取方法,因为它们将原始时间序列转换为固定长度的特征向量。原始的 ROCKET [dempster2020rocket] 应用数千个随机卷积核,并使用最大值和正值比例(PPV)等简单统计数据总结其输出。MultiROCKET [tan2022multirocket] 通过引入一阶差分和额外的池化算子扩展了这一思想,在保持高计算效率的同时增加了特征多样性。
### 2.2 时间序列的学习算法
最简单但有效的、明确利用特征提取进行 TSC 或 TSER 的算法是 tsfresh 管道与旋转森林(FreshPRINCE)[middlehurst2022freshprince]。该方法采用两步方法,使用 tsfresh 库表示时间序列,并将其输入旋转森林分类器或回归器 [bagnall2018rotation]。旋转森林对随机特征子集应用主成分分析(PCA),并在变换后的空间上训练决策树。这种操作使旋转森林能够处理 tsfresh 输出中固有的多重共线性和高维性。
相比之下,ROCKET 家族 [dempster2020rocket,tan2022multirocket](包括 MiniRocket 和 MultiROCKET)通过使用大量随机卷积核来避免手动特征工程。与 FreshPrince 类似,ROCKET 是一种两步方法。它首先从这些核与时间序列卷积产生的信号中提取简单特征(参见第2.1节 (https://arxiv.org/html/2608.04174#S2.SS1))。在将数据变换到该高维特征空间后,它使用传统的线性模型作为分类和回归的最终预测头。
为新数据集在这些技术之间做出选择是困难的。虽然基于 ROCKET 的方法在 TSC 基准上取得了更好的结果 [middlehurst2024bake],但最近的证据表明 FreshPRINCE 在 TSER 上通常表现更好 [guijo2024unsupervised]。
多样化随机卷积区间森林(DrCIF)[middlehurst2021hive] 提出以更局部的方式提取特征。与 FreshPRINCE 和 ROCKET 等总结整个序列的全局方法不同,DrCIF 在随机区间上操作。具体来说,它从原始数据、周期图和随机选择的子序列的自回归中提取 catch22 和汇总统计量(均值、标准差和斜率)。通过关注区间,DrCIF 捕获了可能被全局特征提取削弱的局部模式。这种基于区间的方法已被证明对 TSC 有效,且大量分析表明它是 TSER 最准确的方法之一 [guijo2024unsupervised]。
作为显式特征提取的替代方案,深度学习引入了用于 TSC 和 TSER 的端到端神经架构 [mohammadi2024deep]。诸如全卷积网络和残差网络之类的基线模型使用堆叠卷积层直接从原始信号学习滤波器 [wang2017time]。InceptionTime [ismail2020inceptiontime] 通过 Inception 模块对此进行了改进,以捕获不同尺度的模式。然而,这些模型面临限制:要达到最先进的结果,InceptionTime 通常需要五个或更多模型的集成,这增加了训练和推理的计算成本,这主要是由于训练运行之间的高变异性。此外,这些架构在多样化的基准和实验设置中并不始终优于成熟的基于特征的方法。
最后,我们注意到近期基准评估中最著名的 TSC 技术是 HIVE-COTE 2.0 (HC2) [middlehurst2021hive]。HC2 是一个分层元集成,结合了四个不同的模块:DrCIF(区间型)、TDE(时间字典集成)、STC(形状变换分类器)和 Arsenal(ROCKET 分类器集成)。通过整合具有不同归纳偏置的算法,HC2 在各种数据类型上实现了出色的鲁棒性。然而,HC2 的准确性带来了高昂的计算成本。除了运行其各个组成集成的开销外,HC2 还需要复杂的加权机制(CAWPE - 交叉验证准确率加权概率集成)来估计每个模块的可靠性。此过程需要对训练集进行密集的内部交叉验证,使得 HC2 难以扩展到大型数据集或资源受限的环境。
### 2.3 TabPFN:表格先验数据拟合网络
与需要在每个新数据集上从头训练模型的传统监督机器学习方法不同,TabPFN(Tabular Prior-Data Fitted Network)[hollmann2023tabpfn] 作为表格基础模型运行。它执行直接推断,即通过预训练的 Transformer 架构在单一步骤中生成预测。为实现这一目标,TabPFN 被设计为一种近似复杂贝叶斯推理的先验数据拟合网络(PFN),使其能够识别模式并做出高度准确的预测。相似文章
TabPFN-3:技术报告
TabPFN-3 是一个新的表格数据基础模型,在合成数据上预训练,可扩展到 100 万训练行,同时减少训练和推理时间,在表格预测、时间序列和关系数据上实现了最先进的性能。
TabPFN-3.5:技术报告
TabPFN-3.5 是一种新型表格基础模型,在多个基准测试中创下最佳性能,并在推理速度和多模态能力上进行了改进。
GOTabPFN:从特征排序到紧凑标记化——面向高维数据的表格基础模型
本文介绍了GOTabPFN,一种结合了图引导排序与局部精炼(GO-LR)及神经启发子单元压缩(NSC)的方法,使得小型表格基础模型能够在无需重新训练大型骨干网络的情况下,有效进行高维低样本量预测。
从田间尺度到大尺度光谱库:土壤光谱学中的表格基础模型
本文系统比较了表格基础模型(TabPFN)与经典回归方法在85项土壤光谱任务中的表现,发现TabPFN结合PLSR衍生特征在从田间尺度到全球光谱库的预测性能上均达到最优。
TabPFN-3刚刚发布:一款支持高达100万行的预训练表格基础模型 [R][N]
TabPFN-3,一款预训练的表格基础模型已发布。该模型在单个GPU上支持高达100万行数据,推理速度提升10倍至1000倍,在基准测试中对比经典机器学习方法胜率高达93%。