时间序列即语言:面向通用时间序列基础模型的通用分词器

arXiv cs.LG 论文

摘要

本文提出UniTok,一种将连续时间序列转化为离散标记的通用分词器,以及UniTok-FM,一个基于下一标记预测预训练的基础模型。该模型支持零样本和提示增强预测,以及通过无需训练的上下文推理实现少样本生成和分类——这是以往工作未能实现的能力。

arXiv:2606.09861v1 公告类型:新 摘要:虽然下一标记预测(NTP)统一了大语言模型(LLM)的预训练,但其对无界、连续时间序列(TS)的适应仍是开放问题。为弥合这一差距,我们引入UniTok——将时间序列转化为离散标记的通用分词器,以及UniTok-FM——基于这些标记通过NTP预训练的基础模型。UniTok-FM是一个通用基础模型,支持零样本和提示增强预测,并通过无需训练的上下文推理实现少样本生成和分类——这一能力是先前工作未能达成的。技术上,UniTok是一种向量量化自编码器,融合了用于尺度稳定的前缀归一化、用于编解码的渐进分辨率因果架构,以及用于训练的结构保持重建损失。UniTok-FM采用现成的LLM架构,无需针对时间序列进行特殊修改。它并非在孤立的时间序列上预训练,而是在由多条具有相似模式的序列构成的上下文窗口上执行NTP,旨在捕获其共享动态。在预测、生成和分类任务上的实验表明,单一的UniTok-FM模型在统计基线和有监督基线上均表现一致优越,与特定任务的基础模型性能相当,并独特地实现了跨任务的无需训练的上下文推理。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:13

# 时间序列即语言:面向通用时间序列基础模型的统一分词器  
**来源**: https://arxiv.org/html/2606.09861  

**Yunhao Zhang**  
上海交通大学  
zhangyunhao@sjtu\.edu\.cn  

**&Ruiying Qi**  
上海交通大学  
qry\-sylvia@sjtu\.edu\.cn  

**&Jiale Zheng**  
华为诺亚方舟实验室  
zhengjiale2@huawei\.com  

**&Jianfeng Zhang**  
华为诺亚方舟实验室  
zhangjianfeng3@huawei\.com  

**&Lujia Pan**  
华为诺亚方舟实验室  
panlujia@huawei\.com  

**&Junchi Yan**  
上海交通大学  
yanjunchi@sjtu\.edu\.cn  

###### 摘要  

尽管“下一个词预测”(NTP)已经统一了大型语言模型的预训练,但将其应用于无界、连续的时间序列仍是一个未解决的问题。为弥合这一差距,我们提出了**UniTok** —— 一种将时间序列转化为离散词元的统一分词器,以及**UniTok-FM** —— 一个基于这些词元通过NTP预训练的基础模型。UniTok-FM是一个通用基础模型,支持零样本和提示增强的预测,以及通过免训练上下文推理实现的小样本生成与分类——这一能力在之前的工作中尚未实现。技术上,UniTok 是一个向量量化自编码器,结合了前缀归一化以稳定尺度、渐进分辨率因果架构用于编码与解码,以及结构保持重构损失用于训练。UniTok-FM 采用现成的LLM架构,无需针对时间序列做特定修改。它并非在孤立的时间序列上预训练,而是在由多个具有相似模式的序列构成的上下文窗口上执行NTP,旨在捕捉它们的共享动态。在预测、生成和分类任务上的实验表明,单一的统一UniTok-FM 始终优于统计和监督基线,与任务特定的基础模型性能相当,并且独特地实现了跨任务的免训练上下文推理。

## 1 引言  

近年来,“下一个词预测”(NTP)统一了大型语言模型(LLM)的预训练。尽管时间序列同样是序列数据,但时间序列基础模型(TSFM)的预训练范式仍然高度碎片化。现有的TSFM使用不同的预训练任务,从下一个片段预测(Liu et al., 2024b;Cohen et al., 2025)到掩码重建(Wang et al., 2025;Chen et al., 2025)以及固定长度预测(Shi et al., 2025a;Liu et al., 2025)。骨干架构也多种多样:从xLSTM(Auer et al., 2025)到配备了时间序列专用位置编码(Woo et al., 2024)、注意力机制(Sun et al., 2025)等的Transformer。此外,大多数TSFM被狭隘地定制用于预测,未能达到LLM所实现的多任务通用性。

将NTP扩展到时间序列的一个关键挑战在于时间序列的无界、连续特性。在连续空间中建模复杂分布很困难:传统的基于回归的目标通常依赖于严格的参数假设(Zhang et al., 2026),而扩散等生成式替代方案则引入了显著的架构复杂性(Li et al., 2024)。相反,离散化通过简单的交叉熵目标实现了灵活的分布建模。并且,离散表示便于在统一的上下文窗口中对多个序列建模,从而实现上下文学习,并将学习到的模型从预测推广到更广泛的任务,如生成和分类。

尽管离散化提供了一条明确的路径,但为时间序列开发分词器比图像更为复杂,因为序列长度和数值尺度的变异性更大。因此,大多数现有的时间序列分词器是任务特定的(Shi et al., 2025b),适用范围狭窄(Lee et al., 2023;Talukder et al., 2024),或者对序列长度有严格限制(Tao et al., 2025),尚不足以支持跨领域和任务的通用TSFM。

与我们工作最相关的是Chronos¹(Chronos应与Chronos-Bolt(Ansari et al., 2024b)和Chronos-2(Ansari et al., 2025)区分开,后者不使用离散化和NTP)(Ansari et al., 2024a),它通过逐点均匀分箱离散化缩放过的时间序列,并利用NTP预训练一个TSFM。然而,这种简单的分箱策略无法捕捉丰富的时序依赖,且基于孤立序列训练的模型仅限于预测。因此,NTP的泛化潜力尚未被充分利用。

为填补这一空白,我们提出了一种通用的时间序列分词器**UniTok**,以及一个通用基础模型**UniTok-FM**,该模型通过使用UniTok的NTP进行预训练。两者都在大规模数据集上训练以实现跨领域泛化。除了现有TSFM支持的零样本预测外,UniTok-FM还解锁了三种额外能力:1)提示增强预测,其中具有相似动态的时间序列作为提示引导预测;2)小样本生成,仅凭少量示例时间序列即可生成高保真样本;3)小样本分类,利用有限标记示例进行分类。所有这些能力均通过**免训练上下文推理**实现,无需微调任务特定的输出头。据我们所知,此前没有TSFM以这种方式支持生成或分类。

技术上讲,UniTok基于VQ-VAE框架(Van Den Oord et al., 2017),这是一种常用于图像分词器的方法。为使其适应变长和无界值的时间序列,引入了几个关键修改:1)增量分词属性,使分词与NTP范式对齐;2)前缀归一化,稳定尺度同时保持增量属性;3)渐进分辨率因果自编码器,根据感受野分配词元分辨率;4)结构保持重构损失,忠实捕捉时间结构。基于UniTok,UniTok-FM使用现成的LLM架构通过NTP进行预训练,不对时间序列做特定修改。它并非在孤立序列上预训练,而是在由多个具有相似模式的序列构成的上下文窗口上执行NTP。预训练时,相似性通过从同一长序列中提取片段来强制执行;推理时,它泛化到这种构造之外,以适应每个任务的需求。UniTok-FM支持通用、免训练的推理:零样本/提示增强预测和小样本生成通过在不同提示上下文下的自回归词元生成实现,而小样本分类则通过评估查询序列的条件似然完成。

**亮点如下**:
1. 我们提出了UniTok,一种跨领域和任务运行的通用时间序列分词器,将连续时间序列转化为适合NTP预训练的离散词元。
2. 我们预训练了UniTok-FM,一个通过上下文NTP训练的通用TSFM,支持免训练的零样本和提示增强预测,以及小样本生成和分类,这是此前TSFM所不支持的。
3. 尽管UniTok-FM并非在每个设置中都超越任务特定的SOTA模型,但一个单一统一模型,仅凭少量提示示例的免训练上下文推理,即可达到:1)预测专用TSFM Chronos-Bolt(Ansari et al., 2024b)的预测性能;2)Diffusion-TS(Yuan and Qiao, 2024)的生成质量——尽管后者是在上千个样本上训练的;3)MOMENT(Goswami et al., 2024)的小样本分类准确率——尽管后者依赖下游分类器。

## 2 相关工作  

**时间序列基础模型**  
TSFM在大规模数据集上预训练,并以零样本方式泛化到新场景。与LLM中统一的NTP范式不同,TSFM预训练仍然碎片化。近期工作探索了预训练任务,如下一个片段预测(Liu et al., 2024b)、掩码重建(Wang et al., 2025)和固定长度预测。后者包括点回归(Shi et al., 2025a)、混合分布建模(Cohen et al., 2025)、分位数回归(Ansari et al., 2025)和流匹配(Liu et al., 2025)。骨干设计也多样:虽然多数采用Transformer变体,但xLSTM等替代方案也具备竞争力(Auer et al., 2025)。许多TSFM进一步引入了任务特定的修改,包括定制的位编码(Woo et al., 2024)、注意力机制(Sun et al., 2025)或特定预测长度的输出头(Liu et al., 2025)。此外,大多数TSFM仅支持零样本预测,而通用TSFM则作为特征提取器,需要在这些特征上训练任务特定模型(Gao et al., 2024;Goswami et al., 2024)。与我们工作最相关的是Chronos(Ansari et al., 2024a)。它通过均值缩放对序列进行归一化,并使用固定边界的分箱对每个点进行离散化,从而以T5(Raffel et al., 2020)骨干实现NTP。然而,其逐点分箱限制了丰富时间结构的建模,且在孤立序列上的预训练将Chronos限制在仅零样本预测。

**图像分词器**  
自回归图像生成依赖于离散分词器。工作从像素级离散化(Van den Oord et al., 2016)发展到向量量化变分自编码器(VQ-VAE)(Van Den Oord et al., 2017)及其扩展(Razavi et al., 2019;Esser et al., 2021;Lee et al., 2022)。为解决VQ的不稳定性,提出了免查找替代方案(Yu et al., 2023)。特别是,有限标量量化(FSQ)(Mentzer et al., 2024)通过简单的低维投影和标量量化稳定了训练;因此我们在UniTok中采用FSQ。其他人还探索了多尺度生成(Tian et al., 2024)和高效压缩(Yu et al., 2024)。读者可参考(Jia et al., 2025)了解概述。将这些技术应用于时间序列并非易事,因为时间序列长度可变、值范围无界,而固定尺寸图像(如512×512)的像素值有界(如0~255)。

**图1**: (a) 增量式与非增量式分词。增量式分词使前缀词元独立于未来观测,因此追加数据会扩展词元序列,与NTP范式一致。否则,前缀及其扩展的不兼容词元限制了从长序列到短序列的泛化。(b) UniTok概览。原始时间序列通过前缀归一化(第3.2节)分解为尺度统计量和归一化序列。尺度统计量以Float32十六进制离散化,归一化序列由渐进分辨率因果自编码器(第3.3节)编码,使用结构保持重构损失(第3.4节)训练。

**时间序列分词器**  
近期工作将VQ应用于时间序列生成(Lee et al., 2023)、预测(Feng et al., 2025)和分类(Wen et al., 2024)。一些工作通过重编程(Jin et al., 2024)或VQ-VAE(Tao et al., 2025)将时间序列与文本对齐。领域特定变体也存在,如金融K线分词器(Shi et al., 2025b)。尽管如此,大多数现有的时间序列分词器是任务或数据集特定的,缺乏可复用性。虽然(Talukder et al., 2024)探索了将VQ-VAE扩展到单一数据集之外,但仍局限于少量数据集,尚未达到通用TSFM所需的通用分词器水平。

## 3 UniTok:一种通用的时间序列分词器  

如图1(b)所示,UniTok将时间序列转化为离散词元序列,同时满足NTP所需的增量分词属性(第3.1节)。具体来说,输入序列通过前缀归一化(第3.2节)分解为尺度统计量和归一化序列。尺度统计量使用十六进制表示进行词元化,而归一化序列由渐进分辨率因果自编码器(第3.3节)编码,并使用结构保持重构损失(第3.4节)训练。词元化序列的形式为:

⟨SOS⟩ **z**^(scale-β) ⟨SEP⟩ **z**^(scale-γ) ⟨SEP⟩ **z**^(shape) ⟨EOS⟩    (1)

其中⟨SOS⟩/⟨EOS⟩表示序列的开始/结束。⟨SEP⟩用于分隔。**z**^(scale-β), **z**^(scale-γ)是词元化的尺度统计量。**z**^(shape)对应归一化序列,捕获内在序列形状。

### 3.1 增量分词属性  

给定一个时间序列²(我们关注单变量时间序列,并对多变量数据采用广泛使用的通道独立技术(Nie et al., 2023))**x** = [x₁, ..., x_T], x_t ∈ ℝ,我们的目标

相似文章

Chronicle:用于联合语言和时间序列理解的多模态基础模型

arXiv cs.LG

Chronicle 是一个 324M 参数的纯解码器 Transformer,从零开始在自然语言和时间序列上预训练,在 NLU 和时间序列分类任务上取得了有竞争力的性能,并在 UCR/UEA 数据集上的冻结嵌入时间序列分类中创造了新的最先进水平。

统一零样本时间序列预测:Darts基础

arXiv cs.LG

Darts,一个广受欢迎的开源Python时间序列分析库,引入了一个统一的FoundationModel类集合,该集合整合了多种时间序列基础模型(Chronos-2、TimesFM 2.5、TiRex、PatchTST-FM),通过标准化接口和最小依赖实现零样本和微调预测。

用于时间序列预测的仅解码器基础模型

Papers with Code Trending

本文介绍了一篇关于时间序列基础模型(TimeFM)的研究论文,这是一种仅解码器模型,通过借鉴大型语言模型技术,在多样化的时间序列数据集上实现了近乎最佳的零样本性能。