Chronicle:用于联合语言和时间序列理解的多模态基础模型

arXiv cs.LG 论文

摘要

Chronicle 是一个 324M 参数的纯解码器 Transformer,从零开始在自然语言和时间序列上预训练,在 NLU 和时间序列分类任务上取得了有竞争力的性能,并在 UCR/UEA 数据集上的冻结嵌入时间序列分类中创造了新的最先进水平。

arXiv:2605.20268v1 Announce Type: new 摘要:现实世界的时间序列通常伴随文本:元数据、描述、新闻、报告。然而,时间序列基础模型孤立地处理数值序列,而试图弥合两者差距的多模态文本与时间序列模型,都是事后适配预训练的语言模型,继承的表示从未见过时序数据。这些模型也几乎只与其他多模态基线进行比较,而不是与任一领域中最强的单模态基础模型进行比较,因此联合训练是否必要仍存疑问。我们提出 Chronicle,一个紧凑的 324M 参数纯解码器 Transformer,在单一统一架构中从零开始训练自然语言和时间序列。两种模态共享相同的 Transformer 块、注意力机制和残差流;预训练的大部分使用单模态批次,因此跨模态能力纯粹从共享参数中涌现,并有一个简短的将两者交错的对齐阶段。据我们所知,Chronicle 是第一个从零开始联合预训练文本和时间序列的模型,也是第一个在两种领域内与专门基础模型进行评估的多模态模型。它在 19 个 NLU 任务上与 Gemma-3-270M-PT 持平,在 24 个 UCR/UEA 数据集上为冻结嵌入时间序列分类设立了新标杆,并在 Time-MMD 上产生多模态预测,超越所有有监督融合基线,所有这些都来自单个骨干网络。
查看原文
查看缓存全文

缓存时间: 2026/05/21 06:21

# 用于语言与时间序列联合理解的多模态基础模型 来源:https://arxiv.org/html/2605.20268 Paul Quinlan¹,² Jeremy Levasseur¹ Qingguo Li³ Xiaodan Zhu² ¹InertialAI ²女王大学电子与计算机工程系 ³女王大学机械与材料工程系 ###### 摘要 真实世界的时间序列总是伴随文本:元数据、描述、新闻、报告。然而,时间序列基础模型孤立地处理数值序列,而试图弥合两者间隙的多模态文本与时间序列模型,都是在预训练语言模型事后进行适配,继承的表示从未见过时序数据。这些模型也几乎只与其他多模态基线进行对比评估,而非与任一领域中最强的单模态基础模型比较,因此联合训练是否必要的问题仍悬而未决。我们提出Chronicle,一个紧凑的324M参数解码器专用Transformer,从零开始在单一统一架构中训练自然语言和时间序列。两种模态共享相同的Transformer块、注意力机制和残差流;预训练主体使用单模态批次,因此跨模态能力完全源于共享参数,加上一个简短的将两者交错的对齐阶段。据我们所知,Chronicle是首个从零开始联合预训练文本和时间序列的模型,也是首个在两个领域内与专用基础模型进行对比评估的多模态模型。它在19项NLU任务上匹配Gemma-3-270M-PT,在24个UCR/UEA数据集上为冻结嵌入时间序列分类树立了新标杆,并在Time-MMD上生成的多模态预测超越了所有监督融合基线,所有这一切均来自单个骨干网络。 ## 1 引言 时间序列基础模型(TSFMs)已将预测转变为仅推理流程:单个预训练模型可零样本应用于不同领域 [Ansari 等,2024 (https://arxiv.org/html/2605.20268#bib.bib1), Das 等,2024 (https://arxiv.org/html/2605.20268#bib.bib3), Woo 等,2024 (https://arxiv.org/html/2605.20268#bib.bib4), Wen 等,2026 (https://arxiv.org/html/2605.20268#bib.bib7)]。像 Chronos-2 [Ansari 等,2025 (https://arxiv.org/html/2605.20268#bib.bib2)] 和 PatchTST-FM [Wen 等,2026 (https://arxiv.org/html/2605.20268#bib.bib7)] 这样的模型在标准化基准如 GIFT-Eval [Aksu 等,2024 (https://arxiv.org/html/2605.20268#bib.bib50)] 上设立了高门槛。然而,这些模型仍然是狭隘的专家,孤立地处理数值序列,没有机制融入几乎每个真实世界时间序列都附带的文本上下文(元数据、领域知识、异常描述)。越来越多的研究试图通过连接语言模型与时间序列来弥合这一差距,但这些努力存在三个系统性局限。

第一,每个现有方法都从预训练语言模型开始并事后进行适配。LLMTIME [Gruver 等,2023 (https://arxiv.org/html/2605.20268#bib.bib22)] 和 GPT4MTS [Jia 等,2024 (https://arxiv.org/html/2605.20268#bib.bib32)] 直接查询冻结的LLM;Time-LLM [Jin 等,2024 (https://arxiv.org/html/2605.20268#bib.bib23)] 和 GPT4TS [Zhou 等,2023 (https://arxiv.org/html/2605.20268#bib.bib24)] 添加轻量适配器;ChatTS [Xie 等,2025 (https://arxiv.org/html/2605.20268#bib.bib28)]、ChatTime [Wang 等,2024 (https://arxiv.org/html/2605.20268#bib.bib31)] 和 MSE-ITT [Koval 等,2025 (https://arxiv.org/html/2605.20268#bib.bib82)] 微调大型骨干网络(Qwen2.5-14B、LLaMA-2、LLaMA-3-8B);MoAT [Lee 等,2024 (https://arxiv.org/html/2605.20268#bib.bib80)] 和 TaTs [Li 等,2026 (https://arxiv.org/html/2605.20268#bib.bib81)] 通过学习的头部融合独立编码器(表1 (https://arxiv.org/html/2605.20268#S2.T1))。由于这些模型仅在文本上预训练,其内部表示是在没有接触任何时序数据的情况下形成的,时间序列模态必须适应并非为其设计的表示空间。没有先前工作从零开始在两种模态上训练单一模型,使得文本和时间序列从训练开始就相互塑造彼此的表示。

第二,这些模型几乎只与其他多模态或任务特定基线进行评估,而不是与任一领域中最先进的单模态基础模型比较。最近的综述 [Liu 等,2025 (https://arxiv.org/html/2605.20268#bib.bib86)] 已指出这一差距,Zhang 等人 [2025 (https://arxiv.org/html/2605.20268#bib.bib87)] 发现多模态的优势“高度依赖于条件”,强调需要严格的单模态基线。

第三,许多这类模型,特别是 ChatTS、ChatTime、Chat-TS [Quinlan 等,2026 (https://arxiv.org/html/2605.20268#bib.bib88)] 和 MSE-ITT,针对关于时间序列的对话推理(问答、摘要、解释),需要大型骨干网络(8到14B参数)来支持指令遵循。这混淆了两个不同的目标:构建通用的时序*表示*与构建时序*推理代理*。一个紧凑模型能否在不产生灾难性干扰的情况下学习文本和时间序列的高质量表示,这个问题尚未被解决。来自 Tan 等人 [2024 (https://arxiv.org/html/2605.20268#bib.bib84)] 的证据(显示LLM作为骨干并不能有意义地改善预测)和 Merrill 等人 [2024 (https://arxiv.org/html/2605.20268#bib.bib27)] 的发现(LLM难以处理文本编码的序列),表明可能需要一种不同的训练范式。

我们提出Chronicle,一个324M参数解码器专用Transformer,从零开始在单一架构中训练自然语言和时间序列。两种模态共享相同的Transformer块、注意力机制和残差流;模态特定组件仅限于输入和输出接口。预训练主体使用*单模态*批次:每个微批次包含文本标记或时间序列片段,两种模态仅通过它们都更新的共享参数来塑造骨干网络。在扩展上下文长度的短第二阶段中,引入一小部分交错的文本和时间序列序列进行显式跨模态对齐。推理时,文本嵌入和片段嵌入可以在单个序列中自由交错,跨模态信息流通过因果自注意自然产生,无需任何架构变更。与先前工作不同,我们的目标不是对话推理,而是学习服务于预测、分类和嵌入提取的*通用表示*,同时保留语言理解作为一等能力。

我们在*每个*模态的*自身基准*上,对Chronicle与专用基础模型进行评估:针对GPT-2到LLaMA-3.2-1B的19项NLU任务;针对完整公开排行榜的GIFT-Eval;针对监督模型和冻结TSFM嵌入的14个UCR/UEA数据集;以及按照MM-TSFlib [Liu 等人,2024 (https://arxiv.org/html/2605.20268#bib.bib29)] 融合评估协议,在TimeCAP [Lee 等人,2025 (https://arxiv.org/html/2605.20268#bib.bib30)] 和Time-MMD [Liu 等人,2024 (https://arxiv.org/html/2605.20268#bib.bib29)] 上的多模态分类和预测。

我们的贡献是:
1.  **从零开始的联合预训练**。据我们所知,Chronicle是首个在单一共享Transformer骨干网络中从随机初始化端到端学习文本和时间序列的模型,而不是事后适配预训练LLM。
2.  **针对单模态基础模型的跨领域评估**。我们对Chronicle在19项NLU任务上与规模匹配的LLM*以及*在GIFT-Eval和UCR/UEA上与专用TSFMs进行基准测试,填补了多模态时间序列文献中长期存在的空白。
3.  **强大的冻结骨干下游性能**。无需针对每个数据集重新训练,Chronicle为冻结嵌入的时间序列分类树立了新标杆,在Time-MMD上击败了所有监督融合基线,并在语言理解上与Gemma-3-270M-PT相匹敌。

## 2 相关工作

我们将Chronicle置于三条研究路线中,并在表1 (https://arxiv.org/html/2605.20268#S2.T1) 中总结了架构格局;详细讨论见附录D (https://arxiv.org/html/2605.20268#A4)。

**表1:** Chronicle相对于先前多模态文本和时间序列模型的定位。*基础模型*:预训练骨干网络(“—”表示从零训练)。Chronicle是唯一在两种模态上从零训练并针对两个领域内的单模态基础模型进行评估的模型。

| 模型 | 参数量 | 基础模型 | 时间序列输入 | 适配方式 | 主要目标 | 与TSFMs比较 | 与LLMs比较 | 多模态评估 |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| LLMTIME [Gruver 等,2023 (https://arxiv.org/html/2605.20268#bib.bib22)] | 7–175B | GPT-3 / LLaMA | 数字 | 冻结 | 预测 | 部分 | ✗ | ✗ |
| GPT4MTS [Jia 等,2024 (https://arxiv.org/html/2605.20268#bib.bib32)] | >>7B | GPT-3.5 / GPT-4 | 数字 + 提示 | 冻结 | 预测 | ✗ | ✗ | ✓ |
| Time-LLM [Jin 等,2024 (https://arxiv.org/html/2605.20268#bib.bib23)] | 7B | LLaMA-7B | 片段→文本原型 | 适配器 | 下游适配 | 部分 | ✗ | ✗ |
| GPT4TS [Zhou 等,2023 (https://arxiv.org/html/2605.20268#bib.bib24)] | 124M | GPT-2 | 片段 | 适配器(归一化) | 下游适配 | ✗ | ✗ | ✗ |
| MoAT [Lee 等,2024 (https://arxiv.org/html/2605.20268#bib.bib80)] | 可变 | 独立编码器 | 片段(分解) | 后期融合 | 下游适配 | ✗ | ✗ | ✓ |
| TaTs [Li 等,2026 (https://arxiv.org/html/2605.20268#bib.bib81)] | 可变 | 独立编码器 | 片段(+文本变量) | 后期融合 | 下游适配 | ✗ | ✗ | ✓ |
| ChatTS [Xie 等,2025 (https://arxiv.org/html/2605.20268#bib.bib28)] | 14B | Qwen2.5-14B | 片段(MLP编码器) | 全微调 | 推理 | ✗ | ✗ | ✓ |
| ChatTime [Wang 等,2024 (https://arxiv.org/html/2605.20268#bib.bib31)] | 7B | LLaMA-2 | 标量(离散化) | 全微调 | 推理 | 部分 | ✗ | ✓ |
| Chat-TS [Quinlan 等,2026 (https://arxiv.org/html/2605.20268#bib.bib88)] | 8B | LLaMA-3-8B | 词汇扩展 | 全微调 | 推理 | ✗ | ✓ | ✓ |
| MSE-ITT [Koval 等,2025 (https://arxiv.org/html/2605.20268#bib.bib82)] | 8B | LLaMA-3-8B | 片段(MoE专家) | 全微调 + MoE | 推理 | ✗ | ✗ | ✓ |
| Chronicle (ours) | **324M** | **—** | 片段(交错) | 联合(从零开始) | **基础模型** | **✓** | **✓** | **✓** |

**时间序列基础模型。** TSFMs目标是在不同领域间零样本泛化 [Liang 等,2024 (https://arxiv.org/html/2605.20268#bib.bib12)]。最近的模型涵盖标量分词(Chronos [Ansari 等,2024 (https://arxiv.org/html/2605.20268#bib.bib1)]、Chronos-2 [Ansari 等,2025 (https://arxiv.org/html/2605.20268#bib.bib2)])和基于片段的编码(PatchTST [Nie 等,2023 (https://arxiv.org/html/2605.20268#bib.bib6)]、TimesFM [Das 等,2024 (https://arxiv.org/html/2605.20268#bib.bib3)]、PatchTST-FM [Wen 等,2026 (https://arxiv.org/html/2605.20268#bib.bib7)]、Moirai [Woo 等,2024 (https://arxiv.org/html/2605.20268#bib.bib4)]、MOMENT [Goswami 等,2024 (https://arxiv.org/html/2605.20268#bib.bib9)]、UniTS [Gao 等,2024 (https://arxiv.org/html/2605.20268#bib.bib11)])。我们在GIFT-Eval和UCR上与这些模型进行比较。

**多模态文本和时间序列模型。** 先前工作分为两类(表1 (https://arxiv.org/html/2605.20268#S2.T1))。*推理聚焦*模型包括ChatTS [Xie 等,2025 (https://arxiv.org/html/2605.20268#bib.bib28)]、Chat-TS [Quinlan 等,2026 (https://arxiv.org/html/2605.20268#bib.bib88)]和MSE-ITT [Koval 等,2025 (https://arxiv.org/html/2605.20268#bib.bib82)],它们在合成QA数据上微调大型骨干网络(8–14B),目标是对语基准而非标准预测或分类。ChatTime [Wang 等,2024 (https://arxiv.org/html/2605.20268#bib.bib31)]对LLaMA-2进行指令微调,使用离散化序列,但未在完整GIFT-Eval套件上或与规模匹配的LLM进行评估。*预测聚焦*模型通过冻结LLM(LLMTIME [Gruver 等,2023 (https://arxiv.org/html/2605.20268#bib.bib22)]、GPT4MTS [Jia 等,2024 (https://arxiv.org/html/2605.20268#bib.bib32)])、适配器(Time-LLM [Jin 等,2024 (https://arxiv.org/html/2605.20268#bib.bib23)]、GPT4TS [Zhou 等,2023 (https://arxiv.org/html/2605.20268#bib.bib24)])或后期融合头部(MoAT [Lee 等,2024 (https://arxiv.org/html/2605.20268#bib.bib80)]、TaTs [Li 等,2026 (https://arxiv.org/html/2605.20268#bib.bib81)])来融合文本与时间序列。Time-MMD [Liu 等人,2024 (https://arxiv.org/html/2605.20268#bib.bib29)]贡献了一个基准以及MM-TSFlib融合库,我们将其作为多模态基线协议。在这两个类别中,没有先前工作在其各自基准上对专用TSFMs*和*专用LLMs进行评估。Tan 等人 [2024 (https://arxiv.org/html/2605.20268#bib.bib84)] 表明LLM预训练不能迁移到预测,Merrill 等人 [2024 (https://arxiv.org/html/2605.20268#bib.bib27)] 发现LLM难以处理文本编码的序列,这激励了我们面向模态原生联合训练的方法。Chronicle在三个方面与所有先前工作不同:在两种模态上从零训练,使用专注于表示质量而非对话的紧凑324M骨干网络,并且在两个领域内与单模态基础模型进行评估。

**小型语言模型。** GPT-2 [Radford 等,2019 (https://arxiv.org/html/2605.20268#bib.bib13)] 表明解码器专用Transformer能产生能力强大的少样本学习者;随后的紧凑模型(Qwen2 [Yang 等,2024 (https://arxiv.org/html/2605.20268#bib.bib17)]、LLaMA-3.2 [Grattafiori 等,2024 (https://arxiv.org/html/2605.20268#bib.bib16)]、Gemma-3 [Gemma Team,2025 (https://arxiv.org/html/2605.20268#bib.bib61)]、LFM-2 [Amini 等,2025 (https://arxiv.org/html/2605.20268#bib.bib62)])在sub-1B规模上将零样本理解推向强劲水平。我们在19项NLU任务上与五个此类模型进行比较,以验证联合训练保留了语言能力。

## 3 方法论

图1:Chronicle架构。文本标记和时间序列片段共享一个16层解码器专用Transformer,模态特定组件仅限于输入和输出接口。模态特定输出头产生分位数预测(\(L_{\mathrm{QL}}\))和下一个标记预测(\(L_{\mathrm{CE}}\));同一骨干网络为下游分类提供冻结嵌入。

Chronicle区别于先前的多模态文本与时间序列工作:并非事后适配预训练LLM,而是设计一种架构,使两种模态从随机初始化开始塑造共享骨干网络。结果设计得特意简约——一个解码器专用Transformer [Vaswani 等,2017 (https://arxiv.org/html/2605.20268#bib.bib39), Radford 等,2019 (https://arxiv.org/html/2605.20268#bib.bib13)],其中文本标记和时间序列片段在单一序列中占据位置,并通过相同的块、注意力机制和残差流流动。模态特定组件局限于接口:输入侧是覆盖131,072条目的BPE词汇表的文本嵌入表和一个片段投影;输出侧是一个绑定的语言模型头和一个覆盖\(Q=21\)个水平的分位数头。因此几乎所有参数都由两种模态共同使用,跨模态信息流通过因果自注意自然产生,无需任何架构添加。

### 3.1 时间序列表示

遵循PatchTST-FM [Wen 等,2026 (https://arxiv.org/html/2605.20268#bib.bib7)] 和 Chronos-2 [Ansari 等,2025 (https://arxiv.org/html/2605.20268#bib.bib2)],我们首先使用仅基于可见(非NaN、未遮蔽)数据计算的统计量对每个输入进行标准化。

相似文章

用于时间序列预测的仅解码器基础模型

Papers with Code Trending

本文介绍了一篇关于时间序列基础模型(TimeFM)的研究论文,这是一种仅解码器模型,通过借鉴大型语言模型技术,在多样化的时间序列数据集上实现了近乎最佳的零样本性能。

时间序列即语言:面向通用时间序列基础模型的通用分词器

arXiv cs.LG

本文提出UniTok,一种将连续时间序列转化为离散标记的通用分词器,以及UniTok-FM,一个基于下一标记预测预训练的基础模型。该模型支持零样本和提示增强预测,以及通过无需训练的上下文推理实现少样本生成和分类——这是以往工作未能实现的能力。

ChronoVision:通过潜在状态重建进行时间推理

Hugging Face Daily Papers

ChronoVision 是一个多模态框架,通过将视觉逻辑与潜在图像对齐,使用重构视觉头、ROI 注意力定位模块和强化学习,改进视觉语言模型中的时间推理。它引入了 Vbvr-VQA 数据集,并在时间跟踪基准上达到了 SOTA 准确率。

面向金融应用的多模态事件序列基础模型

arXiv cs.LG

本文提出了一种基于预训练Transformer的基础模型,该模型对金融应用中的多模态事件序列进行训练,统一了异构数据源,并通过下一事件预测学习通用表示。该方法优于传统的任务专用模型,并已在东欧一家大型银行部署,带来了可衡量的业务改进。