使用大型语言模型从时间序列中生成可解释的、数据驱动的洞察

arXiv cs.AI 论文

摘要

提出一个领域无关的框架,利用大型语言模型为时间序列预测生成基于事实的自然语言解释,通过约束到可验证证据来减少幻觉。在金融和货运定价案例研究中进行了评估。

arXiv:2607.18271v1 Announce Type: new 摘要:时间序列预测广泛用于关键决策领域,而这些预测通常需要伴随解释才被采用。生成此类解释通常是手动且成本高昂的过程,而使用大型语言模型自动化的尝试在处理时间数据时常常出现幻觉。我们提出一个领域无关的框架,用于为时间序列预测生成基于事实的自然语言解释,如图1所示。该框架包含三个组件:(i) 从历史分析师编写的解释中提取结构化解释因子,(ii) 基于证据的条件化解释生成,以及(iii) 可扩展的可读性、逻辑一致性和说服力评估。该设计明确地将生成过程约束到可验证的证据,从而减少无根据的断言。我们在涉及NASDAQ-100指数的金融预测案例研究和利用Vortexa数据的货运定价案例研究中评估了该框架。结果表明,生成的解释在可读性、一致性和说服力方面接近分析师编写的解释。这些发现表明,无需领域特定的微调即可大规模实现时间序列预测的基于事实的解释生成。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:21

# 使用大语言模型进行时间序列的可解释、数据驱动洞察生成
来源:https://arxiv.org/html/2607.18271
###### 摘要。

时间序列预测广泛应用于决策关键领域,在这些领域中,预测结果很少在没有附带解释的情况下被使用。生成此类解释通常是一个手动且成本高昂的过程,而尝试使用大语言模型将其自动化时,应用于时间数据往往会遇到幻觉问题。

我们提出了一种领域无关的框架,用于为时间序列预测生成有依据的自然语言解释,如图1 (https://arxiv.org/html/2607.18271#S0.F1) 所示。该框架由三个组件组成:(i) 从历史分析师撰写的解释中提取结构化的解释性因素,(ii) 基于证据的条件化解释生成,以及 (iii) 针对可读性、逻辑一致性和说服力的可扩展评估。该设计明确将生成过程约束于可验证的证据,减少了无依据的论断。

我们在一个涉及纳斯达克100指数的金融预测案例研究和一个使用Vortexa数据的货运定价案例研究上评估了该框架。结果表明,生成的解释在可读性、一致性和说服力方面接近分析师撰写的解释。这些发现表明,无需特定领域的微调,即可大规模实现时间序列预测的有依据解释生成。

大语言模型,时间序列分析,检索增强生成,自然语言评估

††copyright:none††ccs:计算方法学 自然语言生成††ccs:数学计算 时间序列分析参见图注图1。用于生成时间序列预测的有依据自然语言解释的模块化框架。展示端到端的有依据解释生成框架的框图。左侧,分析师撰写的解释输入到标记为“历史因素提取”的模块,该模块包括因素提取、聚类和属性重要性。提取的数据与外部数据一起流入中央模块“依据确定与报告生成”,该模块包含证据检索、证据编码和报告生成。该模块输出生成的解释,然后传递给右侧的“评估”模块,该模块评估可读性、推理一致性和说服力。评估结果显示通过优化循环反馈到依据确定与报告生成模块。## 1. 引言

时间序列预测支撑着许多高风险领域的决策 (Kaushik等人,2020 (https://arxiv.org/html/2607.18271#bib.bib201);Sezer等人,2020 (https://arxiv.org/html/2607.18271#bib.bib202);Brandt和Freeman,2006 (https://arxiv.org/html/2607.18271#bib.bib203);Bechtel和Leuffen,2010 (https://arxiv.org/html/2607.18271#bib.bib204))。在此类场景中,预测很少被孤立地使用。相反,利益相关者需要能够证明预测趋势合理、将不确定性置于情境中,并将模型输出与可观察到的证据联系起来的解释。这些解释对于信任、问责制和决策至关重要,尤其是当预测会影响代价高昂或不可逆转的行动时 (Jiang等人,2025 (https://arxiv.org/html/2607.18271#bib.bib103))。

在许多此类领域,解释性预测在很大程度上仍然是一个人为驱动的过程。领域专家通过将历史模式、外部信号和领域知识综合成对预测的解释,来解释数值预测。虽然这种方法有效,但成本高昂、速度缓慢且难以扩展。随着此类场景中的组织对许多资产或系统日益频繁地要求按需解释,对专家撰写叙事的依赖成为一个显著的瓶颈 (Park和Zach,2025 (https://arxiv.org/html/2607.18271#bib.bib205))。

大语言模型 (LLM) 的最新进展表明了一条实现此过程自动化的潜在路径。大语言模型能够生成流畅、连贯的文本,并整合异构信息源,使其成为生成解释性叙事的候选工具 (Zhang等人,2023 (https://arxiv.org/html/2607.18271#bib.bib109);Hadi等人,2023 (https://arxiv.org/html/2607.18271#bib.bib132);Fei等人,2024 (https://arxiv.org/html/2607.18271#bib.bib194))。然而,将大语言模型应用于时间序列解释带来了根本性挑战 (Jiang等人,2025 (https://arxiv.org/html/2607.18271#bib.bib103))。与自然语言不同,时间序列数据是数值型的、具有时间结构,并且通常表现出强自相关性、季节性和体制转换。大语言模型并未经过直接对此类结构进行推理的训练,如果被原生地使用,可能会生成事实错误、时间不一致或没有数据支持的解释。

#### 大语言模型时间序列解释的挑战

核心困难不在于生成文本,而在于生成**有依据的**解释——即每个论断都明确得到来自基础时间序列数据或在生成时提供给模型的外部来源中可验证证据的支持的解释。没有适当的约束,大语言模型可能会产生幻觉式的因果机制,过分强调虚假相关性,或引入数据无法证明的叙事 (Jiang等人,2025 (https://arxiv.org/html/2607.18271#bib.bib103);Merrill等人,2024 (https://arxiv.org/html/2607.18271#bib.bib163))。

此外,目前尚不清楚应向大语言模型提供哪些信息以实现忠实的解释生成。时间序列预测流程通常会暴露大量潜在信号,包括原始历史值、衍生特征、外部协变量以及非结构化上下文数据(如新闻报道)。用所有可用信息对大语言模型进行条件化是不切实际的,并且可能会因引入噪声而降低性能。相反,过于简化的条件化则有可能遗漏对于生成有意义的论证至关重要的解释性上下文 (Pang等人,2024 (https://arxiv.org/html/2607.18271#bib.bib136);Zhang等人,2023 (https://arxiv.org/html/2607.18271#bib.bib109))。

最后一个挑战涉及评估。与预测准确性不同,解释质量缺乏明确的标准答案。由领域专家进行人工评估成本高昂且无法扩展,而通用的文本相似度指标与人类判断的相关性较差 (Gehrmann等人,2021 (https://arxiv.org/html/2607.18271#bib.bib161);Khapra和Sai,2021 (https://arxiv.org/html/2607.18271#bib.bib155);Dhingra等人,2019 (https://arxiv.org/html/2607.18271#bib.bib158))。因此,系统性地评估生成的解释是否真正有用仍然很困难。

#### 问题范围

我们研究为时间序列预测生成**有依据的**自然语言解释的问题。我们提出了一个模块化的、领域无关的框架,该框架以目标时间序列 \(TS\)(包含历史观测值 \(TShist\{\}\_\{\\text\{hist\}\}\))、其关联的预测值 \(TSfc\{\}\_\{\\text\{fc\}\}\) 以及辅助上下文信息(例如历史分析师撰写的解释 \(AnX\) 或外部信号 \(EXT\))作为输入。目标是生成一个自然语言解释 \(GenX\),通过将预测趋势与相关、可验证的证据联系起来,为预测提供依据。生成预测本身的问题不在本研究范围内。

#### 案例研究

为了在不同的场景中评估所提出的框架,我们将其应用于两个领域:

主要案例研究聚焦于对纳斯达克100指数的预测。该场景提供了丰富、成熟的解释性叙事和高质量的专家评论,使其成为有依据的解释生成的自然基准。

###### 运行示例 0(纳斯达克100)。

在此场景中,目标时间序列 TS 包括纳斯达克100指数的每日收盘价。对于2024年11月29日生成的报告,历史段 TShist\{\}\_\{\\text\{hist\}\} 覆盖前一个月的时间窗口,即从2024年10月29日至11月29日。如图2 (https://arxiv.org/html/2607.18271#S1.F2) 所示,该指数在此期间呈现温和的上升趋势,伴随一些波动。预测段 TSfc\{\}\_\{\\text\{fc\}\} 覆盖随后的一周时间跨度,对应报告日期后的五个交易日。

辅助上下文来自一个由分析师撰写的市场报告语料库 \(AnX\),该语料库解释了先前的纳斯达克100走势,同时结合了同期的外部信号 \(EXT\),例如美国失业率或地缘政治发展。一个合适的生成解释 \(GenX\) 应通过将预测中的增长趋势依据建立在 TShist\{\}\_\{\\text\{hist\}\} 的观测动态和相关的 EXT 上,来证明 TSfc\{\}\_\{\\text\{fc\}\} 的预测增加是合理的,而不仅仅是复述数值预测。

参见图注图2。纳斯达克100运行示例的目标时间序列。实线显示截至报告日期(2024年11月29日)的一个月历史窗口 (TShist\{\}\_\{\\text\{hist\}\})。虚线显示一周的预测范围 (TSfc\{\}\_\{\\text\{fc\}\})。折线图显示纳斯达克100收盘价随时间的变化。横轴显示从2024年10月下旬至12月上旬的日期,纵轴显示指数收盘值。标记为 TS hist 的实线表示一个月时间窗口内的历史每日收盘价。垂直虚线标记报告日期,将历史数据与预测期分开。在此边界右侧,标记为 TS fc 的虚线显示一周预测范围内的预测收盘价。作为一个补充案例研究,我们将相同的流程应用于航运业的运费预测,使用Vortexa分析师的专有行业数据和专家反馈。研究这两个场景使我们能够评估该框架在不同数据特征和决策语境中的表现。为了分析的清晰性和深度,本文的其余部分主要聚焦于纳斯达克100案例研究,而运费场景则作为辅助验证。

## 2. 相关工作

我们的工作处于时间序列预测、可解释机器学习和基于大语言模型的文本生成的交叉点。

#### 时间序列预测中的可解释性

可解释性长期以来被认为是时间序列预测中的一个关键要求,尤其是在金融和经济等高风险领域 (Sezer等人,2020 (https://arxiv.org/html/2607.18271#bib.bib202);Bechtel和Leuffen,2010 (https://arxiv.org/html/2607.18271#bib.bib204))。包括ARIMA在内的经典统计模型通过趋势和季节性等显式组件提供有限的解释性,但由于线性性和平稳性的假设,其表达能力受到限制 (Hyndman和Athanasopoulos,2018 (https://arxiv.org/html/2607.18271#bib.bib119))。

现代机器学习模型显著提高了预测性能,但常常以牺牲可解释性为代价。事后解释技术,如特征归因、显著性方法或注意力可视化,提供了对模型行为的洞察,但很少能产生对非技术利益相关者有意义的解释 (Makridakis等人,2018 (https://arxiv.org/html/2607.18271#bib.bib223);Jiang等人,2025 (https://arxiv.org/html/2607.18271#bib.bib103);Triebe等人,2021 (https://arxiv.org/html/2607.18271#bib.bib222))。

在实践中,预测的解释通常由人类专家提供,他们将数值模式与外部上下文(如宏观经济指标、事件或政策变化)结合起来 (Park和Zach,2025 (https://arxiv.org/html/2607.18271#bib.bib205))。

#### 用于时间序列的大语言模型

最近的研究通过微调预训练模型进行预测、分类或异常检测,探索了将大语言模型应用于时间序列任务 (Chang等人,2023 (https://arxiv.org/html/2607.18271#bib.bib144);Zhou等人,2023 (https://arxiv.org/html/2607.18271#bib.bib145))。这些方法通常将数值时间序列转换为类似标记的表示,或尝试将时间序列嵌入与语言嵌入对齐。虽然在某些场景中很有前景,但这些方法主要关注预测性能而非解释生成。然而,大语言模型已广泛用于总结和科学报告等领域的解释生成 (Pang等人,2024 (https://arxiv.org/html/2607.18271#bib.bib136))。检索增强生成 (RAG) 是一种广泛使用的技术,它将知识库中的文档或段落纳入模型输入,以减少幻觉 (Lewis等人,2020 (https://arxiv.org/html/2607.18271#bib.bib152))。虽然对许多自然语言任务有效,但在时间序列解释中,RAG仍未被充分探索。时间序列数据是连续的、有时间结构的,并且通常是高频的;原生地检索原始序列或大量文档集合本身并不能保证生成连贯、忠实或时间一致的解释 (Yang等人,2025 (https://arxiv.org/html/2607.18271#bib.bib153);Ning等人,2025 (https://arxiv.org/html/2607.18271#bib.bib154))。解决这一限制需要针对时间序列证据的选择、编码和条件化的有原则性机制。

#### 自然语言解释的评估

由于自然语言解释的主观性以及缺乏单一的标准答案,评估它们具有挑战性 (Gehrmann等人,2021 (https://arxiv.org/html/2607.18271#bib.bib161))。领域专家的人工评估仍然是黄金标准,但成本高、耗时长且难以扩展 (Khapra和Sai,2021 (https://arxiv.org/html/2607.18271#bib.bib155))。

诸如BLEU和ROUGE等自动指标被广泛使用,但对于解释任务,它们与人类判断的相关性较差 (Dhingra等人,2019 (https://arxiv.org/html/2607.18271#bib.bib158))。最近的方法通过使用基于蕴含的指标和矛盾检测,融入了上下文感知或逻辑一致性 (Bannur等人,2024 (https://arxiv.org/html/2607.18271#bib.bib165);Akyürek等人,2024 (https://arxiv.org/html/2607.18271#bib.bib166))。大语言模型本身也被用作评判者,沿着定性维度评估解释质量。

尽管取得了这些进展,但如何评估时间序列场景中的解释尚未达成共识,现有研究通常依赖于临时指标或小规模的人工评估。

## 3. 架构

我们提出了一个模块化的、领域无关的框架,用于为时间序列预测生成有依据的自然语言解释。该框架包括三个阶段,如图1 (https://arxiv.org/html/2607.18271#S0.F1) 所示:

1. (1)首先,我们介绍一种**历史因素提取**方法,其中解释性因素从 AnX 中自动提取,并以结构化形式表示。
2. (2)其次,我们利用 RAG 对大语言模型进行条件化以生成**有依据的解释**,其中模型明确地基于选定的证据进行条件化。
3. (3)最后,为了大规模评估解释质量,我们引入了一个**多轴评估框架**,衡量可读性、逻辑一致性和说服力。

这种模块化设计允许独立分析每个阶段,并跨领域进行调整,同时支持基于评估反馈的迭代优化。

## 4. 历史因素提取

本节描述我们框架的第一阶段:**历史因素提取**。此阶段的目标

相似文章

应用于大语言模型的可解释性研究:对比分析

arXiv cs.CL

一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。