ConceptTS: LLM引导的概念瓶颈用于可解释的多元时间序列预测

arXiv cs.LG 论文

摘要

ConceptTS 引入了一个可解释的预测框架,该框架使用大语言模型为多元时间序列预测提出人类可读的概念,通过概念瓶颈在保持透明度的同时实现了具有竞争力的准确性。

arXiv:2608.21277v1 公告类型:新 摘要:最先进的多元时间序列预测器可以建模复杂的时间和跨变量依赖关系,但其不透明的表示方式对于为何产生特定预测提供了有限的洞察。这种缺乏透明度的情况限制了它们在从业者必须理解和评估预测背后因素的场景中的应用。我们引入了 ConceptTS,一个可解释的预测框架,它围绕命名的、人类可读的概念组织预测。ConceptTS 使用大语言模型提出任务相关的概念并生成可执行的标注规则,将语言模型的领域知识转化为直接监督,而无需昂贵的手动概念标注。提出的概念被组织成三个互补的瓶颈,分别描述历史上下文、局部预测区间和完整预测范围。一个共享解码器结合来自其预测激活的表示来构建预测,使模型的决策过程明确化并支持直接的概念级干预。在Beijing 多站点空气质量数据集上的实验表明,ConceptTS 在实现与强大黑盒基准相当准确性的同时,产生了语义上有意义的概念激活。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:38

# ConceptTS:用于可解释多元时间序列预测的LLM引导概念瓶颈模型  
来源:https://arxiv.org/html/2608.21277  

**1st  Yichen Jiang**  
1感谢:1 Yichen Jiang在加入加州大学戴维斯分校的VIA实验室项目时隶属于斯坦福大学,后在董宇刘的指导下作为远程研究实习生完成了工作。  
隶属机构:斯坦福大学电气工程系,美国加利福尼亚州斯坦福市 [email protected]  

**2nd  Yueqiao Chen**  
隶属机构:加州大学戴维斯分校计算机科学系,美国加利福尼亚州戴维斯市 [email protected]  

**3rd  Dongyu Liu**  
隶属机构:加州大学戴维斯分校计算机科学系,美国加利福尼亚州戴维斯市 [email protected]  

###### 摘要  
先进的多元时间序列预测模型能够建模复杂的时间依赖和变量间依赖关系,但其不透明的表示方式对特定预测产生的原因提供的洞见有限。这种缺乏透明度的情况限制了它们在从业者必须理解和评估预测背后因素的场景中的应用。我们提出了ConceptTS,一种可解释的预测框架,它围绕命名的、人类可读的概念组织预测。ConceptTS使用大型语言模型来提出与任务相关的概念并生成可执行的标注规则,将语言模型的领域知识转化为直接的监督信号,无需昂贵的手动概念标注。所提出的概念被组织成三个互补的瓶颈,分别描述历史上下文、局部预测区间和完整预测视野。一个共享的解码器结合从其预测激活中派生的表示来构建预测,使模型的决策过程显式化,并支持直接的概念级干预。在北京多站点空气质量数据集上的实验表明,ConceptTS在实现与强大黑盒基线模型相当的准确性的同时,生成了具有语义意义的概念激活。  

###### 索引词:概念瓶颈模型、可解释人工智能、可解释机器学习、大型语言模型、多元时间序列预测  

## I 引言  
多元时间序列预测旨在从历史观测和相关协变量中预测目标轨迹。在医疗保健、环境监测、能源和工业等领域,持续收集的数据要求可扩展的建模和可解释的时间分析[11, 7]。现代循环、卷积、图、线性/MLP和Transformer架构能够以较高的准确性捕获非线性时间动态和变量间依赖关系[21]。然而,其预测能力的进展已超越了可解释性:一个预测无法揭示哪些时间条件或变量交互塑造了它,或者模型是否使用了合理的证据。这种不透明性在高风险、数据密集型的场景中尤为重要,因为从业者在信任预测之前必须理解潜在的故障模式。  
解释多元时间序列尤其具有挑战性,因为预测性证据分布在多个变量和时间尺度上,并且其相关性可能在整个预测视野内发生变化[20, 26, 16]。一个预测可能共同依赖于一个通道的长期趋势、另一个通道的短期事件以及它们不断变化的交互作用。归因或显著性方法可以识别有影响力的通道和时间戳,但这些底层的重要性分数并不能解释所选证据所代表的语义条件。  
基于概念的模型通过围绕人类可理解的中间变量组织预测,提供了一种有前景的替代方案。概念瓶颈模型使这些变量可检查且可直接干预[9],而最近的时间序列方法提供了互补的方向:ProtoTS引入了用于预测的分层原型推理[17],TimeX++通过信息瓶颈学习保留标签的可解释实例[13]。然而,传统的CBM依赖于专家定义的概念和每个样本的标注;ProtoTS学习的潜在原型其含义必须在训练后推断;而TimeX++解释的是现有的预测器,而非要求预测通过命名的语义证据。因此,获得一个内部证据语义显式、受监督且与预测路径相连,同时又不产生大量标注成本的准确预测器仍然很困难。  
我们通过ConceptTS来解决这一差距,这是一个LLM引导的概念瓶颈框架,用于可解释的多元时间序列预测。给定领域上下文、数据集统计信息和代表性的时间模式,一个离线的大型语言模型会提出概念名称、自然语言定义和可执行谓词,这些谓词会自动标注训练数据段。ConceptTS将这些概念组织成互补的瓶颈,分别描述历史上下文、预测视野内的局部区间以及整个预测视野。一个保持结构的编码器预测它们的激活,一个共享的解码器从由此产生的概念表示中构建预测。输入无关的概念嵌入限制了围绕显式激活路径的信息泄露,而一个小的正则化残差通道则容纳了离散概念未能完全表示的连续幅度信息,并暴露了明确的准确性-可解释性权衡。LLM仅在概念构建阶段使用,在推理时不需要。  
我们在北京多站点空气质量数据集的三个站点上,在未来信息感知和仅回溯两种设置下评估了ConceptTS。该模型与强大的黑盒预测器(包括一个MAE仅比最佳测试的仅回溯基线高5%的模型)保持竞争力。除了预测准确性,我们还通过概念计数和残差通道消融实验、定性案例研究、反事实概念扫描和激活干预来研究这些概念是如何被学习和使用的。特别是,用反转的真实概念标签替换激活值,使测试MAE从15.371增加到99.661,这直接证明了解码器在测试配置中依赖于概念激活通道。  
我们的贡献有三方面:  
- • **LLM引导的概念构建与监督**。我们引入了一个流程,将领域上下文和数据集摘要转化为命名的时间概念、自然语言定义和可执行标注规则,避免了为单个训练数据段进行手动概念标注。  
- • **多尺度、可干预的预测架构**。我们在历史、局部预测和全局预测范围内组织概念,并设计了一个预测路径,该路径在保持时间和变量结构的同时,限制了围绕概念瓶颈的信息泄露。  
- • **预测与可解释性的双重评估**。跨三个监测站点和两种输入模式的实验确立了具有竞争力的预测性能,而消融实验、案例研究、概念扫描和受控干预评估了概念质量、模型依赖性以及准确性-可解释性权衡。  

## II 相关工作  
### II-A 时间序列模型的可解释性  
解释时间序列预测不仅仅是为独立特征分配重要性。预测性证据可能存在于一个事件、其持续时间、窗口内的趋势或通道间的交互中;此外,相关的证据可能在预测视野内发生变化。因此,综述将事后归因、扰动和基于实例的解释与内在可解释架构区分开来,并从局部与全局范围、保真度、稳定性和人类可理解性等维度评估解释[20, 26, 16]。  
对于多元预测,这些要求尤其苛刻:相关变量使单个归因模糊,时间聚合可能隐藏短期事件,而遮蔽可能产生分布外输入[13]。几种预测方法揭示了输入的哪些部分似乎具有影响力。Series Saliency同时学习多元输入区域上的预测和显著性,而Temporal Fusion Transformer则提供了变量选择权重和时间注意力模式[15, 10]。TimeX++通过信息瓶颈目标学习分布内、保留标签的可解释实例,解决了传统遮蔽方法的局限性[13]。  
这些方法提供了有用的定位和模型诊断,但它们的解释主要表达为对变量和时间戳的重要性,或作为选定的输入实例。从业者仍需推断该证据所代表的语义条件——例如,一个联合变化是表示污染事件、天气转变还是循环的每日模式。此外,为现有预测器选择的解释不一定是其预测计算所通过的中间表示。  
相反,我们的工作针对的是一个内在的预测路径,其证据以命名的、稳定的时间概念词汇表表达,并可直接进行干预。  

### II-B 基于概念和语言引导的模型  
概念瓶颈模型最初是为图像分类开发的,模型首先预测人类定义的视觉属性,然后使用它们来推断目标标签[9]。由于任务预测通过这些中间概念表达,用户可以检查并干预模型的推理过程。概念嵌入模型通过用学习的嵌入表示每个概念的活动和非活动状态,增加了该瓶颈的容量[5]。  
将该范式应用于多元时间序列并非易事:与静态视觉属性不同,时间概念可能描述趋势、持续时间、变量间关系以及不同时间尺度的模式。此外,定义这些概念并标注每个序列通常需要大量的领域专业知识。我们的工作将概念瓶颈范式应用于预测,同时减少了这种监督负担。  
语言引导方法提供了一种减轻这种监督负担的方式。LaBo使用语言模型提出候选概念,并通过视觉-语言模型将其具体化,用于可解释的图像分类,而概念瓶颈LLM围绕人类可读的中间概念组织语言模型的决策[23, 19]。这些研究表明语言模型可以辅助概念发现,但它们主要针对图像或文本任务。连续多元序列还需要操作定义,以指定时间概念何时活跃,适应变量之间的交互,并区分在不同时间范围内发生的模式。  
ProtoTS通过学习与规范预测曲线相关的分层潜在原型,提供了一种相关的概念式可解释时间序列预测方法[17]。虽然这些原型支持检查,但它们是无名的,并且预测可以使用超出所显示原型匹配的已学习信息。因此,用户必须在训练后推断其语义,而仅靠匹配并不能完全解释一个预测。相比之下,ConceptTS使用离线的LLM来提出命名的时间概念和可执行的标注规则,然后将受监督的概念组织在历史上下文、局部预测区间和整个预测视野中。这种设计为预测路径提供了一个稳定的语义词汇表,支持直接检查和干预,而无需手动的片段级标注。  

## III 方法  
请参见图1。图1:ConceptTS用于单个预测子窗口的整体架构。LLM提出三个概念集,分别覆盖回溯窗口、每个预测子窗口和全局预测视野。一个ModernTCN风格的编码器嵌入输入;嵌入的时间切片驱动概念激活概率,这些概率与两个静态概念嵌入相结合形成概念上下文向量。这些向量与位置嵌入、跨子窗口BiGRU输出和残差通道连接,并馈送到堆叠的残差解码器中,该解码器以从粗到细的方式细化预测。  
### III-A 公式化与框架  
#### III-A1 问题公式化  
在本项目中,我们考虑多元时间序列预测问题,其中一组外生特征作为上下文信息,用于帮助预测内生(目标)特征。给定回溯目标序列 Y_{1:L}∈R^L,回溯协变量 X_{1:L}∈R^{L×C},以及在预测视野内可用的协变量 X_{L+1:L+H}∈R^{H×C},我们的模型 F 预测 Ŷ_{L+1:L+H}=F(Y_{1:L}, X_{1:L}, X_{L+1:L+H})。除了这种未来信息感知设置外,我们还评估了仅回溯设置,该设置移除了对 X_{L+1:L+H} 的访问,迫使模型仅从 Y_{1:L} 和 X_{1:L} 进行预测。  

#### III-A2 框架概述  
图1说明了ConceptTS流程。一个离线LLM提出者生成三个概念集——用于回溯窗口、预测子窗口和整个预测视野——每个概念集都配有一个可执行谓词,用于标注每个训练数据段。一个ModernTCN风格的编码器保持每个通道和时间结构,产生嵌入,驱动三个并行CEM瓶颈中的概念激活。一个共享的残差子解码器将概念上下文、跨子窗口BiGRU输出和一个正则化残差通道组合成最终的预测,通过混合损失进行端到端训练。  

### III-B LLM驱动的概念提出者  
我们不是依赖人工编写的概念集和每个片段的标注(标准的CBM/CEM要求),而是向离线LLM提供数据集统计信息,并要求其返回三个概念集以及可执行的Python谓词来标注每个训练数据段。  

#### III-B1 每片段统计摘要  
对于每个输入片段 s_{i},我们首先从以下四个方面提取结构化统计摘要:  
- • **回溯统计**:每个通道的{均值、标准差、斜率、范围};加上FFT导出的{主导周期、24小时振幅、频谱熵、低频比率}以揭示循环模式。  
- • **预测统计**:{均值、趋势斜率、极差};未来协变量通道的{均值、方差}。

相似文章

LLM引导的任务语义场分解用于工业过程预测

arXiv cs.LG

本文提出任务语义场分解(TSF),一种LLM引导的框架,利用过程文档的离线语义构建来增强工业过程中的时间序列预测和软测量。TSF在几乎不增加参数和推理开销的情况下,平均降低了6.4%的MAE。