SCENARIODIFF:多模态时间序列预测的场景级指导框架——扩展版本
摘要
ScenarioDiff 是一个用于多模态时间序列预测的分层上下文推理框架,它将文本上下文组织为三个层次以指导Multimodal Diffusion Transformer,在事件驱动领域表现出有效性。
arXiv:2608.17164v1 公告类型:新
摘要:文本上下文(如新闻、报告和日志)可以为时间序列预测提供有价值的信号,尤其是当未来动态由历史数据中尚未可见的外部事件驱动时。现有的多模态预测方法通常要么让大型语言模型(LLMs)直接预测数值,要么隐式地融合文本和时间序列,使得上下文影响难以解释和控制。我们提出SCENARIODIFF,一个用于在噪声和弱对齐文档下进行多模态时间序列预测的分层上下文推理框架。SCENARIODIFF将上下文信息组织为三个层次:一个历史上下文代理从原始文档中提取逐步证据,一个场景代理为预测范围生成定性场景描述,一个锚点指导代理为事件相关未来区域生成稀疏锚点。这些结构化信号条件化Multimodal Diffusion Transformer,而锚点混合采样在不重新训练的情况下局部优化生成轨迹。在Time-MMD基准上的实验表明,SCENARIODIFF在事件驱动领域特别有效,证明了显式分层场景指导对于多模态时间序列预测的价值。我们的完整实现可在 https://anonymous.4open.science/r/ScenarioDiff_ICDM-2C4C 获取。
查看缓存全文
缓存时间: 2026/08/19 10:23
# 场景级指导框架ScenarioDiff用于多模态时间序列预测
来源:https://arxiv.org/html/2608.17164
Tuan-Binh Tran¹, Dat Nguyen-Cong², Duc-Trong Le³, Thanh Trung Huynh¹, Tung Kieu⁴
作者单位:¹越南河内VinUniversity, ²越南河内FPT集团FPT软件AI中心, ³越南河内VNU工程技术大学, ⁴丹麦奥尔堡大学奥尔堡大学
¹{binh.tt2, trung.ht}@vinuni.edu.vn, ²[email protected], ³[email protected]
⁴[email protected]
###### 摘要
新闻、报告和日志等文本上下文可以为时间序列预测提供有价值的信息,尤其是在未来动态由尚未在历史数值中体现的外部事件驱动时。现有的多模态预测方法通常要么要求大语言模型直接预测数值,要么以隐式方式融合文本和时间序列,使得上下文影响难以解释和控制。我们提出了ScenarioDiff,一个在噪声和弱对齐文档下进行多模态时间序列预测的层级化上下文推理框架。ScenarioDiff将上下文信息组织为三个层级:一个*历史上下文代理*从原始文档中逐步提取证据;一个*场景代理*生成预测时域的定性场景描述;一个*锚点引导代理*为事件相关的未来区域生成稀疏锚点。这些结构化信号为一个*多模态扩散Transformer*提供条件,而*锚点混合采样*则在无需重新训练的情况下局部优化生成的轨迹。在Time-MMD基准测试上的实验表明,ScenarioDiff在事件驱动领域尤其有效,证明了显式层级场景指导对多模态时间序列预测的价值。我们的完整实现代码可在 https://anonymous.4open.science/r/ScenarioDiff_ICDM-2C4C 获取。
###### 索引关键词:
时间序列预测,多模态预测,扩散模型,大语言模型,场景指导
## I 引言
时间序列预测(TSF)支持能源[31]、经济[40]、医疗[21]和交通[8]等领域的决策制定。尽管其重要性毋庸置疑,但大多数预测模型主要基于数值历史进行操作。然而,在实际应用中,人类专家很少孤立地解读时间信号。能源工程师可能会结合天气预报和维护日志来分析需求轨迹,而金融分析师则可能参考盈利报告和宏观经济新闻来解读价格序列。这类上下文信息能够解释历史动态,更重要的是,能够揭示仅从数值中无法看出的未来发展趋势。图1展示了一个激发思考的例子,其中上下文证据提供了关于未来动态的有用线索,这些线索是单独观察数值历史所无法获得的。
这一观察推动了对*多模态*时间序列预测(MTSF)日益增长的兴趣,即将数值历史与新闻、报告和日志等上下文文本配对。现有研究表明,文本信息可以提升各领域的预测效果[15, 14, 32, 36]。然而,现实世界的文本往往存在噪声、冗余、与时间戳弱对齐且仅与目标序列部分相关。在这种情况下,隐式的文本-时间融合使得识别哪些证据影响了预测以及模型应在多大程度上信任这些证据变得困难。
图1:激发思考的例子。2025年6月以色列-伊朗冲突前后的布伦特原油价格说明了进行场景级推理的必要性。在预测起点之前,历史价格仅显示温和的上升趋势,而现有的上下文线索表明地区紧张局势加剧、石油供应中断风险上升以及地缘政治风险溢价上升。这些信号表明短期内可能出现石油价格冲击,但这并未完全反映在数值历史中。ScenarioDiff利用观测到的上下文构建中断场景,并生成更能追踪实际价格上涨的轨迹。
大语言模型是处理非结构化上下文的自然工具,因为它们能够对文本证据进行总结、筛选和推理。近期研究探索了两个主要方向。第一个方向是将数值历史提示或重新编程为类语言输入,并要求LLMs直接预测未来数值[7]。虽然这种方式很吸引人,但它将长期数值生成任务置于主要为语言理解而非精确时间外推而优化的模型之上[41]。第二个方向通过多模态融合、交叉注意力或基于代理的摘要流程来融合文本[15, 14, 32, 36]。这些方法有效,但通常假设文本与时间戳对齐良好,或者在潜在空间中隐式地吸收上下文证据。
另一个挑战是,上下文文本不仅可能描述平滑的趋势延续,还可能描述事件驱动的偏离,例如政策干预、停电或需求突然转变。捕捉这类情况需要面向未来的假设来指导数值预测器,而无需让LLM直接输出数字。当可能发生突变时,还需要一种机制将粗糙的文本期望转化为局部约束。
在这项工作中,我们提出了ScenarioDiff,一个用于MTSF的层级化上下文推理框架。其核心思想是将上下文信息组织成三个互补的指导层级,每个层级在指导预测方面扮演不同的角色。首先,一个冻结的*历史上下文代理*将原始文档压缩为与观测历史对齐的*逐步上下文摘要*,使模型基于文档级证据进行推理。其次,一个冻结的*场景代理*将历史序列和这些摘要合成为*场景描述*,作为预测时域的定性先验。第三,一个*锚点引导代理*将可用上下文转换为稀疏的*锚点*,为可能发生突变的未来区域提供时间局部化的指导。这种层级结构分离了过去的证据、未来的假设和局部的轨迹约束,使得上下文的影响比隐式融合更加明确和模块化。
我们将预测器实例化为一个*多模态扩散Transformer*,该模型通过迭代去噪过程对由代理产生的结构化信号进行条件化,来建模未来的轨迹。逐步上下文摘要和场景描述指导基础的扩散过程,使模型能够在不要求LLMs直接输出数值预测的情况下,结合数值历史与场景级的文本证据。为了使锚点发挥作用,我们引入了*锚点混合采样*,这是一种在推理时进行的优化过程,它利用到波段距离目标局部编辑锚点相关区域,并通过混合扩散保留非锚点区域。因此,锚点充当软局部约束而非硬性覆盖,无需重新训练基础预测器即可鼓励生成与事件一致的轨迹。
我们在Time-MMD基准测试[15]上评估了ScenarioDiff。结果表明,ScenarioDiff取得了强劲的性能,在事件驱动领域中提升最为明显,因为在这些领域中,文本证据包含了关于未来动态的可操作信号。这支持了我们的核心假设:当未来变化由未在数值历史中充分体现的外部事件驱动时,显式的层级化场景指导最为有益。
总而言之,我们的主要贡献如下:(i) 我们提出了ScenarioDiff,一个层级化上下文推理框架,它将嘈杂的文本文档转化为用于MTSF的三个层级的指导:历史证据、未来场景和局部锚点约束。(ii) 我们将这些结构化信号整合到多模态扩散Transformer中,实现了基于显式历史和场景级上下文的条件概率预测。(iii) 我们提出了锚点混合采样,它将锚点引导代理产生的锚点与本地的事后轨迹优化相结合,无需重新训练扩散预测器。(iv) 我们在Time-MMD上进行了实证分析,表明主要收益集中在事件驱动领域,其中文本证据包含了可操作的未来信号。
## II 相关工作
基于LLM的时间序列预测。近期的工作探索了利用大语言模型作为时间序列分析和预测的序列先验。OFA[45]研究了预训练语言模型骨干如何迁移到时间序列任务。Time-LLM[7]将数值历史重新编程为类语言表示,使冻结的LLM能够执行少样本和零样本预测。CALF[17]通过将时间标记与文本表示对齐,进一步改进了这一范式。这些方法展示了LLMs为预测提供语义先验的潜力。然而,它们通常要求LLM支持数值外推,由于语言建模与精细时间生成之间的不匹配,这对于精确的长期预测并不理想。相比之下,ScenarioDiff利用LLMs产生上下文信息而非直接生成数值:代理总结历史证据、生成场景描述和提取锚点,而扩散预测器处理概率生成。
多模态时间序列预测。多模态时间序列预测将新闻、报告、日志和事件描述等上下文文本整合到数值预测模型中。Time-MMD[15]引入了一个多领域基准测试,并证明配对的文本信息可以提高跨领域的预测效果。TaTS[14]将文本与每个时间步对齐,并使用文本嵌入作为额外的时间特征。TimeCAP[11]采用基于代理的流程来总结和情境化时间序列,然后再进行预测,而ChatTime[32]在统一的Transformer中联合建模数值和文本输入。尽管这些方法有效,但它们通常假设文本与时间戳对齐良好,或者在潜在空间中隐式地融合文本,使得在嘈杂、弱对齐、多文档输入下难以检查哪些证据影响了预测。ScenarioDiff的不同之处在于将原始文档转化为显式的逐步上下文摘要、场景描述和锚点,使上下文的作用更加模块化和可解释。
基于扩散模型的时间序列预测。扩散模型已成为一类强大的概率预测器,通过迭代去噪生成未来轨迹。现有方法包括一次性时域生成[30, 26]和基于自回归扩散的预测[23]。后续工作通过多分辨率去噪、结构化骨干和检索增强条件化改进了长期预测[25, 1, 16]。近期的多模态扩散方法通过融合、交叉注意力或无分类器引导进一步注入时间戳和文本上下文[28, 39],而流匹配模型旨在降低采样成本[19, 35]。大多数先前的条件生成方法主要通过架构级融合实现,并未显式地控制外部上下文如何影响采样。我们的工作建立在扩散预测的基础上,但在两个方面有所不同。首先,条件信号不是原始文本或通用的潜在嵌入;相反,它们是结构化的场景级信号,分别编码历史证据和未来假设。其次,除了架构条件化,我们引入了一种推理时的引导机制,将生成的轨迹导向由上下文证据隐含的稀疏锚点波段。这为塑造预测分布提供了一种可解释且灵活的方式,同时与标准的扩散骨干兼容。
## III 预备知识
### III-A 去噪扩散概率模型
去噪扩散概率模型(DDPMs)[6]是一种生成模型,它通过遵循马尔可夫链,在T步内逐步向干净样本x⁽⁰⁾添加高斯噪声。噪声调度{βₜ}ₜ₌₁ᵀ 由 βₜ ∈ (0,1) 组成,累积噪声由 ᾱₜ = ∏ᵢ₌₁ᵗ (1−βᵢ) 表示。前向扩散过程描述为:
q(x⁽¹:T⁾ | x⁽⁰⁾) = ∏ₜ₌₁ᵀ q(x⁽ᵗ⁾ | x⁽ᵗ⁻¹⁾), (1)
q(x⁽ᵗ⁾ | x⁽ᵗ⁻¹⁾) = 𝒩(√(1−βₜ) x⁽ᵗ⁻¹⁾, βₜ I). (2)
该过程允许我们直接从干净样本x⁽⁰⁾采样x⁽ᵗ⁾:
x⁽ᵗ⁾ = √(ᾱₜ) x⁽⁰⁾ + √(1−ᾱₜ) ε, ε ~ 𝒩(0, I). (3)
为了逆转这个扩散链,DDPM学习逐步去除每个步骤中的噪声。逆过程也被建模为一个马尔可夫链,定义为:
p_θ(x⁽⁰:T⁾) = p_θ(x⁽ᵀ⁾) ∏ₜ₌₁ᵀ p_θ(x⁽ᵗ⁻¹⁾ | x⁽ᵗ⁾), (4)
p_θ(x⁽ᵗ⁻¹⁾ | x⁽ᵗ⁾) = 𝒩( μ(x⁽ᵗ⁾, x_θ(x⁽ᵗ⁾, t) ), Σₜ ). (5)
这里,p_θ(x⁽ᵀ⁾) 被选为标准高斯分布 𝒩(0, I),而 x_θ(x⁽ᵗ⁾, t)相似文章
针对时间序列预测中不确定性成分的扩散轨迹差分
本文提出了DiffDiff,一种用于概率时间序列预测的扩散框架,它将可预测性不对称性嵌入到扩散轨迹中,在四个预测跨度的七个基准测试上优于六个扩散基线。
DynG-Diff:面向概率时间序列预测的状态感知动态引导扩散框架
DynG-Diff提出了一种状态感知的动态引导扩散框架,用于概率性多元时间序列预测,通过自适应处理变量异质性来提升鲁棒性。
MMDiff: 扩展扩散变换器以实现多模态生成
MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。
SevDiff:基于严重性条件扩散的长尾冲突轨迹生成
SevDiff是一种基于严重性条件的扩散模型,用于生成具有可控碰撞时间值的车辆冲突轨迹,在用于ADAS评估的真实数据集上实现了高命中率。
面向高效鲁棒电网调度的决策聚焦场景生成与选择
本文提出了一种面向电网调度中分布鲁棒优化的决策聚焦生成框架,用于生成相关场景。该框架基于下游运营成本而非预测准确性来优化场景。与不同生成模型下的精度导向方法相比,运营成本降低了0.80%-2.02%。