用于在剩余使用寿命中锚定多模态语言模型的时间序列检索
摘要
本文提出了一种利用时间序列检索锚定多模态大语言模型进行剩余使用寿命预测的框架,展示了基于检索的方法在准确性和稳定性方面优于非检索基线。
arXiv:2608.19218v1 Announce Type: new
摘要:大语言模型(LLMs)和智能AI系统越来越多地被探索用于特定领域的维护和预测任务,这引发了它们能否有效支持预测与健康管理(PHM)的问题。本文研究了通过时间序列检索锚定的多模态大语言模型(MLLMs)进行剩余使用寿命(RUL)估计。我们提出了一个框架,从训练集中检索历史相似的退化片段,并与测试轨迹一起转化为视觉比较产物,通过结构化的多模态提示由MLLM处理。该方法在C-MAPSS基准的FD001分区上通过重复实验进行评估,比较了基于检索的推断与基于随机参考选择的非检索基线。结果表明,时间序列检索在评估的模型中持续提高了基于MLLM的RUL预测,降低了误差并提供了更稳定的性能。同时,效益的幅度取决于模型容量,这表明当底层MLLM能够利用检索到的证据时,检索最为有效。总体而言,该研究表明时间序列RAG是改进多模态预测推理的一种有前景的机制,同时也突出了基于MLLM的RUL估计在实际PHM环境中的当前局限性。
查看缓存全文
缓存时间: 2026/08/21 10:00
# 基于时间序列检索的多模态语言模型剩余使用寿命预测研究
来源:https://arxiv.org/html/2608.19218
Valeriu Dimidov 与 Raphaël Frank
卢森堡大学安全、可靠性与信任跨学科研究中心 (SnT)
地址:29 Avenue J.F. Kennedy L-1855, Luxembourg
###### 摘要
大型语言模型(LLMs)和智能体AI系统正越来越多地被探索用于特定领域的维护与预测任务,这引发了关于它们能否有效支持预测与健康管理(PHM)的讨论。本文研究通过时间序列检索增强多模态大型语言模型(MLLMs)进行剩余使用寿命(RUL)估计。我们提出一种框架:从训练集中检索历史相似退化片段,与测试轨迹一同转换为视觉对比材料,再通过结构化多模态提示词交由MLLM处理。该方法在C-MAPSS基准的FD001分区上进行重复实验,将基于检索的推理与基于随机参考选择的非检索基线进行对比。结果表明,时间序列检索能持续提升MLLM的RUL预测性能,表现为更低的误差和更稳定的预测。同时,效益幅度取决于模型容量,表明检索效果在底层MLLM能有效利用检索证据时最为显著。总体而言,研究表明时间序列RAG是提升多模态预测推理能力的有效机制,但也揭示了MLLM在实际PHM场景中进行RUL估计的当前局限性。
\\phmLicenseFootnote
第一作者名 第一作者姓
## 1 引言
预测性维护(PdM)旨在通过提前预判故障来减少停机时间、维护成本和运行风险。该领域的核心任务之一是剩余使用寿命(RUL)估计,即预测设备距失效的剩余时间。准确的RUL估计可为预测与健康管理(PHM)中的维护规划、资源分配和风险决策提供支持。
传统RUL估计方法通常基于统计退化模型、物理信息方法或基于传感器时间序列训练的数据驱动架构。尽管这些方法具有良好的预测性能,但通常仅处理数值数据,对外部上下文知识的推理支持有限。
近年来,大型语言模型(LLMs)和多模态大型语言模型(MLLMs)的发展为RUL估计提供了新的视角(?, ?, ?)。MLLM不再仅依赖学习到的数值预测器,而是可以通过包含目标轨迹的视觉和文本证据进行提示。检索增强生成(RAG)可通过选择与查询轨迹相似的历史退化片段进一步丰富输入,这延续了利用检索外部证据增强语言模型生成效果的总体思路(?, ?)。然而,在RUL场景下,这种检索的效果尚不明确:匹配良好的参考能帮助模型获取有效的退化证据,而匹配不佳的参考可能引入噪声或导致预测偏差。
因此,本文研究时间序列检索能否提升基于MLLM的RUL估计。我们提出一种框架:从历史全寿命周期轨迹中检索相似退化片段,与查询轨迹结合生成视觉对比材料。随后,在C-MAPSS基准的FD001分区上,使用相同的多模态提示结构对比基于检索的推理与基于随机参考选择的非检索基线(?, ?, ?)。
本研究的主要贡献包括:
- •一种将RUL估计重构为MLLM基于证据的视觉推理任务的多模态框架。
- •一种时间序列RAG机制,检索历史退化片段并以轨迹级参考证据的形式呈现给MLLM。
- •在C-MAPSS基准的FD001分区上,对基于检索与随机参考推理进行的受控实验比较。
- •对RUL估计场景中检索增强的效益、局限性及失败模式的分析。
本文结构如下:第2节(https://arxiv.org/html/2608.19218#S2)回顾相关工作,第3节(https://arxiv.org/html/2608.19218#S3)阐述方法论,第4节(https://arxiv.org/html/2608.19218#S4)报告实验结果,第5节(https://arxiv.org/html/2608.19218#S5)讨论主要发现与局限,第6节(https://arxiv.org/html/2608.19218#S6)总结全文。
见图注 图1:C-MAPSS数据集FD001分区的预处理流程。表1:主要流程模块的输入、转换与输出概述。
## 2 相关工作
LLMs在时间序列分析中开始受到关注。近期研究表明该领域主要遵循多个方向:直接提示、将时间序列量化为类似标记的表示、数值序列与语言模型空间对齐、使用视觉表示作为中间推理接口,以及整合LLMs与外部工具(?, ?)。同时,多模态大型语言模型(MLLMs)的快速发展表明,以语言为中心的模型能够联合处理文本、图像和音频等异构模态,这在将传感器轨迹转换为图表或文本摘要进行推理时尤为重要(?, ?)。
在PHM和RUL估计的具体场景中,LLMs和MLLMs的应用虽处于起步阶段但增长迅速。一项研究提出了基于LLM的涡扇发动机RUL预测回归框架,报告了具有竞争力的结果及良好的迁移学习特性(?, ?)。另一项研究探索了在C-MAPSS上使用预训练LLM进行飞机发动机RUL预测的方法(?, ?)。近期有研究提出多模态框架,联合利用时域信号、频域图像和文本领域知识进行工业时间序列分析,并在C-MAPSS四个标准子集上进行了评估(?, ?)。在更广泛的PHM层面,另一项工作提出了基于语言模型的框架,旨在统一支持多项维护相关任务(?, ?)。
另一个相关方向涉及将外部知识整合到基于LLM的PHM流程中。RAG通过结合参数化语言模型与显式非参数记忆,增强了事实依据和可更新性(?, ?)。在预测性维护中,近期研究认为检索和知识增强有助于基于LLM的系统更有效地访问维护记录、技术文档和操作流程(?, ?)。
尽管取得了这些进展,但在受控条件下明确研究检索增强对基于MLLM的RUL估计影响的研究仍然有限。现有研究主要集中在将LLMs和MLLMs适应预测任务,或使用文本检索支持更广泛的PHM。因此,时间序列RAG对RUL预测质量的影响尚未得到充分研究(?, ?, ?, ?, ?, ?, ?)。
## 3 方法论
本节介绍问题设置、提出的模型流程和实验配置。
### 3.1 问题定义
考虑n个设备单元集合U={U₀,U₁,...,Uₙ₋₁},通过车载测量进行时间监控。每个单元U_i由多变量时间序列X_i∈ℝ^{T_i×M}表示,其中T_i∈ℕ表示观测周期数,M为监控变量数。对应的RUL目标序列为R_i∈ℕ₀^{T_i}。
给定数据集
D={(X_i,R_i)}_{i=0}^{n-1} (1)
目标是学习映射函数
f_{TS}:⋃_{T∈ℕ}ℝ^{T×M}→ℕ₀ (2)
使得对于给定时间序列X_i,函数f_{TS}能预测其最后观测点的RUL。
本文采用多模态大型语言模型近似该映射函数。由于MLLMs设计用于处理图像和文本等多模态输入,每个时间序列X_i被转换为多模态表示Z_i,可能包含传感器轨迹的可视化图表和文本上下文信息。预测函数可表示为
f_{MM}:Z→ℕ₀ (3)
其中Z表示源自原始时间序列的多模态表示空间。目标仍是估计每个单元最后观测点的RUL。
### 3.2 数据集
本研究使用C-MAPSS基准进行RUL估计的实证评估。C-MAPSS是一个广泛使用的模拟涡扇发动机退化数据集,每条轨迹对应一个通过三个运行设置变量和多个传感器测量值在连续运行周期中监控的设备单元。训练集包含完整的全寿命周期轨迹,测试集则包含在失效前截断的轨迹。因此,任务是估计每个测试单元最后观测周期的RUL(?, ?, ?)。
受经济、计算和时间限制,本文报告的实验仅限于FD001分区。该设计选择可在可行的实验预算内进行集中受控分析,更广泛的评估将留待未来工作。
关于模拟器和数据集构建的详细信息,请参见(?, ?, ?)。
见图注 (a) RAG构建器:训练轨迹被分段、按RUL区间采样、编码并索引到向量数据库。
见图注 (b) 查询检索器:测试轨迹的最后片段被编码,并用于检索最近的已索引训练片段。
图2:时间序列RAG机制概述:(a) 编码训练片段的离线索引;(b) 使用编码测试片段的在线检索。
### 3.3 预处理
预处理流程将原始C-MAPSS轨迹转换为标准化的固定长度样本,适用于检索和多模态推理,如图1(https://arxiv.org/html/2608.19218#S1.F1)所示。原始轨迹首先按设备单元分组并按周期排序。随后,使用训练集统计量对所有传感器通道进行独立的min-max归一化。该变换减少了变量间的尺度差异,使不同单元的退化行为表示更具可比性。
归一化后,应用基于皮尔逊相关系数的特征选择以减少冗余并消除非信息测量。仅保留在该过程中被选中的变量用于后续阶段。
接着根据距失效的距离重构周期级RUL目标,并应用125个周期的截断阈值。最后,通过滑动窗口程序对每个归一化轨迹进行分段。给定窗口长度L,该方法提取固定长度的时间片段,每个片段与其最后一个周期的RUL值关联。该步骤将可变长度的退化轨迹转换为标准化样本,可供检索模块和多模态推理流程一致使用。
### 3.4 时间序列RAG机制
提出的时间序列RAG机制由三个主要模块组成:编码器模块、检索记忆构建器和查询检索器。图2(https://arxiv.org/html/2608.19218#S3.F2)总结了整体流程,区分了检索记忆的离线构建和针对测试单元的历史参考在线检索。
#### 3.4.1 编码器模块
编码器模块将每个归一化的滑动窗口片段转换为用于相似性检索的紧凑向量表示。其目的是在固定维度嵌入空间中表示单元的近期时间行为,包括传感器水平和局部退化趋势。
令S_j表示第3.3节(https://arxiv.org/html/2608.19218#S3.SS3)预处理步骤产生的归一化片段。编码器定义映射
z_j=φ(S_j)∈ℝ^d
其中z_j是片段S_j的嵌入,d为嵌入维度。
本文中,编码器通过基于LSTM的自编码方案获得,该方案仅在训练轨迹提取的窗口上进行训练。LSTM编码器处理多变量传感器片段,并将其映射到潜在嵌入。训练期间,一个轻量级解码器连接到该嵌入,并优化以重构片段的最终传感器状态。
训练后,丢弃解码器,仅保留编码器及嵌入投影。编码器的主要架构和训练设置总结于表2(https://arxiv.org/html/2608.19218#S3.T2)。
表2:用于生成检索嵌入的学习LSTM编码器配置。
#### 3.4.2 检索记忆构建器
检索记忆构建器构建所提时间序列RAG机制使用的非参数记忆。该模块对应图2(https://arxiv.org/html/2608.19218#S3.F2)(a)所示的离线阶段。为避免信息泄露,它仅在训练分区上操作,将历史退化数据转换为可搜索的代表性示例集合。
##### 窗口到嵌入的转换
该模块基于第3.3节(https://arxiv.org/html/2608.19218#S3.SS3)预处理步骤产生的窗口化训练片段构建。每个片段与其最后一个周期的RUL值关联。然后使用第3.4.1节(https://arxiv.org/html/2608.19218#S3.SS4.SSS1)描述的训练编码器将每个选定片段转换为固定维度嵌入。
##### RUL平衡检索记忆构建
为减少冗余并提高对各退化阶段的覆盖,训练片段按RUL值分组,并从每个RUL区间中采样子集。
生成的检索记忆可表示为
C={(z_j,r_j,m_j)}_{j=1}^N
其中z_j是编码器模块定义的片段嵌入,r_j是关联的RUL值,m_j包含元数据(如来源单元和周期位置)。随后将嵌入和元数据存储在向量数据库中,形成可搜索的历史退化示例记忆。
见图注 (a) 多模态提示生成工作流。相似文章
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
TimeLens2: 通用视频时间定位与多模态大语言模型
TimeLens2 提出了一种使用多模态大语言模型的通用视频时间定位方法,将时间证据视为区间集,在多个基准上取得了最先进的性能。
基于时间序列基础模型嵌入的剩余使用寿命估计
本文介绍了一种轻量级方法,利用Chronos-2时间序列基础模型的冻结嵌入,结合一个简单的回归头,进行剩余使用寿命估计,在工业传感器数据上相比基线方法取得了更优的性能。
使用大型语言模型从时间序列中生成可解释的、数据驱动的洞察
提出一个领域无关的框架,利用大型语言模型为时间序列预测生成基于事实的自然语言解释,通过约束到可验证证据来减少幻觉。在金融和货运定价案例研究中进行了评估。
超越当前观察:在可控非马尔可夫游戏中评估多模态大语言模型
本文介绍了RNG-Bench,一个基准测试套件,用于评估多模态基础模型在多步交互中重建过去观察并利用它们进行决策的能力。该套件包含两个游戏(Matching Pairs和3D Maze),具有可控难度参数和一个记忆差距指标,用于区分遗忘与糟糕的决策。