LLM引导的任务语义场分解用于工业过程预测
摘要
本文提出任务语义场分解(TSF),一种LLM引导的框架,利用过程文档的离线语义构建来增强工业过程中的时间序列预测和软测量。TSF在几乎不增加参数和推理开销的情况下,平均降低了6.4%的MAE。
arXiv:2607.06623v1 公告类型:新
摘要:过程工业依赖时间序列预测和软测量来估计难以在线测量的质量变量。标签数据稀缺,运行工况频繁变化,为每种场景重新训练模型或重建对齐流程成本高昂。此类设置通常提供记录变量名称、单位、物理意义和过程角色的变量表格和过程文档。然而,标准时间序列骨干通常将输入视为匿名数值列。现有的文本增强方法也很少让输入变量与预测目标之间的语义逻辑关系在每个数值窗口内对模型可用。为了解决这个问题,本文提出任务语义场分解(TSF),一种大语言模型(LLM)引导的框架。TSF在训练前从任务协议和变量文档构建任务语义场,并且仅使用LLM进行离线语义构建。在线训练和推理则保持使用传统时间序列骨干。在训练和推理过程中,当前数值窗口激活变量语义,使得语义信息参与每次预测,并支持对不同预测目标和运行偏移的适应。在多个复杂的工业预测和软测量任务上,TSF在改进设置中平均降低了6.4\%的MAE,最大降幅达到25.5\%。它仅增加约1.8–3.0k参数,在线推理额外开销小于0.008 ms/步。这些结果表明,TSF将现有的过程文档转化为跨骨干和语义生成器的可测量预测增益,同时保持轻量级以便部署。
查看缓存全文
缓存时间: 2026/07/09 07:41
# 面向工业过程预测的LLM引导任务语义场分解
来源:https://arxiv.org/html/2607.06623
\\IEEEmembership学生会员,IEEERunda Jiahttps://orcid.org/0000-0002-8586-243X\{\}^\{\\lx@orcidlink\{0000\-0002\-8586\-243X\}\{\\orcidlogo\}\}Mingxuan Renhttps://orcid.org/0009-0001-0172-5914\{\}^\{\\lx@orcidlink\{0009\-0001\-0172\-5914\}\{\\orcidlogo\}\},以及Dakuo Hehttps://orcid.org/0000-0001-8303-529X\{\}^\{\\lx@orcidlink\{0000\-0001\-8303\-529X\}\{\\orcidlogo\}\}本文工作受中央高校基本科研业务费专项资金资助,中国(N26GFZ006)。(通讯作者:Runda Jia。)Youcheng Zong、Runda Jia、Mingxuan Ren和Dakuo He均供职于东北大学信息科学与工程学院,中国沈阳110004(电子邮箱:[email protected]; [email protected]; [email protected]; [email protected])。
###### 摘要
过程工业依赖时间序列预测和软测量来估计难以在线测量的质量变量。标记数据稀缺,运行工况频繁变化,且针对每种场景重新训练模型或重建对齐流水线成本高昂。此类场景通常提供变量表和过程文档,记录变量名称、单位、物理含义和过程角色。然而,标准时间序列骨干网络通常将输入视为匿名的数值列。现有的文本增强方法也鲜有在数值窗口内将输入变量与预测目标之间的语义逻辑关系呈现给模型。为解决此问题,本文提出任务语义场分解(TSF),一种由大型语言模型(LLM)引导的框架。TSF在训练前根据任务协议和变量文档构建任务语义场,并仅将LLM用于离线语义构建。在线训练和推理仍使用传统时间序列骨干网络。在训练和推理过程中,当前数值窗口激活变量语义,使得语义信息参与每次预测,并支持适应不同的预测目标和工况变化。在多个复杂的工业预测和软测量任务上,TSF在改进设置下平均降低MAE 6.4%,最大降幅达25.5%。它仅增加约1.8–3.0k参数,新增在线推理开销低于0.008 ms/步。这些结果表明,TSF能跨骨干网络和语义生成器将现有过程文档转化为可测量的预测性能提升,同时保持轻量级以利于部署。
\{IEEEkeywords\}
大型语言模型,工业过程预测,软测量,变量语义,语义输入分解。
## 1 引言
过程工业依赖时间序列预测和软测量来估计难以在线测量的质量变量。这些预测直接影响安全裕度、产品质量、能源使用和生产效率。关于软测量和冶金决策支持的研究表明,数据驱动模型现已广泛用于工业信息学[20 (https://arxiv.org/html/2607.06623#bib.bib1),28 (https://arxiv.org/html/2607.06623#bib.bib12)]。然而在实际部署中,数据条件仍然受限:高质量标签稀缺,运行条件频繁变化,针对每种场景重新训练模型或重建对齐流水线的成本高昂。与此同时,变量表和过程文档通常已经可用。它们记录了变量名称、单位、物理含义、采样属性和过程角色。这些文档是天然的先验知识来源,但它们往往被排除在预测过程之外。
这种差距在输入层最为明显。多变量时间序列骨干网络可以学习时间依赖关系,但其输入通常只是按列排列的数值窗口。然而在工业任务中,变量并非匿名数字。它还携带单位、控制含义以及与目标变量的关系。当样本有限时,模型需要识别当前窗口中的这些关系,而不仅仅是记住每列的数值形态。因此,输入变量与预测目标之间的关系应在窗口进入骨干网络之前就可见。
关于大型语言模型(LLM)和文本增强时间序列的研究表明,语言信息可以辅助时间序列建模[7 (https://arxiv.org/html/2607.06623#bib.bib27),11 (https://arxiv.org/html/2607.06623#bib.bib25),15 (https://arxiv.org/html/2607.06623#bib.bib30)]。元数据和变量语义方法进一步表明,数据集描述和变量描述可以提供有用的预测先验。这些研究表明,变量描述不必只是被动的文档。现有设计通常通过提示、元数据、对齐模块或知识结构引入语义,但这些语义通常停留在预测流水线的边缘。对于工业回归,关键在于让当前数值窗口激活这些关系,并揭示每次预测中哪些变量关系是活跃的。图1 (https://arxiv.org/html/2607.06623#S1.F1) 展示了这一转变。
参考图注图1:工业预测中变量语义的范式转变。(a) 传统数值预测仅处理传感器值窗口,将变量文档留在模型外部。(b) 基于LLM和文本增强的预测引入语义引导,但与当前数值窗口的联系可能仍然松散。(c) TSF首先将任务协议和变量描述转化为任务感知语义,然后让当前窗口在骨干网络之前激活这些语义。为解决此问题,我们提出LLM引导的任务语义场分解(TSF)。在训练前,TSF将任务协议、变量描述和过程背景转化为任务感知的变量语义,当前数值窗口在预测时激活这些语义。这样,预测骨干网络能够通过依赖语义被恰当理解的输入变量,动态适应不同的任务场景和运行条件。
主要贡献如下。
- •我们提出TSF,利用LLM的世界知识和推理能力,帮助模型识别输入变量与预测目标之间的语义逻辑关系。
- •我们引入任务语义场,它从任务定义和当前数值窗口激活变量语义,并帮助模型适应不同的预测目标和工况变化。
- •在多个复杂的工业预测和软测量任务上,TSF在不同骨干网络和语义生成器上均提升性能,新增在线推理开销低于0.008 ms/步。
本文其余部分组织如下。第2节 (https://arxiv.org/html/2607.06623#S2) 回顾相关工作。第3节 (https://arxiv.org/html/2607.06623#S3) 介绍方法。第4节 (https://arxiv.org/html/2607.06623#S4) 报告实验。第5节 (https://arxiv.org/html/2607.06623#S5) 总结全文。
## 2 相关工作
### 2.1 数值骨干网络与缺失的输入语义
工业时间序列预测和软测量在骨干网络容量之前常常受到数据条件的限制。高质量标签成本高昂,故障和跨工况样本稀疏,实际部署面临保密性和维护约束。已有研究使用LSTM和Transformer模型进行软测量[25 (https://arxiv.org/html/2607.06623#bib.bib2),5 (https://arxiv.org/html/2607.06623#bib.bib3)],数值骨干网络也已应用于材料压力预测[30 (https://arxiv.org/html/2607.06623#bib.bib17)]。这些结果表明,数值骨干网络可以学习工业动力学,但它们接收的输入通常已被简化为数值通道。在变量到达模型之前,它们的名称、单位、过程角色以及与预测目标的关系通常从输入中缺失。因此,TSF将注意力转移到骨干网络之前的输入接口,使得预测器在建模时间依赖关系之前能看到保留任务语义的工业变量。
### 2.2 时间序列预测的LLM接口
近期研究使用LLM来补充数值窗口缺失的语义上下文。一些方法将LLM置于预测循环中,通过提示学习、直接生成或输入重编程进行预测[23 (https://arxiv.org/html/2607.06623#bib.bib28),7 (https://arxiv.org/html/2607.06623#bib.bib27)]。其他方法将预训练模型重编程为预测器,或将时间序列预测视为自回归生成问题[11 (https://arxiv.org/html/2607.06623#bib.bib25),27 (https://arxiv.org/html/2607.06623#bib.bib26),15 (https://arxiv.org/html/2607.06623#bib.bib30)]。一些方法减少对生成的依赖,将时间序列表示与文本信息对齐,包括跨模态匹配和文本原型[12 (https://arxiv.org/html/2607.06623#bib.bib24),19 (https://arxiv.org/html/2607.06623#bib.bib29)]。更广泛的零样本基础模型应用给出了类似的信息。预训练能力在与目标任务和输入上下文绑定时更可靠[18 (https://arxiv.org/html/2607.06623#bib.bib19)]。这种语义优势也伴随着计算成本。对比研究表明,LLM的额外成本并不总是转化为更好的预测性能[21 (https://arxiv.org/html/2607.06623#bib.bib16)]。TSF遵循这种成本意识视角。它仅在离线语义构建期间使用LLM,而数值预测器处理训练和推理。
### 2.3 作为输入先验的变量语义
在与LLM预测接口平行的方向上,工业研究也使用变量语义和领域知识作为预测先验。相关方法已支持电池健康估计、负荷预测和非平稳对齐[1 (https://arxiv.org/html/2607.06623#bib.bib13),2 (https://arxiv.org/html/2607.06623#bib.bib14),4 (https://arxiv.org/html/2607.06623#bib.bib21)]。其他研究使用LLM或知识结构支持因果图表示、零样本故障诊断和知识图谱辅助诊断[24 (https://arxiv.org/html/2607.06623#bib.bib20),9 (https://arxiv.org/html/2607.06623#bib.bib22),13 (https://arxiv.org/html/2607.06623#bib.bib15)]。这些结果表明,变量描述、过程知识和语义关系可以改进工业建模。然而,许多实现仍然依赖额外的文本输入、显式的图结构或专门的推理模块。TSF将先验保持在输入侧。它在训练前将变量描述压缩成一个冻结的方向矩阵。当前数值窗口随后激活该矩阵作为任务语义场,并馈送给标准骨干网络。这样,现有的传感器表和变量文档可以成为输入侧的先验,无需配对语料库或在线知识图谱维护。
## 3 方法
### 3.1 问题设定与语义方向
我们首先定义每个预测样本以及在训练前固定的语义对象。每个样本由实例索引nn和预测时间tt标识。窗口长度为LL,输入变量数量为dd。对于该样本,令xn,l∈R1×d\\mathbf{x}_{n,\ell}\\in\mathbb{R}^{1\times d}表示窗口内时间步l\\ell的行向量。每列对应一个输入变量。历史窗口Xn,tX_{n,t}由从t-L+1t-L+1到tt的LL行堆叠而成。目标为yn,t∈Rr\\mathbf{y}_{n,t}\in\mathbb{R}^{r}。
X_n,t = [x_{n,t-L+1}; …; x_{n,t}] ∈ R^{L×d}, y_{n,t} ∈ R^{r}. (1)
这里rr是当前任务的输出维度。我们用X~_n,t表示用训练集统计量归一化后的窗口,以下所有输入映射均作用于X~_n,t。
TSF从训练前固定的任务协议T中提取语义。我们定义T = (B, G, I, C)。其中B是过程背景,G是目标和窗口规格,I描述信息可用性和排除信息。变量元数据C = (c_1, …, c_d)遵循输入列顺序。
T = (B, G, I, C), C = (c_1, …, c_d). (2)
该协议记录了数据集概况、可选的领域上下文、变量名称、单位、采样属性、过程角色和目标定义。它排除测试集统计量、未来标签、预测误差和已训练模型状态。
一个离线语义生成器F_phi自动将T映射到语义卡片,其中phi表示在训练前选择的LLM和提示配置。输出(z_1, …, z_d)与输入变量顺序相同,其中z_i是第i个变量的语义卡片。
(z_1, …, z_d) = F_phi(T). (3)
每个语义卡片z_i描述第i个变量在当前任务中的名称、单位、物理含义、过程角色、信息角色、时间关系以及主要耦合关系。然后,语义卡片被转换为变量语义方向。
确定性文本渲染器R将语义卡片z_i转换为简洁的英文短语u_i。嵌入模型E_psi随后将u_i映射为一个向量,其中psi表示该嵌入模型的冻结参数。归一化行向量v_i ∈ R^{1×k}定义了第i个变量的变量语义方向,k为语义方向维度。
u_i = R(z_i), v_i = E_psi(u_i) / ||E_psi(u_i)||_2 ∈ R^{1×k}. (4)
按输入列顺序堆叠所有变量语义方向,得到变量语义方向矩阵V。
V = [v_1; …; v_d] ∈ R^{d×k}. (5)
构建完成后,V在训练、验证和测试期间保持不变。图2 (https://arxiv.org/html/2607.06623#S3.F2) 总结了离线语义构建以及训练和推理中使用的计算路径。
参考图注图2:TSF工作流程。离线构建将任务协议和有序变量元数据映射为语义卡片、渲染短语、嵌入以及冻结的变量语义方向矩阵VV。在训练和推理期间,归一化窗口激活任务语义场S= X~V。约束双路径适配器将语义场、原始值路径和共享偏置组合成骨干网络的输入ZZ;插入图展开了这种分解。
### 3.2 任务语义场分解
在构建变量语义方向矩阵VV之后,TSF使用当前数值窗口激活它。相似文章
语义步骤预测:通过步骤采样实现LLM推理轨迹中的多步潜在预测
本文介绍了语义步骤预测,该方法在推理步骤边界而非随机令牌位置上应用几何正则化,在ProcessBench上相比固定基线实现了168倍的多步潜在预测提升。
StepFinder:一种用于多智能体系统故障归因的时间语义框架
StepFinder 是一个轻量级框架,仅在特征构建阶段使用LLM将执行日志编码为时间语义序列,然后应用参数高效的时间与注意力模块进行多智能体系统的故障归因。在Who&When基准测试中,与最快的基于LLM的方法相比,推理时间减少了79%。
PESD-TSF:一种周期感知与显式结构化分解的长期时间序列预测框架
提出PESD-TSF,一种受物理启发的结构化分解框架,用于长期时间序列预测,通过乘法周期性门控、多尺度结构化编码器和跨尺度协作注意力来解决周期感知退化、趋势-噪声纠缠和跨变量依赖关系丢失的问题。
针对CTF4Science Lorenz挑战的度量感知混合预测
本文描述了一种针对CTF4Science Lorenz挑战的度量感知混合预测系统,该系统结合了神经去噪器、ODE拟合和直方图尾部分布替代,以优化九个任务对中的不同度量,在公开排行榜上取得了83.85529分的成绩。
面向任务的合成数据生成以提升农业预测任务中的机器学习性能
提出了一种任务条件化合成数据生成(TCSDG)算法,该算法结合了贝叶斯网络生成器与基于Transformer的表格基础模型,旨在提升农业预测任务中的机器学习性能,并在基准测试中表现出一致的改进。