SeT-Diff:面向HPC遥测和时间序列的语义基础模型
摘要
SeT-Diff提出了首个面向HPC遥测的基础模型,利用基于语义传感器描述的扩散机制,在插补、预测和虚拟传感等任务上实现零样本泛化,重建任务的MAE达到0.0470。
arXiv:2607.22548v1 Announce Type: new
摘要:数据中心及其计算节点需要精确且灵活的数字孪生,能够建模工作负载、环境参数和物理指标之间复杂的相互作用。当前针对HPC及其遥测的机器学习方法通常依赖于为单一任务定制的静态匿名固定位置传感器变量子集。因此,当目标任务变化或传感器指标变更时,这些模型便会过时。我们提出了SeT-Diff,首个面向计算节点遥测和时间序列的基础模型。与刚性架构不同,我们的基于扩散的方法将生成过程条件于每个传感器的语义描述,从而将系统动力学与数据集结构解耦。在真实世界超级计算机数据集上的实验表明,重建任务的平均绝对误差(MAE)为0.0470。SeT-Diff展现出零样本排列稳定性,即使传感器被打乱,精度也仅出现可忽略的下降。单个预训练模型能够有效执行数据插补、预测和虚拟传感——在热推断中实现0.033的MAE——使得SeT-Diff成为适用于HPC系统的有效数据驱动数字孪生。
查看缓存全文
缓存时间: 2026/07/28 06:23
# SeT-Diff:面向HPC遥测和时间序列的语义基础模型
Source: https://arxiv.org/html/2607.22548
\(2026\)
###### 摘要。
数据中心及其计算节点需要准确且灵活的数字孪生,能够对工作负载、环境参数和物理指标之间复杂的相互作用进行建模。当前用于HPC及其遥测数据的机器学习方法通常依赖于针对单一任务的静态匿名固定位置传感器变量子集。因此,当目标任务发生变化或传感器指标有所变动时,这些模型便会失效。我们提出SeT-Diff,这是首个面向计算节点遥测和时间序列的基础模型。不同于僵化的架构,我们的基于扩散的方法根据每个传感器的语义描述来调节生成过程,将系统动力学与数据集结构解耦。在真实超算数据集上的实验表明,重建任务的平均绝对误差(MAE)为0.0470。SeT-Diff展现出零样本排列稳定性,即使传感器顺序被打乱,其精度也几乎不降。单个预训练模型即可有效执行数据插补、预测和虚拟传感——在热推断任务中达到0.033的MAE——使SeT-Diff成为HPC系统高效的数据驱动数字孪生。
HPC遥测,扩散模型,语义条件化,基础模型,虚拟传感,零样本适应
††journalyear:2026††copyright:cc††conference:第23届ACM国际计算前沿会议论文集;2026年5月19–21日,意大利卡塔尼亚††booktitle:第23届ACM国际计算前沿会议论文集(CF '26),2026年5月19–21日,意大利卡塔尼亚††doi:10.1145/3801487.3806064††isbn:979-8-4007-2568-5/2026/05††ccs:计算方法论 模型开发与分析††ccs:计算方法论 人工智能††ccs:计算方法论 多任务学习
## 1\. 引言
高性能计算(HPC)系统会产生连续的多变量遥测数据流,这些数据对于系统管理(Borghesi等人,2023 (https://arxiv.org/html/2607.22548#bib.bib1);Antici等人,2025 (https://arxiv.org/html/2607.22548#bib.bib13))、预测性维护(Lima等人,2021 (https://arxiv.org/html/2607.22548#bib.bib17))、异常检测(Molan等人,2023 (https://arxiv.org/html/2607.22548#bib.bib19))以及数字孪生(Maiterth等人,2024 (https://arxiv.org/html/2607.22548#bib.bib15),2025 (https://arxiv.org/html/2607.22548#bib.bib16))至关重要。然而,由于数据维度高、存在缺失值(Medaiyese等人,2025 (https://arxiv.org/html/2607.22548#bib.bib20))以及传感器布局动态变化,对该数据进行建模极具挑战性。传统的时间序列模型将输入信号视为匿名的、固定位置的数值向量,因此当配置发生变化时,这些模型就会失效。
为弥补这一语义鸿沟,我们提出了SeT-Diff,一种基于去噪扩散框架的上下文感知基础模型。SeT-Diff不仅根据历史数据,还根据传感器的语义上下文来调节多变量时间序列的生成。通过整合描述每个特征的预训练文本嵌入(通过Sentence-BERT(Reimers和Gurevych,2019 (https://arxiv.org/html/2607.22548#bib.bib14))),模型将信号的物理行为与其含义关联起来,而非其位置索引。
我们的核心贡献是一个统一的框架,无需改变架构即可在多个下游任务上实现零样本泛化——包括数据插补、系统负载预测和未测量指标回归(虚拟传感)。在Marconi100超算数据集(Borghesi等人,2023 (https://arxiv.org/html/2607.22548#bib.bib1))上的评估表明,SeT-Diff在重建任务上达到了0.0470的MAE。此外,在固定和随机打乱的传感器布局之间,它几乎保持了相同的精度(OLS斜率为0.99),并在零样本热回归任务中达到了0.033的MAE。这确立了SeT-Diff作为HPC系统多功能且鲁棒的数字孪生地位。
## 2\. 背景与相关工作
随着HPC系统规模扩展到支持生成式人工智能(AI)和千兆瓦级数据中心,其监控基础设施的复杂性也呈指数级增长。现代Tier-0系统集成了多样化的加速器、多层内存层次结构和液冷技术,每天产生数百GB的高频遥测数据(Borghesi等人,2023 (https://arxiv.org/html/2607.22548#bib.bib1); Jadon等人,2021 (https://arxiv.org/html/2607.22548#bib.bib5))。然而,目前这些数据的使用仅限于仪表盘和可视化。
AI在系统监控中的应用被碎片化,形成了针对特定任务的专门模型,例如用于异常检测的自编码器(Molan等人,2023 (https://arxiv.org/html/2607.22548#bib.bib19))或用于热回归的图网络(Guindani等人,2024 (https://arxiv.org/html/2607.22548#bib.bib22))。这些监督和无监督模型存在“语义鸿沟”问题:它们严格基于位置索引映射匿名的数值向量。如果被监控的指标顺序或组成发生改变,这些僵化的流水线就会失效。此外,这些方法都是单任务的,并且针对特定的输出特征进行训练,无法在推理时更改。
为了超越单任务模型,最近关于时间序列基础模型的研究,如Time-LLM(Jin等人,2024 (https://arxiv.org/html/2607.22548#bib.bib6))和Chronos(Ansari等人,2024 (https://arxiv.org/html/2607.22548#bib.bib7)),采用了Transformer主干进行广泛泛化。然而,它们作为确定性映射,缺乏复杂多任务场景所需的统一生成能力。相反,去噪扩散概率模型(Ho等人,2020 (https://arxiv.org/html/2607.22548#bib.bib2))提供了一个强大的非自回归框架,用于合成高保真数据,并将未观测值视为噪声,以同时进行预测和插补。然而,现有的时间序列扩散方法(例如CSDI(Tashiro等人,2021 (https://arxiv.org/html/2607.22548#bib.bib10)))在结构上仍然僵化且在语义上盲目。SeT-Diff通过融合扩散模型的生成多样性和语言模型的语义感知能力,弥合了这一差距,能够对不断变化的硬件拓扑实现真正的零样本适应。
## 3\. SeT-Diff 基础模型
我们提出SeT-Diff,这是首个面向计算节点遥测的多任务基础模型,充当灵活的数字孪生。其核心设计理念是将物理系统动力学的建模与传感器仪器仪表的刚性结构约束解耦。传统模型近似条件分布p\(x_{t+1}|x_{0:t}\),假设每个特征都有一个固定的索引i。相比之下,SeT-Diff将多变量时间序列视为一个由语义身份和统计行为定义的相互作用的物理信号集合,而非一个固定矩阵。
我们利用DDPM框架,因为它能够对复杂分布进行建模,并且对噪声具有固有的鲁棒性。训练目标是对一个向输入数据X∈R^{N×P}添加高斯噪声的前向扩散过程进行逆向操作。与标准方法不同,我们的去噪网络ε_θ显式地以丰富上下文C为条件,该上下文描述了每个传感器的测量内容。这允许学习置换不变表示:如果“CPU温度”通道发生改变,模型识别的是其上下文嵌入而非其位置,从而确保在重新配置的硬件布局上生成一致的结果。
### 3.1\. 上下文编码
为了将原始元数据转换为机器可解释的信号,一个双流上下文编码器为P个特征中的每一个生成一个上下文向量C,该向量由两种嵌入类型组成:
#### 语义嵌入 \(E_{text}\)
实现排列稳定性的主要锚点是每个传感器的文本描述(例如,“CPU核心0的温度,单位为摄氏度”)。这些描述仅定义特征的标识,明确排除了行为特征或特征间关系,这些由模型自主学习。我们利用Sentence-BERT将其编码为固定大小的稠密向量d∈R^{P×384}。这些嵌入提供了语义含义,使模型摆脱了对位置的依赖,并在传感器被重新排序、移除或新引入时实现零样本适应。
#### 统计描述符 \(E_{stat}\)
语义嵌入缺乏对归一化生成过程至关重要的尺度或平稳性属性。我们为每个通道计算一个汇总统计向量s∈R^{P×9}(均值、分位数、偏度、峰度)。这些描述符提供了关于期望分布的结构先验,有助于稳定具有截然不同动态范围(例如,转速 vs. 电压)的信号的生成。
最终上下文C通过投影并连接这些分量得到,形成一个伴随噪声输入参与整个去噪过程的条件张量。
### 3.2\. 架构
SeT-Diff的主干是一个专门的Transformer架构,处理时间依赖性(动力学)和传感器间相关性(系统拓扑)。
#### 输入投影
噪声输入X_t和上下文C被投影到一个共同的隐藏维度H。为了无缝集成上下文,我们将嵌入预置到原始时间序列之前。具体来说,统计和文本嵌入作为每个传感器的两个额外“时间步”,得到一个增广张量Z_t∈R^{(N+2)×P×H}。因此,注意力机制在处理传感器的描述和统计时,就像处理其过去值一样。
#### 因子化注意力机制
为了高效地对高维遥测数据(P≫100)中的依赖关系进行建模,我们采用了一种因子化注意力方案,在两个块之间交替:
- •**时间注意力**:独立地对每个特征计算跨N个时间步的自注意力,捕获个体时间演化。
- •**特征级注意力**:独立地对每个时间步计算跨P个特征的自注意力。这捕获了瞬时相关性(例如,功率对温度的影响),学习了系统的“交互图”。
这种模块化设计对于处理缺失数据至关重要。通过在注意力头内进行掩码,SeT-Diff忽略缺失的特征或时间步,确保生成仅基于观测到的证据。关键的是,在生成期间适当修改这些掩码位可以在SeT-Diff中实现不同的任务。
### 3.3\. 训练目标
遵循DDPM框架,我们的Transformer主干f_θ(Z_t, t)估计在时间t添加到原始数据X_0上的噪声。训练损失L_θ是估计噪声ε̂与实际噪声ε之间的距离:
L_θ = E[ ‖ε_t - f_θ(Z_t, t)‖_2^2 ]
### 3.4\. 生成与多任务推理
推理过程是迭代且随机性的。从纯高斯噪声X_T ~ N(0, I)开始,模型逐步估计要移除的噪声以达到X_0:
X_{t-1} = (1/√α_t) (X_t - (1-α_t)/(√(1-ᾱ_t)) ε̂_θ(Z_t, t) ) + σ_t z
## 4\. 多任务能力与推理策略
与专门化的架构不同,SeT-Diff作为一个统一的框架,无需重新训练。通过利用生成性逆向扩散过程,我们仅通过在推理时修改一个二值条件掩码M即可处理不同的遥测任务。形式上,推理过程以观测数据X_obs和语义上下文C为条件,迭代地对缺失部分X_miss进行采样。
### 4.1\. 插补与数据恢复
遥测数据流经常因传感器或网络瞬时故障而出现数据点缺失。我们将插补视为一个随机修复任务。掩码M_imp反映缺失值的任意模式。在逆向扩散过程中,模型通过习得的特征间相关性(例如,使用“风扇转速”和“功率负载”重建“CPU温度”)来协调未观测条目与观测条目,确保在严重数据丢失情况下也能实现连贯的日志重建。
### 4.2\. 虚拟传感(回归)
当全面的仪表化成本高昂时,操作员利用可用的代理来推断“隐藏”的物理量。我们将其视为一种特征级回归。要推断一个未监控的指标j,掩码M_reg会将所有时间步的j列置零(M_:,j = 0),而代理列保持可见。由于特征j缺乏数值历史,模型完全依赖其语义上下文(例如,“DRAM功率”)来理解要生成的物理量,并根据可见代理的动态来推断数值。
### 4.3\. 概率性预测
确定性预测器常常无法捕捉工作负载的随机性,难以用于主动式系统管理。我们将预测视为一个时间扩展任务。给定历史上下文长度L和预测范围H,掩码M_fore观测时间戳t∈[1, L]并掩蔽t∈[L+1, L+H]。通过多次运行随机去噪,SeT-Diff生成一个可能的未来分布。这种轨迹集合天然地量化了偶然不确定性,为峰值温度等关键指标提供了置信区间。
参见图注 图1. 通过动态掩码策略的统一任务推理。该图说明单个预训练的SeT-Diff如何通过在推理时修改输入掩码来解决不同的挑战:(a) 随机缺失值的插补;(b) 未来时间步的概率性预测;(c) 对整个未观测特征的虚拟传感(回归)
## 5\. 实验评估
我们在真实HPC遥测数据上验证SeT-Diff,重点关注其多任务能力、零样本排列稳定性以及语义条件化的有效性。
### 5.1\. 实验设置
#### 数据集与预处理
我们使用M100 ExaData数据集(Borghesi等人,2023 (https://arxiv.org/html/2607.22548#bib.bib1))(Marconi100 20个月的操作数据),聚合了带外(IPMI)和带内(Ganglia)指标。数据被结构化为滚动窗口(L=32),产生约40K个窗口,包含P=261个指标。我们采用按时间顺序划分以防止前瞻偏差,并使用训练集统计量对特征进行标准化。训练集中的缺失值使用均值插补;测试集中的缺口保持不变以模拟真实稀疏性。
#### 上下文与实现
传感器描述通过Sentence-BERT编码为固定嵌入E_text ∈ R^{261×384}。为便于生产部署,我们采用了一个紧凑型Transformer(1个块,H=64,8个注意力头,136.3K参数),使用T=1000个扩散步长。在单个NVIDIA A100 GPU上训练(Adam优化器,学习率=10^{-3},批次大小128)约需9小时。相似文章
SevDiff:基于严重性条件扩散的长尾冲突轨迹生成
SevDiff是一种基于严重性条件的扩散模型,用于生成具有可控碰撞时间值的车辆冲突轨迹,在用于ADAS评估的真实数据集上实现了高命中率。
面向真实世界时间序列的量子生成扩散模型
QDiffusion-TS是首个针对真实世界时间序列合成的量子生成扩散模型,它用量子神经网络替换了去噪Transformer中的前馈组件。该模型将可训练参数减少了近三个数量级,并在金融数据上将Wasserstein距离改进了44%,在下游预测任务中RMSE最高提升71%。
MMDiff: 扩展扩散变换器以实现多模态生成
MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。
ReDiTT: 面向异步时间序列的检索增强条件扩散Transformer
本文提出了 ReDiTT,一种面向异步时间序列预测的检索增强条件扩散Transformer。该模型检索结构相似的潜在序列作为参考条件,以改进长时域预测和样本多样性,在七个真实数据集上取得了最先进的性能。
DiFA:扩散模型的推理时前向过程对齐方法
提出DiFA,一种无需训练的框架,将推理时的数据预测优化重新定义为使用卡尔曼滤波的序列状态估计,显著提升了CIFAR-10和ImageNet上的生成保真度。