SEDR-Seq2P:用于多任务工业非侵入式负荷监测的轻量级膨胀残差序列到点网络
摘要
本文提出了SEDR-Seq2P,一种用于多任务工业非侵入式负荷监测(NILM)的轻量级膨胀残差序列到点网络,与WaveNet相比,该网络实现了更高的精度,并将推理延迟降低了58%。
arXiv:2607.28693v1 公告类型:新
摘要:工业非侵入式负荷监测(NILM)仍然具有挑战性,因为测量噪声和广泛的并发机器运行降低了针对住宅数据调优模型的泛化能力。本工作采用一对多、多任务分解设置,即单个网络从聚合功率估计多个工业机器负荷。在IMDELD上的统一评估协议下,我们使用能量估计指标和精度-延迟准则对Seq2Seq、Seq2SubSeq、Seq2Point、GRU和WaveNet进行基准测试。虽然Seq2Point比Seq2Seq/Seq2SubSeq提供了更强的精度-延迟平衡,但GRU和WaveNet以显著更高的计算成本实现了更高的精度。为了弥补这一差距,我们提出了SEDR-Seq2P,一种轻量级的Seq2Point扩展,具有膨胀残差块和压缩-激励注意力。与Seq2Point基线相比,SEDR-Seq2P的MAE降低了约7%,决定系数提高了约1%,匹配率提高了约0.8%。此外,与WaveNet相比,SEDR-Seq2P的推理延迟降低了约58%,为可扩展的工业部署提供了有利的精度-延迟权衡。
查看缓存全文
缓存时间: 2026/08/03 07:31
###### 摘要
工业非侵入式负荷监测(NILM)仍然具有挑战性,因为测量噪声和广泛的并发机器运行会降低在住宅数据上调优的模型的泛化能力。本文采用一对多、多任务分解设置,由单个网络从总功率中估计多个工业机器负荷。在IMDELD上的统一评估协议下,我们使用能量估计指标和精度–延迟准则对Seq2Seq、Seq2SubSeq、Seq2Point、GRU和WaveNet进行基准测试。虽然Seq2Point比Seq2Seq/Seq2SubSeq提供了更强的精度–延迟平衡,但GRU和WaveNet以明显更高的计算成本实现了更高的精度。为缩小这一差距,我们提出SEDR\-Seq2P,一种轻量级Seq2Point扩展,带有扩展残差块和压缩\-激励注意力。相对于Seq2Point基线,SEDR\-Seq2P将MAE降低约7%,决定系数提高约1%,匹配率提高约0.8%。此外,与WaveNet相比,SEDR\-Seq2P将推理延迟降低约58%,为可扩展的工业部署提供了有利的精度–延迟权衡。
††publicationid:pubid:979\-8\-3195\-1058\-7/26/$31\.00 ©2026 IEEE
关键词——非侵入式负荷监测,多任务分解,一对多学习,精度–延迟,IMDELD,工业部署。
## I 引言
电器负荷监测(ALM)能够对工业设备中的能耗进行细粒度分析,在工业4.0框架内支持运营效率、能源优化和预测性维护。传感技术和基于AI的分析的最新进展,通过识别高耗能机器和实施明智的负荷管理策略,提高了工业ALM的准确性和可扩展性。电器级监测可通过侵入式负荷监测(ILM)或非侵入式负荷监测(NILM)实现[1 (https://arxiv.org/html/2607.28693#bib.bib1)];然而,ILM依赖于每台设备专用的传感器,导致安装和维护成本高,限制了其在大规模工业部署中的适用性。NILM是指一类信号处理和机器学习技术,从建筑物配电系统中有限数量的测量点(通常在总线上)采集的总功率测量值中估计电器级用电量。通过仅依赖总测量值,NILM无需在各电器处安装专用传感器即可实现整栋建筑的负荷分解。尽管NILM研究可追溯到1985年[2 (https://arxiv.org/html/2607.28693#bib.bib2)],但大多数分解方法主要在住宅基准上评估[3 (https://arxiv.org/html/2607.28693#bib.bib3)],这主要是因为公开可用的工业数据集稀缺。然而,先前研究[3 (https://arxiv.org/html/2607.28693#bib.bib3)]表明,强劲的住宅性能不一定能推广到工业环境;工业环境在运行特性上有根本差异,包括轮班制生产计划、在苛刻且噪声更大的条件下运行的各种复杂机械,以及违反常见住宅NILM假设的高并发机器运行水平[4 (https://arxiv.org/html/2607.28693#bib.bib4)]。因此,常用于住宅NILM的“单设备运行”模型通常在工业场景中不适用,因为多设备同时运行是常态。工业环境中的能量分解本质上不可辨识,可表述为单通道盲源分离问题[5 (https://arxiv.org/html/2607.28693#bib.bib5)]。在此设置下,必须从单个总功率信号中,在噪声、重叠的用电模式以及频繁的并发运行条件下推断多个负荷。因此,纯确定性NILM模型(如组合优化、确定性HMM、线性回归、非负矩阵分解和基于规则的方法)只能产生一个固定的解,无法表示工业分解任务的内在歧义[6 (https://arxiv.org/html/2607.28693#bib.bib6)]。为解决这一问题,序列到序列(Seq2Seq)学习被提出,通过将总功率序列映射到电器级序列来建模单通道负荷分解[7 (https://arxiv.org/html/2607.28693#bib.bib7)]。然而,长输入输出序列会带来高计算成本并可能阻碍收敛。序列到点(Seq2Point)学习[6 (https://arxiv.org/html/2607.28693#bib.bib6)]通过仅预测输出窗口的中点缓解了这些限制,在降低训练复杂度的同时保留时间上下文。序列到子序列(Seq2SubSeq)[8 (https://arxiv.org/html/2607.28693#bib.bib8)]代表了Seq2Seq与Seq2Point之间的一种中间学习范式,旨在平衡NILM中的时间上下文和预测效率。它将一个总功率输入窗口映射到一个较短且通常居中的电器级功率子序列。与Seq2Seq相比,Seq2SubSeq减少了冗余预测和边缘平滑效应,同时比仅预测单时间步的Seq2Point保留了更多的局部时间结构。
本文采用一对多的工业NILM设置,而不是为每个设备单独训练模型。这种多任务公式更匹配工业并发运行,并降低部署开销。本文的主要贡献有四个方面:
- •多任务工业NILM:我们采用一对多设置,由一个共享模型同时从总功率中分解所有机器负荷,匹配工业现场并发运行的特点。
- •统一基准测试与评估:我们在相同的预处理和训练条件下,在IMDELD数据集上对Seq2Seq、Seq2SubSeq、Seq2Point、GRU和WaveNet进行基准测试,报告能量估计(EE)指标,即平均绝对误差(MAE)、归一化分解误差(NDE)、信号聚合误差(SAE)、决定系数\(R^\{2\}\),以及通过匹配率(MR)衡量的事件级时间对齐。
- •精度–延迟评估:为联合评估预测质量和计算效率,我们采用源自调整比率比(ARR)框架的精度–延迟准则(AccD)[9 (https://arxiv.org/html/2607.28693#bib.bib9)]。本文使用MR作为精度项,并使用实测测试时间推理时长作为延迟项。
- •提出的轻量级扩展残差Seq2Point架构:我们引入SEDR\-Seq2P,一种结构增强的Seq2Point模型,整合了扩展残差块和压缩\-激励通道注意力,并置于多任务一对多框架中,旨在提高时序建模能力而不牺牲推理效率。
EE指标独立于计算成本评估分解精度,而AccD指标捕捉精度与计算时间之间的权衡。因此,AccD是对EE指标的补充而非替代,因为实际的工业NILM部署需要在预测性能与计算效率之间取得平衡。本文使用AccD参数,将训练和推理时间与精度联合评估,以衡量模型的整体效率。首先,我们报告所有模型每个epoch的训练时间和测试集上的总推理时间。然后,我们基于MR使用AccD指标结合预测精度和计算性能。
## II NILM基准模型
本文评估以下基于学习的NILM模型:
- •Seq2Point[6 (https://arxiv.org/html/2607.28693#bib.bib6)]:将总功率的固定长度窗口映射到窗口中心处单个电器功率估计,这限制了冗余重叠预测,通常降低推理成本。
- •Seq2Seq[7 (https://arxiv.org/html/2607.28693#bib.bib7)]:学习从总输入窗口到完整电器级输出窗口的端到端映射,保留时间结构,但由于密集、重叠的序列预测而增加计算量。
- •Seq2SubSeq[8 (https://arxiv.org/html/2607.28693#bib.bib8)]:从每个输入窗口预测电器信号的短居中段,在时间细节和预测效率之间提供中间权衡。
- •门控循环单元网络(GRU)[10 (https://arxiv.org/html/2607.28693#bib.bib10)]:使用循环门控对电器运行中的长期时间依赖进行建模,可改善对长时间且可变的工业周期的跟踪,但通常增加运行时间。
- •WaveNet风格的时间卷积网络[11 (https://arxiv.org/html/2607.28693#bib.bib11),12 (https://arxiv.org/html/2607.28693#bib.bib12)]:使用堆叠的扩展卷积(通常带有残差连接)有效扩展感受野,同时捕捉尖锐的开关事件和持续运行的平稳段。
在第二步中,受所评估模型比较性能的启发(TableII (https://arxiv.org/html/2607.28693#S4.T2)),我们引入一种Seq2Point架构,结合残差块[13 (https://arxiv.org/html/2607.28693#bib.bib13)]和扩展卷积层[14 (https://arxiv.org/html/2607.28693#bib.bib14)],以更好地捕捉长期时间依赖。此外,还集成了压缩\-激励通道注意力[15 (https://arxiv.org/html/2607.28693#bib.bib15)],以增强最具信息量的特征通道的表示,如图1 (https://arxiv.org/html/2607.28693#S2.F1)所示。所得架构称为SEDR\-Seq2P。
参见说明图1:所提出模型的总体架构。FC表示全连接层。
## III 实验设置
### III\-A IMDELD数据集
IMDELD(工业机器负荷分解数据集)[16 (https://arxiv.org/html/2607.28693#bib.bib16)]是一个公开可用的工业数据集,使用十一个GreenAnt能量表(一个现场总表和十个用于真值监测的表)采集。每个表内部以8 kS/s采样,并提供1 Hz降采样时间序列,我们直接使用而不进一步重采样。数据集涵盖八台机器:双极接触器(DPCI、DPCII)、排风扇(EFI、EFII)、铣床(MMI、MMII)和造粒机(PI、PII)。数据集提供RMS电压、电流、有功、无功和视在功率,以及有功电能测量值,所有输入均使用在训练集上计算的z\-score统计量[17 (https://arxiv.org/html/2607.28693#bib.bib17)]进行归一化。我们使用Pearson、Kendall和Spearman系数[18 (https://arxiv.org/html/2607.28693#bib.bib18)]进行了特征相关性分析,结果表明RMS电压、RMS电流、无功功率和视在功率与有功功率高度相关;因此,仅使用有功功率作为输入特征。
数据集涵盖111天;但最后3天因缺少电器级测量值而被排除。在剩余数据中,7天用于验证,1天用于测试,每台电器得到691,072个测试样本,其余数据用于训练。
### III\-B 超参数
所有深度学习模型均使用Adam优化器和MAE损失函数训练。超参数通过随机搜索优化,每个模型从预定义网格中采样20次试验。训练最多30个epoch,批大小为128,使用基于验证性能的早停(耐心为5个epoch),并使用ReduceLROnPlateau调度器在训练过程中调整学习率。
表I:IMDELD上序列模型的选定超参数
由于所提出的多任务框架需要所有电器共用一个窗口大小,我们为所有序列模型采用统一的输入窗口长度155个样本。该长度设置为[19 (https://arxiv.org/html/2607.28693#bib.bib19)]中报告的电器特定最优窗口大小的平均值,该值是在单任务设置中使用LightGBM获得的。对于序列到子序列架构,输出子序列长度固定为75个样本。通过随机搜索选择的序列模型超参数总结在表I (https://arxiv.org/html/2607.28693#S3.T1)中。
尽管GRU和WaveNet模型使用相同的训练设置进行调优,但由于架构差异,它们未在表中列出。性能最佳的GRU配置使用32个循环单元,后接两个分别有128和64个单元的全连接层,dropout率为0.2。性能最佳的WaveNet配置使用三个卷积层,分别有64、128和256个滤波器(核大小为5),两个残差块,每块含四个扩展卷积层,dropout率为0.3,学习率为0.001。
SEDR\-Seq2P模型使用一个初始Conv1D层(32个滤波器),后接三个残差块,分别有32、128和256个滤波器;最后两个块的扩展率分别为2和4。我们使用核大小3、压缩\-激励缩减比0.25、dropout率0.3,以及一个具有256和64个单元的稠密头,学习率为\(10^\{\-3\}\)。
所有实验均在NVIDIA GeForce RTX 3070 Laptop GPU(8 GB内存)上进行。
### III\-C 性能评估
对于性能评估,我们采用五个互补的EE指标[20 (https://arxiv.org/html/2607.28693#bib.bib20)]:MAE,衡量预测与真值功率之间的平均绝对偏差;NDE,量化单电器估计精度;SAE,评估总估计能量的一致性;\(R^\{2\}\),捕捉趋势和幅度的一致性;MR,评估预测与真值激活之间的时间对齐。我们强调MR,因为它捕捉激活时间和重叠,这在频繁并发运行和复杂时间动态的工业NILM中至关重要。
此外,采用精度–延迟(AccD)效率得分[9 (https://arxiv.org/html/2607.28693#bib.bib9)],在多电器设置中联合评估分解精度和计算效率。在我们的实验中,匹配率(MR)被用作成功率项,因为它直接量化电器运行间隔的正确检测,并且有界于\([0,1]\),便于在各电器间进行一致聚合。因此,我们为多电器评估定义如下\(\mathrm\{AccD\}\_\{\mathrm\{MR\}\}\):
\(\mathrm\{AccD\}\_\{\mathrm\{MR\}\}=\frac\{1\}\{T\}\cdot\frac\{1\}\{|\mathcal\{A\}|\}\sum_\{i\in\mathcal\{A\}\}\mathrm\{MR\}_\{i\},\) (1)
其中\(\mathcal\{A\}\)表示电器集合,\(\mathrm\{MR\}_\{i\}\)是电器\(i\)的匹配率,\(T\)是在相同硬件条件下对测试数据集测得的总推理时间。该公式通过联合考虑时间精度和推理延迟,为评估可部署性提供了一个相对准则。
## IV 实验结果
表II:各模型的能量估计性能比较
### IV\-A EE性能
表II (https://arxiv.org/html/2607.28693#S4.T2)表明,分解相似文章
封闭-开放工业检测场景的统一:新的大规模基准、挑战与基线
介绍了MMIOC-1M,一个用于工业缺陷检测的大规模多模态基准,并提出了RTVPNet,一种精细的文本-视觉提示网络,实现了最先进的性能。
新本地模型在PII移除上达到接近前沿性能,仅需9毫秒CPU推理
介绍了ScreenLeak基准,用于衡量计算机使用AI数据中的PII编辑,并提出了两个本地模型(用于文本的v45_phase3和用于图像的rfdetr_v8),在低延迟下实现了接近前沿的性能。
LiNO: 基于提升的多分辨率神经算子
本文介绍了 LiNO,一种使用基于提升的多分辨率分解来学习偏微分方程解算子的神经算子。它在包括达西流、泊松方程和纳维-斯托克斯方程在内的基准测试中表现出色,能够同时捕捉全局动态和精细尺度结构。
低延迟激活正则化稀疏神经算子与蒸馏辅助实现的实时边缘部署虚拟感知
本文提出了一种Sparse-Activation-ReLU (SAR)层,用于低延迟、高能效的虚拟感知,在延迟-误差-能效指标上实现了显著提升,并通过合成知识蒸馏降低了误差。
M^{2}SNet:多尺度内多尺度减法网络用于医学图像分割
本文提出了M2SNet,一种用于医学图像分割的多尺度内多尺度减法网络。它利用减法运算捕获编码器各层之间的差异特征,提高了病灶定位的准确性和边缘的清晰度。在涵盖四种医学成像模态的十一个数据集上,该方法取得了最先进的性能。