区域供热系统数据多变量离群值检测方法探索
摘要
本文评估了用于识别区域供热系统数据中异常运行的不同多变量离群值检测方法(Z-score、马氏距离、PCA、孤立森林和Hotelling T-squared),并提出了一种基于表现最佳方法之间一致性的集成方法。
arXiv:2608.11375v1 公告类型:新
摘要:在本文中,我们测试了在本地区域供热系统所选换热站的传输热能数据中,同时考虑外部环境温度的情况下,进行多变量离群值检测的不同方法,即Z-score(单变量,作为基准)、马氏距离、主成分分析(PCA)、孤立森林和Hotelling T-squared检验。整体研究旨在揭示异常的设备运行,更广泛的目标是识别减少集中供热厂气体消耗以及二氧化碳排放的机会。所提出的方法考虑了特定的领域情况,例如零传输能量时间点不能作为设备离网的指示。不同方法的结果与领域专家进行了讨论。结论是PCA、孤立森林和Hotelling方法提供了相关的结果。最后,我们采用集成方法(基于三种方法对检测到的离群值的一致性的选择)作为最终方法。
查看缓存全文
缓存时间: 2026/08/13 15:35
# 面向区域供热系统数据的多元异常值检测方法探索 来源:https://arxiv.org/html/2608.11375 Rajko Turudija (https://orcid.org/0000-0002-6324-5967)致谢:本研究得到塞尔维亚共和国科学基金资助,项目编号 23-SSF-PRISMA-206,“区域供热系统中可解释人工智能辅助运维 - XAI4HEAT”所属机构:机械工程学院所属机构:尼什大学所属机构:ul. Aleksandra Medvedeva 14, 18000 Niš, Serbia邮箱:[[email protected]](mailto:)Dušan Stojiljković (https://orcid.org/0000-0002-6787-4533)所属机构:机械工程学院所属机构:尼什大学所属机构:ul. Aleksandra Medvedeva 14, 18000 Niš, Serbia邮箱:[[email protected]](mailto:)Milan Zdravković (https://orcid.org/0000-0002-4141-2058)所属机构:机械工程学院所属机构:尼什大学所属机构:ul. Aleksandra Medvedeva 14, 18000 Niš, Serbia邮箱:[[email protected]](mailto:)Marko Ignjatović (https://orcid.org/0000-0001-7205-7987)所属机构:机械工程学院所属机构:尼什大学所属机构:ul. Aleksandra Medvedeva 14, 18000 Niš, Serbia邮箱:[[email protected]](mailto:) ###### 摘要 在本文中,我们测试了不同方法对本地区域供热系统选定子站中传输热能数据的多元异常检测,同时考虑了室外环境温度,即 Z-score(单变量,作为基准)、马氏距离、主成分分析(PCA)、孤立森林和 Hotelling T 平方检验。整体研究旨在发现异常的工厂运行情况,更广泛的目标是识别减少中央供暖厂燃气消耗以及 CO2 排放的机会。所提出的方法考虑了特定的领域情况,例如将零传输热能时间点视为离网工厂的指示是不相关的。不同方法的结果与领域专家进行了讨论。结论是 PCA、孤立森林和 Hotelling 方法提供了相关结果。最后,我们采用集成方法(基于三种方法对检测到的异常值的一致同意进行选择)作为最终方法。 出版说明。本预印本对应于以下论文的出版版本: R. Turudija, D. Stojiljković, M. Zdravković, and M. Ignjatović, “Towards an Approach to Multivariate Outlier Detection for District Heating System Data,” 载于 *Disruptive Information Technologies for a Smart Society*, M. Trajanović, N. Filipović, and M. Zdravković (编著), Lecture Notes in Networks and Systems, vol. 860, Springer, Cham, 2024。最终认证版本可在 https://doi.org/10.1007/978-3-031-71419-1_5 获取。 ## 1 引言 区域供热系统(DHS)工厂运行是指对主工厂和子站供应管线中的水温和水流量进行自动或半自动管理。这种控制基于 DHS 的整体需求以及当前的天气条件。通过分析每个时间段传输的能量来考虑 DHS 的总需求,该能量由回水管线上的热量计测量。通常,这种传输能量与室外环境温度相关,而室外环境温度是 DHS 工厂运行中的主要控制参数。 DHS 旨在有效地将热量分配给某个地理区域内的多栋建筑。数据中的异常,例如能源消耗的突然峰值或下降,可能表明系统中存在低效或故障。检测这些异常可以进行及时干预,以优化能源使用并最大限度地减少浪费。数据异常可以突显供暖性能的波动,这可能导致客户投诉。及时识别和纠正异常可以提高服务质量和客户满意度。在寻找传输能量之外的异常时,数据可以揭示 DHS 不同组件(如锅炉、泵和管道)性能的异常,这可能预示着即将发生的故障或维护需求。异常检测技术可用于在区域供热系统中实施预测性维护策略。通过识别设备或性能数据中的异常,可以优化维护计划,以减少停机时间并最大程度地降低成本。检测传感器数据或测量误差中的异常有助于维护用于决策和建模的数据的准确性和可靠性。 异常检测是在数据集或数据流中突出显示意外项目或事件(与常态不同)的问题。它通常用于时间序列数据,尤其是在工业中,用于故障检测。有许多不同的异常检测方法,从传统的(如统计方法、孤立森林、主成分分析等)到基于深度学习架构的高级方法(基于实例的异常检测8 (https://arxiv.org/html/2608.11375#bib.bib8)、生成对抗网络4 (https://arxiv.org/html/2608.11375#bib.bib4)、基于 LSTM 的编码器-解码器架构6 (https://arxiv.org/html/2608.11375#bib.bib6) 等)。尽管后者更加有效,但深度学习网络的黑箱特性被视为在工业系统中应用的重要缺点,因为在工业系统中,对检测到的异常进行解释对于根本原因分析和验证高影响的车间决策(如修改运行参数、设备维护等)至关重要。 在本文中,我们定义了总体研究的初始方法,用于检测本地 DHS 中与热能消耗相关的数据异常。我们的方法探索了使用传统方法进行单变量和多变量异常检测的可行性,即 z-score(单变量,作为基准)、马氏距离、主成分分析(PCA)、孤立森林和 Hotelling T 平方检验。在第 2 节中,我们详细介绍了问题并介绍了一些该领域的参考工作。在第 3 节中,描述了方法、数据集以及候选的异常检测方法。在第 4 节中,简要描述了实现过程,然后我们对结果和采用的方法进行了详细讨论。最后,在第 5 节中,给出了结论和进一步的工作。 ## 2 背景 传统的 DHS 目前由监控与数据采集(SCADA)系统管理。该系统集成了各种传感器、控制机制和综合算法,可根据传感器读数调整运行参数。DHS 的控制是完全自动化的,涵盖锅炉厂和区域供热子站两级。它还涉及实施合适的热水复位控制策略,例如室外空气复位或控制曲线,通常由带有多个控制设定点的调节曲线表示。 参考图注图 1:子站 8 示意图所选的子站方案如图 1 所示。热流体在初级和次级管线中流动,并由热交换器隔开。中央供暖厂产生热水或蒸汽作为热载体。这种高温流体将热能输送到各个用户,即子站。这是初级供应管线。在子站中,来自中央工厂的高温流体通过热交换器。该热交换器通常设计为将热量从中央流体传递到独立的闭环系统,即从初级供应管线到次级供应管线。在闭环系统中,流体通过分支被泵送到各个客户的供暖系统。该闭环防止中央供暖流体与客户的内部系统混合。在将热量传递给客户的闭环系统后,子站中流体的温度会降低。这种冷却的流体返回到子站。这是次级回水管线。在子站中,冷却的流体利用中央供暖厂的热量重新加热。子站中的热交换器促进该过程。传输的热能在位于初级回水管线上的热量计处测量。该能量与次级供应和回水管线之间的温度差以及次级管线中的流量成正比。 ### 2.1 检测 DHS 中的故障和异常 异常检测涉及识别数据中偏离预期行为的模式,通常称为离群值或异常1 (https://arxiv.org/html/2608.11375#bib.bib2)。 在数据分析中,离群观测值会显著影响结果,这强调了使用稳健统计方法(或其他方法)来识别和减轻其影响的必要性。稳健统计学侧重于通过识别最适合大多数数据的模型来检测离群值。Rousseeuw 和 Hubert11 (https://arxiv.org/html/2608.11375#bib.bib11) 对多种稳健方法和离群值检测工具进行了概述,涉及单变量、低维和高维数据。讨论涵盖了用于估计位置和散布的稳健程序,处理线性回归、主成分分析(PCA)和分类,提供了在存在离群值的情况下提高数据分析可靠性的技术的全面探索。另一方面,故障被定义为系统发生变化,使其无法正常运行并满足用户需求14 (https://arxiv.org/html/2608.11375#bib.bib14)。Neumayer 等人9 (https://arxiv.org/html/2608.11375#bib.bib9) 强调了系统故障检测与异常检测之间的区别。 Al Koussa 和 Månsson3 (https://arxiv.org/html/2608.11375#bib.bib1) 提出了两种使用能量计数据检测区域供热(DH)子站故障的方法。第一种是基于聚类的方法,比较网络中的子站以识别性能不佳的情况。第二种是基于实例的方法,使用黑箱模型预测子站行为并识别与预期性能的偏差。两种方法都证明了在检测 DH 客户设施中的偏差行为方面的有效性,为该领域的自动化故障检测提供了重大进步。这一区别强调了在识别系统行为异常时(无论是表现为异常还是故障)需要精确性。Mbiydzenyuy 和 Sundell7 (https://arxiv.org/html/2608.11375#bib.bib7) 解决了区域供热中无监督异常检测的挑战,提及了有限的标记数据和复杂的结构。他们的解决方案涉及一种算法,该算法使用层次聚类、动态时间规整、矩阵轮廓和生成对抗网络来检测与标记异常具有相似模式的异常实例。研究结果为能源分析师评估区域供热网络中的特定异常提供了一种战略方法,揭示了数据集中普遍的聚类模式。 Zhang 和 Fleyeh15 (https://arxiv.org/html/2608.11375#bib.bib15) 提出了一种新颖的混合方法用于 DHS 子站中的异常检测,承认由于各种故障而导致系统性能不佳的常见情况。所提出的方法将简化的物理模型与基于长短期记忆的变分自编码器(LSTM VAE)相结合。使用来自瑞典某匿名子站的数据集,该研究评估并比较了两种最先进模型的性能,即 LSTM 和基于长短期记忆的自编码器(LSTM AE),并与 LSTM VAE 进行了比较。结果表明,在应用最优阈值时,LSTM VAE 优于基线模型。 Seem12 (https://arxiv.org/html/2608.11375#bib.bib12) 概述了一种创新方法,通过每日能量读数和峰值消耗数据来识别建筑物中的异常能源消耗。利用离群值检测,该方法评估每日能源消耗是否显著偏离先前水平。对于表现出异常能源模式的建筑物,稳健的均值和标准差估计可量化与正常水平的偏差。这种数据分析技术有望通过检测未被注意的问题来降低成本,并节省以前用于手动故障检测的操作时间。现场测试结果证明了在各类建筑物中成功检测高能耗的能力,展示了其在识别诸如冷水机组故障、次优控制策略、通风系统设计缺陷以及配电盘更换后设备操作不当等问题上的有效性。 在旨在揭示工厂运行异常并最终确定减少中央供暖厂燃气消耗和 CO2 排放机会的更广泛研究范围内,本文是该轨迹中整体研究的第一步。本文深入探讨了各种异常检测方法,评估了它们的有效性。与领域专家合作,通过他们的专业知识阐明了已识别的异常值,最终确定了在追求优化工厂效率和环境可持续性方面进行准确异常检测的合适方法。 ## 3 方法 显然,每日运行预计会遵循特定模式。该模式包括由操作员决策引起的高峰,以及在供暖系统关闭时出现的低谷。为了避免将上述高峰检测为异常,在我们的方法中,我们对多个数据集进行异常检测,其中数据仅包括给定小时的传输能量和环境温度。例如,我们将分别分析在 7:00 和其他小时收集的所有数据。该方法用于特定小时的数据,因为传输热能存在与人工操作程序相对应的非常明显的每日季节性模式。异常检测方法将在包含以下小时的环境温度和传输热能的每日时间序列上进行测试:7、8、9、10、11、12、13、14、22、23。检测将同时考虑两个时间序列,因此将使用双变量异常检测方法。多变量异常值是指同时考虑多个变量时异常或极端的数据点。换句话说,这些是在多变量空间中属于离群值的观测值。作为参考,将对传输热能信号使用简单的统计 Z-score 方法。 ### 3.1 数据集描述 数据集包括以下相关特征: - •室外空气温度,由子站中的传感器获取(C,tsp) - •参考温度(C,trt)。参考温度是次级供应管线需要达到的目标温度。参考温度由控制曲线计算。 - •次级供应管线中的水温(C,tns) - •次级回水管线中的水温(C,tps) - •初级供应管线中的水温(C,tnp) - •初级回水管线中的水温(C,tpp) - •传输的热能(MWh,e) 数据通过合并不同数据集从本地 DHS 的 9 号子站收集。数据时间段为 2018-05-05 至 2023-05-01。通常,采用的供暖季开始时间是 10 月 1 日之后传输热能首次发生变化的时间。
相似文章
用于多变量风电场SCADA数据滤波的聚类算法
本文比较了用于过滤风电场SCADA数据以仅保留正常运行测量值的聚类算法,引入了适用于未标记数据的评估指标,并基于对三台海上风机的测试给出了建议。
多变量时间序列基准中的异常大多数是单变量的
本文介绍了一种用于多变量时间序列异常检测基准的诊断框架,发现标记的异常大多可以从单个通道检测到,这对跨通道建模的必要性提出了挑战。作者呼吁开发更多结构多样的评估数据集。
重新思考结构性异常检测:从决策边界到投影算子
本文重新思考结构性异常检测,将重点从决策边界转向低维正常数据流形上的投影算子,证明投影对齐方法优于现有的基于边界和基于重建的方法。
建模正常行为足矣:多模态信息物理系统中的异常检测联合潜在聚类
本文介绍了一种用于多模态信息物理系统异常检测的联合潜在聚类方法,将正常行为建模为潜在空间中的高斯混合模型,并提出了一个公平的评估协议。在三个真实世界的CPS数据集上,该方法取得了最先进的成果,尤其是在困难子集上表现优异。
D2H-AD:一种利用超维计算的高级异常检测混合模型
D2H-AD是一种新颖的异常检测框架,采用超维计算(HDC),结合了基于距离和密度感知的编码。它在多个基准测试中优于五种基线方法,为边缘AI和物联网提供轻量级、可解释且高效的性能。