用于多变量风电场SCADA数据滤波的聚类算法
摘要
本文比较了用于过滤风电场SCADA数据以仅保留正常运行测量值的聚类算法,引入了适用于未标记数据的评估指标,并基于对三台海上风机的测试给出了建议。
arXiv:2607.13544v1 公告类型:新
摘要:在风电场运行期间,监控与数据采集(SCADA)系统记录了大量异常、瞬态和特定运行模式,导致数据集庞大。然而,对于广泛的应用场景,仅需要对应于正常运行状态的测量值,因此必须对SCADA数据进行滤波。为此,已提出多种方法来自动化并替代专家通过目视检查进行的手动滤波。本文比较了多种聚类算法与手动滤波的滤波精度,引入了适用于未标记数据且在不同应用中鲁棒的评估指标。基于结果,我们提出了将模型校准推广到不同数据集的建议,并讨论了各模型的潜在用例。模型应用于现有海上风电场三台风机的SCADA数据,使用了多个数据通道的10分钟统计数据。除了通常记录的异常和运行模式外,数据集还因多次现场测试而包含大量不明显异常值。总体而言,结果强调了将分析扩展到功率曲线之外的重要性,无论是在特征选择还是评估指标的设计方面。在大多数情况下,基于聚类的方法能够检测到明显和细微的异常值,且精度高于手动滤波。然而,准确性和保留的数据量因模型而异,专家参与仍是必要的,但程度较手动滤波有所降低。
查看缓存全文
缓存时间: 2026/07/16 04:22
# 用于多变量风电场SCADA数据过滤的聚类算法 来源:https://arxiv.org/html/2607.13544 ###### 摘要 在风电场运行期间,监控与数据采集(SCADA)系统记录了大量的异常事件、瞬态过程和特定运行模式,导致数据集规模庞大。然而,对于广泛的应用而言,只需要对应于正常运行状态的测量数据,因此必须对SCADA数据进行过滤。为此,已有多种方法被提出,旨在实现数据过滤的自动化,替代专家通过目视检查数据来进行的人工过滤。在本文中,我们比较了多种聚类算法与人工过滤的过滤精度,并引入了适用于无标签数据且在不同潜在应用中具有鲁棒性的评估指标。基于结果,我们为将模型校准推广到不同数据集提供了建议,并讨论了每个模型的潜在应用场景。这些模型应用于一个现役海上风电场的三台机组的SCADA数据,使用了多个数据通道的10分钟统计量。除了通常记录的异常和运行模式外,该数据集由于多次现场测试还包含了大量不明显的异常值。总体而言,结果强调了将分析扩展到功率曲线之外的重要性,无论是在特征选择方面,还是在评估指标的设计方面。在大多数情况下,基于聚类的方法能够检测到明显和微妙的异常值,实现了比人工过滤更高的精度。然而,精度和保留的数据量因模型而异,专家的参与仍然必要,尽管其程度相比人工过滤有所降低。 ###### 关键词: 异常检测,功率曲线,风力发电机监测,无监督学习,数据预处理,正常运行行为建模 ## 1. 引言 在其运行寿命期间,风电场暴露于各种非稳态大气条件下,这些条件在风力发电机(WT)之间可能存在显著差异,例如由于尾流效应或场址风资源的异质性空间分布。此外,风力发电机经历不同的运行模式和瞬态过程,例如空转、启动/停机以及功率限制。所有这些不仅影响每台单机的功率性能,也影响其各自的结构载荷和运行寿命。因此,持续监测、分析和控制每台风力发电机的运行至关重要。这是通过使用监控与数据采集(SCADA)系统来完成的,该系统收集广泛的数据通道,包括与天气相关的变量,如当地风速和风向、室外温度,以及运行参数,例如发电功率、桨叶桨距角、转子转速,以及根据所安装传感器而定的其他数据。SCADA系统通常存储和传输10分钟平均数据,尽管实际测量是以更高的采样频率收集的[1 (https://arxiv.org/html/2607.13544#bib.bib1)],从而产生大量的数据。这些数据可用于广泛的应用,包括但不限于故障检测、基于状态的预测性维护、北向校准、功率曲线建模、正常运行行为建模、功率预测以及尾流模型参数校准。 然而,许多这些应用所需的输入数据应专门对应于最大功率点跟踪(MPPT)状态,为清晰起见,下文简称为正常运行。例如,基于包含空转或功率限制时段数据的SCADA数据进行功率曲线建模,将导致对功率性能的低估。这同样适用于训练功率预测模型。然而,在实践中,SCADA系统记录了大量的异常值、异常事件、瞬态过程和偏离正常运行的特定运行模式,通常没有相应的标签或标记。过滤这些数据的传统方法依赖于由专业专家进行的深入数据分析,他们定义了一套针对特定机组的基于规则的过滤器,例如,移除低于额定风速时负功率值和偏离小桨距角的桨距角。然而,这样的过程耗时且资源密集,特别是对于大规模风电场而言。 近年来,已有几项研究探索了不同的方法,以促进、改进和提高风电场SCADA数据过滤的自动化水平。这些方法可分为三大类[2 (https://arxiv.org/html/2607.13544#bib.bib2),3 (https://arxiv.org/html/2607.13544#bib.bib3)]:i) 统计方法,ii) 基于图像的方法,以及 iii) 机器学习(ML)方法,其中第一类和最后一类常常结合使用。第一类方法包括基于一个或多个数据信号的统计分布应用过滤器。例如,四分位距(IQR)常用于过滤掉功率曲线第一和第三四分位数之外的数据点[4 (https://arxiv.org/html/2607.13544#bib.bib4),5 (https://arxiv.org/html/2607.13544#bib.bib5),6 (https://arxiv.org/html/2607.13544#bib.bib6)],而马氏距离的工作原理类似,但考虑了变量之间的协方差[3 (https://arxiv.org/html/2607.13544#bib.bib3),7 (https://arxiv.org/html/2607.13544#bib.bib7)]。这些方法的一个主要局限性是,过滤阈值必须适应数据的分布范围,而这又取决于所考虑场址的湍流特性[8 (https://arxiv.org/html/2607.13544#bib.bib8)],并且高浓度的异常值会显著扭曲统计分布。第二类方法,即图像处理技术,也已被研究。Long等人[9 (https://arxiv.org/html/2607.13544#bib.bib9)]将数学形态学操作应用于功率曲线的二值图像,实现了比其他统计和机器学习方法更高的异常数据删除率。类似地,Wang等人[10 (https://arxiv.org/html/2607.13544#bib.bib10)]基于功率曲线图像的像素空间分布过滤数据,在精度和计算时间上均优于[9 (https://arxiv.org/html/2607.13544#bib.bib9)]的算法。然而,基于图像的方法主要应用于功率曲线,忽略了功率对环境条件和运行参数的多变量依赖性[11 (https://arxiv.org/html/2607.13544#bib.bib11)]。第三类,机器学习算法,可用于捕捉SCADA数据信号之间的潜在相关性。大多数研究集中在聚类算法上,该算法适用于SCADA系统通常生成的无标签数据。Zhao等人[4 (https://arxiv.org/html/2607.13544#bib.bib4)]和Wang等人[2 (https://arxiv.org/html/2607.13544#bib.bib2)]提出了基于具有噪声的基于密度的空间聚类(DBSCAN)的方法,用于在应用IQR过滤以剔除稀疏异常值后,消除功率曲线上对应于功率限制的堆积异常值。然而,这些研究仅使用了10分钟平均功率和本地风速作为输入。Kijanowski等人[3 (https://arxiv.org/html/2607.13544#bib.bib3)]将K-Means++聚类(用于划分功率曲线)与马氏距离相结合进行异常值剔除,取得了与DBSCAN相似的性能。Morrison等人[12 (https://arxiv.org/html/2607.13544#bib.bib12)]引入了额外的输入,包括桨叶桨距角和温度的平均值,并比较了几种基于统计和机器学习的模型在检测稀疏异常值、功率限制和空转时段方面的准确性。高斯混合模型(GMM)被证明是最有效的方法,特别是在手动过滤掉最明显的异常之后。然而,不同模型的输出并未与彻底的人工过滤进行比较。 尽管文献中已经提出并比较了多种算法和方法,但对于哪种方法最适合过滤SCADA数据尚无共识。部分原因是所使用的评估指标的异质性,这阻碍了有意义且可靠的比较。一些研究提出了通用指标,例如轮廓系数和斯皮尔曼相关性[2 (https://arxiv.org/html/2607.13544#bib.bib2),13 (https://arxiv.org/html/2607.13544#bib.bib13)]。另一些研究比较了在原始数据和过滤数据上训练的回归模型的功率预测精度[14 (https://arxiv.org/html/2607.13544#bib.bib14),15 (https://arxiv.org/html/2607.13544#bib.bib15)]。虽然这些指标可以应用于无标签数据,但它们要么过于通用,仅评估聚类质量,要么针对特定应用(例如功率预测)量身定制。这限制了它们对其他应用(例如正常运行行为建模和结构载荷预测)的相关性。少数研究引入了针对功率曲线的指标,例如[4 (https://arxiv.org/html/2607.13544#bib.bib4)]中的功率曲线建模误差,以及[12 (https://arxiv.org/html/2607.13544#bib.bib12)]中的风速四分位距变化,同时结合剔除率,该指标指示模型过滤掉了多少数据。本工作建立在这些评估指标的基础上,将范围扩大到其他运行曲线,以更好地处理SCADA数据的多变量性质及其广泛的应用范围。 除此之外,文献通常侧重于比较过滤方法,而没有评估其相对于人工过滤方法的准确性,也没有讨论替代它们所面临的挑战和影响。此外,所分析研究中的SCADA数据大多呈现可见的异常和异常值,这些异常值可以通过功率曲线的目视检查检测到,例如空转时段、功率限制和稀疏异常值。这简化了过滤方法的任务,并且可能无法反映其在复杂数据集上的准确性。 在本研究中,我们将多个聚类算法的过滤输出与通过目视检查进行的人工过滤(在第2.2节 (https://arxiv.org/html/2607.13544#S2.SS2)中描述)进行比较。具体而言,研究将重点放在GMM、DBSCAN和层次化DBSCAN (HDBSCAN)上,这些算法已被证明对此目的有效。HDBSCAN在不同应用中显示出比DBSCAN更高的精度,例如[16 (https://arxiv.org/html/2607.13544#bib.bib16)],但据作者所知,它尚未用于风电场的SCADA数据过滤。这些算法应用于一个现役风电场的SCADA数据,该风电场经历了多次风电场流动控制实验和其他现场测试[17 (https://arxiv.org/html/2607.13544#bib.bib17)],导致产生了大量数据,这些数据通常不易通过视觉检查检测到。最后,受近期鼓励分析超出常用功率和风速平均信号范围的工作[11 (https://arxiv.org/html/2607.13544#bib.bib11),12 (https://arxiv.org/html/2607.13544#bib.bib12)]的启发,研究将广泛的SCADA通道作为输入特征进行考察,包括多个10分钟统计量,例如最大值、最小值和标准差。 总而言之,本研究的贡献如下: - 基于一个以微妙且具有挑战性的偏离正常运行数据为特征的案例研究,将多种基于聚类的SCADA数据过滤方法与通过目视检查进行的人工过滤进行基准测试; - 为无标签数据定义针对风力发电机运行曲线的鲁棒评估指标,可重复用于不同应用; - 将HDBSCAN应用于风电场SCADA数据过滤。 研究中使用的数据,以及执行人工(基线)和基于聚类的过滤的方法,将在第2节 (https://arxiv.org/html/2607.13544#S2)中介绍。第3节 (https://arxiv.org/html/2607.13544#S3)描述了用于比较不同过滤方法性能的评估指标。结果在第4节 (https://arxiv.org/html/2607.13544#S4)中展示和讨论,重点关注模型比较、潜在应用和研究的局限性。最后,第5节 (https://arxiv.org/html/2607.13544#S5)对本文进行总结。 ## 2. 方法论 工作流程的概览如图1 (https://arxiv.org/html/2607.13544#S2.F1)所示,突显了不同过滤方法之间的差异。对于人工过滤,对每台风力发电机的原始数据进行分析和目视检查,以定义基于阈值的过滤器,具体在第2.2节 (https://arxiv.org/html/2607.13544#S2.SS2)中详细描述。对于基于聚类的过滤,数据在进行预处理(例如标准化)后,应用聚类算法,该算法将把数据分类为不同的点群,即簇。然后,需要最后一步来选择一个或多个对应于风力发电机正常运行的簇,如第2.3节 (https://arxiv.org/html/2607.13544#S2.SS3)中进一步详述。最后,使用第3节 (https://arxiv.org/html/2607.13544#S3)中定义的指标,对采用不同算法的基线过滤和基于聚类的过滤的准确性进行评估和比较。 参阅图注图 1:人工过滤(基线)和基于聚类的过滤的工作流程。平行四边形代表输入/输出数据,而圆角矩形表示处理步骤。### 2.1 风电场数据 可用数据包括在瑞典南部厄勒海峡海上Lillgrund风电场收集的SCADA测量的10分钟平均统计量,该风电场由48台SWT-2.3-93型风力发电机组成,总装机容量为110.4 MW。该数据集包含多个通道,包括有功功率、机舱风速计测得的风速、机舱朝向、桨叶桨距角和发电机转速。然而,它不包含任何指示风力发电机是否在正常发电运行模式下运行的标记。已应用北向校准,使用FLASC[18 (https://arxiv.org/html/2607.13544#bib.bib18)](一个用于支持SCADA数据过滤和分析的开源工具)来纠正机舱朝向信号。所有风力发电机可用通道的概览列于表1 (https://arxiv.org/html/2607.13544#S2.T1)。 表 1:研究中可用的SCADA数据通道。X 表示可用,N/A 表示该统计量对于给定变量不适用。 数据涵盖了数台风力发电机超过3年的运行记录,时间在2019年至2022年之间,在此期间风电场经历了多次现场测试。这包括,例如,尾流偏转测试活动,其中对部分风力发电机施加了顺时针和逆时针偏航偏差[19 (https://arxiv.org/html/2607.13544#bib.bib19)],以及轴向感应控制测试活动,其特征在于对特定风力发电机排和风向扇区在基本控制和下调控制之间进行切换测试[17 (https://arxiv.org/html/2607.13544#bib.bib17)]。这些实验用大量数据点丰富了数据集,这些数据点虽然不代表风力发电机的正常运行,但难以检测,如第2.2节 (https://arxiv.org/html/2607.13544#S2.SS2)中进一步解释的那样。 为了限制需要处理和手动过滤的数据集数量,选择3台风力发电机的子集作为数据过滤的主要样本,如图2 (https://arxiv.org/html/2607.13544#
相似文章
区域供热系统数据多变量离群值检测方法探索
本文评估了用于识别区域供热系统数据中异常运行的不同多变量离群值检测方法(Z-score、马氏距离、PCA、孤立森林和Hotelling T-squared),并提出了一种基于表现最佳方法之间一致性的集成方法。
STCAD: Scalable Trajectory Clustering and Anomaly Detection on Terabyte-Scale AIS Data
Presents STCAD, a scalable framework using BERT-based encoding and CURE clustering to perform trajectory clustering and anomaly detection on terabyte-scale AIS maritime data, demonstrating stable clusters and clear separation of anomalous vessel behavior.
风功率预测中当前架构的系统评估
本文系统综述了区间风速预测的混合方法,结合深度学习、模态分解和统计方法以提高预测精度和可靠性。
基于聚类的物联网系统集体异常检测:图神经网络方法
本文提出了UGCAD,一个使用变分图自编码器和聚类来检测物联网网络流量中集体异常的无监督框架,基准数据集上的实验展示了其有效性。
基于最优传输的海上风电场布局置换不变贝叶斯优化
本文提出了一种基于最优传输的置换不变贝叶斯优化方法,用于优化海上风电场布局。与标准贝叶斯优化相比,该方法将计算时间减少一半,并生成更优的布局。