XGBoost“即一切”:区域供热系统中传输热能预测的案例研究
摘要
该预印本比较了XGBoost和LSTM在区域供热系统传输热能预测中的表现,发现XGBoost在持续优于LSTM的同时,还提供了更低的计算成本和环境影响。
arXiv:2608.11446v1 公告类型:新
摘要:本文对两种不同方法——XGBoost和长短期记忆网络(LSTM)——在区域供热系统(DHS)传输热能预测中的表现进行了比较研究。目的是探索在时间序列预测中,传统机器学习算法相对于深度学习网络表现更优的场景,以及由此带来的计算成本和环境影响方面的优势。研究聚焦于一个真实的DHS数据集。通过实验和分析表明,在此特定预测任务中,XGBoost始终优于LSTM。这一差异可由误差分布解释:LSTM在数据可用性较低的区间会产生更显著的误差。传统机器学习方法降低的计算需求不仅节省了成本,还最小化了能源系统数据分析任务相关的碳足迹。
查看缓存全文
缓存时间: 2026/08/13 15:36
# XGBoost“就是一切”:区域供热系统中传输热能预测的案例 来源:https://arxiv.org/html/2608.11446 Milan Zdravković (https://orcid.org/0000-0002-4141-2058)致谢:本研究得到塞尔维亚共和国科学基金资助,资助编号:23-SSF-PRISMA-206,项目:区域供热系统中可解释AI辅助运行 - XAI4HEAT所属机构:机械工程学院所属机构:尼什大学所属机构:塞尔维亚尼什 Aleksandra Medvedeva 14号, 18000邮箱:[[email protected]](mailto:) ###### 摘要 本文对两种不同方法——XGBoost和长短期记忆网络(LSTM)——在区域供热系统(DHS)中传输热能预测方面进行了比较研究。其目标是探索在时间序列预测中传统机器学习算法相对于深度学习网络表现更优的场景,以及由此在计算成本和环境影响方面带来的益处。本研究聚焦于一个真实的DHS数据集。通过实验和分析,证明XGBoost在此特定预测任务中始终优于LSTM。误差分布解释了这一差异,表明LSTM在数据可用性较低的区间会犯更显著的错误。传统机器学习方法降低的计算需求不仅节省了成本,还最大限度地减少了能源系统数据分析任务的碳足迹。 出版说明。本预印本对应于以下正式发表的论文: Zdravković, M. (2024). XGBoost “is All You Need”: the Case of Forecasting Transmitted Heat Energy in District Heating Systems. In: Trajanović, M., Filipović, N., Zdravković, M. (eds) Disruptive Information Technologies for a Smart Society. ICIST 2024. Lecture Notes in Networks and Systems, vol 860. Springer, Cham. 最终审定版本可在 https://doi.org/10.1007/978-3-031-71419-1_2 获取。 ## 1 引言 如今,开箱即用的深度学习算法和架构极度流行且易于获取,这在各行各业中引发了对于快速解决不同自动化挑战的兴奋和极高期望。简单易用与已在语言处理和计算机视觉等案例中得到验证的性能相结合,推动了这些技术在各领域的应用激增。这些领域包括医疗、金融、汽车等,它们被用于疾病检测、财务预测、自动驾驶和客户服务自动化等任务。然而,这种热情必须与对相关复杂性的认识相平衡。成功的实施往往需要大量高质量数据,以及针对特定需求解释和微调模型的能力。此外,算法偏见、透明度和伦理考量等问题也构成了额外挑战。现实情况是,虽然深度学习提供了强大的工具,但其有效应用需要更多的数据、更多的谨慎和更多的专业知识。很多时候,深度学习架构在没有仔细考虑的情况下被快速测试和应用,并带有由AI炒作驱动的偏见。这种仓促采用往往导致忽视算法适用性、数据质量和计算需求等关键方面。其结果是系统要么表现不佳,要么消耗过多能量,从而抵消了使用AI的益处。这种情况凸显了以更审慎的方式实施机器学习解决方案的重要性,这种方式需要彻底的测试、对环境影响的考虑以及对特定问题背景的理解。此外,它还强调组织需要投资于建立或获取必要的专业知识,以有效且可持续地利用AI技术的全部潜力。 本文背后的研究目标是证明在处理某些时间序列预测问题时,传统机器学习算法确实能与复杂的神经网络算法相竞争。这将通过在区域供热系统中传输热能预测的示例来展示。 尽管区域供热系统(DHS)已相当成熟,但在提高其运行效率方面仍存在大量机会。这尤其涉及降低燃料消耗成本和最小化碳排放。一个有前景的策略是利用重新设计DHS当前短期和长期运营策略的巨大潜力。这可以通过利用精确的热需求预测来实现。此类预测对于优化热力生产至关重要,可降低燃料消耗、浪费和CO2排放。此外,这种方法还能确保消费者满意度最大化,并有助于更有效地规划短期和长期热力生产。预测问题和方法将在第2节中描述。第3节介绍并描述了两种竞争性方法,并展示了使用所提出和论证的架构进行的实验实现。第4节讨论最终结果。 ## 2 方法 本质上,区域供热系统(DHS)工厂的运行涉及对一次侧(工厂级)和二次侧(换热站级)供水温度以及一次侧供水流量的自动化或半自动化管理。一次侧和二次侧回路是闭环的,能量通过换热器从一次侧线路传递到二次侧线路。供水温度的管理基于DHS的总需求和当时的天气状况。DHS的总需求由指定区间内传输的热能决定,即位于一次回水线路上的热量计记录的当前时间点与过去时间点之间传输能量测量值的差值。 目前,传统DHS通过监控与数据采集(SCADA)系统进行管理。该系统集成了各种传感器、控制机制和算法,能够根据传感器数据自动调整运行参数。DHS在区域供热换热站级别(DHS的一次侧和二次侧)的控制是自动化的。这包括实施适当的热水复位控制(室外空气复位或控制曲线),通常被称为调节曲线,SCADA系统用它来根据测得的室外空气温度推导出期望的供水管线水温。该过程在早前的工作8(https://arxiv.org/html/2608.11446#bib.bib1)中已有详细描述,并给出了预测模型的详细说明。本文考察了用一种能够基于前一时间点测得的空气温度预测传输能量的模型来替代简单控制曲线的潜力。 选用的比较方法是堆叠长短期记忆网络架构和梯度提升方法,即其XGBoost实现。实验涉及为每个模型适当地准备数据、训练两个模型,然后使用相关指标评估并比较它们的性能。此外,通过寻找能提供最佳指标的超参数集来优化XGBoost模型,使用的方法是贝叶斯优化。 使用的指标包括均方根误差(RMSE)、平均绝对误差(MAE)和决定系数(R2分数)。决定系数通常记为R2(R平方),是一个统计量,表示回归模型中自变量(或多个自变量)对因变量方差的解释比例。其他用于比较的指标包括训练时间和测试集上的推理时间。实验在Google Colab环境中使用T4 GPU运行时进行。 XGBoost用于回归问题的实现期望的是结构化数据集,而不是时间序列。将时间序列数据转换为适合回归问题的格式是机器学习中用于预测和其他随时间变化分析的常见方法。此过程涉及将时间序列数据的序列特性转换为回归
相似文章
基于GPU加速的深度学习用于热浪预测和城市热风险评估
本文提出了一种使用ConvLSTM模型的GPU加速深度学习框架,用于预测次日城市热状况并生成热风险地图,在萨拉热窝数据上取得了优异性能(R²=0.8877)。
评估Transformer和LSTM框架在无资料流域中的预测能力
本文利用NOAA国家水模型模拟,评估了仅编码器Transformer和LSTM模型在无资料流域中的径流预测能力。结果显示,LSTM的表现优于Transformer,并且加入下游信息显著提升了两种架构的预测技能。
面向电网层级的电力负荷预测基准:时间序列Transformer优于传统方法
本文提出了面向电网层级的电力负荷预测综合基准,评估了十种方法,发现基于Transformer的方法持续优于传统方法,将预测误差降低了6.6%–10.7%。标准Transformer的性能优于一种新颖的灵活架构,基础模型Chronos-2在某些数据集上展现出具有竞争力的零样本性能。
区域供热系统数据多变量离群值检测方法探索
本文评估了用于识别区域供热系统数据中异常运行的不同多变量离群值检测方法(Z-score、马氏距离、PCA、孤立森林和Hotelling T-squared),并提出了一种基于表现最佳方法之间一致性的集成方法。
加权共形预测用于电动赛车动力总成实验室到赛道热传递
本文通过应用加权共形预测,解决了高性能电动汽车动力总成在实际负载下预测热波动性的挑战,在协变量偏移下实现了覆盖率的适度提升。