私有云中CPU工作负载预测的两阶段预测系统

arXiv cs.LG 论文

摘要

本文提出了一种两阶段集成预测模型,利用XGBoost预测私有云中的CPU工作负载,首先预测客户服务请求,对大多数应用实现了SMAPE低于7%的高精度。

arXiv:2609.03457v1 Announce Type: new 摘要: 准确的云资源预测对于主动资源调配、保持服务质量(QoS)和降低动态云环境中的运营成本至关重要。现有的预测方法主要从历史资源跟踪中直接估计未来的CPU工作负载,这往往忽略了客户服务需求与后续资源消耗之间的关系。本研究提出了一种两阶段集成预测模型,通过首先预测客户服务请求(以每秒事务数TPS表示),然后从TPS预测估计未来的CPU工作负载,显式地建模了这种依赖关系。预测组件和资源预测组件均采用了XGBoost模型,构建在级联学习架构中,并辅以使用扩展窗口策略的自适应在线重训练,以应对持续演变的云工作负载中的概念漂移。所提出的工作使用从包含十个应用的私有云环境中收集的真实跟踪进行了评估。实验结果表明,预测性能稳健,大多数应用的对称平均绝对百分比误差(SMAPE)低于$7\%$,表现最佳的应用实现了MAE为$0.7372$、RMSE为$1.1866$、SMAPE为$3.57\%$和R2为$0.9185$。逐范围漂移分析确认了在60步预测范围内稳定的递归预测行为和可控的误差积累。与传统的直接CPU预测方法相比,所提出的两阶段集成模型提高了预测稳健性、计算效率和可解释性,使其非常适合云计算环境中的主动资源管理和智能自动扩展。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:28

# 私有云CPU工作负载预测的两阶段预测系统
来源:https://arxiv.org/html/2609.03457  
Ashir Javeed  
Anton Borg 注:通讯作者。邮箱:[email protected]  
所属机构:布罗斯学院计算机科学系,瑞典卡尔斯克鲁纳,371 79  
Håkan Grahn  
所属机构:布罗斯学院计算机科学系,瑞典卡尔斯克鲁纳,371 79  
Lars Lundberg  
所属机构:布罗斯学院计算机科学系,瑞典卡尔斯克鲁纳,371 79  
Dhyey Patel  
所属机构:爱立信公司,瑞典卡尔斯克鲁纳,371 33  
Sogand Shirinbab  
所属机构:爱立信公司,瑞典卡尔斯克鲁纳,371 33  

###### 摘要  
准确的云资源预测对于动态云环境中的主动资源调配、维持服务质量以及降低运营成本至关重要。现有的预测方法主要基于历史资源跟踪数据直接估算未来的CPU工作负载,这往往忽略了客户需求与后续资源消耗之间的关系。本研究提出一种两阶段集成预测模型,该模型首先预测以每秒事务数(TPS)表示的客户服务请求,随后根据TPS预测估算未来的CPU工作负载,从而显式地建模了这种依赖关系。预测组件和资源预测组件均采用级联学习架构中的XGBoost模型,并辅以使用扩展窗口策略的自适应在线重训练,以应对持续演变的云工作负载中的概念漂移。该研究使用从包含十个应用程序的私有云环境中收集的真实世界跟踪数据进行了评估。实验结果表明,该系统具有稳健的预测性能,对大多数应用程序实现了低于7%的对称平均绝对百分比误差,其中表现最佳的应用程序MAE为0.7372,RMSE为1.1866,SMAPE为3.57%,R²为0.9185。预测步长漂移分析证实,在60步预测范围内,递归预测行为稳定,误差累积可控。与传统的直接CPU预测方法相比,新开发的两阶段集成模型在预测鲁棒性、计算效率和可解释性方面均有所提升,使其非常适合云计算环境中的主动资源管理和智能自动扩展。  

## 1 引言  
云计算近年来经历了巨大增长,其驱动力来自于更低的运营成本和更高的生产力[22 (https://arxiv.org/html/2609.03457#bib.bib1)]。人工智能(AI)和大数据的最新进展也促使云计算需求稳步上升,因为这些技术需要大量的计算资源[20 (https://arxiv.org/html/2609.03457#bib.bib2)]。为了维持服务质量(QoS),云服务提供商应高效地分配和管理计算资源,同时考虑能源和可持续性因素。云资源的过度配置会导致能源浪费,而配置不足则会影响QoS[1 (https://arxiv.org/html/2609.03457#bib.bib3)]。因此,应高效分配处理(CPU)能力、内存和存储等云计算资源,以满足云客户的需求和能源效率。相应地,维持云操作的顺畅和效率需要对云资源未来需求进行准确预测。云服务提供商依赖工作负载预测,在动态工作负载条件下主动分配计算资源并维持QoS[24 (https://arxiv.org/html/2609.03457#bib.bib4)]。在这方面,可以利用历史数据构建预测模型,估算计算资源(如CPU、存储、内存和网络带宽)的未来需求。然而,准确估算计算资源的未来需求并非易事,因为数据中心的工作负载具有高度动态性和快速变化性。例如,阿里云数据中心观测到云工作负载存在5%到80%的变化[7 (https://arxiv.org/html/2609.03457#bib.bib5)]。本研究也观测到类似的云工作负载变化,数据来自一家私有云服务提供商。开发一种能够准确处理云资源需求高方差的有效方法,需要对工作负载模式有深入的理解和认识[35 (https://arxiv.org/html/2609.03457#bib.bib6)]。通过获得的知识,我们可以构建一个稳健且精确的算法来预测云的未来工作负载。  

通常,云数据本质上是顺序的,并随时间收集,这使得资源预测成为一个时间序列问题[32 (https://arxiv.org/html/2609.03457#bib.bib7)]。因此,研究人员利用了统计方法(如ARIMA模型)和机器学习模型(包括线性回归、决策树以及最新的基于深度学习的方法,如循环神经网络(RNN)和长短期记忆网络(LSTM))来处理这一时间序列任务[10 (https://arxiv.org/html/2609.03457#bib.bib8), 15 (https://arxiv.org/html/2609.03457#bib.bib9)]。这些模型成功地预测了未来的云工作负载,但它们未考虑由于云客户行为数据有限而导致的此类预测的不确定性。此外,文献中很少有研究考虑云客户请求的服务这一因素对未来工作负载预测的影响[14 (https://arxiv.org/html/2609.03457#bib.bib10), 13 (https://arxiv.org/html/2609.03457#bib.bib11), 34 (https://arxiv.org/html/2609.03457#bib.bib12)]。此外,基于客户需求对云应用程序的资源需求进行跨应用预测,对云研究人员来说仍然是一个挑战。而且,在不同时间步骤上,基于客户需求的各种服务存在高波动性,以及它们对未来云资源(如CPU利用率)的影响,给未来资源(CPU)的准确预测带来了重大挑战。因此,需要一种机制,能够考虑特定云应用程序在给定时间步骤的客户服务请求,并准确预测处理客户需求所需的未来资源。  

现有的预测方法直接基于历史CPU跟踪数据建模未来的CPU利用率。然而,CPU消耗主要是传入服务需求的下游结果。忽略这种因果依赖性限制了在高动态云工作负载下的预测鲁棒性。为了克服这些局限性,本研究提出一种两阶段集成预测系统,用于云环境中的主动CPU资源预测。我们基于先前的工作[14 (https://arxiv.org/html/2609.03457#bib.bib10)],在该工作中,客户请求被用作输入特征来训练机器学习模型,以预测云应用程序的CPU工作负载。在本研究中,开发了一个专用的预测模型来预测未来的客户请求,随后将其用作下游CPU工作负载估计的输入特征。将CPU模型与预测模型集成,可以全面理解特征(客户请求)随时间的交互作用,从而增强了模型的预测能力。与计算成本高昂的深度顺序预测架构(如LSTM和基于Transformer的预测模型[10 (https://arxiv.org/html/2609.03457#bib.bib8)])不同,所提出的基于XGBoost的框架支持轻量级的自适应学习,具有更低的重训练开销和更快的推理速度,适用于流式云环境。我们工作的贡献和发现总结如下:  

- • 本研究提出一个集成预测系统,在两个连续学习阶段中对客户服务请求和下游CPU利用率进行建模。  
- • 开发了一种TPS驱动的预测机制,在CPU估计之前捕捉工作负载动态,以实现主动云资源管理。  
- • 在所提系统中集成了自适应在线重训练和滚动最大值(Rolling_Max)平滑技术,以增强在高动态云计算工作负载下的预测稳定性。  
- • 使用基于XGBoost的学习方法,展示了计算高效的预测能力,适用于轻量级流式部署。  
- • 使用真实的私有云跟踪数据验证了所提系统,并表明与传统预测方法相比,其预测准确性和鲁棒性有所提高。  

其余部分的结构如下:第2节 [相关工作](https://arxiv.org/html/2609.03457#S2)。第3节 [方法论](https://arxiv.org/html/2609.03457#S3)。第4节详细阐述[实验结果和统计分析](https://arxiv.org/html/2609.03457#S4)。第5节 [详细讨论](https://arxiv.org/html/2609.03457#S5)。最后,第6节 [结论](https://arxiv.org/html/2609.03457#S6)。  

## 2 相关工作  
云数据中心中的资源预测是高效资源管理的关键组成部分;因此,文献中已投入大量研究关注这一问题。研究人员采用了基于统计学、传统机器学习和前沿新颖技术的不同方法来进行准确的资源预测。  

统计模型主要基于数学原理,有助于识别数据中的趋势和模式。然而,当数据包含复杂非线性关系时,这些模型难以捕捉模式。因此,当依赖传统统计模型(如ARIMA[5 (https://arxiv.org/html/2609.03457#bib.bib13)])时,在云环境中进行准确的资源预测变得具有挑战性。ARIMA基于自回归(AR)和移动平均(MA)原理,能有效捕捉平稳趋势和季节性。因此,ARIMA在捕捉云资源预测数据中的非线性关系和复杂模式方面能力有限[17 (https://arxiv.org/html/2609.03457#bib.bib14)]。  

另一方面,机器学习(ML)模型在学习非线性工作负载模式以实现高效云资源预测方面,相比统计模型表现出优越的能力。ML模型有时计算成本高昂,因为它们需要特征工程[36 (https://arxiv.org/html/2609.03457#bib.bib15)]来学习数据中的复杂模式,并需要超参数调优以提高性能[2 (https://arxiv.org/html/2609.03457#bib.bib16)]。例如,文献中使用了不同的ML模型进行云环境中的资源预测,如随机森林[31 (https://arxiv.org/html/2609.03457#bib.bib20)]、XGBoost[25 (https://arxiv.org/html/2609.03457#bib.bib21)]、K近邻回归[21 (https://arxiv.org/html/2609.03457#bib.bib18)]、支持向量回归[30 (https://arxiv.org/html/2609.03457#bib.bib19)]和集成学习[3 (https://arxiv.org/html/2609.03457#bib.bib22), 15 (https://arxiv.org/html/2609.03457#bib.bib9)]。尽管机器学习方法在非线性云工作负载条件下提高了预测能力,但它们的性能通常严重依赖于特征工程和超参数优化。此外,许多基于ML的预测系统主要关注预测准确性,对流式云环境中不断演变的工作负载动态适应性有限。  

A. Rathee 等人提出了一种集成模型(XGBoost和红狐优化算法(RFOA)),用于云环境中的优化资源分配。在其提出的模型中,部署了RFOA算法来优化XGBoost模型的超参数。所提模型的性能与基准和基于遗传算法(GA)的模型进行了比较。实验结果显示,所提模型在准确性和资源利用率方面取得了优异性能,同时降低了计算成本并提高了云服务的可靠性[25 (https://arxiv.org/html/2609.03457#bib.bib21)]。  

G. Sripathi 和 D. A. Khan 提出了一种使用支持向量机(SVM)回归模型的云计算环境主动资源分配框架。该开发框架利用工作负载和地理信息来预测QoS需求,并在地理分布的云位置动态分配资源。所提出的方法有助于高效利用资源、减少过度配置和利用不足,并增强整体系统响应性和QoS性能。实验结果表明,与现有方法相比,在预测准确性、精确度、召回率和F1分数方面均有显著提高[30 (https://arxiv.org/html/2609.03457#bib.bib19)]。  

此外,N. Roy 等人提出了一种用于云环境工作负载预测的自动扩展预测方法,以改善服务质量(QoS)。他们的预测模型基于二阶自回归移动平均方法,能够准确预测未来工作负载,并在保持低运营成本的同时满足应用程序的QoS[28 (https://arxiv.org/html/2609.03457#bib.bib23)]。  

Y. C. Chang 等人开发了一种基于循环神经网络(RNN)模型的算法,用于云计算服务器中的高效工作负载预测。他们提出的方法通过提前预测未来工作负载来帮助主动资源分配,从而改善云中的资源管理[6 (https://arxiv.org/html/2609.03457#bib.bib24)]。  

Z. Chen 等人提出了一种混合模糊神经网络(FNN)与集成建模方法,用于准确预测云中的未来工作负载。该开发模型结合了模糊逻辑和集成学习,以更好地捕捉云环境中的复杂工作负载模式,有助于准确预测资源和高效管理云资源[9 (https://arxiv.org/html/2609.03457#bib.bib25)]。  

Z. Chen 等人开发了一种基于深度学习技术的算法,即云计算工作负载预测算法,用于云工作负载预测。通过将顶部稀疏自编码器(TSA)与门控循环单元(GRU)集成,改进了传统RNN模型的性能。TSA通过从数据中提取有用的工作负载模式,而GRU则准确预测未来工作负载。他们的算法在来自谷歌和阿里云的真实世界工作负载跟踪数据上进行了评估。实验结果表明,所提算法在工作负载预测准确性方面优于传统的RNN模型[8 (https://arxiv.org/html/2609.03457#bib.bib26)]。  

尽管深度学习模型提高了非线性序列建模能力,但它们通常需要计算成本高昂的重训练、大规模数据集和大量的硬件资源,这限制了它们在轻量级自适应云部署中的实用性。  

2021年,M. A. Razz 等人设计了一个混合自动扩展框架,用于云计算环境中的工作负载预测。该开发框架基于集成技术,采用了多种ML模型,如支持向量机、决策树、随机森林和K近邻。为了识别动态工作负载变化并提供更好的服务质量(QoS),他们的框架引入了一种突发感知自动扩展机制,通过垂直

相似文章