合理调整建议(RSR):数据中心运维中虚拟机云工作负载的共形预测

arXiv cs.AI 论文

摘要

本文提出一种基于自举法的共形预测方法构建预测区间,以改进数据中心虚拟机的合理调整建议,提升成本效益和资源分配效率。

arXiv:2607.24773v1 公告类型: new 摘要: 高效管理云基础设施,尤其是在大型云提供商或超大规模云环境中,需要优化物理资源的使用以最小化成本并最大化性能。选择合适的虚拟机(VM)容量对于在这些动态环境中实现成本效益至关重要。然而,传统的虚拟机分配和调度方法往往未能考虑到虚拟机利用率的波动性和不可预测性,导致资源过度配置或配置不足等低效问题。高质量的区间预测有助于准确捕捉云资源需求中的不确定性,并支持云运营商高效地进行实例配置。 作为一种有效且可靠的预测区间构建框架,共形预测(CP)被用于云计算环境中的中长期预测任务。本研究提出了一种新的数据驱动的预测区间构建方法,利用自举共形预测用于现代动态数据驱动的合理调整建议(RSR),以增强超大规模云上多样化应用工作负载的配置。通过学习工作负载利用率模式、识别多个时间序列之间的相关性以及预测中长期利用率趋势,本研究旨在通过基于AI/ML的配置管道提高云和数据中心运维的效率。 我们的研究表明,由机器学习回归技术驱动、并通过回测评估的AI模型,在云资源利用率的预测方面取得了令人满意的结果。此外,我们对选定的模型进行排名,以确定长期存活虚拟机候选的最佳方法。所提出的框架增强了合理调整建议,并支持在动态云环境中实现更具成本效益的资源分配。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:51

# 数据中心运维中虚拟机云工作负载的共形预测  
© 2025 IEEE. 本材料仅允许个人使用。所有其他用途(包括为广告或促销目的转载/再版本材料、收集新作品用于转售或重新分发到服务器或列表、或复用本作品中任何受版权保护的组件于其他作品)均需获得IEEE许可。  
来源:https://arxiv.org/html/2607.24773  
Mehryar Majd1,2,\*, Feng Cheng1,2, Ali Pahlevan2, 1哈索·普拉特纳研究所(HPI),波茨坦大学,德国波茨坦 2SAP SE,德国瓦尔多夫 \*通讯作者:mehryar\.majd@\{hpi\.de, sap\.com\}

###### 摘要

高效管理云基础设施(尤其在大型云提供商或超大规模云环境中)需要优化物理资源的使用以降低成本并最大化性能。选择合适的虚拟机(VM)规格在这些动态环境中实现成本效率至关重要。然而,传统的VM分配和调度方法往往无法应对VM利用率的波动性和不可预测性,导致资源过度或不足配置等问题。高质量的区间预测有助于准确捕捉云资源需求中的不确定性,并支持云运维人员实现高效的实例配置。共形预测(CP)作为一种有效且可靠的预测区间(PI)构建框架,被用于云计算环境中的中长期预测任务。本研究提出了一种新的数据驱动的预测区间构建方法,利用自举共形预测为现代/动态/数据驱动的合理规格推荐(RSR)服务,以增强超大规模云上多样化(Web/)应用工作负载的配置效率。通过学习工作负载利用模式、识别多个时间序列之间的相关性并预测中长期利用趋势,本研究旨在利用基于AI/ML的配置流水线提升云/数据中心运维的效率,根据VM工作负载预测结果以成本效益方式分配VM资源,满足云工作负载的波动需求。我们的研究表明,由机器学习(ML)回归结合回溯测试驱动的AI模型在云资源利用率预测方面取得了令人满意的结果。此外,我们对所选模型进行了排名,以引入长期VM候选中的全局顶级模型。该方法增强了动态云环境中的合理规格推荐。

## I 引言与背景

对于超大规模云环境中的虚拟机(VM)合理规格配置,由于工作负载的动态性、不一致性和频繁的不可预测性,一直是一个持续的挑战。与小规模部署不同,超大规模云必须应对数千个租户和应用程序之间巨大且不可预测的需求波动。即使是资源分配中的微小低效也可能导致巨大的成本、能耗增加和性能问题。传统的合理规格配置方法通常基于静态阈值或简单的利用模型,难以捕捉动态工作负载特征,导致资源过度配置(浪费资源)或不足配置(危及服务等级协议,SLA)。

为解决这一问题,预测分析对于准确预测中长期工作负载模式并生成可操作的合理规格推荐至关重要。构建准确的预测区间非常重要,因为这使云运维人员能够考虑到云工作负载固有的波动性和不可预测性。共形预测(CP)提供了一种构建此类区间的原理框架,生成可靠的预测,有助于更精确的配置、资源扩展和成本优化。

参考图说明  
图1:云计算中提出的合理规格推荐(RSR)框架概览。历史VM工作负载数据输入到一个共形预测器,该预测器使用共形预测(CP)在预测目标周围生成预测区间(PI)。这些区间为配置阶段提供信息,该阶段选择最优的计算实例大小(例如,vXPU)以匹配未来需求。红色阴影部分突出显示本工作的核心贡献在于使用CP进行中/大规模工作负载预测,构建PI以增强云工作负载管理(例如,vCPU、vMem、vDisk)和用于RSR用例的资源优化,并通过跨不同VM工作负载对基于ML的预测模型进行排名以提供最佳实践配置决策的见解。  
一个显著的例子是Resource Central(RC),由Cortez等人[12](https://arxiv.org/html/2607.24773#bib.bib2)提出的系统,利用Microsoft Azure生产VM工作负载的详细特征来改善资源管理。他们的研究表明,VM行为通常随时间保持一致,使得历史遥测数据能够支持准确的工作负载预测。RC离线收集并学习高分辨率CPU和内存使用轨迹,然后向各种资源管理器提供在线预测,以支持智能超量配置等决策。随着(生成式)AI和现代预测技术的发展,实例行为分析(IBA)变得越来越有效,这进一步激励我们关注合理规格推荐(RSR),其中预测分析可以在超大规模云环境中驱动更准确、具有不确定性意识的VM配置。

### I-A 动机与贡献

准确估计VM未来资源消耗的上限(UB)对于合理配置和选择最优VM配置以满足工作负载需求(既不过度也非不足配置)至关重要。当缩放到更小的VM时,未来的需求必须保持在缩减后的内存和CPU容量范围内,以避免性能下降和SLA违规。

我们采用约束驱动的方法进行配置阶段:缩放后,峰值内存使用率应低于容量的60%,而CPU利用率的第99百分位数不应超过70%(考虑CPU超出的情况)。虽然可以从历史最大值获得粗略的UB估计,但这往往过于保守,尤其对于具有周期性模式的工作负载。相反,具有不确定性意识的预测可以提供更准确和稳健的UB估计,从而在大规模云环境中实现成本高效且可靠的合理配置。

本文的主要贡献总结如下:

- • 我们提出了一种基于AI/ML的预测流水线,使用CP进行云工作负载预测,并可扩展到合理规格推荐(RSR)用例。
- • 我们通过实验比较了几种时间高效的回归模型在中长期预测中的预测准确性。
- • 我们提出了工作负载预测的最佳实践,利用基于回溯测试(BT)的交叉验证专门用于时间序列数据。
- • 我们根据研究问题对预测模型进行排名,以识别长期存在的VM工作负载全局顶级模型。

### I-B 为RSR用例提出的流水线

在本研究中,历史CPU工作负载数据被建模为单变量时间序列进行分析和预测。应用不同的预测模型来预测实例内的高分辨率CPU观测值。利用时间序列数据,预测器子流水线中的回归模型被部署用于开发VM中CPU工作负载的高分辨率预测模型,同时利用当前和历史CPU利用率数据。

在RSR流水线的末端,配置器子流水线与适当的策略一起使用,将实例候选分类为计算密集型或非计算密集型,以进行合理配置。除了以往使用不同统计阈值进行合理配置的配置工具外,本研究的主要重点是比较和识别能够高效拟合VM工作负载特性的最佳ML回归模型。在我们的案例中,我们研究了公开数据集的CPU数据,这些数据由Microsoft Azure VM系列统一组织,并按其记录方式处理。在动机小节中,我们解释了一些高分辨率CPU/内存工作负载的实用策略。在此,我们仅关注VM的CPU利用率数据。

在本研究中,潜在基于ML的预测模型(列于表I (https://arxiv.org/html/2607.24773#S3.T1)),结合预测区间(PI)技术,被训练用于预测CPU工作负载PI,并最终监控时间序列数据上的上限利用率。基于误差分析选择最佳预测模型。通过误差分析评估预测模型的性能,计算并报告各种预测指标。此外,提出并实现了一种可视化评估方法,以及独立的误差分析,使用scikit-learn Python包验证目标点预测指标的结果,以及PI预测指标的结果。

参考图说明  
图2:所提出的流水线架构的摘录,结合PI并最终监控RSR用例时间序列数据上的上限(UB)利用率,能够对中/长期时间内的VM工作负载性质进行概率预测,可用于配置决策。
### I-C 论文的组织结构

本文的其余部分组织如下:第I节 (https://arxiv.org/html/2607.24773#S1) 介绍了问题背景、背景信息和动机。第II节 (https://arxiv.org/html/2607.24773#S2) 回顾了关于VM工作负载预测、RSR方法和共形预测技术的现有文献。第III节 (https://arxiv.org/html/2607.24773#S3) 概述了理论基础、基准方法以及CP和预测区间的原理,以及公共数据集及其特征。第IV节 (https://arxiv.org/html/2607.24773#S4) 详细描述了问题陈述和提出的方法。第V节 (https://arxiv.org/html/2607.24773#S5) 展示并讨论了实验结果。最后,第VI节 (https://arxiv.org/html/2607.24773#S6) 总结了本文并概述了未来研究方向。

## II 相关工作

我们根据近期对云数据中心工作负载预测研究的调查进行的文献回顾显示,大多数研究集中在目标(点)预测方法上,发布活动在2021年达到显著峰值。尽管这些方法主导了文献,但提供具有统计保证的区间预测的共形预测技术仍然未被充分探索。它们的采用似乎高度依赖于特定用例,且在调查的文献中仅占很小一部分。这表明,尽管对可靠、具有不确定性意识的预测兴趣日益增长,但共形预测在云环境中大规模工作负载预测的背景下仍是一个研究不足的领域。[39 (https://arxiv.org/html/2607.24773#bib.bib3),8 (https://arxiv.org/html/2607.24773#bib.bib4)]

一项最近的调查探索了以应用为导向的视角在主动资源管理中云工作负载预测的重要性,强调了其在支持性能保证、成本降低和能源优化方面的作用。作者根据工作负载变异性和异质性系统地对预测方法进行了分类,并回顾了密切相关的研究和主动应用AIOps(人工智能用于IT运维)框架。此外,他们概述了几个有用的变通方法以及未来研究方向,以应对大规模工作负载预测的挑战。[16 (https://arxiv.org/html/2607.24773#bib.bib1)]

另一项最近的研究引入了Pitot框架,将工作负载运行时间预测建模为考虑干扰的矩阵补全问题,引入了对数残差训练目标、考虑干扰的矩阵分解以及用于不确定性量化的共形分位数回归,实现了比现有方法更准确且更紧密的预测区间。[18 (https://arxiv.org/html/2607.24773#bib.bib9)]

[28 (https://arxiv.org/html/2607.24773#bib.bib10)] 提出了一个评估基于深度学习的概率预测模型的框架,使用Google Cloud和Alibaba轨迹评估了单变量和双变量HBNN及LSTMD架构在CPU、GPU和内存使用预测上的表现。与依赖点式准确性指标的先前工作不同,他们强调具有不确定性意识的预测,展示了其对云服务性能的好处。他们还研究了在不同分布域上的迁移学习,发现跨云提供商的性能下降以及微调的收益有限。然而,大型且多样的源域产生了更稳健的泛化能力。置信水平可以积极影响关键的云服务性能指标。

先前的研究探索了使用经典、集成和深度学习方法在私有云中进行资源预测(预测CPU使用率)。研究表明,如图3 (https://arxiv.org/html/2607.24773#S2.F3) 饼图所示的预测类型分布,某些模型表现优于其他模型并超越了朴素的基线方法。使用多变量输入(如CPU和内存)可略微提高准确性,同时降低低估风险。此外,通过分位数回归和共形化分位数回归进行的不确定性量化提供了校准良好、更紧密的预测区间,相较于过于保守的标准共形预测。[26 (https://arxiv.org/html/2607.24773#bib.bib11)]

参考图说明  
图3:根据近期对云数据中心工作负载预测研究的调查数据,年度发表趋势(左)和按预测类型划分的比例(右),显示目标预测(93.7%)占主导地位,而共形预测仅占6.3%。

共形预测(CP)仍然未被充分探索,尤其在中到大规模的VM工作负载预测中,这在云环境中的合理规格配置方面留下了空白,如图3 (https://arxiv.org/html/2607.24773#S2.F3) 的统计图所示。

一种AI/ML驱动的方法有可能帮助估计VM候选的长期特征,使我们能够增强以前基于统计、阈值或规则的合理规格机制。虽然一些研究采用了基于人工神经网络(ANN)的预测模型,但深度神经网络(DNN)架构的最新进展带来了更高的预测准确性。这些模型可以有效学习资源利用时间序列数据,并提取在给定服务器或主机上运行的应用程序/服务的潜在CPU消耗模式。开发此类复杂模型增强了实例分析,并改进了大规模云平台(如Microsoft Azure)的工作负载轨迹分析。最近基于GenAI的方法利用基于LLM的时间模型使我们能够实时预测低频时间数据(由于输入提示长度的限制),这在企业规模上非常有吸引力,因为它通过生成提示作为查询并返回所需反馈来简化任务。另一方面,

相似文章

帮助数据中心以更少的硬件实现更高性能

MIT News — Artificial Intelligence

麻省理工学院的研究人员开发了Sandook,这是一种基于软件的系统,通过同时解决SSD的三个变异性来源,将数据中心存储性能提升近一倍,效率远超传统方法。

在线局部化共形预测

arXiv cs.LG

本文提出了在线局部化共形预测(OLCP),旨在解决在线学习和时间序列设置中的协变量异质性问题。文章引入了用于带宽选择的 OLCP-Hedge 算法,并证明与现有基线相比,该方法在获得更窄预测集的同时,仍能保持有效的长期覆盖率。