数据中心能源优化的AI应用
摘要
本文系统回顾了用于数据中心能源优化的AI研究,识别了现有研究空白,并提出了CLEAR-DC框架——通过整合能源、碳排放与水资源指标来打通优化器-负载的闭环。
arXiv:2609.03716v1 公告类型:新论文
摘要:数据中心正通过人工智能进行日益精细的能源优化,同时也因AI负载的增加面临新的挑战。现有文献将这两个问题视为相互独立:控制研究常将工作负载建模为外生到达过程,而可持续性研究则将基础设施简化为固定乘数。我们通过标准化检索协议筛选了约194篇论文,对其中63篇进行深度编码分析,并报告编码结果。在28项以控制为导向的核心研究中,18项仅通过仿真验证,5项触及物理硬件或生产环境;但无一研究考虑水资源消耗,也未评估隐含碳排放。四类技术方案所报告的节能区间高度重叠,表明该领域目前尚无法对其方法进行有效排序。我们对10个重复出现的研究空白按影响程度与可解决性进行评分,并提出CLEAR-DC框架——该架构通过显式弹性系数将控制策略分支与工作负载需求分支相耦合,计算净收益而非直接效益,并输出符合标准的数据记录,涵盖能源消耗、碳排放、水资源使用、隐含碳占比及验证场景。本框架是架构性方法论提案而非已训练系统;我们实证支撑的贡献点在于通过代码库分析所建立的语料库分析体系及其衍生报告标准。编码表、衍生统计及所有结果产物:https://github.com/Kimalice/AI-for-Energy-Optimization-in-Data-Centers-Closing-the-Optimizer-Load-Loop
查看缓存全文
缓存时间: 2026/09/04 06:10
# 用于数据中心能效优化的人工智能:闭合优化器-负载回路 来源:https://arxiv.org/html/2609.03716 Summaiya Unnisa Begum 隶属机构:印度海德拉巴 [email protected] Mohammed Nadeem Ullah 隶属机构:印度海德拉巴 [email protected] ## 摘要 数据中心正日益由人工智能进行优化,同时也日益因其而产生负载。现有文献将这两个问题视为互不相关:控制研究将工作负载建模为外生到达过程,而可持续性研究则将基础设施建模为固定乘数。我们通过记录在案的方案筛选了约194篇检索到的论文,对其中63篇进行了编码分析,并报告了编码结果。在28项主要面向控制的研究中,18项仅通过仿真进行验证,5项涉及物理硬件或生产设施;没有研究考虑水资源消耗,也没有考虑隐含碳。报告的节能区间在四个技术类别中几乎完全重叠,这意味着该领域目前无法对自身方法进行排名。我们根据后果和可处理性对十个反复出现的差距进行评分,并提出了CLEAR-DC框架。该框架通过显式弹性项将控制策略分支与工作负载需求分支耦合,读取净收益而非直接收益,并生成涵盖能源、碳、水、隐含碳份额和验证场所的模式一致记录。该框架是一个架构和方法论上的提议,而非训练好的系统;我们通过实证捍卫的贡献是语料库分析及其衍生的报告模式。编码表、衍生统计数据和所有结果工件:https://github.com/Kimalice/AI-for-Energy-Optimization-in-Data-Centers-Closing-the-Optimizer-Load-Loop 关键词:数据中心能效、深度强化学习、冷却优化、工作负载调度、碳感知计算、可持续人工智能、回弹效应、系统性综述、报告标准 ## I 引言:为何能效声明需要闭合回路 数字基础设施已成为一个独立的能源领域。早期核算在计入冷却和电力分配后,将数据中心的电力消耗置于全球总消耗的大约百分之一[20 (https://arxiv.org/html/2609.03716#bib.bib20)]。随后的自下而上建模表明,由于效率提升吸收了大部分差异,对服务的需求增长速度远快于电力消耗的增长[50 (https://arxiv.org/html/2609.03716#bib.bib50), 31 (https://arxiv.org/html/2609.03716#bib.bib31)]。如今,这种乐观情绪正面临压力。根据对硬件趋势和服务增长的假设,预测结果差异巨大[21 (https://arxiv.org/html/2609.03716#bib.bib21)],近期的场景研究预计到本世纪中叶能耗约为1,800至5,000 TWh[10 (https://arxiv.org/html/2609.03716#bib.bib10)],而一项竞争性的长期分析则认为,计算在全球电力中的份额在十多年前就已达到峰值并趋于稳定[40 (https://arxiv.org/html/2609.03716#bib.bib40)]。这种分歧不仅仅是学术性的:它决定了效率研究是边际优化还是脱碳优先事项。 在这一背景下,人工智能首先作为建模工具,然后作为控制器进入该领域。神经网络模型直接从运营传感器数据中学习设施行为,并以足够低的误差预测电力使用效率以指导设定点选择[13 (https://arxiv.org/html/2609.03716#bib.bib13)]。深度强化学习随后闭合了回路,用学习策略取代了手动调整的控制逻辑[26 (https://arxiv.org/html/2609.03716#bib.bib26)],控制范围扩展到共同覆盖信息技术和冷却子系统[42 (https://arxiv.org/html/2609.03716#bib.bib42), 43 (https://arxiv.org/html/2609.03716#bib.bib43)],在学习过程中执行热安全约束[55 (https://arxiv.org/html/2609.03716#bib.bib55), 4 (https://arxiv.org/html/2609.03716#bib.bib4)],并遵循时间和地理上的碳强度[41 (https://arxiv.org/html/2609.03716#bib.bib41), 46 (https://arxiv.org/html/2609.03716#bib.bib46)]。报告的节能效果显著且一致,以至于一些综述现在将该方法视为已确立[18 (https://arxiv.org/html/2609.03716#bib.bib18), 25 (https://arxiv.org/html/2609.03716#bib.bib25), 39 (https://arxiv.org/html/2609.03716#bib.bib39)]。 ### I-A 一个调试场景 设想一位运营商在一个同时托管大规模模型训练的设施中调试一个学习到的控制器。该控制器预计能降低设施能耗,而其管理的工作负载增长速率是任何冷却优化都无法抵消的,在一个可能水资源紧张的流域取水,并产生设施自身模型未表征的电力暂态。任何评估该部署是否为净改进的尝试都面临三个障碍: 1. 1. 开环框架:控制研究将工作负载视为外生随机过程,并在固定需求下报告节省的能量。可持续性研究则将基础设施效率视为应用于其他地方确定的需求轨迹的固定系数。两者都未建模效率如何降低计算的有效单位成本,从而影响计算购买量的路径。一项涵盖整个人工智能生命周期的系统性综述从不同方向得出了相似的结论,报告一个阶段实现的收益被系统其他部分的响应反复抵消,以至于阶段级的改进无法汇总为生命周期级的改进[38 (https://arxiv.org/html/2609.03716#bib.bib38)]。这种抵消在那里被命名但未形式化,本文试图闭合的正是它留下的路径。 2. 2. 验证不足:学习到的控制器绝大多数在仿真中进行评估。一项关于建筑气候控制强化学习的综述发现,不到四分之一的研究涉及真实建筑[2 (https://arxiv.org/html/2609.03716#bib.bib2)],而一项专注于数据中心的系统性综述则指出缺乏实时验证是主要差距[18 (https://arxiv.org/html/2609.03716#bib.bib18)]。一项针对算法、任务、系统动力学和迁移设置的专门评估报告,领先方法对超参数、奖励规范和操作场景仍然敏感,约束违反和样本效率仍不令人满意[62 (https://arxiv.org/html/2609.03716#bib.bib62)]。 3. 3. 测量不可比:节能报告基于异构的基线和边界。一项综述记录的节能范围在启发式方法约为5%到90%,元启发式方法为8%到97%,机器学习方法为2%到89%[39 (https://arxiv.org/html/2609.03716#bib.bib39)],这些区间如此宽泛且重叠,以至于任何排序在它们面前都无法成立。基础证据本身也不均衡:一项对258个已发布估算值的审计发现,其中不到三分之一的来源经过同行评审[35 (https://arxiv.org/html/2609.03716#bib.bib35)],而单一年度的全球数据被报道的范围跨度达六倍[57 (https://arxiv.org/html/2609.03716#bib.bib57)]。 研究问题:数据中心能效优化能否以一种同时考虑控制器实现的直接节能、其效率可能引发的诱导需求、其消耗的电能之外的资源,以及其报告结果可与他人结果相比较的条件来进行评估?本文通过编码语料库分析、优先排序的差距综合以及一个针对所识别差距设计的框架来回答这个问题。 图1 (https://arxiv.org/html/2609.03716#S1.F1)总结了共同决定设施碳足迹的驱动因素,并标记了当前公式化所忽略的反馈路径。 IT工作负载:计算、GPU 冷却设备:精密空调、液冷 电源:电网碳组合 水资源使用:冷却+电力 隐含碳:硬件、建筑 电网耦合:爬坡、灵活性 数据中心能耗与碳足迹 AI优化层:控制、测量、诱导需求(未建模) 图 1:数据中心碳足迹的驱动因素。优化层控制设施,但它使变得更便宜的需求反馈到工作负载——在本综述研究中,这是一条未被建模的路径。 ### I-B 缺失了什么,我们增加了什么 该领域的现有综述列举架构并比较报告的准确性,但很少对语料库进行编码,我们定位到的综述也未量化证据库在验证场所或资源范围上的分布。贡献如下所列,每项都附带其声称范围的限制: - • 七范式综合与差距识别:对度量、预测、冷却控制、调度、碳感知计算、可持续人工智能和使能技术(第II节)进行比较阅读,每项均以指出其未完成的工作结束。 - • 编码语料库分析:对63篇论文按验证场所、范围和资源广度进行编码,报告所得分布于第VI节。范围:编码在摘要层面进行,非全文,且为单人编码而非双人编码(见第VII节)。 - • 排名差距集:源于编码的十个缺陷,按两个轴进行排序:每个缺陷的重要性及其可解决性(第III节)。范围:两个分数均反映我们自身对语料库的解读;未召集专家小组来设定它们。 - • CLEAR-DC:一个通过显式弹性项将控制策略分支与工作负载需求分支耦合的框架,逐组件追溯到其针对的差距(第III节)。范围:CLEAR-DC在此处被规范定义,而非实现、训练或测量。 - • 最小报告模式:一组字段,若共同报告,将使未来结果可相互比较;第IV节将每个字段与其现状并列。 本文后续结构如下。第II节综述七个范式及其缺陷。第III节陈述综述方案、形式化问题并呈现CLEAR-DC。第IV节给出评估设计和一个印度聚焦的案例。第V节描述可重复性。第VI节报告语料库分析。第VII节讨论局限性和影响,第VIII节给出结论。 ## II 七个范式及其未完成的工作 语料库分为七个范式。以下每个小节最后都指出该范式遗留的缺陷,这些缺陷将在第III节中进行评分。 ### II-A 度量与宏观估算 最古老的分支询问数据中心实际消耗多少电力。自下而上的核算建立了早期基线[20 (https://arxiv.org/html/2609.03716#bib.bib20)],后来被精炼以显示美国的需求即使在工作负载增长时也已趋于平稳[50 (https://arxiv.org/html/2609.03716#bib.bib50)],这一发现被推广到全球,用以论证效率趋势抵消了服务增长[31 (https://arxiv.org/html/2609.03716#bib.bib31)]。预测工作则在明确的社会经济假设下拓展了时间视野[21 (https://arxiv.org/html/2609.03716#bib.bib21), 10 (https://arxiv.org/html/2609.03716#bib.bib10)],而关键性的审计则质疑每个人引用的数字来源[35 (https://arxiv.org/html/2609.03716#bib.bib35), 57 (https://arxiv.org/html/2609.03716#bib.bib57)]。教程性综述开始将基础设施和可持续性问题汇集到一起[8 (https://arxiv.org/html/2609.03716#bib.bib8)]。另一条平行的研究线量化了电力之外的碳足迹,包括水资源消耗及其在压力流域的空间集中性[34 (https://arxiv.org/html/2609.03716#bib.bib34), 51 (https://arxiv.org/html/2609.03716#bib.bib51), 23 (https://arxiv.org/html/2609.03716#bib.bib23), 19 (https://arxiv.org/html/2609.03716#bib.bib19)]。 差距识别:该分支提供了分母(即需求),但没有提供控制器。其资源广度——水资源、空间压力、隐含影响——尚未渗透到以其为动机的优化文献中。 ### II-B 预测建模 对设施和工作负载行为的数据驱动建模早于学习控制。基于运营数据训练的神经网络模型可以准确预测电力使用效率,足以指导配置[13 (https://arxiv.org/html/2609.03716#bib.bib13)],类似的方法后来被部署在超大规模设施中,用于调节冷却设定点和检测不合理的运行状况[60 (https://arxiv.org/html/2609.03716#bib.bib60)]。工作负载预测并行发展,在常见的集群跟踪数据上系统性地比较了经典预测器和深度预测器[48 (https://arxiv.org/html/2609.03716#bib.bib48)]。 差距识别:预测准确性很少与实际实现的能效结果相关联。一个能很好预测利用率的模型被报告为一个预测结果,而它所实现的下游节能却未被量化。 ### II-C 用于冷却的深度强化学习 学习控制始于将离策略的演员-评论家方法端到端地应用于冷却设备,报告了与手动配置的基线相比,冷却成本降低了个位数百分比[26 (https://arxiv.org/html/2609.03716#bib.bib26)]。随后,使用参数化动作空间处理混合离散-连续决策,并采用双时间尺度机制来协调响应速率不同的子系统,实现了调度和气流的联合优化[42 (https://arxiv.org/html/2609.03716#bib.bib42), 43 (https://arxiv.org/html/2609.03716#bib.bib43)],后来扩展到跨地理分布式站点[44 (https://arxiv.org/html/2609.03716#bib.bib44)]。多智能体分解解决了联合动作空间的维度问题[6 (https://arxiv.org/html/2609.03716#bib.bib6)]。安全性随后成为首要约束:模仿预训练结合事后动作修正,与奖励塑形相比大幅减少了热违规,同时仍节省了大量设施电力[55 (https://arxiv.org/html/2609.03716#bib.bib55)],而基于Lyapunov的公式用机架级合规指标取代了均匀温度假设[4 (https://arxiv.org/html/2609.03716#bib.bib4)]。代理建模通过将计算流体动力学从控制回路中移出,使实时优化变得可行[63 (https://arxiv.org/html/2609.03716#bib.bib63), 29 (https://arxiv.org/html/2609.03716#bib.bib29)]。 差距识别:部署证据未能跟上算法的复杂性。对奖励设计、超参数和场景变化的敏感性有记载但尚未解决[62 (https://arxiv.org/html/2609.03716#bib.bib62)],在非平稳条件下的性能下降已在实际中观察到[56 (https://arxiv.org/html/2609.03716#bib.bib56)],而简化的占用或负载假设已知会夸大仿真性能[33 (https://arxiv.org/html/2609.03716#bib.bib33)]。 ### II-D 工作负载调度与整合 在计算端,整合通过将负载打包到更少的活动机器上来降低服务器功耗。预测感知策略预测未来的利用率,而不是对当前利用率做出反应,减少了不必要的迁移和服务级别违反[11 (https://arxiv.org/html/2609.03716#bib.bib11), 15 (https://arxiv.org/html/2609.03716#bib.bib15)],深度强化学习已在很大程度上取代了启发式方法用于放置[61 (https://arxiv.org/html/2609.03716#bib.bib61), 14 (https://arxiv.org/html/2609.03716#bib.bib14)]。核心矛盾是热管理:激进的整合会集中热量并产生热点,侵蚀
相似文章
为应对AI电力激增,数据中心迎来重新设计竞赛
AI公司正在重新设计数据中心,以应对激增的能源需求和基础设施压力。
AI数据中心资源使用的数据对比。这些东西到底消耗多少电和水?
本文利用各种来源的数据,将AI数据中心的电力、水和噪音消耗与其他美国行业及日常活动进行比较,从而将数据中心的资源使用置于具体背景中。
AI的用水问题有多严重?
本文探讨了AI数据中心日益增长的用水量、其环境影响,以及通过技术和战略性选址的潜在解决方案。
AI水资源危机到底是硬性需求,还是我们当下的建造方式所致?
文章探讨了AI数据中心引发的水资源危机,指出冷却过程将热量负荷集中在单一流域,并提出了利用闲置硬件进行分布式计算的方案,以分散水和能源需求。
提升AI智能体的速度与能效
麻省理工学院和微软的研究人员开发了一种智能系统,可自动优化智能体工作流,在保持性能的同时减少计算资源和能源消耗。