LLM驱动的可持续数据中心运营预测决策

arXiv cs.LG 论文

摘要

本研究论文介绍了一种基于LLM的预测调度系统,旨在提升数据中心效率并降低环境影响,通过实际合作实现了能源消耗和等待时间的显著减少。

arXiv:2608.18503v1 公告类型:新 摘要:随着对AI驱动工作负载需求的增长,尤其是来自大型语言模型(LLMs),数据中心显著的能源和资源消耗引起了关注。本研究提出了一种新型的基于LLM的预测调度系统,旨在提升运营效率同时降低数据中心的环境影响。我们的系统利用LLM从源代码预测关键指标,如执行时间和能耗,并且有潜力扩展到其他可持续性相关指标,如冷却用水和碳排放,前提是数据中心能够跟踪这些数据。预测模型之后是一个实时调度算法,用于分配GPU资源,旨在通过优化能耗和排队延迟来提高可持续性。凭借快速的推理时间、跨多样任务类型的泛化能力以及训练所需的最小数据量,我们的方法为数据中心调度提供了实用解决方案。该框架展示了在AI驱动基础设施中推进可持续性目标的巨大潜力。通过与数据中心的合作,我们实现了能耗降低32%和等待时间减少30%。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:28

# 面向可持续数据中心运营的LLM驱动预测性决策  
来源:https://arxiv.org/html/2608.18503  
王瀚超*1 吴景轩*2 李雨梦3 潘宇1 陈冠廷†2  
1![[未标注图片]](https://arxiv.org/html/2608.18503v1/logo/usyd.png)悉尼大学商学院,悉尼大学  
2![[未标注图片]](https://arxiv.org/html/2608.18503v1/logo/unc.png)统计与运筹学系,北卡罗来纳大学教堂山分校  
3![[未标注图片]](https://arxiv.org/html/2608.18503v1/logo/Purdue.png)工业工程系,普渡大学  
*同等贡献  
†通讯作者 [email protected]  

###### 摘要  
人工智能驱动的工作负载需求日益增长,尤其是来自大语言模型(LLMs)的需求,引发了对数据中心能源与资源消耗的担忧。本研究提出一种基于LLM的新型预测调度系统,旨在提升运营效率的同时降低数据中心的环境影响。该系统利用LLM从源代码预测执行时间、能耗等关键指标,并在数据中心具备数据追踪能力的前提下,可扩展至冷却用水、碳排放等其他可持续性指标。预测模型后接实时调度算法,通过分配GPU资源优化能耗与排队延迟,以实现可持续性目标。凭借快速的推理能力、跨任务类型的泛化能力以及对训练数据的最小化需求,该方法为数据中心调度提供了实用解决方案。该框架展现出推动人工智能基础设施可持续目标的强大潜力。通过与数据中心的合作,我们实现了能耗降低32%和等待时间减少30%的成效。  

## 1 引言  
机器学习(ML)特别是大语言模型(LLMs)的快速发展带来了突破性能力,但也引发了重大的社会与环境关切[47, 4, 42]。最紧迫的问题之一是ML模型训练与服务过程中消耗的大量能源与水资源,这已引起广泛关注[8, 15, 56]。计算密集型ML任务可能需要数百GPU小时,并消耗大量电力和冷却用水。因此,基于ML应用需求的增长显著放大了数据中心的环境影响,凸显了针对AI驱动工作负载构建更高效、可持续的现代化基础设施的必要性[7, 39, 33]。  

本文旨在通过设计基于LLM的预测调度系统,高效分配ML任务流的数据中心资源(例如GPU),以提升运营效率并降低现代数据中心的足迹。我们利用LLMs的上下文理解与预测能力,并将预测能力与优化数据中心运营的序列决策相结合。  

如图1所示,我们提出的方法首先采用LLM以ML任务源代码作为输入,输出所需资源(包括执行时间与GPU能耗)的估计值。若数据中心可获取相关数据,该方法在预测用水量、碳排放等其他指标方面具有巨大潜力。通过利用这些估计值,数据中心可做出更智能、高效的GPU资源实时分配决策,从而缩短任务队列等待时间并降低整体能耗。  

本研究旨在解决当前中小规模到大规模数据中心运营流程中的一个关键限制。我们关注当前普遍存在的模式:用户提交任务并请求资源,数据中心基于启发式算法分配资源,而这些算法依赖于用户提供的估计值(如预测的任务时长与资源需求)[60]。事后看来,最优资源分配取决于任务实际消耗的时间与能源。然而,由于现代计算系统的内在复杂性,准确预测这些因素几乎不可能。因此,用户与数据中心均无法精确知晓给定任务所需的最佳资源,导致效率低下与资源浪费。  

我们提出统一的预测模型与实时数据驱动调度系统,实现更高效、可持续的资源分配决策。如图2所示,先前方法无法处理未见过的任务或复合任务(例如先训练CNN再训练LSTM)。然而LLMs的泛化能力使我们的模型能有效处理此类情况,使其适应更广泛的任务类型与组合。  

### 1.1 贡献  
我们提出一个原型流程,为数据中心运营(特别是AI训练与推理应用)的方法论与实践提供贡献。我们的方法在提供方法论洞察的同时,为当今可持续发展与AI驱动背景下的应用开辟了新可能。相关工作的详细讨论见附录A.1。  

**方法论贡献**:  
本工作推动了数据中心预测建模与序列决策领域的发展。  
- •**基于LLM的通用预测模型**:尽管数据中心运营中存在多种预测方法,但我们首次提供以源代码为输入、输出目标估计值的端到端综合解决方案。我们的模型有望兼容任何用户提交的任务,并预测数据中心所需的任何可衡量指标。该方法的优势在于LLM生成的表征比手工特征更具信息量与泛化性,从而提升预测性能与运营效率。  
- •**全自动预测调度系统**:该方法实现了全自动预测调度系统的可能性。通过采用统一框架,系统能够处理任何用户提交的任务并直接提供目标估计值。这在过去难以实现(见图3),因为传统预测方法高度任务专用(例如仅适用于CNN或LLM),且仅覆盖有限任务类型。此外,每种任务类型需单独的预测模型与手工特征,极大限制了这些方法的灵活性与可扩展性。  
- •**序列决策算法**:我们的预测框架辅以优化资源分配的序列决策算法。该问题源于可重用资源分配与排队控制领域,尚无解析解。我们提出数据驱动的决策算法,并与小型数据中心合作实现。该算法显著优于基线调度规则,降低能耗32%、排队延迟30%。该方法在日益强调可持续性的背景下,能实现更有效的数据中心管理。  

**应用层面贡献**:  
我们方法的独特特性——端到端预测模型及其对不同任务类型与估计目标的兼容性——为构建下一代AI驱动数据中心基础设施提供了巨大潜力。  
- •**实际部署**:我们的流程可在一秒内执行,实现低成本、全自动的预测调度系统。此外,在数据中心内训练与部署模型简单高效,即使数据有限也能有效工作,使其特别适用于现实世界的数据中心运营。  
- •**多用途可持续数据中心运营**:我们的方法足够通用,可预测时间、能耗等多种指标,并相信也能预测碳排放与用水量。不同于先前局限于特定模型的目标专用方法,我们的统一框架提供一站式解决方案,满足广泛的预测需求,为构建更可持续、环保的数据中心基础设施提供关键洞见。  

## 2 问题描述  
**预测问题**:考虑配备多类型GPU的数据中心,机器学习任务依次到达。数据中心需决定为每个到达的任务分配何种GPU(注意GPU数量通常由用户提交的代码或命令输入指定)。令\( \bm{x} \)表示用户提交的源代码,\( z \)表示数据中心的决策(即分配执行任务的GPU类型)。决策\( z \)产生包括任务完成时间(记为\( t \))和使用配置\( z \)完成任务\( \bm{x} \)的能耗(记为\( e \))在内的结果。结果与决策的关系由函数\( f \)和\( g \)建模:  
\[ t := f(\bm{x}, z), \quad e := g(\bm{x}, z) \]  
需注意,函数\( f \)和\( g \)依赖于数据中心特定的基础设施(如带宽、CPU、内存、存储、通信、系统配置、软件栈等)。通常,由于现代计算系统的复杂性,表征函数\( f(\bm{x}, z) \)和\( g(\bm{x}, z) \)极具挑战性。  

**使用大语言模型进行预测**:为解决预测问题,我们采用大语言模型(LLMs)[43, 52, 1]。为简化起见,读者可参考[62]了解基于解码器的Transformer与LLM架构的详细说明。本文中,我们用\( f_\theta \)和\( g_\theta \)简写表示LLMs,其中\( \theta \)涵盖所有模型参数。\( f_\theta \)和\( g_\theta \)接受两个输入:任务源代码\( \bm{x} \)和数据中心决策\( z \)。其原理是LLM能有效分析并解读任务源代码,将其转化为有意义的表征;这些表征与GPU配置\( z \)结合后,模型可产生满足以下条件的估计:  
\[ f_\theta(\bm{x}, z) \approx f(\bm{x}, z), \quad g_\theta(\bm{x}, z) \approx g(\bm{x}, z) \]  

为论证基于LLM的方法,我们强调LLMs在以下两个关键特性使其在本研究场景中尤为突出:  
- •**上下文理解与特征提取**:LLMs以其卓越的源代码上下文理解与特征提取能力(即表征)而闻名。凭借大规模预训练数据,LLMs与其他自然语言模型(NLP)能识别代码中含相关信息的关键部分,将其转化为包含有意义信息的表征[58, 48],并利用这些向量预测时间、能耗等指标。  
- •**泛化能力**:LLMs的另一突出能力是其泛化性[67]。即使预训练数据集未涵盖函数域内所有可能的示例,LLMs仍能识别数据集中的模式,并将所学知识扩展以实现合理的准确近似。  

### 2.1 模型架构 - 预测  
本节正式描述预测模型的架构。我们的方法采用预训练LLM提取源代码表征,并应用探测器[2, 51, 64, 71]训练监督模型以预测目标量。图3展示了架构与先前方法的性能差异。  

我们的精简设计易于快速实现,具有高度灵活性,可跨多种任务泛化。注意,为估计其他目标量,我们只需添加额外的探测器。相反,先前方法需为每种任务采用不同的手工特征与单独的预测模型,灵活性与可扩展性远不及此。下图展示了性能差异:越接近直线的点表示预测越准确。性能在包含对抗生成数据的测试集上评估,我们的方法在准确性与鲁棒性上均优于先前方法([9]和[32])。值得注意的是,先前方法显示出一致的系统性偏差,可能源于其依赖缺乏泛化性的“物理”特征(如前向/后向传递次数与层深度)。  
- •**表征提取**:我们采用预训练LLM提取任务表征,建模为函数\( l_{\theta_1}(\cdot): \mathcal{V} \to \mathbb{R}^d \),其中\( \mathcal{V} \)表示源代码空间,\( \mathbb{R}^d \)为映射表征的\( d \)维嵌入空间。此处\( \theta_1 \)涵盖LLM参数。注意\( l_{\theta_1}(\cdot) \)指不含最终线性与softmax层的LLM,其最后一层输出最后一个token的\( d \)维表征向量。  
- •**探测**:探测指利用生成的表征,通过线性回归或浅层神经网络预测目标值。我们将该探测器表示为\( h_{\theta_2}(\cdot, \cdot): \mathbb{R}^d \times \mathcal{Z} \to \mathbb{R} \),其中\( \theta_2 \)表示探测器参数,\( \mathcal{Z} \)表示决策空间(例如GPU类型)。因此,执行时间的预测模型可表示为:  
\[ f_\theta(\bm{x}, z) = h_{\theta_2}(l_{\theta_1}(\bm{x}), z) \]

相似文章

超越预测:面向尾延迟的LLM推理调度

arXiv cs.LG

本文提出了一种面向LLM推理的分布感知、无预测调度框架,利用轻量级统计信号以软优先级提升替代显式长度预测。该方法联合优化调度与缓存感知的抢占,以降低尾部延迟,相比具备完美长度知识的SRPT,P99 TTLT最多降低35-50%。

PowerAtlas:面向电力系统的电算协同调度

arXiv cs.LG

PowerAtlas是一个LLM代理框架,用于在数据中心中联合调度电力和计算,确保电网可行性和任务SLA。通过与真实电力公司和包含2000个实例的新基准(ECBench)进行验证,它在多个开放权重LLM上显示出一致的性能提升。

PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

arXiv cs.AI

PALS是一种面向LLM服务的功耗感知运行时,将GPU功率上限视为可控旋钮,与批大小联合优化,以在满足吞吐量目标的同时最大化能效。该系统在功率约束下可将能效提升高达26.3%,并将QoS违规减少4倍至7倍。