用强化学习削减AI数据中心能耗:从单GPU到整个集群的LLM训练实测功率控制

arXiv cs.AI 论文

摘要

一篇新的arXiv论文探索使用强化学习,通过动态控制大语言模型训练工作负载的功率,在从单个GPU到整个集群的规模上降低AI数据中心的能耗。

arXiv:2608.11226v1 公告类型:新 摘要:强化学习后训练在现代语言模型开发中占据主导地位,但其在GPU硬件上的功耗行为尚未被刻画,而数据中心使用对工作负载无感知的机制(静态上限和反应式限频)来管理GPU功率,这会不加区分地拖慢硬件。我们在1到4块A100上以7B、14B和72B规模对GRPO训练进行半秒级功率遥测(超过38万个样本),并训练了一个PPO元控制器,使工作负载自身的生成参数适应实测功率。与完整的500步7B轨迹相比,该控制器将功率上限违例减少了89.8%,同时令牌输出增加了18.1%,能量效率(每MWh令牌数)提高了26.2%。在72B规模实时部署时,同一控制器系列产生了可复现的零结果,经诊断是组大小执行器在模型分片下失去控制权。执行器控制权扫描显示,同样的参数作为生成并发度应用时保留了17-22%的功率控制权,从而提炼出占用率与规模的原则;基于该执行器重建的控制器在三次重复实验中控制了实时的72B rollout生成工作负载:相比静态安全基线输出增加35.7%,预算违例率为2.27±1.08%,比无控制运行减少87.2%的违例,并且在受限控制器中取得了最佳的平均吞吐量和每令牌能耗,其中一种自适应阈值规则在三种运行条件之一与其持平。在实际测量窗口下,原有的72B瞬态从半秒分辨率的23.6%降至30秒时的1.6%,并在5分钟时降为零;一个由16块GPU组成的集群在30秒及更长时间内显示零违例,峰值需求为额定值的50-56%。对于该集群组合,约两倍的额定功率超订似乎是可行的,但需运营商验证。我们量化了经济和碳排放影响,并制定了一个低成本的运营商试点方案。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:22

# 利用强化学习削减AI数据中心能耗:从单个GPU到整个集群的LLM训练实测功耗控制
来源:https://arxiv.org/abs/2608.11226
文献工具

## 文献与引用工具

Bibliographic Explorer 切换

代码、数据与媒体

## 与本文相关的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于 arXivLabs

## arXivLabs:与社区合作者共同开展的实验项目

arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。

与 arXivLabs 合作的个人和组织都已拥护并接受我们开放、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。

有想到能为 arXiv 社区增值的项目点子吗?**了解更多关于 arXivLabs**(https://info.arxiv.org/labs/index.html)。

相似文章

使用ART微调多模态大语言模型:基于艺术强化训练

Hugging Face Daily Papers

ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。