用强化学习削减AI数据中心能耗:从单GPU到整个集群的LLM训练实测功率控制
摘要
一篇新的arXiv论文探索使用强化学习,通过动态控制大语言模型训练工作负载的功率,在从单个GPU到整个集群的规模上降低AI数据中心的能耗。
arXiv:2608.11226v1 公告类型:新
摘要:强化学习后训练在现代语言模型开发中占据主导地位,但其在GPU硬件上的功耗行为尚未被刻画,而数据中心使用对工作负载无感知的机制(静态上限和反应式限频)来管理GPU功率,这会不加区分地拖慢硬件。我们在1到4块A100上以7B、14B和72B规模对GRPO训练进行半秒级功率遥测(超过38万个样本),并训练了一个PPO元控制器,使工作负载自身的生成参数适应实测功率。与完整的500步7B轨迹相比,该控制器将功率上限违例减少了89.8%,同时令牌输出增加了18.1%,能量效率(每MWh令牌数)提高了26.2%。在72B规模实时部署时,同一控制器系列产生了可复现的零结果,经诊断是组大小执行器在模型分片下失去控制权。执行器控制权扫描显示,同样的参数作为生成并发度应用时保留了17-22%的功率控制权,从而提炼出占用率与规模的原则;基于该执行器重建的控制器在三次重复实验中控制了实时的72B rollout生成工作负载:相比静态安全基线输出增加35.7%,预算违例率为2.27±1.08%,比无控制运行减少87.2%的违例,并且在受限控制器中取得了最佳的平均吞吐量和每令牌能耗,其中一种自适应阈值规则在三种运行条件之一与其持平。在实际测量窗口下,原有的72B瞬态从半秒分辨率的23.6%降至30秒时的1.6%,并在5分钟时降为零;一个由16块GPU组成的集群在30秒及更长时间内显示零违例,峰值需求为额定值的50-56%。对于该集群组合,约两倍的额定功率超订似乎是可行的,但需运营商验证。我们量化了经济和碳排放影响,并制定了一个低成本的运营商试点方案。
查看缓存全文
缓存时间: 2026/08/13 15:22
# 利用强化学习削减AI数据中心能耗:从单个GPU到整个集群的LLM训练实测功耗控制 来源:https://arxiv.org/abs/2608.11226 文献工具 ## 文献与引用工具 Bibliographic Explorer 切换 代码、数据与媒体 ## 与本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于 arXivLabs ## arXivLabs:与社区合作者共同开展的实验项目 arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。 与 arXivLabs 合作的个人和组织都已拥护并接受我们开放、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。 有想到能为 arXiv 社区增值的项目点子吗?**了解更多关于 arXivLabs**(https://info.arxiv.org/labs/index.html)。
相似文章
EnergyLens: 面向多GPU大语言模型推理优化的预测性能耗感知探索
EnergyLens是一个端到端的框架,用于多GPU大语言模型推理的预测性能耗感知优化,在Llama3和Qwen3-MoE上验证,平均绝对百分比误差在9.25%至13.19%之间,并揭示了不同配置之间显著的能耗差异。
@dair_ai: // 自对弈加上一点人类数据 // 结合人类演示和自对弈强化学习的超酷论文。30分钟…
一篇研究论文,将少量人类演示作为正则化目标与自对弈强化学习相结合,从而使用极少的人类数据(30分钟对比数千小时)并在单个消费级GPU上训练15小时,实现与人类兼容的驾驶策略。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
多时间尺度隐式动作深度强化学习在边缘-云网络中的联合优化
提出了一种具有隐式动作空间的双时间尺度多层深度强化学习框架,用于分层边缘-云计算中的联合服务放置、计算委托和功率控制,实现高达20.8%的延迟降低和13%的资源利用率提升。
使用ART微调多模态大语言模型:基于艺术强化训练
ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。