PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

arXiv cs.AI 论文

摘要

PALS是一种面向LLM服务的功耗感知运行时,将GPU功率上限视为可控旋钮,与批大小联合优化,以在满足吞吐量目标的同时最大化能效。该系统在功率约束下可将能效提升高达26.3%,并将QoS违规减少4倍至7倍。

arXiv:2605.21427v1 Announce Type: new 摘要:大语言模型(LLM)推理已成为现代数据中心的主导工作负载,驱动着显著的GPU利用率和能源消耗。虽然先前的系统通过批处理、调度和并行化来优化吞吐量和延迟,但它们基本上将GPU功率视为静态约束而非可控资源。在本文中,我们提出了一种面向LLM服务的功耗感知运行时PALS,它将GPU功率上限视为一等控制旋钮,并与批大小等软件参数联合优化。该系统结合轻量级离线功耗-性能模型与反馈驱动控制器,选择满足吞吐量目标并最大化能效的配置。我们在现有LLM服务框架vLLM中实现了PALS,展示了它无需模型重新训练或API更改。在多GPU系统以及密集和混合专家(MoE)模型上,PALS将能效提升高达26.3%,在功率约束下将QoS违规减少4倍至7倍,并跟踪动态功率预算。这些结果凸显了将功率控制直接集成到LLM推理运行时中的潜力,从而实现能量比例和电网交互式AI系统。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:50

# PALS:面向混合专家模型的功耗感知LLM服务
来源:https://arxiv.org/html/2605.21427
Can Hankendi、Rana Shahout(哈佛大学工程与应用科学学院,美国马萨诸塞州剑桥,ranash\.cs@gmail\.com (https://arxiv.org/html/2605.21427v1/mailto:[email protected]))、Minlan Yu(哈佛大学工程与应用科学学院,美国马萨诸塞州剑桥,minlanyu@g\.harvard\.edu (https://arxiv.org/html/2605.21427v1/mailto:[email protected]))以及Ayse K\. Coskun(波士顿大学电气与计算机工程系,美国马萨诸塞州波士顿,acoskun@bu\.edu (https://arxiv.org/html/2605.21427v1/mailto:[email protected]))

###### 摘要

大型语言模型(LLM)推理已成为现代数据中心的主导工作负载,驱动着显著的GPU利用率和能源消耗。尽管先前的系统通过批处理、调度和并行化来优化吞吐量和延迟,但它们基本上将GPU功耗视为一个静态约束,而非可控资源。

在本文中,我们提出了一种面向LLM服务的功耗感知运行时系统PALS,它将GPU功耗上限视为第一类控制旋钮,并与批处理大小等软件参数联合优化。该系统将轻量级的离线功耗-性能模型与反馈驱动的控制器相结合,以选择在满足吞吐量目标的同时最大化能效的配置。

我们在现有的LLM服务框架vLLM中实现了PALS,证明它不需要模型重新训练或API更改。在多GPU系统以及密集型和混合专家(MoE)模型上,PALS将能效提升了高达26.3%,在功耗约束下将服务质量违规减少了4倍到7倍,并能跟踪动态功耗预算。这些结果凸显了将功耗控制直接集成到LLM推理运行时中的潜力,从而实现了能量比例和电网交互式AI系统。

## 1\. 引言

大型语言模型(LLM)推理已迅速成为现代数据中心的主导工作负载,对GPU资源和电力产生了前所未有的需求。与传统的批处理导向工作负载不同,LLM服务对延迟敏感、具有突发性,并且越来越多地跨异构多GPU系统大规模部署(Yu等人,2022 (https://arxiv.org/html/2605.21427#bib.bib13);Kwon等人,2023 (https://arxiv.org/html/2605.21427#bib.bib1);Narayanan等人,2021 (https://arxiv.org/html/2605.21427#bib.bib20))。因此,操作员必须在满足严格性能目标的同时,管理不断增长的能源成本和功耗约束(Mahajan等人,2025b (https://arxiv.org/html/2605.21427#bib.bib17);Chung等人,2023 (https://arxiv.org/html/2605.21427#bib.bib15);Barroso等人,2019 (https://arxiv.org/html/2605.21427#bib.bib28))。

最近的系统引入了批处理、请求调度和模型并行执行,以提高LLM推理的吞吐量和延迟(Yu等人,2022 (https://arxiv.org/html/2605.21427#bib.bib13);Kwon等人,2023 (https://arxiv.org/html/2605.21427#bib.bib1);Shoeybi等人,2019 (https://arxiv.org/html/2605.21427#bib.bib19);Narayanan等人,2021 (https://arxiv.org/html/2605.21427#bib.bib20);Li等人,2022 (https://arxiv.org/html/2605.21427#bib.bib8);Shahout等人,2024a (https://arxiv.org/html/2605.21427#bib.bib48),b (https://arxiv.org/html/2605.21427#bib.bib49))。然而,这些机制很大程度上假设固定的功耗供应,并将GPU功耗视为外部约束而非可控资源。在实践中,操作员依赖于粗略的功耗供应和静态功耗上限,以保持在机架或集群级别限制内,但缺乏能够在运行时根据工作负载条件变化精确且快速地权衡性能与功耗的机制。这导致了低效运行,因为系统要么过度供应功耗,浪费能源,要么供应不足,导致吞吐量和服务质量(QoS)违规(Chung等人,2023 (https://arxiv.org/html/2605.21427#bib.bib15);Mahajan等人,2025b (https://arxiv.org/html/2605.21427#bib.bib17);Barroso等人,2019 (https://arxiv.org/html/2605.21427#bib.bib28))。

数据中心越来越受到设施级功耗上限、实时电价和来自电网的需求响应信号的约束(Radovanovic等人,2023 (https://arxiv.org/html/2605.21427#bib.bib23);Zhang等人,2021 (https://arxiv.org/html/2605.21427#bib.bib25);Acun等人,2023 (https://arxiv.org/html/2605.21427#bib.bib24))。与此同时,碳感知计算引入了额外的激励,以随时间推移和跨位置调节能源消耗(Radovanovic等人,2023 (https://arxiv.org/html/2605.21427#bib.bib23);Acun等人,2023 (https://arxiv.org/html/2605.21427#bib.bib24))。随着LLM推理日益耗能,提高效率已变得与最大化吞吐量同等重要。这些趋势要求推理系统将功耗视为一个可控资源,而非固定约束,从而能够动态调整以平衡性能、效率和外部信号。

在本文中,我们认为GPU功耗上限应被视为LLM推理运行时中的第一类控制原语。我们提出了一种功耗感知运行时系统,该联合优化硬件级功耗限制和软件级参数,如批处理大小和并行化。通过协调这些旋钮,系统暴露了吞吐量、延迟和能效之间的可控权衡。

然而,实现这种控制具有挑战性。LLM推理中功耗、性能和效率之间的关系高度非线性,并且取决于工作负载特性、批处理行为以及计算和通信等系统瓶颈。因此,在一种工作负载下高效的配置可能随着条件变化而变得次优,这使得静态或离线调整变得不足。因此,有效的控制需要轻量级的预测模型和在运行时运行的快速反馈机制。

我们的设计基于三个观察:增加功耗会产生超出模型相关阈值的递减收益;批处理大小主导效率;最佳并行度取决于计算-通信平衡。这些观察在混合专家(MoE)模型中尤为明显(Shazeer等人,2017 (https://arxiv.org/html/2605.21427#bib.bib21);Fedus等人,2022 (https://arxiv.org/html/2605.21427#bib.bib22))。在MoE架构中,标记被动态路由到专家子集,从而在计算的同时引入了显著的通信。这导致了高度可变且通常通信受限的执行,其性能取决于路由模式、负载不均衡和互连带宽。因此,增加功耗上限可能会放大通信开销而非有用的计算,进一步复杂化了功耗与性能之间的关系。

为了应对这一挑战,我们设计了一个功耗感知运行时系统,它结合了离线功耗-性能建模和反馈驱动的控制循环。该系统持续选择满足性能目标同时最大化效率的配置,并以低开销适应工作负载变化和动态功耗预算。重要的是,我们的方法是即插即用的:它集成到现有的LLM服务框架(如vLLM)中,无需更改模型架构或推理API。我们的具体贡献如下:

- •我们识别并量化了LLM推理中GPU功耗上限、批处理和并行化之间先前未被利用的跨层交互,表明独立优化从根本上讲是次优的。
- •我们设计了一个闭环控制系统,在QoS约束下联合调整硬件(功耗上限)和软件(批处理)旋钮,从而在动态功耗预算下实现能量比例LLM服务。
- •我们在vLLM中实现了我们的设计,而无需修改模型架构或推理API,展示了一种实用且可部署的方法。
- •我们表明,将功耗视为第一类调度原语扩展了可实现的帕累托前沿,超出了仅通过动态电压频率调整(DVFS)或批处理所能达到的范围,实现了高达26.3%的效率提升和4倍至7倍的QoS违规减少。

先前关于GPU功耗管理和DVFS的工作将功耗视为低级硬件旋钮,而LLM服务系统则专注于固定功耗预算下的批处理、调度和并行化。这两层是独立优化的。相比之下,我们表明,对于现代LLM推理,尤其是MoE模型,功耗上限通过计算/通信权衡与批处理和并行化基本相互作用,创建了任何一层都无法单独捕获的运行状态。本文介绍了第一个LLM服务运行时,它在明确的QoS约束下联合优化硬件功耗限制和软件调度旋钮,从而在运行时动态导航功耗-性能-效率空间。我们表明,将功耗视为第一类控制维度扩展了可实现的效率-性能帕累托前沿,超出了仅靠批处理或DVFS所能达到的范围。在多GPU系统以及密集型和MoE模型上,我们的运行时将能效提升了高达26.3%,在功耗约束下将QoS违规减少了4倍至7倍。

## 2\. 动机

LLM推理已成为现代数据中心中持续的高功耗工作负载,要求系统在日益增长的功耗约束下满足严格的吞吐量和延迟目标。在实践中,部署越来越受到设施级功耗限制、电价波动以及需求响应和碳感知运行等外部信号的约束(Barroso等人,2019 (https://arxiv.org/html/2605.21427#bib.bib28);Zhang等人,2021 (https://arxiv.org/html/2605.21427#bib.bib25);Radovanovic等人,2023 (https://arxiv.org/html/2605.21427#bib.bib23);Acun等人,2023 (https://arxiv.org/html/2605.21427#bib.bib24))。

尽管存在这些约束,现有的LLM服务框架并未明确地将功耗纳入运行时决策。GPU功耗通常是静态供应的,导致要么过度供应并造成能源效率低下,要么供应不足并导致QoS下降。关键的是,这些系统缺乏根据工作负载条件和性能目标动态调整功耗消耗的机制。

为了理解这一差距,我们对跨多种模型和配置的LLM推理进行了实证研究。我们的分析表明,功耗、性能和效率之间的关系高度非线性,并且强烈依赖于工作负载特性。这些发现激励了需要一种运行时系统,将功耗视为第一类控制维度,并与软件级参数联合优化。

参见图注图1. (a) tokens/J 与功耗上限的关系,显示出不同的行为:计算受限的 Mixtral 持续改善,而通信受限的 Qwen-MoE 和 OLMoE 在 200 W 处达到峰值并下降。(b) tokens/J 与批处理大小的关系:所有模型系列的效率增益都很显著。

### 2.1. 离线分析的关键实证洞察

我们的实验揭示了跨模型和配置的三个一致趋势。

##### 洞察1:功耗上限在模型相关阈值处表现出递减收益

图1 (https://arxiv.org/html/2605.21427#S2.F1)(a) 显示了三个模型 Mixtral、Qwen-MoE 和 OLMoE 的 tokens/J 与功耗上限的关系。虽然增加功耗最初会提高吞吐量,但超过工作负载相关阈值(通常为150–200 W)后,效率增益递减。这种行为因模型是计算受限还是通信受限而异。计算受限模型(如 Mixtral)继续受益于更高的功耗上限,因为额外的功耗会增加SM时钟频率和计算吞吐量。相比之下,通信受限模型(如 Qwen-MoE 和 OLMoE)在较低的功耗水平下达到峰值效率。超过这一点后,额外的功耗主要加速通信开销(例如,通过NVLink的NCCL全对全流量)而非有用的计算,导致较低的tokens/J。与常见做法相反,在最大功耗下运行GPU对于LLM推理通常是次优的,尤其是对于通信受限的工作负载。

##### 洞察2:批处理大小主导功耗效率

图1 (https://arxiv.org/html/2605.21427#S2.F1)(b) 显示了相对于批处理大小1归一化的tokens/J。将所有模型的批处理大小从1增加到64,效率提高了1.7倍至2.1倍。这种改进源于将固定的每步开销(包括内核启动、注意力计算和通信设置)分摊到更多标记上,从而增加了SM利用率和有效算术强度。

此效应的幅度取决于模型特性。计算受限模型(如 Mixtral)在较小的批处理大小下就达到效率增益饱和,而通信受限模型(如 Qwen-MoE 和 OLMoE)由于额外分摊了路由和通信开销,在更大的批处理大小下继续受益。例如,对于 Mixtral,批处理大小从32增加到64的边际增益仅为2%,而对于 Qwen-MoE,这一增益仍为7%。

##### 洞察3:计算-通信比率决定最佳并行度

图2 (https://arxiv.org/html/2605.21427#S2.F2) 将推理时间分解为计算和通信组件,跨越不同的模型和配置。结果表明,功耗缩放的有效性强烈取决于这些组件的相对贡献。

对于计算受限的工作负载(例如,中等并行度下的 Mixtral),增加GPU功耗上限通过提高SM时钟频率和加速算术运算直接提高了吞吐量。因此,更高的功耗水平可以转化为更高的吞吐量和改进的效率,直到饱和点。

相比之下,通信受限的工作负载(例如,高专家并行度下的 Qwen-MoE 和 OLMoE)从增加功耗中获得的收益有限。在这些状态下,推理时间的很大一部分花在了通信操作上,例如通过NVLink或PCIe的专家路由和全对全交换。

参见图注图2. 按模型和配置划分的计算与通信时间分解。Mixtral 保持计算受限;Qwen-MoE 和 OLMoE 在更高的 TP 和批处理大小下变得通信受限。

因此,对于通信受限的配置,最佳工作点转向较低的功耗上限。此外,相同的功耗配置根据通信/计算比率可以产生根本不同的效率结果,使得静态配置本质上就是次优的。

参见图注图3. 三种 MoE 模型(单节点,4×A100)的帕累托前沿扩展。显示了四个前沿:仅 SW(批处理扫描,固定上限),仅 HW(上限扫描,固定批处理),HW+SW(联合上限×批处理),以及完全联合(HW+SW+TP)。完全前沿优于任何单一旋钮方法;收益取决于模型,并遵循计算/通信比率。

### 2.2. 通过硬件-软件旋钮组合扩展帕累托前沿

我们通过比较可实现效率前沿与仅改变一类旋钮的配置,量化了联合控制硬件和软件参数的收益。图3 (https://arxiv.org/html/2605.21427#S2.F3) 显示了结合硬件和软件控制旋钮对可实现效率前沿的影响。为了说明这一点,我们构建了三个

相似文章

PowerAtlas:面向电力系统的电算协同调度

arXiv cs.LG

PowerAtlas是一个LLM代理框架,用于在数据中心中联合调度电力和计算,确保电网可行性和任务SLA。通过与真实电力公司和包含2000个实例的新基准(ECBench)进行验证,它在多个开放权重LLM上显示出一致的性能提升。

通过潜在感知实例生成与LLM进化并行算法组合

arXiv cs.AI

本文介绍了PIAC,一种通过使用潜在增益度量(无需参考解)并利用LLM生成多样化的实例变异器,来改进基于LLM的并行算法组合自动构建的框架。在TSP和CVRP上,它持续优于现有的LLM-ACP基线,实现了最高19.76%的相对改进。