power-aware

标签

Cards List
#power-aware

PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

arXiv cs.AI ↗ · 2026-05-22 缓存

PALS是一种面向LLM服务的功耗感知运行时,将GPU功率上限视为可控旋钮,与批大小联合优化,以在满足吞吐量目标的同时最大化能效。该系统在功率约束下可将能效提升高达26.3%,并将QoS违规减少4倍至7倍。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈