从Token到瓦时:现代GPU上LLM推理的分析能耗估算
摘要
本文提出了一种分析结构化、经验校准的方法,用于在不直接测量的情况下估算NVIDIA H100 GPU上LLM推理的能耗,该方法将预填充和解码阶段分开,并将能耗分解为计算、参数访问、KV缓存写入和注意力读取组件。
arXiv:2607.26571v1 公告类型:新
摘要:大语言模型(LLM)推理的运行能耗正成为已部署AI系统环境足迹中日益重要的组成部分。然而,直接测量推理能耗通常需要硬件遥测、功率仪器或特定基础设施监控,这限制了其在比较研究、早期系统设计和可持续性报告中的适用性。本报告提出了一种分析结构化、经验校准的GPU级方法,用于在不进行直接运行时测量的情况下估算NVIDIA H100级加速器上的LLM推理能耗。该估算器结合了参数缩放变压器FLOP计算、校准的内存流量因子以及FP16/BF16张量核心计算和高带宽内存移动的硬件特定能耗系数。它明确区分了提示预填充和自回归解码,从而能够估算输入令牌、输出令牌和完整推理请求的能耗。该方法还将总能耗分解为计算、参数访问、键值缓存写入和注意力读取组件,使得可以分析能耗随模型大小、上下文长度和生成令牌数量的缩放行为。所得估算并非旨在取代物理功率测量,而是提供透明、可重现、假设明确的近似值,适用于模型比较、绿色编码分析和LLM推理工作负载的设计时评估。
查看缓存全文
缓存时间: 2026/07/30 09:59
# 从Token到瓦时:现代GPU上大语言模型推理的解析能耗估算 来源:https://arxiv.org/html/2607.26571 \copyrightclause 本文版权归作者所有。依据知识共享署名4.0国际许可协议(CC BY 4.0)允许使用。 \conference [orcid=0000-0002-0877-7063, [email protected], ]\cormark[1]\fnmark[1] [orcid=0000-0001-7116-9338, [email protected], ]\fnmark[1]\fnmark[1] [orcid=0009-0006-1309-8598, [email protected], ] [orcid=0000-0002-0562-5136, [email protected], ] [ [email protected], ] [orcid=0000-0002-9421-8566, [email protected], ] [orcid=0000-0002-9421-8566, [email protected], ] [orcid=0000-0002-9421-8566, [email protected], ] \cortext[1]通讯作者。 \fntext[1]这些作者贡献相同。 Tina Vartziotis 雅典国家技术大学,Patission Complex 42, 10682 雅典,希腊 哈佛大学,1350 Massachusetts Avenue, 02138 剑桥,马萨诸塞州,美国 TWT GmbH Science & Innovation,Industriestraße 6, 70565 斯图加特,德国 Rodopi Kosteli NIKI Ltd Digital Engineering,205 National Resistance Street, 45500 约阿尼纳,希腊 约阿尼纳大学,校区,451 10 约阿尼纳,希腊 Elli Danae Vartziotis George Dasoulas Michael Keckeisen Konstantinos Skianis Sotirios Kotsopoulos 麻省理工学院,77 Massachusetts Avenue, 02139 剑桥,马萨诸塞州,美国 Francesca Dominici (2022) ###### 摘要 大语言模型(LLM)推理的运行能耗正成为已部署AI系统环境足迹中日益重要的组成部分。然而,直接测量推理能耗通常需要硬件遥测、功率仪表或基础设施级监控,这限制了其在对比研究、早期系统设计和可持续性报告中的适用性。本文提出了一种分析结构化、经验校准的GPU级方法,用于在无需直接运行时测量的情况下估算NVIDIA H100级加速器上的LLM推理能耗。该估算器结合了参数缩放Transformer FLOP计算、校准的内存流量因子,以及FP16/BF16张量核心计算和高带宽内存移动的硬件特定能耗系数。它明确区分了提示预填充和自回归解码,从而能够估算输入令牌、输出令牌以及完整推理请求的能耗。该方法还将总能耗分解为计算、参数访问、键-值缓存写入和注意力读取四个部分,从而可以分析其随模型规模、上下文长度和生成令牌数量的缩放行为。所得估算结果并非旨在替代实际功耗测量;而是提供透明、可重复且假设明确的近似值,适用于模型比较、绿色编码分析以及LLM推理工作负载的设计时评估。 ###### 关键词: 大语言模型\sep GPU推理\sep 推理能耗建模\sep Transformer系统\sep 计算排放\sep 张量核心计算\sep 能效AI\sep 绿色AI\sep 可持续计算\sep 高性能计算 ## 1 引言 随着大语言模型(LLM)在云端、边缘和本地部署中服务于数百万用户,其累积推理能耗已成为首要的可持续性问题,这源于大规模AI推理所带来的巨大计算和环境成本。先前在绿色AI领域的研究表明,模型能力的提升往往伴随着能耗和碳排放的增加,从而激发了机器学习研究和部署中的能耗感知方法[strubell2019energy, schwartz2020green]。虽然早期工作主要关注训练成本[patterson2021carbon],但更广泛的绿色AI研究强调了在ML全生命周期中计算效率、能耗感知报告和环境影响的重要性[schwartz2020green, henderson2020systematic, lacoste2019quantifying, lannelongue2021green],包括近期将能耗感知优化扩展到模型选择的努力[betello2025one]。此后,关注点已转向推理,因为这正成为已部署LLM系统中日益重要的运行组成部分。与偶尔进行的训练不同,推理工作负载连续运行,并通过自回归令牌生成随用户需求扩展,在模型部署生命周期内累积大量能耗成本[lim2024carbon]。其能耗足迹强烈依赖于生成令牌数量、序列长度、模型规模、硬件配置和批处理行为[fernandez2025energy, fu2024llmco2, Vartziotis_LLMasaService]。这使得推理能耗不仅是大型云提供商的现实关切,也是应用AI团队、研究小组以及使用本地或本地GPU基础设施部署LLM的中小型组织的实际问题。对于此类部署,加速器侧能耗并不能完全反映服务级成本,因为系统和设施开销(包括冷却、网络和电力输送)也会产生贡献[uptime2024survey, mlperfpower2024]。尽管如此,在GPU密集系统中,GPU侧能耗通常是推理成本的一个主要可控组成部分[nvidia_h100_datasheet],这使得GPU级估算对于比较模型和工作负载选择、评估绿色编码干预措施[Vartziotis_GreenCode]以及在缺乏完整数据中心级仪器时做出部署时决策非常有用。 现有用于估算或报告AI相关能耗的方法通常依赖于硬件遥测、外部功耗测量、基础设施级监控或粗略的碳核算工具[lannelongue2021green, lacoste2019quantifying]。基于测量的研究在不同硬件配置和任务类型上提供了宝贵的经验证据[samsi_words_2023, luccioni_power_2024],但其结果受限于特定硬件、服务系统和运行时配置。碳感知推理工作(如SPROUT)进一步证明,自回归生成本身可以针对可持续性进行优化[li2024sprout]。相反,Transformer缩放定律研究和GPU微架构基准测试为分析FLOP和硬件能耗建模提供了基础[kaplan2020scaling, hoffmann2022training, antepara2025benchmark],但它们本身并不能提供请求级或令牌级的推理能耗估算。这留下了一个空白:需要透明、可重复的估算器,结合Transformer计算建模、内存流量归因和硬件特定能耗系数,以估算请求级和归一化令牌级的GPU推理能耗,而无需运行时仪器。 我们通过提出一种半解析方法来解决这一空白,用于估算LLM推理过程中加速器侧GPU计算和内存移动能耗。该估算器结合了参数缩放Transformer FLOP建模、校准的HBM内存流量估计和硬件特定能耗系数。它区分了提示预填充和自回归解码,报告了归一化的输入令牌、输出令牌和请求级能耗估算,并将总能耗分解为计算、参数访问、KV缓存写入和注意力读取四个部分。除了比较性估算外,该框架还指出了减少GPU推理能耗的可操作机制,包括更小的模型、更短的生成、KV缓存量化、提示压缩和改进的批处理效率。 ## 2 方法 本节定义了用于估算LLM推理中GPU级能耗的分析结构化、经验校准方法。该估算器专为无法进行直接运行时功耗测量、不切实际或无法跨系统比较的场景而设计。因此,它提供假设明确的能耗估算,而非替代硬件级测量。估算器的范围是加速器侧运行能耗。我们仅建模推理过程中GPU侧计算和GPU内存移动相关的能耗。系统级和数据中心级的贡献,包括CPU执行、主机内存、网络、存储、电源损耗、冷却和电能使用效率(PUE),不在本文范围内,也不包含在报告估算中。同样,本文不估算碳排放;所有报告量均表示为GPU级能耗。 每个推理请求分为两个阶段:提示预填充和自回归解码。在预填充阶段,模型处理输入提示并构建初始键-值(KV)缓存。在解码阶段,模型顺序生成输出令牌,每个步骤通过KV缓存关注累积的上下文。这种阶段分离是必要的,因为输入令牌和输出令牌的成本具有不同的计算和内存访问模式。 ### 2.1 请求级能耗分解 令 \(T_{\mathrm{in}}\) 表示输入令牌数量,即提供给模型的token化提示,令 \(T_{\mathrm{out}}\) 表示生成的输出令牌数量。一个请求的总GPU能耗 \(E_{\mathrm{GPU}}\) 分解为预填充和解码能耗: \[ E_{\mathrm{GPU}} = E_{\mathrm{pre}} + E_{\mathrm{dec}}. \] 其中 \(E_{\mathrm{pre}}\) 是预填充阶段消耗的能耗,\(E_{\mathrm{dec}}\) 是自回归解码阶段消耗的能耗。报告中的输入令牌和输出令牌能耗值定义为: \[ E_{\mathrm{in/token}} = \frac{E_{\mathrm{pre}}}{T_{\mathrm{in}}}, \quad E_{\mathrm{out/token}} = \frac{E_{\mathrm{dec}}}{T_{\mathrm{out}}}. \] 其中 \(E_{\mathrm{in/token}}\) 和 \(E_{\mathrm{out/token}}\) 分别表示每个输入令牌和每个生成输出令牌的平均能耗。这些量并非模型的固有常数。它们取决于提示长度、生成令牌数量、推理精度、批处理、缓存复用、硬件特性和服务实现。 在GPU层面,请求能耗建模为张量核心计算能耗和高带宽内存(HBM)移动能耗之和: \[ E_{\mathrm{GPU}} = E_{\mathrm{compute}} + E_{\mathrm{memory}}. \] 其中 \(E_{\mathrm{compute}}\) 表示张量核心计算消耗的能耗,\(E_{\mathrm{memory}}\) 表示内存移动消耗的能耗。这种分解遵循常见的GPU能耗建模方法,将计算和数据移动视为能耗的主要贡献者[antepara2025benchmark]。计算项与张量核心浮点运算数量成正比: \[ E_{\mathrm{compute}} = \alpha_{\mathrm{TC}} C_{\mathrm{TC}}, \] 其中 \(C_{\mathrm{TC}}\) 表示张量核心FLOPs,\(\alpha_{\mathrm{TC}}\) 是硬件特定的每张量核心FLOP能耗。内存项与通过HBM传输的比特数成正比: \[ E_{\mathrm{memory}} = e_{\mathrm{HBM}} Q_{\mathrm{HBM}}, \] 其中 \(Q_{\mathrm{HBM}}\) 表示以比特为单位的HBM流量,\(e_{\mathrm{HBM}}\) 是每传输HBM比特的能耗。结合这些项得到: \[ E_{\mathrm{GPU}} = \alpha_{\mathrm{TC}} C_{\mathrm{TC}} + e_{\mathrm{HBM}} Q_{\mathrm{HBM}}. \] 该公式将工作负载依赖量 \((C_{\mathrm{TC}}, Q_{\mathrm{HBM}})\) 与硬件特定系数 \((\alpha_{\mathrm{TC}}, e_{\mathrm{HBM}})\) 分开[antepara2025benchmark]。 ### 2.2 计算模型 对于密集解码器仅Transformer,我们使用标准参数缩放Transformer估计来近似主导张量核心FLOPs: \[ C_{\mathrm{pre,dense}} = K N T_{\mathrm{in}}, \quad C_{\mathrm{dec,dense}} = K N T_{\mathrm{out}}, \] 其中 \(N\) 是模型参数数量,\(K = 6\) 是每参数每令牌的FLOP系数。对于长上下文,通过 \[ C_{\mathrm{pre}} = C_{\mathrm{pre,dense}} + C_{\mathrm{pre,attn}}, \quad C_{\mathrm{dec}} = C_{\mathrm{dec,dense}} + C_{\mathrm{dec,attn}}, \] 添加架构感知的注意力校正,使得 \[ C_{\mathrm{TC}} = C_{\mathrm{pre}} + C_{\mathrm{dec}}. \] 完整的注意力校正项见补充材料A节 (https://arxiv.org/html/2607.26571#A1)。 ### 2.3 内存移动模型 除了张量核心计算,LLM推理还需要通过GPU内存层次结构进行大量数据移动。我们将主导的片外内存流量近似为高带宽内存(HBM)流量,并将其分解为参数访问流量、KV缓存写入流量和与注意力相关的KV缓存读取流量: \[ \mathrm{Bits}_{\mathrm{total}} = \mathrm{Bits}_{\mathrm{params}} + \mathrm{Bits}_{\mathrm{KV}} + \mathrm{Bits}_{\mathrm{attn}}'. \] 这种分解捕获了自回归Transformer推理中内存流量的主要来源,包括参数访问、KV缓存存储和注意力相关读取,正如现代LLM服务系统中所观察到的[kwon2023efficient]。相应的内存能耗建模为: \[ E_{\mathrm{memory}} = \mathrm{Bits}_{\mathrm{total}} \cdot e_{\mathrm{HBM}} \cdot \eta(N), \] 其中 \(e_{\mathrm{HBM}}\) 是从HBM传输每比特的能耗,\(\eta(N)\) 是校准的内存低效因子。各个内存流量项的定义见第3.4节 (https://arxiv.org/html/2607.26571#S3.SS4),完整推导见补充材料B节 (https://arxiv.org/html/2607.26571#A2)。 ### 2.4 总请求和令牌级能耗 一个请求的总GPU能耗 \(E_{\mathrm{request}}\) 通过结合张量核心计算项和校准的HBM内存移动项得到: \[ E_{\mathrm{request}} = \alpha_{\mathrm{TC}} \left( C_{\mathrm{pre}} + C_{\mathrm{dec}} \right) + \mathrm{Bits}_{\mathrm{total}} \cdot e_{\mathrm{HBM}} \cdot \eta(N). \] 其中 \(C_{\mathrm{pre}}\) 和 \(C_{\mathrm{dec}}\) 表示总的预填充和解码张量核心FLOPs,来自第2.2节中的密集项,以及适用时补充材料A节中的注意力校正项。\(\mathrm{Bits}_{\mathrm{total}}\) 表示总HBM流量(公式(10))。因子 \(\eta(N)\) 是无量纲的低效乘数,应用于内存项,代表非理想HBM行为。每个处理令牌的平均能耗为: \[ E_{\mathrm{avg/token}} = \frac{E_{\mathrm{request}}}{T_{\mathrm{in}} + T_{\mathrm{out}}}. \]
相似文章
EnergyLens: 面向多GPU大语言模型推理优化的预测性能耗感知探索
EnergyLens是一个端到端的框架,用于多GPU大语言模型推理的预测性能耗感知优化,在Llama3和Qwen3-MoE上验证,平均绝对百分比误差在9.25%至13.19%之间,并揭示了不同配置之间显著的能耗差异。
观点:LLM推理应当以能量到令牌的生产来评估
本文主张,在计算、功耗、冷却和运营效率的约束下,LLM推理应当作为能量到令牌的生产来评估,并提出了如焦耳/令牌和经PUE调整的输送功率等新指标。
基于混合分析与机器学习预测器的大语言模型推理延迟与能耗多级建模
本文介绍了HYMELL,一种混合分析与机器学习框架,用于估算LLM在预填充(prefill)和解码(decode)阶段的推理延迟与能耗,并在NVIDIA H100上进行了验证,对LLaMA 3 8B的误差低于5%。
@hardmaru: 人脑极其高效,因为它只激活特定思维所需的神经元。现代LLM…
本文介绍了TwELL和Hybrid稀疏格式,配合自定义CUDA内核,有效利用LLM中的非结构化稀疏性,在H100 GPU上实现了训练和推理速度提升超过20%,同时降低了能耗和内存使用。
WattLayer: 正确理解层以估算神经网络的推理能耗
本文介绍了WattLayer,一种与任务无关的逐层能量估算模型,用于神经网络。该模型在295种架构的超过10万个层上进行了评估,实现中位误差19.6%,优于现有最先进方法。