基于混合分析与机器学习预测器的大语言模型推理延迟与能耗多级建模

arXiv cs.LG 论文

摘要

本文介绍了HYMELL,一种混合分析与机器学习框架,用于估算LLM在预填充(prefill)和解码(decode)阶段的推理延迟与能耗,并在NVIDIA H100上进行了验证,对LLaMA 3 8B的误差低于5%。

arXiv:2608.06723v1 公告类型:新 摘要:大型语言模型(LLM)的快速扩展显著增加了计算成本、能耗和推理延迟,使得准确估算对于可持续的人工智能部署和硬件感知设计至关重要。在这项工作中,我们提出了LLM能耗与延迟的混合建模方法(HYMELL),这是一个结合分析建模与机器学习(ML)的三级混合框架,用于估算LLM推理延迟和能耗。HYMELL通过三级层次结构对LLM执行进行建模:原始操作的分析估算、高层组件的ML预测,以及一个端到端模型,用于捕获预填充(prefill)和解码(decode)阶段的系统级开销。该框架支持多种架构,包括密集和混合专家(MoE)前馈网络(FFN),以及多头注意力(MHA)和分组查询注意力(GQA)机制。在NVIDIA H100图形处理器(GPU)上评估时,HYMELL实现了高预测精度;值得注意的是,对于LLaMA 3 8B,它在预填充和解码阶段均实现了低于5%的误差。通过直接从架构参数预测执行成本,它能够实现快速、无需硬件的设计空间探索和节能优化。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:02

# 基于混合解析-机器学习预测器的大语言模型推理延迟与能耗多层级建模
来源:https://arxiv.org/html/2608.06723

Mohammad Erfan Sadeghi,南加州大学,美国加利福尼亚州洛杉矶,[email protected] (https://arxiv.org/html/2608.06723v1/mailto:[email protected]),Mehdi Kamal,南加州大学,美国加利福尼亚州洛杉矶,[email protected] (https://arxiv.org/html/2608.06723v1/mailto:[email protected]) 和 Massoud Pedram,南加州大学,美国加利福尼亚州洛杉矶,[email protected] (https://arxiv.org/html/2608.06723v1/mailto:[email protected])

###### 摘要。

大语言模型(LLM)的快速扩展显著增加了计算成本、能耗和推理延迟,使得准确估算对于可持续人工智能部署和硬件感知设计至关重要。在这项工作中,我们提出了LLM能耗与延迟混合建模(HYMELL),这是一个结合解析建模与机器学习(ML)的混合三级框架,用于估算LLM推理延迟和能耗。HYMELL通过三个层级层次对LLM执行进行建模:原语操作的解析估算、更高层级组件的ML预测,以及一个捕获预填充和解码阶段系统级开销的端到端模型。该框架支持多种架构,包括密集和混合专家(MoE)前馈网络(FFN),以及多头注意力(MHA)和分组查询注意力(GQA)机制。在NVIDIA H100图形处理器(GPU)上评估时,HYMELL实现了高预测精度;值得注意的是,对于LLaMA 3 8B,它在预填充和解码阶段的误差均小于5%。通过直接从架构参数预测执行成本,它能够实现快速的、无需硬件的设计空间探索和能效优化。

大语言模型、功耗估算、能耗建模、GPU能耗、延迟估算

††版权:无††ccs:硬件 功耗估算与优化††ccs:硬件 平台功耗问题††ccs:硬件 能耗计量## 1.引言

神经网络(NN),特别是大语言模型(LLM),已成为现代人工智能的核心。大多数LLM基于《Attention Is All You Need》(vaswani2017attention, (https://arxiv.org/html/2608.06723#bib.bib1))中引入的Transformer架构,并且通常实现为密集或混合专家(MoE)模型(fedus2022switch, (https://arxiv.org/html/2608.06723#bib.bib2))。然而,它们的快速扩展和部署已经带来了大量的能源成本(schwartz2019greenai, (https://arxiv.org/html/2608.06723#bib.bib3);luccioni2024power, (https://arxiv.org/html/2608.06723#bib.bib4));例如,训练GPT-3估计消耗约1,287兆瓦时电力并产生552吨二氧化碳当量(patterson2021carbon, (https://arxiv.org/html/2608.06723#bib.bib5))。因此,大量研究致力于通过剪枝、量化、高效注意力、稀疏性和内存高效服务等技术来降低NN和LLM的能耗(han2016deepcompression, (https://arxiv.org/html/2608.06723#bib.bib6);abbasi2026integration, (https://arxiv.org/html/2608.06723#bib.bib7);strumolo2025data, (https://arxiv.org/html/2608.06723#bib.bib8);frantar2022gptq, (https://arxiv.org/html/2608.06723#bib.bib9);dettmers2022llmint8, (https://arxiv.org/html/2608.06723#bib.bib10);dao2022flashattention, (https://arxiv.org/html/2608.06723#bib.bib11);dao2023flashattention2fasterattentionbetter, (https://arxiv.org/html/2608.06723#bib.bib12);frantar2023sparsegpt, (https://arxiv.org/html/2608.06723#bib.bib13);kwon2023efficient, (https://arxiv.org/html/2608.06723#bib.bib14))。NN,尤其是LLM,现在被广泛应用于各种场景,包括自然语言处理、工程、医疗保健、金融、法律和教育(chen2021evaluating, (https://arxiv.org/html/2608.06723#bib.bib15);abdollahi2026unified, (https://arxiv.org/html/2608.06723#bib.bib16);abdollahi2026hdlforgetwostagemultiagentframework, (https://arxiv.org/html/2608.06723#bib.bib17);golkarieh2025semi, (https://arxiv.org/html/2608.06723#bib.bib18);fayyazi2026coft, (https://arxiv.org/html/2608.06723#bib.bib19);khezresmaeilzadeh2025preserving, (https://arxiv.org/html/2608.06723#bib.bib20);singhal2023large, (https://arxiv.org/html/2608.06723#bib.bib21);wu2023bloomberggpt, (https://arxiv.org/html/2608.06723#bib.bib22);guha2023legalbench, (https://arxiv.org/html/2608.06723#bib.bib23);kasneci2023chatgpt, (https://arxiv.org/html/2608.06723#bib.bib24))。其迅速增长的应用使得对LLM推理延迟和能耗进行高效且准确的建模变得越来越重要。

参见图1。LLM的通用架构(L和N_H分别表示层数和注意力头数)。如图1 (https://arxiv.org/html/2608.06723#S1.F1)所示,尽管实现上存在差异,大多数LLM共享堆叠层的通用架构,包括注意力机制(多头注意力(MHA)或分组查询注意力(GQA))和前馈网络(FFN;密集或混合专家(MoE))。在更低的执行层面上,这些组件对应通用矩阵乘法(GEMM)以及逐元素或非线性操作(例如,归一化、softmax)。虽然GEMM主导预填充计算,但内存受限的逐元素操作占总能耗的很大一部分,尤其是在自回归解码期间。

LLM推理包含两个具有不同特征的阶段。在预填充阶段,整个输入序列被并行处理,由于大型矩阵乘法,该阶段主要受计算约束。相比之下,解码阶段以自回归方式生成token,越来越依赖于键值(KV)缓存访问,使其对延迟敏感且通常受内存约束。这些差异促使我们跨阶段分别对性能和能耗进行建模。

在本文中,我们提出了LLM能耗与延迟混合建模(HYMELL),一种用于LLM推理过程中能耗和延迟的混合模型。HYMELL采用三阶段建模方法:

1. (1)算子级建模:解析模型首先估算原语操作的延迟和能耗成本,包括归一化、softmax和GEMM。
2. (2)块级建模:然后,机器学习(ML)模型利用这些估算来预测块级组件的成本,包括注意力和前馈网络(FFN)块。
3. (3)系统级建模:最后,一个ML模型聚合预测的块成本,以估算整个LLM的端到端推理延迟和能耗。

我们的目标是构建准确且可解释的预测器,能够跨序列长度和批处理机制进行泛化,从而为密集和稀疏MoE的LLM实现能耗感知的部署和设计决策。

## 2.相关工作

大量研究工作已探索了预测LLM运行时间(延迟)和能耗的方法。

AMALI(精确建模LLM推理的解析模型)(cao2025amali, (https://arxiv.org/html/2608.06723#bib.bib25))提出了一种详细的解析模型,通过显式捕获底层架构行为来对现代图形处理器(GPU)上的LLM推理进行建模。虽然它实现了高精度,但它依赖于大量手动建模和校准,需要对每个内核和每个工作负载进行详细分析。这种对GPU微架构知识的强烈依赖使得该方法复杂且不太易用。此外,将模型适配到新的LLM架构或内核需要重复分析,限制了可扩展性。

LIFE(patwari2025forecastingllminferenceperformance, (https://arxiv.org/html/2608.06723#bib.bib26))引入了一个与硬件无关的解析框架,对算子级计算和内存行为进行建模。然而,它依赖于显式的硬件规格,如计算吞吐量和内存带宽,以及效率假设。将框架适配到新模型或优化需要手动重新配置其组件。此外,它对模拟流水线和配置驱动工作流的依赖增加了系统复杂性并限制了部署便利性。

SweetSpot(cavagna2026sweetspotanalyticalmodelpredicting, (https://arxiv.org/html/2608.06723#bib.bib27))提出了一种解析模型,基于计算和内存访问的复杂度来估算LLM推理的能效。虽然有效,但它需要推导与Transformer内部结构和工作负载结构相关的详细方程。这在适配新模型或未见行为时限制了灵活性,因为扩展该方法需要手动重新推导。此外,与更多数据驱动的方法相比,其结构化的解析流水线增加了建模开销。

(krupp2026takinglonginvestigating, (https://arxiv.org/html/2608.06723#bib.bib28))中的工作研究了使用推理时间作为代理来估算基于API的LLM的能耗。然而,这依赖于延迟与能耗直接相关的假设,这在硬件利用率、并行策略或系统级开销变化的情况下可能不成立。因此,该方法无法捕获细粒度的架构或工作负载相关效应,只能提供粗粒度的估算。

## 3.方法

图2 (https://arxiv.org/html/2608.06723#S3.F2)总结了HYMELL框架。HYMELL使用三级层次结构来预测LLM推理延迟和能耗。第1级使用基于算子维度和特定机制特征的解析估算器对原语算子进行建模,包括GEMM、Softmax和RMSNorm。第2级将这些原语预测与架构参数一起输入轻量级MLP,以估算注意力和FFN块的成本,捕获诸如重塑、掩码、激活和路由等残差开销。第3级将块级预测与全局模型参数(包括层数、序列长度、批大小和推理模式)相结合,以估算预填充和解码阶段的端到端延迟和能耗。

参见图2。HYMELL分层预测框架概述。第1级对原始GPU算子进行解析建模。第2级使用轻量级MLP预测块级执行。第3级将块级估算与架构参数相结合,以预测端到端延迟和能耗。连接原始GPU算子估算器、块级MLP预测器和端到端延迟/能耗预测器的三级HYMELL层次结构。

### 3.1.RMSNorm估算器(解析)

归一化是一种轻量级操作,独立应用于每个LLM层中的每个token。虽然每次调用成本很低,但在层和token之间的重复使用会产生不可忽略的延迟和能耗,尤其是在自回归解码期间。

在现代基于Transformer的LLM中,RMSNorm已在很大程度上取代了传统的层归一化(LayerNorm)。因此,在这项工作中,我们使用RMSNorm对归一化进行建模。尽管如此,所提出的估算方法可以轻松扩展到其他归一化变体,因为它们表现出类似的归约和逐元素执行模式。

为了捕获执行行为,我们采用了一种双机制估算器,根据处理的总元素数量来区分启动受限和内存受限的执行。对于每种机制,执行时间和能耗建模如下:

\(1\)ERMSNorm=α5EN⋅dmodel\+α4EN⋅log2⁡\(dmodel\)\displaystyle E\_\{\text\{RMSNorm\}\}=\alpha\_\{5\}^\{E\}\,N\cdot d\_\{\text\{model\}\}+\alpha\_\{4\}^\{E\}\,N\cdot\log\_\{2\}\(d\_\{\text\{model\}\}\)\+α3Edmodel\+α2EN\+α1Elog2⁡\(dmodel\)\+α0E\displaystyle+\alpha\_\{3\}^\{E\}\,d\_\{\text\{model\}\}+\alpha\_\{2\}^\{E\}\,N+\alpha\_\{1\}^\{E\}\,\log\_\{2\}\(d\_\{\text\{model\}\}\)+\alpha\_\{0\}^\{E\}(2)TRMSNorm=α5TN⋅dmodel\+α4TN⋅log2⁡\(dmodel\)\displaystyle T\_\{\text\{RMSNorm\}\}=\alpha\_\{5\}^\{T\}\,N\cdot d\_\{\text\{model\}\}+\alpha\_\{4\}^\{T\}\,N\cdot\log\_\{2\}\(d\_\{\text\{model\}\}\)\+α3Tdmodel\+α2TN\+α1Tlog2⁡\(dmodel\)\+α0T\displaystyle+\alpha\_\{3\}^\{T\}\,d\_\{\text\{model\}\}+\alpha\_\{2\}^\{T\}\,N+\alpha\_\{1\}^\{T\}\,\log\_\{2\}\(d\_\{\text\{model\}\}\)+\alpha\_\{0\}^\{T\}

其中NN是token数量,dmodeld\_\{\text\{model\}\}是隐藏维度,αiE\alpha\_\{i\}^\{E\}和αiT\alpha\_\{i\}^\{T\}是回归系数。执行机制由总工作量决定:当N⋅dmodelN\cdot d\_\{\text\{model\}\}低于阈值thRMSth\_\{\text\{RMS\}\}时,操作为启动受限;否则为内存受限。这种分离提高了建模精度,特别是对于小问题规模。估算器中的每一项捕获特定的物理方面:dmodeld\_\{\text\{model\}\}表示每个token的操作和依赖向量长度的内存访问;NN反映随序列长度的线性扩展;N⋅dmodelN\cdot d\_\{\text\{model\}\}作为总计算量和主要内存流量的代理;log2⁡\(dmodel\)\log\_\{2\}\(d\_\{\text\{model\}\}\)和N⋅log2⁡\(dmodel\)N\cdot\log\_\{2\}\(d\_\{\text\{model\}\}\)对基于树的归约的深度和总成本进行建模;偏置项则考虑固定的内核启动和同步开销。

这种双机制公式捕获了不同的执行行为而不增加模型复杂性,在保持大规模精度的同时减少小张量的误差。

总的来说,归一化最好被描述为具有不可

相似文章

降低LLM延迟

Reddit r/AI_Agents

用于降低大语言模型延迟、提高推理速度的技术和方法。

从Token到瓦时:现代GPU上LLM推理的分析能耗估算

arXiv cs.LG

本文提出了一种分析结构化、经验校准的方法,用于在不直接测量的情况下估算NVIDIA H100 GPU上LLM推理的能耗,该方法将预填充和解码阶段分开,并将能耗分解为计算、参数访问、KV缓存写入和注意力读取组件。

基于自监督早期退出机制加速大语言模型推理

arXiv cs.CL

本文介绍了一种针对大语言模型的自监督早期退出方法,允许在置信度较高时在中间层提前停止计算,从而降低推理成本。此外,还提出了动态自推测解码(DSSD),相比现有基线实现了更高的令牌接受率。