WattLayer: 正确理解层以估算神经网络的推理能耗

arXiv cs.LG 论文

摘要

本文介绍了WattLayer,一种与任务无关的逐层能量估算模型,用于神经网络。该模型在295种架构的超过10万个层上进行了评估,实现中位误差19.6%,优于现有最先进方法。

arXiv:2606.27841v1 公告类型: 新 摘要:人工智能(AI)的广泛采用引发了对能耗日益增长的关注,然而目前缺乏标准化的方法来准确估算AI推理能耗,尤其是在不同任务和架构之间。在本研究中,我们提出了一种与任务无关的、逐层能耗估算模型,适用于AI架构。该模型在包含超过10万个层的大型数据集上进行了评估,涵盖295种神经网络架构、3种广泛使用的任务和3种不同的硬件平台。我们的方法实现了中位误差19.6%,优于现有最先进方法。我们进一步证明,通过利用跨架构共享的层,逐层分解能够推广到新任务而无需完全重新训练。它为利益相关者提供了工具、洞察和精确的方法论,以赋能设计节能AI系统。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:26

# WattLayer: 正确分解层以估算神经网络推理能耗
来源: https://arxiv.org/html/2606.27841
\\copyrightclause

版权所有归本文作者所有。根据知识共享署名4.0国际许可协议 (CC BY 4.0) 允许使用。

\\conference

SuRE’26: 第1届人工智能可持续性与资源效率研讨会,与IJCAI 2026联合举办,2026年8月17日,德国不来梅

[[email protected], orcid=0009-0004-2226-6253, url=https://aupeka.github.io/] [email=marie\[email protected], orcid=0000-0002-3843-7617, ] [[email protected], orcid=0009-0009-6643-0568, url=https://www-sop.inria.fr/members/Sara.Alouf/] [[email protected], orcid=0000-0002-3727-051X, url=https://www-sop.inria.fr/members/Frederic.Giroire/] [[email protected], orcid=0000-0002-4367-5839, url=https://www-sop.inria.fr/members/Joanna.Moulierac/]

Marie Line Alberi-MorelSara AloufFrédéric GiroireJoanna Moulierac贝尔实验室,诺基亚网络法国Inria,蔚蓝海岸大学,法国蔚蓝海岸大学,CNRS,Inria,I3S,法国

(2026)

###### 摘要

人工智能的广泛普及引发了对能耗日益增长的关注,然而,目前缺乏标准化的方法来准确估算AI推理能耗,尤其是在不同任务和架构之间。在本研究中,我们提出了一种与任务无关、基于层的AI架构能耗估算模型。我们的模型在一个包含295个神经网络架构、超过10万个层的大型数据集上进行了评估,涵盖3个广泛使用的任务和3种不同的硬件平台。我们的方法实现了中位误差19.6%,优于现有最先进方法。我们进一步证明,通过利用跨架构共享的层,基于层的分解可以在无需完全重新训练的情况下泛化到新任务。本文提供了工具、见解和精确的方法论,使利益相关者能够设计节能的AI系统。

###### 关键词:

层分解\\sep能耗测量\\sep推理\\sep神经网络

## 1 引言

由于模型精度的持续提升,人工智能在各行业得到了迅速采用[maslej2025artificialintelligenceindexreport]。这种广泛普及导致能源需求大幅增长,尤其是在大规模模型方面。例如,谷歌报告称,机器学习工作负载在2019年至2021年间占其总能耗的10%至15%[patterson\_carbon\_2022]。AI能耗大致可分为两个阶段:训练和推理。尽管由于单次训练相比单次推理的绝对成本更高,历史上大部分效率工作都聚焦于训练[luccioni\_power\_2024],但AI服务的大规模部署已改变了这一平衡。在大规模场景下,推理——即模型的使用阶段——可能主导总能耗。事实上,来自谷歌[patterson\_carbon\_2022]和Meta[wu\_sustainable\_2022]的报告指出,推理约占总能耗的60–65%,在亚马逊云服务等云部署中甚至高达90%[chateauvieux\_optimize\_2022]。随着AI系统越来越深入地融入实际应用,节能模型设计在开发者中日益受到重视。然而,尽管需求不断增长,目前仍缺乏标准化的工具和方法来在无需执行模型的情况下估算AI系统的能耗。虽然谷歌[elsworth\_google\_2025]和Mistral AI[mistralai\_our\_2025]等公司已报告了大语言模型的能耗,但缺少统一的估算框架使得比较变得困难,并限制了在本地或个人部署场景中的实际应用。

本文介绍了WattLayer:一种与任务无关、基于层的神经网络架构能耗估算模型。我们提出并评估了在不同硬件和实验设置下估算能耗的方法论。通过在精度上优于现有最先进模型,我们证明了基于层的方法可以跨多个任务提升预测质量,并在无需重新训练的情况下泛化到全新任务,这使其区别于传统模型。本文满足了用户主动预测AI服务能耗这一新兴需求。它提供了神经网络层级别的精准能耗预测,使利益相关者能够在AI开发和部署过程中就能效做出明智决策。我们的主要贡献如下:

- •实验协议我们建立了一套严格的实验协议,以确保在GPU上对AI算法及其单个层的能耗测量可靠且可重复。
- •大规模数据集我们收集了涵盖3个广泛使用的任务和3种硬件的神经网络架构的能耗数据,最多包含295个架构,总计超过10万次能耗测量,创建了考虑完整架构和单个层能耗的AI能耗估算领域最全面的数据集之一。
- •架构特征提取我们开发了一个基于Python的框架,能够严格提取任何PyTorch架构的层分解,包括各层及其主要特征。这使得在层级别详细分析和建模能耗成为可能。
- •基于层的能耗估算方法论我们提出了WattLayer,一种与任务无关的AI算法能耗估算方法论。通过将架构分解到足够细的粒度以消除任务特定依赖,并且不同于需要为每个任务重新训练的现有最先进模型,我们的方法无需定制即可跨不同算法泛化,实现了卓越的精度和适应性。
- •大型语言模型的零样本泛化最后,我们在少量大语言模型上测试了层能耗模型的零样本泛化能力。该模型无需微调即成功估算LLM能耗(平均绝对百分比误差MAPE≤30%),展示了其泛化能力以及作为可持续AI倡议可靠工具的潜力。

## 2 相关工作

研究人员长期以来一直致力于能耗估算模型,最初针对通用程序[dubois\_parallel\_2012],近期则聚焦于AI算法[rodriguez\_evaluating\_2024]。[saborido\_impact\_2015]通过在离散时间间隔Δτ上测量功率,并假设两次测量之间功率恒定,来近似能耗值。给定k∈N个长度为Δτ∈R的间隔,E=∑\_k P(k·Δτ)Δτ 说明了能耗E与功率P之间的关系。基于这一定义,[yang\_part-time\_2024]试图理解NVIDIA-smi(NVIDIA提供的命令行工具,可用于监控、管理和查询GPU统计信息)提供的能耗测量内部机制。他们提出了一些非常实用的指导方针,帮助通过NVIDIA-smi收集功率和能耗数据。[li\_evaluating\_2016]提出了在GPU和CPU上对若干卷积神经网络(CNN)能耗的评估。他们评估了多种实验设置(包括库、批大小和硬件设置)对能耗的影响,并首次评估了几个CNN各层的能耗。他们发现,在卷积层、池化层、全连接层和ReLU层中,卷积层是能耗最高的层(占总能耗的87%)。

估算能耗的常用方法是使用神经网络执行的操作数量作为特征:FLOPs或MACs[rodrigues\_synergy\_2018, goel\_energynn\_2021, desislavov\_trends\_2023, getzner\_accuracy\_2023]。然而,仅凭这一特征往往不足够,需要补充其他特征或修改模型本身[sze\_efficient\_2017]。此外,使用架构级别的估算模型阻碍了在不同任务上的泛化。正如我们在第4节中的实验所示,向数据库添加新任务会削弱最终模型的估算性能。[bytezcom\_icml\_2025]收集了1200个视觉模型的能耗。他们提出了一种基于模型3个超参数(参数量、GMACs和激活数)的对数线性回归模型来估算能耗。总体而言,他们的模型误差为34%。虽然该模型提供了一个稳健的基准,并在受控条件下表现强劲,但其范围仅限于视觉架构。作者还提出了第二个使用吞吐量作为特征的估算模型,实现了误差率低于1%的卓越结果。他们建议在GPU信息不可用但吞吐量数据可获取的情况下,将此指标作为估算的可行选择。然而,在实验中测量GPU吞吐量与测量能耗一样具有挑战性,因此我们决定不将该第二个模型与我们进行比较。

另一种方法是通过建模神经网络各层的能耗来估算总能耗。这一策略已显示出前景[cai\_neuralpower\_2017, getzner\_accuracy\_2023, zhang\_ampere\_2025],但现有研究在硬件覆盖和执行设置方面仍然有限。NeuralPower提出了针对在GPU上执行的CNN的多项式回归框架,但仅考虑了卷积层、全连接层和池化层,并依赖于固定的GPU频率和电压设置。[getzner\_accuracy\_2023]引入了基于MACs等特征的线性回归模型,但专注于CPU执行,并在真实架构上显示出较低的精度。这些局限性凸显了需要一种更通用的方法论,以支持在现实硬件配置下的现代基于GPU的工作负载。我们在表1中总结了现有最先进模型。

表1:最先进模型总结,包括特征、模型类型和所处理的任务。模型特征层级别任务MACs激活参数量输入批大小视觉NLP音频或FLOPs大小模型NeuralPower[cai\_neuralpower\_2017]✓✓✓✓✓Getzner[getzner\_accuracy\_2023]✓✓✓MAC,例如[desislavov\_trends\_2023]✓✓✓HJ[bytezcom\_icml\_2025]✓✓✓✓WattLayer✓✓✓✓✓✓✓✓✓
## 3 方法论与实验设置

### 3.1 实验协议

所进行的实验涉及短时间过程。实际上,使用PyTorch库执行神经网络的某一层可能耗时不到一秒。为了确保高质量的实验数据并提高可重复性,必须建立严格的实验协议。这包括定义数据收集工具、测量频率以及每次执行的重复次数。

数据收集工具有多种应用程序可用于测量NVIDIA GPU的能耗或功耗。大多数(如果不是全部)这些应用程序都依赖于同一个工具来估算NVIDIA GPU能耗:NVIDIA-smi。[yang\_part-time\_2024]研究了NVIDIA-smi提供的能耗测量内部机制,发现该工具的总体测量误差为5%。基于这一发现,我们在实验中采用NVIDIA-smi。具体来说,我们使用CodeCarbon[benoit\_courty\_2024\_11171501]来测量能耗,它结合了Intel RAPL用于CPU能耗测量和NVIDIA-smi用于GPU能耗测量。

测量频率采样频率f\_mes设置为10 Hz,以接近[yang\_part-time\_2024]推荐的值,同时避免CodeCarbon报错。

重复次数为了获得可靠的能耗测量值,每次实验的持续时间必须明显长于功率传感器的采样间隔。因此,我们多次重复每次推理,并测量累积能耗。如第4.1节所示,重复次数直接影响测量精度。基于这些实验,我们定义了最小前向传播次数N\_mes,对于大多数实验设置为4,000次,对于自然语言处理层设置为15,000次。

### 3.2 基于层的能耗估算框架

框架我们的方法论通过将架构分解为单个层来估算神经网络的能耗。对于每种层类型,使用该层参数训练专门的估算模型。然后,通过汇总所有组成层的估算能耗,得到架构的总能耗。图1示意性地说明了该方法论。

![[无标题图片]](https://arxiv.org/html/2606.27841v1/x1.png)

图1:WattLayer用于神经网络能耗估算概述。为完整架构和单个层收集能耗测量值。训练阶段,层按类型分组,并为每组拟合专用模型。推理阶段,目标架构被分解为层,使用相应模型估算每一层的能耗,通过汇总所有层的估算值得到总能耗。

基于层的能耗估算设A为一个神经网络架构,具有N∈N个层L\_1, ..., L\_N。E\_A和{E\_\{L\_i}\}_i分别表示架构和层的能耗。我们假设总能耗E\_A可以近似为各层能耗{E\_\{L\_i}\}_i之和乘以一个修正因子α:E\_A ≈ α∑\_{i=1}^N E\_\{L\_i\}。尽管现有架构种类繁多,但使用的层类型数量有限(例如,Linear、Conv2d、Embedding等)。我们用type(i)表示层i的类型。然后,对于每种类型,我们定义一个层特定函数f\_\{type(i)\}(\mathbf{x}\_i)来估算层i的能耗,其中\mathbf{x}\_i表示影响层i能耗的相关参数。这些参数包括:#MAC、#Activation、#Parameters、Input shape、Batch size以及卷积层的Kernel size(见附录A)。最后,我们写成

E\_A ≈ α∑\_{i=1}^N E\_\{L\_i} = α∑\_{i=1}^N f\_\{type(i)\}(\mathbf{x}\_i), (1)

其中α是一个修正因子,用于考虑架构能耗与各层能耗求和之间的差距。

数据收集为训练层估算模型,我们收集了(E\_A,{E\_\{L\_i}\}_i)数据对。E\_A通过对架构进行多次推理并测量累积能耗直接获得。为了获得单个层的能耗,我们专门为每个感兴趣的层构建一个仅包含该层的微型神经网络

相似文章

从Token到瓦时:现代GPU上LLM推理的分析能耗估算

arXiv cs.LG

本文提出了一种分析结构化、经验校准的方法,用于在不直接测量的情况下估算NVIDIA H100 GPU上LLM推理的能耗,该方法将预填充和解码阶段分开,并将能耗分解为计算、参数访问、KV缓存写入和注意力读取组件。

学习线性逆问题的归一化能量模型

arXiv cs.LG

本文提出了一种新的用于线性逆问题的基于能量的模型,该模型学习归一化后验密度,克服了扩散模型的局限性。它实现了无偏采样、自适应采样和盲退化估计,在ImageNet、CelebA和AFHQ上具有竞争力的性能。