理解大语言模型推理在上下文长度和注意力架构下的能耗缩放

arXiv cs.LG 论文

摘要

本文对大语言模型推理的能耗进行了系统性实证研究,分析了如多头注意力(Multi-Head Attention)、分组查询注意力(Grouped Query Attention)和滑动窗口注意力(Sliding Window Attention)等注意力架构如何影响不同上下文长度和工作负载下的能耗缩放。

arXiv:2608.25096v1 公告类型:新 摘要:随着大语言模型(LLMs)的日益普及,推理的能耗和环境影响引起了越来越多的关注。本文对代表性开源大语言模型的解码阶段能耗进行了系统性实证研究,这些模型采用了多头注意力(Multi-Head Attention, MHA)、分组查询注意力(Grouped Query Attention, GQA)和带滑动窗口注意力的分组查询注意力(Grouped Query Attention with Sliding Window Attention, SWA)。研究旨在表征注意力架构如何影响不同推理工作负载下的解码阶段能耗。我们评估了四种模型在不同上下文长度、批大小和生成工作负载下的表现,同时使用NVIDIA硬件计数器测量GPU能耗。我们考察了上下文长度、注意力机制、键值(KV)缓存增长和批处理对解码阶段能耗的影响。结果表明,注意力机制是控制解码能耗随上下文长度缩放的主要因素。MHA模型表现出比GQA模型显著更陡峭的能耗增长,而GQA与SWA结合则保持几乎恒定的能耗。我们进一步表明,模型大小主要决定绝对能耗,而批处理可将每生成令牌的能耗和请求延迟最多降低87%。这些发现为选择节能的大语言模型架构和推理配置提供了实用指导。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:33

# 理解跨上下文长度和注意力架构的大型语言模型推理能耗缩放规律
来源:https://arxiv.org/html/2608.25096
Molka Chkir1, Syed Muhammad Danish1, Jos Höll2, Arghavan Asad1Affiliation:2罗伊特林根大学计算机学院, 罗伊特林根Affiliation:1阿戈马大学, 布兰普顿, 加拿大 邮箱: \{mchkir, syed\.danish, arghavan\.asad\}@algomau\.ca, jos\.hoell@reutlingen\-university\.de

###### 摘要

大型语言模型 \(LLMs\) 的日益普及引发了对其推理阶段能耗和环境影响的日益关注。本文通过系统性的实证研究,分析了采用多头注意力 \(MHA\)、分组查询注意力 \(GQA\) 以及带滑动窗口注意力的分组查询注意力 \(SWA\) 的代表性开源 LLM 在解码阶段的能耗,旨在表征不同推理负载下注意力架构如何影响解码阶段能耗。我们在不同上下文长度、批大小和生成负载下评估了四种模型,并通过 NVIDIA 硬件计数器测量 GPU 能耗。我们研究了上下文长度、注意力机制、键值 \(KV\) 缓存增长以及批处理对解码阶段能耗的影响。结果表明,注意力机制是决定解码能耗随上下文长度缩放规律的主要因素。MHA 模型的能量增长显著高于 GQA 模型,而 GQA 与 SWA 的结合则保持近乎恒定的能耗。我们进一步证明,模型规模主要决定绝对能耗,而批处理可将每个生成 token 的能耗和请求延迟最多降低 87%。这些发现为选择能效更高的 LLM 架构和推理配置提供了实用指导。

###### 索引词:

大型语言模型,可持续性,注意力机制,KV 缓存

## I 引言

LLMs\[1 (https://arxiv.org/html/2608.25096#bib.bib19)\] 已成为现代 AI 应用的基础,支持对话助手、代码生成\[2 (https://arxiv.org/html/2608.25096#bib.bib21)\]、问答和摘要\[3 (https://arxiv.org/html/2608.25096#bib.bib1)\] 等能力。随着这些模型从研究原型过渡到生产服务,其环境影响日益受到关注。训练和提供 LLM 的计算需求导致了巨大的能源消耗、碳排放和用水量\[4 (https://arxiv.org/html/2608.25096#bib.bib2)\]。虽然模型训练传统上最受关注,但最近的研究估计,推理阶段可能占模型整个生命周期能源消耗的 90%\[5 (https://arxiv.org/html/2608.25096#bib.bib3)\]。因此,提高推理效率已成为可持续部署 LLM 应用的关键挑战。

尽管对可持续的 LLM 推理兴趣日增,现有工作的范围仍然有限。大多数先前研究关注的是模型训练的环境影响\[4 (https://arxiv.org/html/2608.25096#bib.bib2),6 (https://arxiv.org/html/2608.25096#bib.bib5)\],或者仅在固定负载下使用少量模型评估推理能耗\[7 (https://arxiv.org/html/2608.25096#bib.bib20)\],对于影响推理能耗的因素提供的见解有限。一个特别重要但未被充分探索的因素是现代 LLM 架构中注意力机制的演变。当代模型采用了日益多样化的注意力设计,包括 MHA\[8 (https://arxiv.org/html/2608.25096#bib.bib11)\]、GQA\[9 (https://arxiv.org/html/2608.25096#bib.bib10)\] 以及结合 SWA 的分组查询注意力\[10 (https://arxiv.org/html/2608.25096#bib.bib12)\]。这些机制在自回归解码过程中如何存储和访问键值状态方面存在根本差异,导致随上下文长度增加而产生不同的计算和内存行为。尽管这些架构创新主要是为了提高推理效率,但其对解码阶段能耗缩放的影响尚未得到系统表征。因此,开发者缺乏关于注意力架构如何影响推理能耗及相关部署权衡的实证指导。

为解决这一差距,我们对采用不同注意力机制的代表性开源 LLM 的解码阶段能耗进行了系统性的实证研究。我们的目标不仅仅是测量总能耗,而是理解在真实推理负载下解码能耗如何缩放。具体来说,我们研究了上下文长度、注意力机制设计、自回归生成过程中 KV 缓存增长以及请求批处理如何影响解码阶段能耗。我们提出以下研究问题 \(RQ\):

– RQ1:每个生成 token 的解码能耗如何随上下文长度增加而缩放?
– RQ2:不同的注意力机制如何影响解码能耗随上下文长度的缩放?
– RQ3:在生成序列中,随着 KV 缓存增长,token 位置如何影响解码能耗?
– RQ4:批处理如何影响不同模型和上下文长度下每个生成 token 的能耗和延迟?

为回答这些研究问题,我们对四种代表性的开源 LLM 进行了全面的实证评估,它们涵盖了三种注意力机制:OPT\-1\.3B 和 Phi\-3 Mini \(MHA\),Gemma\-2\-2B \(GQA\),以及 Mistral\-7B \(GQA 与 SWA\)。我们的结果表明,注意力机制设计是决定解码能耗缩放的主要因素。MHA 模型的能量增长显著高于 GQA 模型,而 GQA 与 SWA 的结合在上下文长度增加时保持近乎恒定的能耗。在生成序列内,对于 MHA 模型,随着 KV 缓存增长,解码能耗逐渐增加;对于 GQA 模型基本保持稳定;而对于 SWA 则基本恒定。相比之下,尽管注意力架构决定了能耗缩放行为,但绝对能耗主要由模型规模驱动,这意味着较小的 MHA 模型尽管注意力机制效率较低,其每个生成 token 的能耗可能低于较大的 GQA 模型。最后,批处理持续提高了推理效率,在所有评估的模型和上下文长度下,每个生成 token 的能耗和请求延迟最多降低了 87%。这些发现共同系统性地表征了现代注意力机制如何影响解码阶段能耗缩放,并为大型语言模型的能效感知部署提供了实用指导。

论文其余部分组织如下。第 II 节介绍相关工作。第 III 节介绍总体方法论和实验设置。第 IV 节讨论每个研究问题的结果和分析。第 V 节介绍局限性,第 VI 节总结全文。

## II 相关工作

关于 LLM 环境影响的早期研究主要集中在训练阶段。Patterson 等人\[6 (https://arxiv.org/html/2608.25096#bib.bib5)\]量化了训练大型神经网络的碳排放,强调了开发前沿模型的巨大环境成本。在此基础上,Wu 等人\[5 (https://arxiv.org/html/2608.25096#bib.bib3)\]分析了 AI 系统的完整生命周期,并估计一旦模型大规模部署,推理可能占总能耗的 90%。这些研究确立了可持续 AI 的重要性,但对影响推理时能耗的因素提供的见解有限。

随着推理成为运营能源消耗的主要来源,一些研究开始表征 LLM 推理的能效。Samsi 等人\[11 (https://arxiv.org/html/2608.25096#bib.bib4)\]进行了最早的 LLM 推理基准测试之一,在 NVIDIA V100 和 A100 GPU 上评估了多种 LLaMA 模型在问答和数学推理任务上的表现。Luccioni 等人\[4 (https://arxiv.org/html/2608.25096#bib.bib2)\]系统比较了多种机器学习模型的推理成本,表明生成模型比特定任务系统消耗更多能量,且能耗随模型复杂度增加而增长。最近,Husom 等人\[12 (https://arxiv.org/html/2608.25096#bib.bib16)\]证明提示长度显著影响推理能耗,而 Stojkovic 等人\[13 (https://arxiv.org/html/2608.25096#bib.bib13)\]研究了提高 LLM 推理能效的系统级策略。类似地,TokenPowerBench\[14 (https://arxiv.org/html/2608.25096#bib.bib15)\]分析了不同服务配置下每个 token 的功耗,SustainableNLP\[15 (https://arxiv.org/html/2608.25096#bib.bib14)\]对多样化的模型和任务集合进行了推理能耗基准测试,强调了模型架构和负载特征的影响。尽管这些研究显著推进了对推理能耗的理解,但它们主要报告了聚合测量结果,未分离解码阶段,也未系统研究注意力机制设计如何影响随上下文长度增加的能量缩放。

与此同时,大量研究集中在通过架构创新提高 Transformer 效率。Vaswani 等人\[8 (https://arxiv.org/html/2608.25096#bib.bib11)\]引入了 MHA,这构成了现代 Transformer 架构的基础。Ainslie 等人\[9 (https://arxiv.org/html/2608.25096#bib.bib10)\]提出了 GQA,通过允许多个查询头共享一组较小的键值头来降低解码成本。Beltagy 等人\[10 (https://arxiv.org/html/2608.25096#bib.bib12)\]引入了 SWA,将注意力限制在固定的局部上下文以降低长序列的计算复杂度。基于这些思想,Jiang 等人\[16 (https://arxiv.org/html/2608.25096#bib.bib9)\]将 GQA 和 SWA 结合到 Mistral\-7B 中,展示了长上下文生成推理吞吐量的显著提升。除了架构变更,Pope 等人\[17 (https://arxiv.org/html/2608.25096#bib.bib17)\]从系统角度研究了 Transformer 推理效率,而 Chung 等人\[18 (https://arxiv.org/html/2608.25096#bib.bib18)\]研究了量化、批处理和服务策略,表明批大小在降低每个生成 token 的能耗方面起着关键作用。尽管有这些进步,现有工作主要集中在提高计算效率,而非理解不同注意力机制如何从根本上影响解码阶段能耗。

### II\-A 本工作的创新性

现有研究已从模型基准测试、硬件平台、提示特征和服务策略等角度研究了推理时能耗。然而,没有研究系统地表征随着上下文长度增加,注意力机制设计如何影响解码阶段能耗缩放。先前的工作要么报告未分离解码阶段的聚合推理能耗,要么专注于单一模型族,要么在评估固定负载时未同时考虑上下文长度、token 生成位置和批处理。相比之下,本工作专门从预填充阶段中分离出解码阶段,并系统表征了上下文长度、注意力机制、token 生成位置和批大小如何共同影响解码阶段能耗。我们在相同的硬件、精度和测量条件下,使用硬件级 GPU 能耗计数器,评估了采用 MHA、GQA 和 GQA 与 SWA 的代表性 LLM。据我们所知,这是首次直接比较这些根本不同的注意力机制之间解码能耗缩放规律的研究。

我们的发现为部署时选择能效更高的 LLM 架构和推理配置提供了实用指导。它们也提供了现代注意力机制如何影响解码阶段能耗缩放的量化证据,为未来能效 LLM 架构的设计提供了信息。

## III 方法论

本节介绍了所提研究的总体方法论,如图 1 (https://arxiv.org/html/2608.25096#S3.F1) 所示。以下小节详细描述了方法论的各个组成部分。

参见说明符图 1:本工作的总体方法论。### III\-A LLM 的选择

在本研究中,我们评估了四种代表性的开源语言模型:OPT\-1\.3B\[19 (https://arxiv.org/html/2608.25096#bib.bib6)\]、Gemma\-2\-2B\[20 (https://arxiv.org/html/2608.25096#bib.bib8)\]、Phi\-3 Mini\[21 (https://arxiv.org/html/2608.25096#bib.bib7)\]和 Mistral\-7B\[16 (https://arxiv.org/html/2608.25096#bib.bib9)\]。选择这些模型是因为它们代表了现代 Transformer 架构中使用的不同注意力机制。具体来说,OPT\-1\.3B 和 Phi\-3 Mini 采用 MHA,Gemma\-2\-2B 采用 GQA,Mistral\-7B 将 GQA 与 SWA 结合。这种选择使得能够系统地比较不同注意力机制如何影响解码阶段能耗及其随上下文长度增加的缩放。为确保公平比较,所有模型均从 Hugging Face 下载,使用 16 位浮点精度 \(FP16\) 在本地执行,并在相同的硬件和软件条件下进行评估。

### III\-B 可持续性指标

为评估解码阶段推理的能效和性能,我们考虑三个指标:每个生成 token 的能耗、每个 token 的延迟和每个请求的延迟。

1\) 每个生成 token 的能耗:该指标表示在解码阶段生成一个输出 token 所需的平均 GPU 能耗。通过将总解码能耗除以生成的 token 数量计算得出。该指标能够在模型和上下文长度之间进行公平比较,报告单位为焦耳 \(J\)。

2\) 每个 token 的延迟:该指标表示在解码阶段生成一个输出 token 所需的平均时间。通过将总解码时间除以生成的 token 数量计算得出。它与每个生成 token 的能耗一起,有助于区分能耗差异是源于更高的功耗还是更慢的 token 生成。延迟以毫秒 \(ms\) 为单位报告。

3\) 每个请求的延迟:该指标表示在批处理推理中处理单个请求所需的平均时间。通过将总解码时间除以批大小计算得出。该指标捕捉了批处理对推理效率的影响,以毫秒 \(ms\) 为单位报告。

### III\-C 推理设置

模型选择后,所有四种模型均从 Hugging Face 下载并使用 16 位浮点精度 \(FP16\) 在本地执行。为确保所有模型和实验配置输入一致,我们从一段通用英文文本构建了固定的基本提示,并使用每个模型的分词器将其截断到目标上下文长度,确保分词后的输入与所需的上下文长度匹配。推理分为两个阶段:预填充和解码。在预填充阶段,处理输入提示并填充键值 \(KV\) 缓存;此阶段不包含在能耗测量中。在解码阶段,模型通过重用 KV 缓存自回归生成输出 token,只有此阶段被纳入评估。所有实验使

相似文章

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。

理解大型语言模型中与语气相关的推理成本

arXiv cs.CL

本文研究了提示语气如何影响大型语言模型的准确性和推理成本(输出令牌消耗),发现不同语气下输出令牌长度差异高达44.3%,而准确性变化较小,并确定了不同模型的最优语气。

大型语言模型中的句子级上下文夹带

arXiv cs.CL

本文将上下文夹带从标记级扩展到句子级,表明提示中的反事实句子在推理时也会增加其概率。该效应随模型规模增大而减弱,且由2-4%的注意力头驱动,这些注意力头可被消融而不影响性能。