设备上LLMs中提示变化如何影响能耗?

arXiv cs.CL 论文

摘要

本文探讨了提示属性(如认知负荷和措辞模式)如何影响设备上LLM推理的能耗,表明认知负荷影响每个令牌的能耗,而措辞模式通过令牌使用影响能耗,强调了为能效设计模型感知提示的必要性。

arXiv:2609.01798v1 Announce Type: new 摘要:大型语言模型(LLMs)越来越多地部署在移动设备上,使能效成为关键的部署约束,但提示设计对能耗的影响仍被低估。本文旨在理解两个提示属性——认知负荷和措辞模式——如何塑造设备上LLM推理的能耗行为。我们进行了一项广泛的实证研究,涵盖提示属性、数据集、模型和设备,并通过阶段级性能分析分离了预填充和解码能耗。我们发现,认知负荷主要影响每个令牌的能耗成本,而措辞模式主要通过令牌使用影响能耗。我们的能效质量分析进一步表明,提示设计在不同模型上重塑了可达前沿,强调了在能效设备上LLM推理中需要模型感知的提示设计。代码、数据集和脚本可在 https://amai-gsu.github.io/PromptProperty/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:47

# 提示词变体如何影响设备端大语言模型的能耗?
来源:https://arxiv.org/html/2609.01798

魏华††贡献相等。涂晓龙11脚注标记:1  
单位:乔治亚州立大学  
邮箱:[[email protected]](mailto:[email protected])  
陈大为  
单位:丰田汽车北美公司  
\{whu6, xtu1\}@student.gsu.edu, [email protected]  
邮箱:[[email protected]](mailto:[email protected])  
陈逸涛  
单位:丰田汽车北美公司  
\{whu6, xtu1\}@student.gsu.edu, [email protected]  
韩京泽  
单位:丰田汽车北美公司  
\{whu6, xtu1\}@student.gsu.edu, [email protected]  
王浩鑫††通讯作者。  
单位:乔治亚州立大学

###### 摘要  
大语言模型(LLMs)正越来越多地部署在移动设备上,这使得能效成为关键部署约束,然而提示词设计对能耗的影响仍被严重忽视。本文旨在探究提示词的两个属性——认知负荷和句式模式——如何影响设备端大语言模型推理的能耗行为。我们进行了一项广泛的实证研究,涵盖提示词属性、数据集、模型和设备,并采用能分离预填充与解码能耗的阶段级分析。我们发现,认知负荷主要影响每个词元的能耗成本,而句式模式主要通过词元使用量影响能耗。我们的能效-质量分析进一步表明,提示词设计在不同模型上重塑了可实现的能效-质量前沿,凸显了在能效设备端大语言模型推理中需要模型感知的提示词设计。代码、数据集和脚本可在以下网址获取:https://amai-gsu.github.io/PromptProperty/。

## 1 引言  
大语言模型(LLMs)的部署正日益从云端服务扩展至移动和边缘平台上的设备端执行Chen等人 (2020) (https://arxiv.org/html/2609.01798#bib.bib5); Zhou等人 (2019) (https://arxiv.org/html/2609.01798#bib.bib53)。这一趋势是由对更强用户隐私保障、更低推理延迟和可靠离线访问的需求增长所驱动的Das等人 (2025) (https://arxiv.org/html/2609.01798#bib.bib9)。然而,与能耗被大规模基础设施摊销且对用户直接影响较小的云端推理不同,设备端推理由有限的电池供电,使得能效成为一个严格且用户可见的约束Liu等人 (2024) (https://arxiv.org/html/2609.01798#bib.bib27)。因此,能效已成为限制设备端大语言模型广泛采用的关键瓶颈Schwartz等人 (2020) (https://arxiv.org/html/2609.01798#bib.bib39)。

先前关于高效大语言模型的研究绝大多数集中在以模型为中心的优化技术上,包括量化、剪枝、架构压缩和蒸馏Xiao等人 (2023) (https://arxiv.org/html/2609.01798#bib.bib49); Dettmers等人 (2022) (https://arxiv.org/html/2609.01798#bib.bib10); Frankle和Carbin (2019) (https://arxiv.org/html/2609.01798#bib.bib11); Gu等人 (2024) (https://arxiv.org/html/2609.01798#bib.bib14); Hinton等人 (2015) (https://arxiv.org/html/2609.01798#bib.bib15)。这些方法主要通过参数或架构修改来减少模型大小和计算成本,从而提高推理效率,并已成为设备端大语言模型部署的主导策略。

此外,最近的一些研究通过分析提示词在措辞、结构和格式上的变化如何影响模型输出的质量和稳定性来考察提示词敏感性Long等人 (2025) (https://arxiv.org/html/2609.01798#bib.bib28); Ismithdeen等人 (2025) (https://arxiv.org/html/2609.01798#bib.bib18); Zhu等人 (2024) (https://arxiv.org/html/2609.01798#bib.bib54); Lu等人 (2022) (https://arxiv.org/html/2609.01798#bib.bib30)。然而,一个根本问题在很大程度上尚未被探索:提示词设计本身如何影响设备端大语言模型推理的能耗?如果不同的提示词变体即使在产生可比输出时也导致显著不同的能耗成本,那么提示词工程可能成为一种新的、与模型无关的方法,超越以模型为中心的优化来提高能效。

研究提示词变体如何影响设备端大语言模型的能耗并非易事。首先,提示词是语言产物,而能耗取决于它们在模型内部触发的计算,两者之间没有直接映射。因此,理解一个提示词为何耗能需要精心设计的实证分析,系统地将提示词变体与计算行为和测量功耗的差异联系起来。其次,以原则性方式构建提示词变体具有挑战性。提示词变体可以在许多维度上有所不同,例如措辞、认知负荷或长度,而天真的改变可能会无意中改变任务语义。设计能隔离特定提示词属性同时保持可比任务意图的提示词变体,对于将观察到的能耗差异归因于提示词设计至关重要。最后,获得可推广的见解需要超越孤立的例子,识别在提示词变体、任务、模型和硬件设备上保持一致的模式。

为应对这些挑战,我们设计并进行了一项全面的实证研究,系统性地考察了提示词变体对设备端大语言模型推理能耗的影响。我们的贡献总结如下:

- • **认知负荷的新数据集构建。** 我们构建了一个新的提示词数据集,在保持任务意图的同时改变认知需求。然后我们开发了基于大语言模型的评分和嵌入相似性以确保语义一致性并限制语义变化。该数据集能够受控地检查与认知负荷需求(而非语义差异)相关的能耗变化。
- • **提示词属性效应的实证研究。** 我们首次进行了大规模实证研究,探讨两个提示词属性——句式模式和认知负荷——如何影响设备端大语言模型推理的能耗,评估空间涵盖提示词变体 × 数据集 × 模型 × 设备。这使得首次研究语言形式和推理需求如何影响设备端大语言模型推理的计算行为。
- • **能耗行为分析与实证发现。** 我们使用每词元能耗和词元使用量来分析能耗行为,它们分别表示每个词元的成本和处理或生成的词元数量。我们发现认知负荷主要影响每词元能耗变化,而句式模式主要影响词元使用量。我们进一步表明,能效-质量权衡是模型依赖的,这为模型感知的、能效的提示词设计提供了指导。

## 2 提示词属性与数据集  
本节首先根据先前文献介绍两个提示词属性,然后介绍用于研究它们的数据集。

### 2.1 提示词属性  
为分析提示词变体如何影响能耗行为,我们关注两个代表性的提示词属性:句式模式和认知负荷。句式模式表征语义等价下的语言和结构变化,而认知负荷引入了推理结构和认知需求。这两个属性捕捉了提示词变体的互补方面,涵盖了表达形式和推理需求,如图1 (https://arxiv.org/html/2609.01798#S2.F1)所示。句式模式和认知负荷子属性的详细定义见附录A (https://arxiv.org/html/2609.01798#A1)。

图1:两个提示词属性的提示词示例。(a) 句式模式包括一个基础提示词和七个子属性,这些子属性在相同语义意图下捕捉表面语言和结构的变化。(b) 认知负荷包括一个基础提示词和三个子属性,它们改变提示词的信息密度和推理需求。

**句式模式。** 先前研究表明,语义等价的释义可能引发模型行为的显著变化,引发对鲁棒性和评估可靠性的担忧Ismithdeen等人 (2025) (https://arxiv.org/html/2609.01798#bib.bib18); Mizrahi等人 (2024) (https://arxiv.org/html/2609.01798#bib.bib33)。基于这种敏感性,我们将句式模式作为一个提示词属性来研究,它表征在保持语义意图的同时语气、语言风格和呈现结构的变化。借鉴Sotic和Kamps (2025) (https://arxiv.org/html/2609.01798#bib.bib40)为CLEF 2025 ELOQUENT实验室Karlgren等人 (2025) (https://arxiv.org/html/2609.01798#bib.bib21)引入的句式风格分类法,我们考虑了七个子属性:攻击性语气、会话语气、思维链(CoT)、格式差异、基于角色的提示、礼貌语气和技术性/术语密集的提示。

**认知负荷。** 认知负荷理论将认知负荷分为内在负荷、外在负荷和关联负荷,强调问题解决需要精心管理认知负荷Sweller和Chandler (1991) (https://arxiv.org/html/2609.01798#bib.bib41)。最近的工作将认知负荷概念化为一个提示词级属性,它系统地影响模型的推理行为Long等人 (2025) (https://arxiv.org/html/2609.01798#bib.bib28)。本文中,我们通过三个子属性考察认知负荷:内在负荷、外在负荷和关联负荷。每个子属性由明确的提示词线索表示,这些线索在保持原始任务意图的同时改变推理需求。

### 2.2 提示词数据集  
对于句式模式,我们从现有的鲁棒性评估数据集中选择变体;对于认知负荷,我们构建了一个新数据集。

**句式模式的公开基准数据集。** 为了研究句式模式,我们使用Sotic和Kamps (2025) (https://arxiv.org/html/2609.01798#bib.bib40)引入的数据集,该数据集为鲁棒性评估提供了语义等价提示词的受控风格变体。我们保留覆盖所选七个子属性的提示词。

**认知负荷的新数据集构建。** 由于没有现有的公开基准旨在捕捉认知负荷的三个子属性(内在、外在和关联负荷),我们使用手动设计的模板构建了一个新的认知负荷属性数据集,该模板指导大语言模型生成提示词变体(见附录B (https://arxiv.org/html/2609.01798#A2))。对于每个子属性,我们在最小化其他子属性混淆线索的同时创建专用的提示词变体。我们从三个代表不同推理类型的公开数据集中采样基础提示词作为语义锚点:SVAMP(算术应用题)Patel等人 (2021) (https://arxiv.org/html/2609.01798#bib.bib36)、BoolQ(二元是/否问答)Clark等人 (2019) (https://arxiv.org/html/2609.01798#bib.bib6)和AI2-ARC(多选科学题)Clark等人 (2018) (https://arxiv.org/html/2609.01798#bib.bib7)。

## 3 实证研究流程  
本节描述我们设计的实证研究流程。如图2 (https://arxiv.org/html/2609.01798#S3.F2)所示,该工作流包括三个阶段:提示词生成、提示词验证和设备端能耗分析。

图2:实证研究流程。提示词变体通过属性定义和生成约束从基础提示词生成,然后通过评分和语义相似性过滤进行验证。验证通过的提示词通过MLC-LLM部署在轻量级大语言模型(Gemma-2-2B Team等人 (2024) (https://arxiv.org/html/2609.01798#bib.bib42), Llama-3.2-1B Grattafiori等人 (2024) (https://arxiv.org/html/2609.01798#bib.bib13), Qwen-2.5-0.5B/1.5B Team (2024) (https://arxiv.org/html/2609.01798#bib.bib43), and SmolLM2-360M Allal等人 (2025) (https://arxiv.org/html/2609.01798#bib.bib1))上,以收集阶段级功耗、延迟和响应质量测量值。

### 3.1 提示词变体生成  
对于认知负荷属性,我们为每个基础提示词生成三个变体,分别对应内在负荷、外在负荷和关联负荷。我们使用Gemini-2.5-Pro API Comanici等人 (2025) (https://arxiv.org/html/2609.01798#bib.bib8)作为生成器。给定从公开数据集采样的基础提示词,生成器生成目标特定提示词子属性同时保留语义意义的候选提示词变体。生成过程遵循三个规则:(i)单属性隔离,其中每个变体只实例化一个提示词子属性以避免属性重叠;(ii)语义保留,即原始任务意图和预期答案保持不变;(iii)子属性一致性,其中每个单独的变体严格遵循其目标子属性的精确定义。

### 3.2 提示词变体验证  
为确保生成的提示词变体有效且与预期的认知负荷子属性对齐,所有候选变体都通过严格的验证过程:(i)属性纯度:确认每个候选严格反映其目标子属性,同时避免与其他子属性重叠。(ii)语义相似性:验证每个候选在语义上与基础提示词保持对齐,对齐程度通过基于嵌入的余弦相似性量化。

**提示词变体评分。** 为了提示词变体质量控制,我们采用Long等人 (2025) (https://arxiv.org/html/2609.01798#bib.bib28)的基于量规的评分系统,该系统不仅提供了定义,还提供了用于认知负荷属性的标准化评估模板(见附录C (https://arxiv.org/html/2609.01798#A3))。具体来说,我们反转外在负荷的标准评分方向,以便更高的分数表示存在更多无关和冗余信息,与预期的外在负荷子属性对齐更好。根据评估模板,每个变体在三个认知负荷子属性上获得一个分数向量 \(\mathbf{s}=(s_i, s_e, s_g)\)。为了隔离目标属性,我们仅保留目标子属性分数至少为8分,且所有非目标分数在1-10分制上最多为3分的变体。

**语义一致性过滤。** 我们进一步过滤每个提示词变体组,以防止原始任务语义漂移。具体来说,对于每个基础提示词嵌入 \(\mathbf{e}_0\) 和变体嵌入 \(\mathbf{e}_i\),我们计算余弦相似性。考虑到认知负荷实例化所需的结构性重写,我们采用一个阈值 \(\tau\),并仅当其所有变体的相似性都高于此阈值时才保留该提示词变体组: \(\min_{i} \mathrm{CosSim}(\mathbf{e}_0, \mathbf{e}_i) \geq \tau,\) (1) 我们使用一个宽松的阈值 \(\tau=0.6\) 以容纳添加的认知负荷信息。

### 3.3 设备端大语言模型推理分析  
我们使用经过指令调优、量化并本地通过MLC框架部署的模型,在移动设备上运行验证通过的提示词。所有提示词均使用固定的推理配置进行评估。

**设备端功耗和延迟分析框架。** 在MLC-LLM MLC-LLM Team (2023) (https://arxiv.org/html/2609.01798#bib.bib34)和LM-Meter Wang等人 (2025) (https://arxiv.org/html/2609.01798#bib.bib45)的基础上,我们开发了一个分析框架,用于测量设备端大语言模型推理期间的功耗和延迟。该框架通过测量设备的系统级功耗,并利用模型执行的开始/结束标记来同步功耗数据与推理阶段。我们报告了两个关键指标:总能耗(以焦耳计)和延迟(以秒计),以及从单次推理运行中得出的每词元能耗(以焦耳/词元计)。这种阶段级分析使我们能够区分预填充和解码阶段的能耗,这对于理解提示词设计如何影响计算行为的不同方面至关重要。

相似文章