关键词至关重要:揭示端侧大语言模型提示词的能量敏感性
摘要
本文通过实验研究提示词表述如何影响端侧大语言模型的能耗,表明关键词选择会显著影响解码长度和总能耗,并提示工程可作为轻量级能耗优化手段。
arXiv:2607.22568v1 Announce Type: new
摘要:大语言模型(LLMs)越来越多地部署在移动和嵌入式设备上,以提升隐私保护并降低网络延迟。然而,端侧推理面临一个基本约束:电池供电、资源受限的硬件上能耗高。虽然模型压缩和运行时加速已得到广泛研究,但提示词设计对能效的影响仍未得到充分探索。本文对端侧大语言模型提示词表述与能耗之间的关系进行了实证研究。通过智能手机上采集的真实功耗测量数据,我们量化了语言特征(尤其是命令式关键词和指令结构)如何影响解码长度和总能耗。我们的结果显示不同动词和任务之间存在一致的能耗差异,表明提示工程是提高能效的轻量级杠杆。
查看缓存全文
缓存时间: 2026/07/28 06:24
# 关键字至关重要:揭示设备端大语言模型提示词的能量敏感性
来源:https://arxiv.org/html/2607.22568
Ruiyi Tao 胡安妮塔高中 美国华盛顿州雷德蒙德 taoroy960@gmail\.com &Xiaolong Tu 佐治亚州立大学 美国佐治亚州亚特兰大 xtu1@gsu\.edu &Haoxin Wang 佐治亚州立大学 美国佐治亚州亚特兰大 haoxinwang@gsu\.edu
###### 摘要
大语言模型(LLMs)越来越多地部署在移动和嵌入式设备上,以提升隐私保护并降低网络延迟。然而,设备端推理面临一个根本性限制:电池供电、资源受限硬件上的高能耗。尽管模型压缩和运行时加速已被广泛研究,但*提示词设计*对能效的影响仍未得到充分探索。本文对设备端LLM的提示词措辞与能耗之间的关系进行了实证研究。通过在智能手机上收集真实功耗测量数据,我们量化了语言特征(特别是祈使关键字和指令结构)如何影响解码长度和总能量。我们的结果显示,不同动词和任务之间的能量消耗存在一致差异,表明提示词工程是提升能效的一种轻量级杠杆。
关键字至关重要:揭示设备端大语言模型提示词的能量敏感性
Ruiyi Tao胡安妮塔高中美国华盛顿州雷德蒙德taoroy960@gmail\.comXiaolong Tu佐治亚州立大学美国佐治亚州亚特兰大xtu1@gsu\.eduHaoxin Wang佐治亚州立大学美国佐治亚州亚特兰大haoxinwang@gsu\.edu
参见图说明图1:实验流程概览。提示词通过关键字替换从文本生成和情感分析任务构建,然后在两个边缘平台(Google Pixel 9a | Android 15 和 Orange Pi 5 Pro | Ubuntu 22.04)上执行,用于设备端推理和能耗分析。## 1 引言
大语言模型(LLMs),如GPT-4、LLaMA 3和DeepSeek,在文本生成、推理和问题解决方面展现了卓越的能力。它们现在为虚拟助手、编程助手以及教育和创意工具等各种应用提供支持。为了支撑这些工作负载,大多数商业LLM目前部署在云端环境中,大型计算集群提供足够的内存、处理和冷却资源来处理数十亿参数和实时用户请求Meta AI (2024 (https://arxiv.org/html/2607.22568#bib.bib1)); Microsoft Research (2024 (https://arxiv.org/html/2607.22568#bib.bib2))。
然而,基于云的推理引发了对数据隐私、延迟和能耗日益增长的担忧。敏感用户数据必须通过网络传输到远程服务器,这带来了潜在的隐私风险并增加了响应延迟。因此,研究人员和行业开发者开始探索设备端LLM部署,将紧凑型模型直接运行在手机、嵌入式系统和物联网设备上MLC AI (2023 (https://arxiv.org/html/2607.22568#bib.bib5)); NVIDIA (2023 (https://arxiv.org/html/2607.22568#bib.bib6)); Han等 (2016 (https://arxiv.org/html/2607.22568#bib.bib3)); Hinton等 (2015 (https://arxiv.org/html/2607.22568#bib.bib4))。这种新兴趋势提供了更好的隐私性和离线可用性,但也暴露了一个根本性限制:有限的能量和计算资源。
与具有持续供电和主动冷却的数据中心不同,边缘设备由电池供电且受热约束。自回归令牌生成的高计算需求导致CPU、GPU或NPU上的大量能量消耗,缩短了设备电池寿命并限制了持续性能Schwartz等 (2020 (https://arxiv.org/html/2607.22568#bib.bib7)); Strubell等 (2019 (https://arxiv.org/html/2607.22568#bib.bib8))。随着模型推理随提示词长度、解码步骤和推理深度而扩展,即使是模型执行或输入设计中的微小低效也可能导致显著的能量开销。因此,理解和减少能耗已成为实现实用且可持续的设备端智能的关键一步。
虽然先前的研究通过量化、剪枝和蒸馏优化了模型架构,但提示词设计对能耗的影响仍未得到充分探索。最近的研究表明,不同的提示词措辞可能触发不同的推理路径、令牌长度和注意力激活,从而可能改变功耗。这引发了一个有趣的问题:提示词工程能否作为一种轻量级机制,用于在设备端LLM推理中进行能量感知控制?
在这项工作中,(i) 我们提出了一项受控测量研究,探讨关键字级别提示词对解码能量的影响。(ii) 我们定义了一个测量协议和指标(TTFT、TBT、能量分为预填充/解码),并报告了跨模型、跨任务的趋势。我们分析了不同语言模式,尤其是关键字,如何影响运行时行为和功耗。我们的发现强调,提示词表述不仅仅是一个语义或风格因素,也是一个与能量相关的因素。
## 2 相关工作
### 2.1 LLM优化与设备端部署
系统和算法协同设计的最新进展显著降低了LLM推理成本。FlashAttention重新排序注意力计算以最小化内存访问并实现GPU加速Dao等 (2022 (https://arxiv.org/html/2607.22568#bib.bib13)),而vLLM引入PagedAttention以缓解KV缓存碎片化并提高长上下文吞吐量Kwon等 (2023 (https://arxiv.org/html/2607.22568#bib.bib14))。推测解码通过草稿和验证预测加速生成Leviathan等 (2023 (https://arxiv.org/html/2607.22568#bib.bib15))。模型端压缩补充了这些努力。例如,QLoRA实现了低比特模型上的内存高效微调Dettmers等 (2023 (https://arxiv.org/html/2607.22568#bib.bib20))。
在云服务器之外,紧凑型Transformer架构如MobileLLMLiu等人 (2024 (https://arxiv.org/html/2607.22568#bib.bib24))展示了十亿参数以下LLM在边缘设备上的可行性。MLC-LLM和TensorRT-LLM等框架进一步优化了移动和嵌入式NPU的执行流水线。同时,诸如CarbonTrackerAnthony等 (2020 (https://arxiv.org/html/2607.22568#bib.bib25))和BLOOM碳报告Luccioni等 (2023 (https://arxiv.org/html/2607.22568#bib.bib27))等可持续性研究提供了量化AI训练和推理中能量和排放的工具。然而,大多数先前的工作侧重于硬件或模型效率,而不是用户驱动的语言效果对能耗的影响。
### 2.2 提示词工程与能量感知
提示策略直接影响推理深度和令牌生成。思维链Wei等 (2022 (https://arxiv.org/html/2607.22568#bib.bib28))以更长的解码序列为代价增强了多步推理。自动提示工程(APE)Zhou等 (2022 (https://arxiv.org/html/2607.22568#bib.bib30))和Active-PromptDiao等 (2023 (https://arxiv.org/html/2607.22568#bib.bib31))搜索或选择有效提示来指导模型行为。虽然这些研究侧重于提高准确性、效率或可控性,但很少考虑其对能耗的影响。我们的工作通过实证测量提示词中祈使关键字选择如何影响智能手机上的预填充和解码能量消耗来扩展这一方向,为提示词工程引入了可持续性视角,并弥合了语言设计与设备级能效之间的差距。
## 3 背景与动机
### 3.1 背景
像ChatGPT、Gemini和Claude这样的大语言模型(LLMs)依赖大规模基于云的GPU和TPU集群进行实时推理。虽然这种设置实现了可扩展性和持续更新,但也引发了对隐私、延迟和能耗的担忧。承载AI工作负载的全球数据中心预计到2030年每年将消耗近1,000 TWh的电力。
为缓解这些挑战,量化、剪枝和高效Transformer架构的最新进展使得设备端LLM成为可能——紧凑型模型如Phi-3-mini、Qwen-1.5和LLaMA 3.2 1B/3B——可以在智能手机或嵌入式NPU上本地运行。这些设备端部署提高了隐私性和响应速度,但也引入了一个新的瓶颈:能效。自回归推理涉及两个主要阶段:预填充和解码,其中后者在运行时间和功耗上占主导地位。实证分析表明,总能量几乎与输出长度和解码延迟呈线性关系,使能耗成为边缘部署的关键约束。
### 3.2 动机
先前改善能效的努力侧重于硬件或模型级别的技术,如量化、剪枝或内核优化,这些需要重新训练和平台特定的调整。然而,一个轻量级且被忽视的替代方案在于提示词设计。语言选择如“生成”、“解释”或“列出”可以改变推理深度、令牌长度和激活模式,从而在相同模型和硬件配置下影响能耗。
尽管越来越多的证据表明提示词措辞会影响计算,但现有研究大多是理论或基于模拟的,缺乏在真实设备上的验证。这项工作填补了这一空白,首次将祈使关键字选择与设备端LLM推理期间测量的功耗联系起来进行实证分析。我们的发现强调提示词工程是实现边缘端节能且保护隐私的智能的一个简单而有效的杠杆。
## 4 实验设计
### 4.1 研究目标与问题
基于第3节 (https://arxiv.org/html/2607.22568#S3),我们的目标是量化语言变化,特别是祈使关键字的选择,如何影响设备端LLM的能耗。本研究由三个研究问题指导:
- •RQ1:不同的提示词关键字如何影响设备端LLM推理的整体能耗?
- •RQ2:观察到的关键字驱动的能量模式在不同LLM模型和设备之间是否一致?
- •RQ3:提示词关键字如何影响响应质量,以及它与能耗有何关联?
### 4.2 硬件设置、模型与实验流程
硬件设置:实验在运行Ubuntu 22.04的Orange Pi 5 Pro和已root的Google Pixel 9a上进行。这两个设备各自具有不同的能力,这在研究中显现出来。Orange Pi在预填充方面表现出色,平均115ms完成预填充阶段,而Pixel 9a平均约87,000ms完成预填充阶段。然而,解码率在设备间相似:Orange Pi的TBT为114ms,Pixel 9a为100ms。为减少无关系统活动的干扰,Orange Pi上的所有测量均在多用户模式下进行。在Pixel 9a上,CPU频率固定为:核心0-3 1328 kHz,核心4-6 1418 kHz,核心7 2294 kHz。为保持稳定的功耗测量,禁用了热节流、自适应亮度和后台服务,屏幕亮度固定为最低水平以减少显示相关的噪声。
模型与实验流程:端到端测量工作流程如图1 (https://arxiv.org/html/2607.22568#S0.F1)所示。我们评估了来自Qwen、SmolLM、Gemma和Llama家族的模型,以确保我们的观察在不同架构间一致。大多数选定的模型在参数大小和量化设置上匹配,同时额外包含一个较小的模型以研究模型大小的影响。除Gemma模型外,所有模型都是指令模型。选择Gemma模型是为了测试不同类型的模型如何受到不同关键字的影响。
### 4.3 任务、提示词与数据收集
为了将语言结构与能耗联系起来,我们评估两个代表性NLP任务,捕捉开放性和分析性行为:
文本生成:提示词改编自Alpaca-GPT4数据集Taori等 (2023 (https://arxiv.org/html/2607.22568#bib.bib12))(创意写作、解释)。选择了50个提示词,并将关键字替换为10个选定的指令动词。此前,我们为每个关键字选择了50个不同的提示词,而不是为每个关键字使用相同的50个提示词。然而,由于Alpaca-GPT4数据集中每个关键字的固有使用偏差,这导致了在不同环境中可疑地一致的结果。本文使用的文本生成提示词仅在关键字上有所不同,从而隔离其影响,同时保留了语言模型的固有随机性。
情感分析:使用Yelp评论数据Yelp, Inc. (2024 (https://arxiv.org/html/2607.22568#bib.bib11))和分析性动词(确定、标记等)合成的提示词,代表简短、确定性的推理。这些提示词使用相同的50条Yelp评论,结合一个用于二元情感分析的短句。与文本生成类似,这也是为了隔离关键字的影响。
参见图说明图2:原始文本生成提示词数据集与关键字替换后的提示词数据集之间的提示词复杂度分布比较。提示词:对于每个关键字,我们选择了50个提示词,总共1,000个提示词(每个任务500个)和跨5个模型的5,000次提示词-模型运行。为了验证关键字替换不会显著改变提示词难度,我们使用NVIDIA提示词-任务-复杂度分类器NVIDIA (2024 (https://arxiv.org/html/2607.22568#bib.bib35))评估了原始和重写的文本生成提示词。如图2 (https://arxiv.org/html/2607.22568#S4.F2)所示,两个分数分布大部分重叠,表明重写的提示词保留了原始提示词的总体复杂度分布。量化上,匹配的原始提示词的平均复杂度得分为0.3048,而重写提示词为0.3199,对应于在0-1尺度上的微小平均偏移+0.0151。此外,在平均重写变体后,提示词级别的分数与原始提示词高度相关(Pearson r=0.942 r=0.942, Spearman ρ=0.944 \rho=0.944)。这些结果共同表明,关键字替换仅引起分类器分配复杂度的微小变化,同时保留了提示词集的相对难度结构。
数据收集:对于Orange Pi 5 Pro,我们使用Python API运行模型,并使用FNIRSI FNB58收集能量数据。输出使用第三方数据记录器解析Baryluk (2026 (https://arxiv.org/html/2607.22568#bib.bib32))。对于Pixel 9a,我们运行了一个定制的MLCChat,通过在手机放电时测量电池的功耗将日志记录集成到推理流水线中。响应限制为1,000个令牌,以停止在小型量化模型中偶尔出现的无限循环。
每次运行的指标包括:提示词长度\(L_p L_p\)、响应长度\(L_r L_r\)、TTFT、TBT以及以10 Hz采样的瞬时电压/电流轨迹。总能量计算为:
\[
E = \sum_{i=1}^{N} I_i V_i \Delta t, \quad \Delta t = 0.1\,\mathrm{s},
\]
并分别记录预填充(\(E_{\text{prefill}}\))和解码(\(E_{\text{dec}}\))的能量。为防止内存累积,在每次运行前重新加载模型实例。
### 4.4 准确性评估
为了评估响应质量,我们使用DeepEval Python库DeepEval。相似文章
PromptPrint:通过自然语言提示在大语言模型中实现行为生物特征识别
介绍PromptPrint,一项系统性研究,表明用户在LLM提示中的习惯性词汇和句法构成可学习的行为生物特征,词汇特征优于语义编码器,并揭示了独特性-一致性悖论。
从文字到控件:实现可控的LLM生成
可塑提示(Malleable Prompting)是一种新颖的交互技术,它将自然语言偏好具体化为GUI控件(滑块、开关、下拉菜单)以供直接操作,并配有解码算法,该算法根据控件值调节词元概率,从而实现对LLM生成的精确控制。一项用户研究表明,在精确性、可控性和透明度方面,它优于纯自然语言提示。
提示复杂性:大型语言模型中文本与行为的最短提示
本文正式定义了提示复杂性这一概念,该概念衡量固定语言模型生成目标文本或行为所需的最短合理提示,类比于资源有界的柯尔莫哥洛夫复杂性。
为什么感觉大型LLM提供商在故意隐藏提示缓存?
一篇文章讨论提示缓存如何大幅降低LLM API成本,指出提供商对此解释不足,并提供一个简单的规则来构建提示以获得最大缓存命中率。
自监督提示优化
本文提出了一种名为自监督提示优化(SPO)的框架,该框架通过输出对比来优化大语言模型的提示词,无需外部参考,显著降低了成本和数据需求。