AgentStop:在消费设备上提前终止本地AI代理以节省能源

arXiv cs.LG 论文

摘要

本文介绍了AgentStop,一种轻量级的监督器,能够预测并提前终止那些不太可能成功的本地AI代理轨迹,从而将能源浪费减少15-20%,同时几乎不影响任务性能。

arXiv:2605.15206v1 Announce Type: new 摘要:由大语言模型(LLM)驱动的自主代理越来越多地用于自动化复杂、多步骤的任务,例如编程或基于网页的问答。虽然远程的基于云的代理提供了可扩展性和易于部署的优点,但它们也引发了隐私问题,依赖网络连接,并产生持续的API成本。在用户设备上本地部署代理通过保护数据隐私和消除按使用付费来缓解这些问题。然而,代理工作流程比典型的LLM交互要消耗更多的资源。迭代推理、工具使用和失败重试大大增加了token消耗,经常在没有成功完成任务的情况下消耗大量计算资源。 在这项工作中,我们研究了在消费硬件上本地部署基于LLM的代理的时间、token和能源开销。我们的测量表明,与单次推理工作负载相比,代理执行增加了GPU功耗、温度和电池消耗。为了解决这一低效问题,我们引入了AgentStop,一种轻量级的效率监督器,能够预测并提前终止那些不太可能成功的轨迹。利用低成本的执行信号,例如token级别的对数概率,AgentStop可以在具有挑战性的基于网页的问答和编程基准测试中,将浪费的能源减少15-20%,同时对任务性能的影响最小(效用下降<5%)。这些发现表明,预测性提前终止是一种实用机制,可以在用户设备上实现可持续、保护隐私的LLM代理。我们的项目代码和数据可在https://github.com/brave-experiments/AgentStop获取。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:37

# AgentStop:提前终止本地AI代理以在消费设备上节约能源  
来源:https://arxiv.org/html/2605.15206 (2026)  

###### 摘要。由大型语言模型(LLM)驱动的自主代理正越来越多地被用于自动化复杂的多步骤任务,例如编码或基于网络的问答。远程云端代理虽然具有可扩展性和易于部署的优点,但会引发隐私问题、依赖网络连接,并产生持续的API成本。将代理部署在用户本地设备上,通过保护数据隐私和消除按使用付费的成本,缓解了这些问题。然而,代理工作流的资源消耗远高于典型的LLM交互。迭代推理、工具使用和失败重试显著增加了令牌消耗,往往在不成功完成任务的情况下耗费大量计算资源。在这项工作中,我们研究了在消费硬件上本地部署的基于LLM的代理所产生的时间、令牌和能量开销。我们的测量表明,与单次推理工作负载相比,代理执行会增加GPU功耗、温度和电池消耗。为了解决这一效率低下问题,我们引入了AgentStop,一个轻量级效率监督器,用于预测并提前终止可能失败的任务轨迹。利用低成本执行信号(例如令牌级别的对数概率),AgentStop在具有挑战性的网络问答和编码基准测试中,能够将能量浪费减少15–20%,同时任务性能下降最小(效用下降<5%)。这些发现表明,预测性提前终止是实现用户设备上可持续、隐私保护的LLM代理的一种实用机制。我们的项目代码和数据可在 https://github.com/brave-experiments/AgentStop 获取。  

语言模型,本地代理,能源,效率,提前终止  

††期刊年份:2026  
††版权:cc  
††会议:ACM人工智能与代理系统会议,2026年5月26–29日,美国加利福尼亚州圣何塞  
††论文集:ACM人工智能与代理系统会议(CAIS ’26),2026年5月26–29日,美国加利福尼亚州圣何塞  
††DOI:10.1145/3786335.3813163  
††ISBN:979-8-4007-2415-2/2026/05  
††CCS:计算方法论 → 人工智能  
††CCS:硬件 → 功耗与能量  

## 1. 引言  

由大型语言模型(LLM)驱动的自主代理在自动化广泛用户任务方面前景广阔,包括编写和调试代码、进行在线购物、预订以及回答问题。在一种常见的部署范式中,这类代理以云托管服务的形式提供,提供商公开一个自然语言接口,用户通过该接口发出指令并提供待处理的数据,而底层的LLM推理、行动和与环境交互则在提供商的远程基础设施上执行。然而,这种架构引入了三个根本性挑战:隐私风险、实际限制和财务成本。例如,考虑一个自动修复错误的编码任务。用户提交的源代码(代理处理的主要数据)通常包含敏感信息,包括文件路径、目录结构和专有业务逻辑,因此是有价值的知识产权。将这些内容传输给第三方代理提供商存在泄露机密数据的风险,可能违反隐私义务,并损害竞争优势。除了隐私问题,这种提交还需要网络连接;考虑到真实世界代码库的规模和复杂性,在扩展的代理工作流中重复传输会带来显著的带宽消耗和累积延迟。最后,代理任务本质上成本高昂:与典型的单次提示-响应式LLM交互不同,自主代理在多步骤推理链中反复运行模型推理并调用外部工具。仅执行上述编码任务就花费约1美元(Jimenez 等,2024),而大规模持续部署可能导致每月数万美元的运营费用(OpenAI,2026;Anthropic,2026)。  

本地代理通过在用户设备本地运行来应对这些挑战:它们保护隐私(不与代理提供商共享任何数据),消除对外部基础设施的依赖,并降低财务成本。然而,将计算任务迁移到用户设备上引入了新的约束:用户设备上的持续资源消耗。在这种情况下,长时间的代理工作负载可能导致显著的电池消耗、热压力和设备磨损。与服务器端计算(能源成本外包给数据中心)不同,设备端执行直接与用户的日常需求竞争,可能降低设备的可用性和可用性。在实践中,代理通过长动作序列、频繁的决策点和工具交互放大了模型的使用,导致资源需求远高于单次推理测量所暗示的水平。因此,基于LLM的代理对系统资源(尤其是电池寿命)的影响可能远比预期的严重。  

设备端代理带来的资源压力也会影响可用性。先前的研究记录了“无手机恐惧症”(即“nomophobia”,失去可用移动设备的焦虑),这种焦虑通常因电池电量低而加剧(Yildirim 和 Correia,2015)。此类担忧与使用模式相关,例如持续的后台活动和不愿关闭设备(Katevas 等,2018)。一个快速耗尽电池电量的代理会增加焦虑,并阻碍在移动或始终开机场景中的持续采用。  

在这项工作中,我们研究了本地部署的基于LLM的代理的资源影响,并引入了一种实用机制来缓解其低效问题。我们在消费级设备(例如 MacBook Pro M1 Max)上通过实验表征了代理执行所产生的时间和能量开销。与典型的LLM推理相比,我们表明迭代执行(包括失败重试循环)显著增加了令牌消耗、延迟和电池消耗,并且通常无法产生成功的任务结果。图1显示了一个示例代理编码任务,持续约600秒,进行30多次LLM推理调用和终端工具调用,在此期间GPU功耗反复飙升至40W以上。GPU温度也升至接近95°C,并长期维持在90°C以上,表明存在持续的热应力。  

为了解决这一低效问题,我们提出了AgentStop,一个轻量级效率监督器,旨在预测并提前终止可能失败的任务轨迹。该监督器可以在不同层级部署:(a) 用户可以实现本地提前终止机制来控制成本和资源使用,或者 (b) 代理提供商可以将其作为内置功能提供,主动防止不必要的计算并降低用户费用。我们将提前终止表述为一个二元监督预测问题,并基于直接从代理执行轨迹中提取的轻量级特征训练一个梯度提升决策树模型。这些特征包括令牌级别的特征(如对数概率),在推理和工具使用过程中生成。重要的是,AgentStop仅依赖标准推理过程中已经产生的信号,引入的计算或能量开销可忽略不计,并且无需修改底层模型。  

我们在代表性的代理工作负载上评估AgentStop,包括基于网络的问答和基于终端的编码基准测试。我们的结果表明,在具有挑战性的问答和编码基准测试中,AgentStop能够将Qwen3-30B-A3B驱动的代理的能量浪费减少15–20%,同时任务效用下降不到5%。除了性能提升,我们的工作将效率监督重新定义为可持续、隐私保护的设备端代理的关键推动因素。通过减轻不必要的电池消耗和执行时间,预测性提前终止不仅改善了系统级资源使用,还解决了围绕设备耐用性、可用性和信任的重要人本问题。  

总之,我们的贡献包括:  
- • 我们引入了AgentStop,一个轻量级基于ML的监督器,利用代理执行过程中已有的信号预测失败的代理轨迹。  
- • 我们证明,预测性提前终止在代表性的网络和编码代理基准测试中减少了能量消耗和执行时间。  
- • 除了系统级增益,我们将效率监督定位为隐私保护型设备端代理的关键推动因素,通过减轻电池消耗、改善可用性并降低实际采用的障碍。  

参见标题  

图1. 使用Qwen3-Coder-30B-A3B(Qwen,2025)驱动的编码代理解决SWE-Bench Verified任务(Jimenez 等,2024)时,Apple M1 Max笔记本电脑上的瞬时功率(左y轴)和硬件温度(右y轴)随时间(x轴)的变化。瞬时GPU功耗逐渐增加,同时CPU/GPU/电池温度上升。GPU功耗尖峰对应于LLM推理的预填充阶段,而较低但更持续的模式对应于生成阶段。  

## 2. 背景与相关工作  

在本节中,我们概述本地LLM驱动的代理及其能耗,以及节能策略。  

### 2.1. 本地代理  

AI代理是利用AI技术(特别是大型语言模型(LLM))为用户解决任务的自主软件系统。代理执行通常交替进行LLM推理(GPU密集型阶段,进行推理和规划)和环境交互(涉及调用专门的外部工具,例如网络搜索)。最先进的代理通常由基于云的LLM(例如Claude Code¹)驱动,这不仅需要直接的经济成本,还会带来隐私风险。相比之下,本地AI代理使用本地部署的语言模型,这些模型“适合普通的消费电子设备”(Belcak 等,2025),如手机、平板电脑和配备2–16 GB内存(RAM)的PC/笔记本电脑,或在更高端机器(例如MacBook Pro/Max系列)上达到32–64 GB。用户对这些本地代理的任何请求完全留在设备上,延迟极小。因此,这种设置提供了更好的隐私保护和可访问性,但代价是任务性能下降和由于硬件限制导致的高耗能(Lu等,2025b)。  

为了提高运行本地语言模型的效率,一种流行技术是对模型权重(以及键值缓存)进行量化,从而将内存占用减少2–4倍,同时对效用影响较小(Laskaridis等,2024;Li等,2025)。另一种日益常见的技术是专家混合(MoE)模型架构,该架构并非始终使用所有参数,而是训练模型选择一小部分参数来执行推理(Shazeer等,2017)。通过将量化与MoE结合,我们可以在配备24GB RAM的消费设备上更高效地运行多达300亿参数的LLM。  

### 2.2. 消费设备上的LLM能耗  

尽管使用了这些效率优化,LLM仍然给消费设备带来不可忽视的压力。例如,像MELT(Laskaridis等,2024)或PalmBench(Li等,2025)这样的测量框架发现,在iPhone 14 Pro上运行Gemma 2B模型,每生成100个输出令牌大约消耗3 mAh的电量,这大致相当于使用约0.1%的设备电池来生成60–80个英文单词或4–5个英文句子。尽管这种成本乍看似乎很小,但像编码这样的代理工作负载通常需要生成(数万)个令牌,更不用说需要处理的输入令牌,在真实的信息检索场景中,输入令牌的数量往往比输出令牌多一个数量级。此外,尽管本地LLM部署在非代理任务上取得了令人印象深刻的效率提升(每年每瓦特智能提高2–3倍(Saad-Falcon等,2025)),但本地部署与云部署之间的效率差距仍然很大(Patterson等,2024;Elsworth等,2025;Saad-Falcon等,2025)。  

此外,大多数代理基准测试并不直接测量能耗,通常只使用代理指标(如令牌数量和延迟)(Zhu等,2025)。唯一从效率角度研究代理的工作是Kim等(2025),但仅限于云服务器环境,且未考虑能耗。  

### 2.3. 效率提升的提前停止策略  

在自然语言处理中,一种简单但有效的提升模型推理效率的方法是基于某种置信度或不确定性信号(Lin等,2024),提前停止过程(Zhou等,2020;Sun等,2022)。这一思想也已应用于LLM级联中,推理从较弱的LLM开始,可能级联到更强的LLM或直接停止(Yue等,2024;Gupta等,2024;Zellinger等,2025)。据我们所知,提前退出仅在简单的单轮LLM推理中研究过,尚未应用于多轮代理设置中。最接近的工作是Lu等(2025a),主要研究“内在提前退出”,即代理可以选择EXIT动作来停止自身。该论文仅在具有可追踪进度的结构化基准测试上评估,且未测量节能效果。  

## 3. 问题陈述  

考虑一个代理 \( A \) 及其执行历史 \( H \),由环境状态序列 \( S_i \) 和代理动作序列 \( A_i \) 组成,例如 \( H = [S_1, A_1, S_2, A_2, \ldots, S_t, A_t] \)。我们将效率监督器定义为一个分类器 \( C \),它接收 \( H \) 作为输入,并返回代理 \( A \) 能够从 \( H \) 继续执行并成功完成任务的概率,即 \( C: H \rightarrow [0, 1] \)。在LLM代理的情况下,\( S_1 \) 由系统提示和代理 \( A \) 的初始任务提示组成;每个后续的

相似文章

提升AI智能体的速度与能效

MIT News — Artificial Intelligence

麻省理工学院和微软的研究人员开发了一种智能系统,可自动优化智能体工作流,在保持性能的同时减少计算资源和能源消耗。

预见与学习:在主动式智能体中释放空闲时间计算能力

Hugging Face Daily Papers

ProAct 是一种主动式智能体架构,利用空闲时间计算来预见用户需求,提升任务完成的效率与准确性。它引入了 ProActEval 基准测试,涵盖 40 个领域的 200 个场景,相比被动式基线取得了显著提升:所需交互轮次减少 14.8%,用户努力降低 11.7%,幻觉率下降 28.1%。

AgentOS

Product Hunt

AgentOS 提供了一个统一控制层,用于管理 AI 代理、任务和工作空间。