在线技能与记忆模块是否总是值得其令牌消耗?一项关于网络代理的预算受限研究

arXiv cs.CL 论文

摘要

本文研究了在固定推理预算下,网络代理的在线技能和记忆模块是否值得其令牌成本,发现预算匹配的朴素基线方法在三个领域和模型上通常与增强方法性能相当或更优。

arXiv:2606.15017v1 公告类型: 新 摘要: 在线网络代理通常会为基础参与者增加记忆、工作流或技能模块。这些模块可以提高性能,但它们也会消耗测试时的令牌,而这种成本很少与参与者的推理成本一起报告。我们研究了在线增强,其中这种开销在每个任务中都会支付,并在固定的总推理预算下重新评估其收益。我们将AWM、ASI和ReasoningBank与一个令牌匹配的朴素基线进行比较,该基线使用相同的预算进行额外的参与者步骤。在三个WebArena领域和三个模型(Gemini 3 Flash、GPT-5.4-mini和Qwen 3.6-27B)上,朴素基线在总成功率上达到或超过了所有三种增强方法,同时通常使用更少的令牌。我们在WorkArena-L1上使用Qwen 3.6-27B观察到了类似的趋势,表明这种效果也适用于企业知识工作任务。我们的结果表明,技能和工作流记忆在特定领域可能有用,但它们在预算匹配的参与者面前通常会失去明显的优势。我们进一步表明,运行间方差会显著影响结果,应作为在线网络代理的核心评估标准进行报告。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:44

# 在线技能与记忆模块是否总是物有所值?网络代理的预算约束研究
来源:https://arxiv.org/html/2606.15017
1\]ServiceNow AI Research 2\]ÉTS Montreal\\affiliationbreak3\]不列颠哥伦比亚大学 4\]麦吉尔大学\\contribution\[\*\]同等指导

Masih AminbeidokhtiJose DolzIsmail Ben Ayed Issam H\. LaradjiSpandana GellaNicolas Gontier\\[\[\[

###### 摘要

在线网络代理通常会用记忆、工作流或技能模块来增强基础执行器。这些模块可以提升性能,但它们也会消耗测试时的令牌,这个成本很少与执行器的推理成本一同报告。我们研究在线增强,其中这笔开销在每个任务上都会支付,并在固定的总推理预算下重新评估其收益。我们将 AWM、ASI 和 ReasoningBank 与一个令牌匹配的普通基线进行比较,该基线使用相同的预算进行额外的执行器步骤。在 WebArena 的三个领域和三个模型(Gemini 3 Flash、GPT-5.4-mini 和 Qwen 3.6-27B)上,普通基线的总体成功率匹配或超过了所有三种增强方法,同时通常使用更少的令牌。我们在 WorkArena-L1 上使用 Qwen 3.6-27B 观察到了类似的趋势,表明这种效果也适用于企业知识工作任务。我们的结果表明,技能和工作流记忆在特定领域可能有用,但它们表面的收益在与预算匹配的执行器对比时往往消失。我们进一步表明,运行间差异会显著影响结果,应作为在线网络代理的核心评估标准进行报告。

## 1 引言

每任务受控总推理预算在线增强AWM / ASI / ReasoningBank预算匹配的执行器普通执行器 + 更多探索执行器模块10 步执行器 + 模块调用执行器15 步执行器在线支付的成本:留给探索的令牌更少预算重新分配:与环境更多交互

参见标题

图 1:在受控测试时推理成本下的预算分配。\(上方\) 在线增强将预算用于工作流、技能或记忆模块,而预算匹配的普通执行器 (Vanilla-IB) 将其用于额外的观察-行动步骤。\(下方\) 在 WebArena 上使用 Gemini 3 Flash\(gemini-team-2025-gemini3\),Vanilla-IB 以更少的令牌实现了最高的成功率。

网络代理根据它们在测试时预算内解决任务的频率进行评估。越来越多的工作通过引入可重用工作流、维护记忆或从先前轨迹中提炼技能的模块来增强基础执行器(wang-etal-2025-asi;wang-etal-2024-agent;ouyang-etal-2025-reasoningbank;li-etal-2025-polyskill)。遵循 Agent Skill Induction(wang-etal-2025-asi) 和 SkillWeaver(zheng-etal-2025-skillweaver),我们使用术语*技能*指代可执行代码,通常是 Python 函数,它封装了一个可重用的低级动作序列。

这些辅助模块并非免费。它们消耗令牌,增加提示和逻辑控制,并且在线设置中,其性能与任务处理的顺序耦合。它们的令牌成本很少与执行器的成本一同报告,这使得很难判断在固定预算内观察到的收益是否合理。这造成了一个简单的分配问题:用于诱导、检索、验证或注入可重用知识的令牌,无法用于直接任务执行,例如观察当前页面、推理其状态或采取额外操作。

图[1 (https://arxiv.org/html/2606.15017#S1.F1) 展示了这种权衡。在相同的总推理预算下,在线增强代理将其预算分配在直接环境交互与辅助记忆、工作流或技能机制之间。一个预算匹配的普通执行器反而将该预算重定向到额外的观察-行动步骤。下方的面板预览了我们在 WebArena(zhou-etal-2024-webarena) 上观察到的主要实证模式:一旦计算了总令牌使用量,预算匹配的普通代理在实现最高平均成功率的同时,使用的令牌数少于在线增强方法。

先前关于增强方法的工作很大程度上假设基础模型缺乏端到端完成任务的能力(wang-etal-2024-agent;wang-etal-2025-asi);然而,较新的前沿模型可能不再面临这一限制,并且可能不需要那么多的外部脚手架。因此,我们直接提出一个问题:在固定推理预算下,是将令牌分配给在线记忆和技能模块更好,还是普通执行器通过将相同的预算用于额外的交互步骤就能实现可比的性能?我们专注于*在线*设置,其中代理使用在评估期间收集的轨迹来更新其行为,而不是依赖部署前构建的离线技能库。在这种设置下,辅助成本会反复产生,记忆或技能模块积累的知识取决于任务遇到的顺序而非完整的任务分布,并且任务级别的并行性受到任务之间顺序依赖关系的限制。

为了研究这种权衡,我们将三种在线增强方法:Agent Workflow Memory (AWM;wang-etal-2024-agent)、Agent Skill Induction (ASI;wang-etal-2025-asi) 和 ReasoningBank (ouyang-etal-2025-reasoningbank),与一个预算匹配的普通执行器进行比较。与使用默认 10 步执行器视野的增强方法不同,此基线将相同的推理预算分配给更长的交互视野;我们将其称为 Vanilla-Increased-Budget (Vanilla-IB)。我们不将 Vanilla-IB 作为一种新的代理框架提出,而是作为一种简单的预算感知对照,旨在测试在线增强的开销是否合理。

我们在 WebArena(zhou-etal-2024-webarena) 和 WorkArena-L1(drouin-etal-2024-workarena) 上评估这种比较。WebArena 提供了我们研究中最广泛的扫描,涵盖三个模型、四种代理配置和三个领域:Shopping、Reddit 和 Admin。WorkArena-L1 在 Qwen 3.6-27B 下测试了同样的预算匹配问题,在知识工作任务中。

我们的主要发现如下:(1) 在 WebArena 上,Vanilla-IB 在所有我们测试的三个模型中实现了最高的总体成功率,同时使用的总令牌数大多少于 AWM、ASI 和 ReasoningBank。(2) 在 WorkArena-L1 上,Vanilla-IB 与表现最佳的增强方法保持竞争力,表明预算匹配问题并非特定于 WebArena 或消费者类网站。(3) 除了这些总体结果,我们还表明单次运行的成功率掩盖了高任务级方差,并且从单次运行中报告方法的性能是一个薄弱的比较基础。

这些发现为在线网络代理提出了三个评估原则。首先,比较应该报告*所有模块的总令牌使用量*,而不仅仅是执行器。第二,在线增强方法应该与*相同预算内的基线*进行比较。第三,评估应该报告*多次运行的方差*,因为代理评估引入了随机性,而总体单次运行指标无法捕捉到这一点。

## 2 相关工作

#### 网络代理基准。

Mind2Web(deng-etal-2024-mind2web) 和 WebArena(zhou-etal-2024-webarena) 引入了用于现实多步骤浏览器交互的大规模基准。后续工作扩展了这一基准格局,包括 VisualWebArena(koh-etal-2024-visualwebarena) 中的视觉基础、WorkArena(drouin-etal-2024-workarena) 和 WorkArena++(boisvert-etal-2024-workarenaplusplus) 中的企业工作流、Online-Mind2Web(xue-etal-2025-illusion) 中的实时网站,以及 WebArena-Infinity(webarena-infinity) 中的持续生成的开放式任务。在这项工作中,我们专注于 WebArena 和 WorkArena,因为它们提供了交互环境,代理可以在其中行动,观察其行动的后果,并端到端地完成多样化任务。这使得它们非常适合评估测试时计算机制,在这些机制中,额外推理步骤、工具调用或记忆访问的成本必须作为代理部署时行为的一部分进行衡量。

#### 在线工作流、记忆和技能归纳。

越来越多的工作通过从评估时轨迹中提取可重用知识来增强基础执行器。AWM(wang-etal-2024-agent) 从成功轨迹中归纳自然语言工作流,并为后续任务检索它们。ASI(wang-etal-2025-asi) 合成可重用的 Python 技能函数,作为后续任务的更高级操作进行调用。ReasoningBank(ouyang-etal-2025-reasoningbank) 将来自成功和失败的推理策略提炼到一个不断增长的记忆库中,在测试时查询。PolySkill(li-etal-2025-polyskill) 将技能的抽象目标与其具体实现分离以实现更通用的重用,PlugMem(yang-etal-2026-plugmem) 提出了一种任务无关的记忆插件,可附加到任何 LLM 代理。ACE(zhang-etal-2025-ace) 将代理的上下文本身视为一个不断发展的剧本,通过生成-反思-策展的循环积累和精炼策略。ERL(allard-etal-2026-erl) 反思任务轨迹以提取可迁移的启发式规则,在测试时检索以指导后续任务的执行。所有这些方法都有一个共同的前提:测试时预算的一部分被用于生产和检索可重用知识,这个成本很少与执行器的成本一同报告。我们的工作问的是这种分配是否总是正确的选择。

#### 离线可重用知识。

一条互补的工作线在部署开始之前,通过一个与评估运行分开的探索或合成阶段来构建可重用知识。SkillWeaver(zheng-etal-2025-skillweaver) 在部署前的离线阶段发现并合成 Python API 技能。WALT(prabhu-etal-2025-walt) 在评估前从网站结构中逆向工程学习稳定的工具抽象,WebXSkill(wang-etal-2026-webxskill) 从合成代理轨迹中挖掘参数化的动作程序。JEF-Hinter(nekoei-etal-2025-jefhinter) 将离线轨迹提炼成紧凑的、上下文感知的提示,包括来自成功和失败轨迹,并在推理时为代理的当前状态检索相关提示。离线方法将发现或提炼成本分摊到多次后续使用中,当代理在相同的稳定环境中重复部署时,这很有用。当环境很少被访问,当其结构在发现和部署之间发生变化,或者当代理遇到新领域时,这种权衡就会失效。这些局限性促使了作为我们工作重点的在线设置。

#### LLM 能力和脚手架的价值。

前沿语言模型在网络代理的核心能力方面迅速提高:多步推理、指令遵循和不确定性下的自适应决策。最近的模型如 GPT-5.4(openai-2026-gpt54)、Claude Sonnet 4.6(anthropic-2026-sonnet46) 和 Gemini 3(gemini-team-2025-gemini3) 可以通过相对轻量的脚手架解决复杂的长期任务,通常匹配或超越更重工程化的代理架构(bechard-etal-2026-terminal)。这种快速进步对增强方法有影响:在较弱的模型上真实且显著的收益,随着基础执行器自身能力的增强,可能会缩小或消失。

#### 替代范式与评估稳健性。

大多数网络代理使用浏览器、无障碍树和固定动作词汇。一条工作线探索结构上不同的范式:基于 API 的代理在 WebArena 上显著优于基于浏览器的代理,混合代理甚至达到更高性能(song-etal-2025-beyond),而基于终端的代理通过代码和程序化接口进行操作,在企业自动化任务上可以匹配或超越基于 GUI 的代理(bechard-etal-2026-terminal)。这些方法避免了一些浏览器技能脆弱性,但依赖于可能不存在的稳定、文档化的 API。在基于浏览器的设置中,评估可靠性本身就是一个问题:超时、页面加载失败和非确定性 UI 行为可能导致结果独立于代理决策而变化。将现实的网络故障引入 WebArena、WebVoyager(he-etal-2024-webvoyager) 和 REAL(garg2025realbenchmarkingautonomousagents) 已被证明会导致成功率显著下降(kara-etal-2025-warex)。这些问题强化了将多轮报告作为一等评估标准的重要性。

## 3 实验设置

### 3.1 任务与领域

我们在 WebArena(zhou-etal-2024-webarena) 上进行评估,这是一个跨隔离网站环境的现实多步骤网络任务基准。我们报告三个领域的结果。Shopping 包含 187 个任务,是一个包含产品搜索、比较和结账任务的电子商务网站。Reddit 包含 106 个任务,是一个包含导航、发帖和搜索任务的社交讨论平台。Admin 包含 182 个任务,是 WebArena 购物网站的管理员面板,涵盖产品管理、订单处理和账户管理。这些领域的任务在多大程度上共享导航模式是不同的,这与工作流或技能重用是否能带来收益相关。

该设置是顺序和在线进行的:代理按顺序尝试任务,并使用具有技能、记忆或工作流组件的模块从早期轨迹中提取知识并将其应用于后期的任务。

我们还评估 WorkArena(drouin-etal-2024-workarena) 的 Level-1 任务集合,这些任务侧重于 ServiceNow 平台中常见的企业知识工作交互。该基准包含 33 个任务,涵盖 ServiceNow 操作,如仪表板、表单、知识库搜索、列表过滤、列表排序、菜单导航和服务目录请求。对于 WorkArena-L1,我们对所有任务类型进行相同的在线比较,每种方法每种任务类型使用三个随机种子。该基准以企业软件工作流取代了消费者类和社区网站,同时保留了我们代理使用的基于浏览器的交互设置。

### 3.2 研究的系统

在我们的实验中,我们比较了四种代理框架。三种方法用辅助模块增强执行器,同时将执行器的交互步数限制在最多 10 步。第四种,Vanilla-IB,是一个没有辅助模块但具有扩展交互预算的普通执行器。

AWM(wang-etal-2024-agent):在线工作流记忆,其中基于 LLM 的辅助模块从先前的轨迹中归纳并检索工作流,与执行器并行工作。

ASI(wang-etal-2025-asi):在线程序化技能归纳,其中基于 LLM 的辅助模块合成、验证并重用 Python 技能函数。

ReasoningBank(ouyang-etal-2025-reasoningbank):在线推理记忆,其中基于 LLM 的辅助模块从先前的成功和失败中积累并检索推理策略。

Vanilla-IB:一个普通执行器,其交互步骤扩展到 15 步,并对无障碍树进行基于规则的修剪。修剪会移除父节点与其直接子节点之间重复的文本,这是无障碍树中常见的模式,它会增加上下文长度而不增加信息。这种修剪不涉及 LLM 调用(参见附录 B (https://arxiv.org/html/2606.15017#A2))。我们不将这些修改作为贡献;它们包含进来只是为了

相似文章

全量召回,代价几何?智能体记忆系统的服务成本基准测试

arXiv cs.CL

本文对三种智能体记忆系统(Mem0、Hindsight、Mastra Observational Memory)与参考策略在多种对话主干模型上的服务成本进行了基准测试,发现成本主要由内部记忆行为驱动,盈亏平衡点差异很大,且没有系统能在成本和准确性上同时胜出。