EconSkills:面向实时经济数据的Web智能体技能迁移与检索研究

arXiv cs.AI 论文

摘要

EconSkills提出了一种技能库与评估框架,使Web智能体能够迁移和检索处理实时经济数据的流程知识,在受控迁移中提升效率,并在库规模评估中展现竞争力。

arXiv:2609.19523v1 公告类型:新研究 摘要:Web智能体常重复访问同一网站,但现有评估大多忽略了早期成功交互中习得的流程。我们提出EconSkills——一个技能库与评估框架,它将经过验证的EconWebArena轨迹提炼为参数化的标准操作流程,用于检索实时经济数据。每个技能记录其作用范围、导航流程、网站特定指导、验证检查和恢复步骤,同时将原始实例值替换为占位符。EconSkills区分了两个关键问题:已知的相关流程是否可迁移到未见过的任务;智能体在从库中选择时能否保持该迁移优势。在受控迁移实验中,匹配的技能相比无技能提示能提升成功率,并在成对成功案例中减少所需步骤,而抽象化流程比直接回放原始轨迹更有效。在库规模评估中,检索方法总体上与无技能基线具有竞争力,并在直接覆盖的任务上表现最佳;按覆盖率分层的结果表明,对未覆盖任务的近似匹配抵消了这些优势。浏览器轨迹分析进一步揭示了流程指导何时能缩短门户类网站导航时间,以及语义验证在何种情况下仍属必要。这些结果证实了可复用的经济类Web流程能在不同任务实例间迁移,并为覆盖率感知的选择与上下文交付提供了具体的设计目标。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:20

# EconSkills:基于实时经济数据的网络智能体技能转移与检索研究  
来源:https://arxiv.org/html/2609.19523  
权银珠  
单位:佐治亚理工学院  
单位:美国佐治亚州亚特兰大市  
邮箱:[[email protected]](mailto:[email protected])  
刘泽方  

###### 摘要  
网络智能体常重复访问相同网站,但现有评估体系往往丢弃早期成功交互中习得的流程。本文提出EconSkills——一个技能库与评估框架,将经过验证的EconWebArena轨迹提炼为参数化的标准操作流程,用于获取实时经济数据。每个技能记录其适用范围、导航流程、网站特定指导、验证检查与恢复步骤,同时用占位符替代实例具体值。EconSkills区分两个常被混淆的问题:已知相关流程是否可迁移至保留任务?智能体能否在从库中选择时保持该优势?在受控迁移实验中,匹配技能相比无技能提示能提升成功率,并在配对成功案例中减少步骤数;而抽象化相比重放原始轨迹显著提升效率。在技能库规模下,整体检索性能与无技能基线相当,在直接覆盖任务上表现最优;分层覆盖率分析表明,未覆盖任务的近似匹配抵消了部分优势。浏览器轨迹进一步揭示了流程指导何时能缩短门户导航步骤,以及语义验证何时仍不可或缺。研究证实可复用的经济网络流程能在任务实例间迁移,并为覆盖率感知的技能选择与上下文投放提供了明确设计目标。  

## 1引言  
基于大语言模型(LLM)的自主网络智能体日益具备操作真实网站的能力(He等,2024;Zheng等,2024),它们能通过阅读渲染页面、填写表单、跟踪链接并返回最终答案来完成任务。经济数据检索是这一应用领域中具有挑战性且实际意义重大的场景。分析师经常需要从官方门户(如央行、国家统计局或国际组织)获取特定数据——通胀数字、政策利率、汇率或国家级指标。EconWebArena(Liu和Quan,2025)正是针对这一场景的标准化评测平台,它将自然语言问题与对应的实时权威页面配对。更广泛地看,LLM智能体正被应用于经济与商业任务,从经济序列推理(Quan和Liu,2024a)、多智能体库存管理(Quan和Liu,2024b)、供应链风险评估(Quan等,2026)到电子商务内容生成(Quan等,2025)。相关系统还利用LLM智能体进行宏观经济模拟(Li等,2024)以及金融研究与估值(Yang等,2024)。这些应用都依赖于及时、准确识别的经济证据,但从官方网站获取此类证据仍需单独处理交互问题。  

尽管进展迅速,标准网络智能体评估通常孤立处理每个任务。对于结构重复的任务——例如同一门户下仅参考年份、国家或数据系列不同的两个问题——智能体每次都会从头解决,先前任务中学习到的经验在后续任务中被完全丢弃。反思机制(Reflection)虽能帮助智能体从单次任务反馈中改进(Shinn等,2023),但一次性智能体通常在处理相关任务时无法复用这些经验。这种处理方式存在资源浪费,因为在同一门户内,到达答案的路径远比答案本身稳定。无论是国际组织指标的访问路径、央行统计页面的选择器序列,还是国家统计局的导出操作,这些可复用的结构都被一次性智能体反复丢弃。如果将这些结构捕获为可供智能体调用的技能库,就能避免为每个任务重新探索路径;而当前未解决的问题是:当智能体拥有大量技能但仅有少数与当前任务匹配时,应如何从库中选择技能?  

经济场景的特殊性使得这一选择问题尤为复杂。门户可能展示标签相似但单位、季节性调整、地理覆盖范围、发布版本或生效日期不同的相邻序列。因此,实用的经济网络技能不仅需编码点击位置,还需明确目标序列的标识及其来源与解读的验证方法。为解决这些不足,我们推出EconSkills——一套抽象化、无实例的经济网络技能库,供网络智能体在新任务中调用(如图1所示)。基于EconWebArena,我们提炼出50个技能,每个技能从已解决的种子轨迹中提取,形成包含七部分的标准操作流程(SOP),记录如何在权威门户获取数值,涵盖技能名称、目的、前提条件、有序导航步骤、网站特定指导以及验证与恢复规则。国家或年份等实例具体值被替换为占位符,使流程具备通用性。  

我们分离了评估中常被混淆的两个问题:第一,当任务存在已知对应技能时,该技能能否迁移至新实例?第二,当智能体需从完整技能库中选择时,技能选择能否保持迁移优势?我们通过100个保留变体的受控研究回答第一个问题,分别测试无技能、原始轨迹和匹配技能三种条件,每种条件重复3次。针对第二个问题,我们在全部360个EconWebArena任务中测试五种条件:无技能、全技能库、检索五个技能、随机五个技能、可选提示。  

我们的贡献有三点:(1)提出EconSkills——包含50个抽象经济网络技能的库,每个技能是从验证轨迹中提炼的可复用SOP,用占位符替代实例值,同时保留前提条件、验证与恢复机制;(2)在两个互补层面评估技能使用:已知匹配技能的受控迁移,以及在完整基准上通过检索、随机选择、全库和可选提示条件的库级投放;(3)揭示两个层面的行为差异:匹配技能能提升迁移效果,检索在技能库直接覆盖的任务上表现最佳。配对结果与轨迹分析阐明了覆盖率、语义匹配度和上下文规模如何决定优势在端到端部署中的存续。  

## 2相关工作  
**网络智能体与基准**:WebArena(Zhou等,2024)评估在全交互网站上的长期任务,Mind2Web(Deng等,2023)研究跨多样真实网站的泛化能力。VisualWebArena(Koh等,2024)增加视觉定位任务,WebLINX(Lù等,2024)关注对话式导航。BrowserGym(Le Sellier De Chezelles等,2025)为跨基准比较智能体提供统一环境。评估也通过WebCanvas(Pan等,2024)和Mind2Web 2(Gou等,2025)向在线设置与智能体搜索发展。EconWebArena(Liu和Quan,2025)将此方向专注于实时权威网站上的多模态多步骤经济任务,其中相关任务族常共享流程结构。  

**经验与工作流复用**:多种方法跨任务传递信息而非从空上下文重启。ExpeL(Zhao等,2024)从历史经验提取自然语言见解,在推理时召回相关示例。Agent Workflow Memory(Wang等,2025)在离线与在线环境中归纳可复用的网络工作流,并在新任务中有选择地提供。RaDA(Kim等,2024)为网络任务分解与动作生成分别检索范例。VideoWebArena(Jang等,2024)进一步表明长上下文教程可能损害技能保持性能,说明流程上下文并非普遍有益。这些结果推动了跨任务复用,但存储的流程及其投放常被一并评估。我们的两级设计则分离了已知匹配的迁移价值与从库中选择呈现的问题。  

**智能体技能**:Voyager(Wang等,2024)维护可执行代码技能库,SkillWeaver(Zheng等,2025)通过探索发现并优化可复用的网络API。近期研究关注可审计与可泛化的技能制品:SkillGen(Ma等,2026)通过技能对保留任务的影响验证合成技能;ContractSkill(Lu等,2026)增加显式验证与修复机制;PolySkill(Yu等,2025)通过多态抽象实现跨站点泛化。SkillsBench(Li等,2026)同样通过下游智能体行为而非文本合理性评估技能。SkillGen与SkillsBench均在整体提升之外暴露任务级性能波动,促使采用配对结果分析而非仅报告平均改进。EconSkills基于此功能视角,测试同一技能库在匹配迁移与库级投放下的不同表现。  

## 3EconSkills  
EconSkills的构建与应用分三个阶段(如图1所示):任务执行生成已解决的种子轨迹;技能提取将该轨迹提炼为抽象标准操作流程(SOP);技能应用将所得库中的技能提供给网络智能体,并在EconWebArena基准上评估。该库包含50个技能,每个技能对应一个已解决的种子任务,捕捉了权威门户上独特的经济数据检索工作流。  

### 3.1任务执行  
我们通过浏览器驱动实时门户解决每个种子任务。每一步中,智能体观察当前页面的结构化视图、无障碍树(AXTree)、截图以及上下文元数据(如焦点元素与操作历史),并从EconWebArena的BrowserGym高层动作集中选择一个或多个操作响应。该动作空间支持基于元素与坐标的交互、键盘输入、滚动、导航和标签管理。智能体重复此循环直到提交最终答案。我们仅在任务解决且答案通过基准自动检查(要求正确数值与预期权威域名上的落地URL)后保留种子任务。  

将每个保留的技能建立在已验证的成功案例上,而非门户行为的预期描述,确保每个技能后续从实际到达目标值的轨迹中提炼。该过程产生50个已解决的种子任务,对应库中的50个技能。这些种子任务涵盖EconWebArena十类经济数据中的九类(政府、银行、市场、劳动力、金融、能源、教育、健康、贸易),涉及37个不同的权威网站,包括央行、国家统计局、国际组织与金融数据门户。表1列出了各类别的种子任务数量及每个技能用占位符替代的实例字段。  

### 3.2技能提取  
提取器模型从每个已解决轨迹中提炼一个结构化技能,写为七部分SOP。提取器读取解决种子任务的完整轨迹、访问的URL、AXTree观察、执行的操作及确认的最终答案,并将其重写为其他智能体可在新实例上遵循的流程。七个字段为:(i)名称;(ii)目的(技能回答的问题类型);(iii)前提条件(流程开始前必须满足的条件,如门户与数据集可访问);(iv)流程(有序导航与交互步骤);(v)网站指导(门户特定菜单、选择器与注意事项);(vi)验证(如何确认检索数值符合任务要求);(vii)恢复(步骤失败时的应对措施)。后两个字段对经济数据尤为重要。官方门户常在同一页上展示名义值与实际值、调整序列与未调整序列、初步发布与修订版本,或多个生效日期。因此EconSkills记录对实体、时期、单位、序列定义与来源域的检查,并包含门户特定的备选方案(如表格、归档与下载视图)。即使实例值被抽象化,这些领域信息仍被保留。  

技能可复用的关键在于抽象化。提取器识别种子轨迹中涉及的每个实例具体值(年份、国家、指标或数值目标),并将其替换为命名占位符(如<YEAR>、<COUNTRY>或<INDICATOR>)。流程随后引用这些槽位而非具体问题,使得诸如“选择<INDICATOR>序列,将地区设为<COUNTRY>,将时期设为<YEAR>”的步骤在为不同实例填充占位符后仍有效。验证与恢复机制将技能与脆弱点击记录区分开来:验证字段说明如何确认回读数值符合请求的单位、时期和实体;恢复字段规定步骤失败时(如菜单标签变更或选择器缺失)的应对措施,例如回退到门户搜索或备选导出视图。我们将每个技能序列化为包含这七个字段的JSON,并渲染为Markdown注入网络智能体。每个已解决种子任务仅提取一个技能,共获得50个独立技能。表2展示了技能提取示例...

相似文章

SkillRet:面向 LLM 智能体技能检索的大规模基准

arXiv cs.AI

本文提出了 SkillRet,这是一个用于评估 LLM 智能体技能检索的大规模基准,旨在解决从大型技能库中选择相关技能的挑战。该基准提供了包含超过 17,000 项技能的 dataset,并证明针对特定任务的微调能显著提升检索性能。

基于状态感知动态检索的Web智能体在线技能学习

arXiv cs.AI

本文提出了SGDR(State-Grounded Dynamic Retrieval,状态感知动态检索),一种面向Web智能体的在线技能学习方法,支持逐步、感知当前状态的技能复用,而非静态的任务级检索。在WebArena上的实验表明,SGDR结合GPT-4.1可达到37.5%的成功率,相较于强基线取得了约10.6%的相对提升。

SkillNet:创建、评估并连接AI技能

Papers with Code Trending

SkillNet 提供了一个开放的基础设施,通过统一的本体系统地积累和迁移 AI 技能,在多个领域展现了智能体性能的显著提升。