AutoTailor: 面向网页代理的自动用户对齐能力选择与适配

arXiv cs.AI 论文

摘要

AutoTailor是一个元代理框架,能自动为网页代理选择和适配紧凑的浏览器自动化API集,通过离线过滤和动态重选提升准确性和效率。

arXiv:2609.13548v1 公告类型:新 摘要: 网页代理可以利用可重复使用的工具来降低底层浏览器交互的成本和延迟,但自动发现的工具集可能庞大、冗余且与用户需求不匹配。我们提出AutoTailor,一个元代理框架,用于构建和维护紧凑的轨迹驱动模型上下文协议(MCP)API集。离线时,AutoTailor将网页轨迹转换为参数化的浏览器自动化程序,应用质量过滤器移除粒度不当和功能冗余的API,并应用使用可能性过滤器优先选择广泛有用的能力,同时保留语义覆盖。在线时,动态重选监控任务结果和API使用情况,识别反复出现的覆盖缺口,添加相关候选者,并修剪持续未使用的能力。我们在106个WebArena Postmill任务上评估AutoTailor。离线过滤将初始1,283个未精炼API减少到87个,动态重选产生一个33-API集合。在带有推理和行动(ReAct)回退的情况下,该集合达到90.6%的正确率,而单独ReAct为87.5%,同时将平均总请求令牌成本降低57.8%,延迟降低29.4%。没有ReAct时,它达到60.1%的正确率,略微匹配未精炼集合的性能,同时将请求令牌使用减少94.9%。总的来说,这些结果表明静态过滤产生了一个紧凑的API库存,预期支持核心、高可能性任务,而动态重选进一步根据观察到的用户需求调整该库存。这种组合提高了准确性和延迟,同时显著减少了令牌使用和端到端成本,展示了用户对齐能力管理对高效网页代理的价值。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:56

# AutoTailor:面向网络智能体的自动化、用户对齐能力选择与适配
来源:https://arxiv.org/html/2609.13548

Adriana Szekeres
所属机构:微软研究院,华盛顿州雷德蒙德市
邮箱:[email protected], {aszekeres,fafaisal}@microsoft.com

Fazle Elahi Faisal
所属机构:微软研究院,华盛顿州雷德蒙德市
邮箱:[email protected], {aszekeres,fafaisal}@microsoft.com

###### 摘要
网络智能体可通过复用工具来降低底层浏览器交互的成本与延迟,但自动发现的工具集往往规模庞大、存在冗余且与用户需求契合度低。我们提出AutoTailor,一个元智能体框架,用于构建和维护一套精简的、源自交互轨迹的模型上下文协议(MCP)API集合。在离线阶段,AutoTailor将网络交互轨迹转化为参数化的浏览器自动化程序,应用“质量过滤器”移除粒度不合适及功能冗余的API,并应用“使用可能性过滤器”在保留语义覆盖范围的同时优先保留广泛适用的能力。在在线阶段,“动态重选”模块监控任务执行结果与API使用情况,识别反复出现的覆盖缺口,添加相关候选API,并删除长期未使用的能力。

我们在WebArena Postmill环境的106个任务上评估了AutoTailor。离线过滤将初始的1283个未精炼API减少至87个,而动态重选进一步生成了一个包含33个API的集合。结合“思考与行动”(ReAct)回退机制,该集合实现了90.6%的正确率,相比单独使用ReAct的87.5%有所提升,同时将平均总请求token成本降低了57.8%,延迟降低了29.4%。在没有ReAct的情况下,其正确率为60.1%,与未精炼集合的表现相当,但请求token使用量减少了94.9%。这些结果共同表明,静态过滤能生成一套精简的API库,预期可支持核心且高概率的任务;而动态重选则能根据观察到的用户需求进一步定制该库。这种组合提升了准确性并降低了延迟,同时显著减少了token使用量和端到端成本,彰显了用户对齐的能力管理对于高效网络智能体的价值。

图注 图1:AutoTailor系统架构概览:源自交互轨迹的网络操作被转化为可复用的MCP API,经过去重和过滤形成精简的能力库,然后根据用户需求动态重选,同时为下游运行时网络智能体维持功能覆盖范围。

## 1 引言
网络智能体是一种自主的AI系统,它能感知网络内容、解读通过自然语言指令表达的用户目标,并通过点击、输入、滚动等操作与网络界面交互,以代表用户完成任务。此类系统有潜力支持广泛的应用,从提升与复杂网站交互的效率,到通过非视觉交互模式增强网络可访问性。

早期的网络智能体通常遵循ReAct交互范式,反复观察屏幕截图或文档对象模型(DOM)树,推理下一步动作,执行该动作,并重新评估所得网页状态,直至任务完成。然而,这个迭代过程可能容易出错、速度缓慢且计算成本高昂。近期的系统越来越多地采用可复用的技能和工具,以提高网络智能体部署的速度、准确性和成本效益。尽管如此,如何构建网络智能体的“能力空间”,使其在保持效率的同时与用户需求对齐,仍是一个开放问题。

手动构建技能和工具成本高昂,而自动发现系统可能提供不足够的覆盖。先前的工作引入了自动化的智能体网络爬取,通过发现大量候选行为来以更低的成本提高覆盖范围。然而,这些行为可能是冗余的、重叠的,或与用户需求契合度低。这些局限性催生了对一个可靠框架的需求,该框架旨在构建一个精简但全面的网络智能体能力空间,并以MCP API的形式表示。

我们提出了AutoTailor,一个元智能体框架,包含两个主要的能力管理模块:**离线选择模块**和**在线动态重选模块**(见图1)。离线模块通过三个阶段构建初始能力集:
*   **轨迹爬取**:收集多样化的网络交互轨迹。
*   **能力(API)构建**:将轨迹转化为可复用的参数化程序。
*   **能力选择**:依次应用“质量过滤器”(QF)和“使用可能性过滤器”(ULF),生成初始的被管理的MCP能力集。

在运行时,在线模块通过四个阶段调整活跃能力集:
*   **记录运行时使用情况**:记录用户意图、工具使用和任务结果。
*   **覆盖缺口检测**:识别当前API无法充分支持的反复出现的任务。
*   **候选检索**:从候选API池中选择能弥补已检测到缺口的非活跃API。
*   **能力添加与剪枝**:整合有用的候选API,同时移除长期未使用的API。

这种设计结合了广泛的离线能力发现和使用驱动的在线适配,使得部署的工具集能够保持精简,同时跟踪观测到的任务分布所需的能力。

我们在WebArena的Postmill环境中的106个任务上评估了AutoTailor,比较了初始未精炼集(S_init)、经过QF筛选后的静态选择集(S_QF)、经过ULF筛选后的集合(S_ULF)以及动态重选集(S_DR),评估了是否使用ReAct回退方法的情况。我们测量了任务成功率、延迟、API使用量以及模型调用和token成本。我们的评估揭示了能力集大小、效率和功能覆盖范围之间的权衡。

QF和ULF将候选能力池从|S_init| = 1283个API缩减至|S_ULF| = 87个,而DR进一步将其调整为精简的|S_DR| = 33个API集合。我们的结果显示,在启用ReAct回退的情况下,与单独使用ReAct相比,S_DR将正确率从87.5%提升至90.6%,同时将平均总请求token成本降低了57.8%,延迟降低了29.4%。在没有ReAct的情况下,S_DR保持了60.1%的正确率,与S_init的表现相当,但请求token使用量减少了94.9%。这些结果表明,AutoTailor能够大幅压缩部署的能力集,同时保持任务性能(在启用ReAct的设置中甚至有所提升)。

我们的贡献如下:
- • 我们提出了AutoTailor,一个元智能体框架,用于构建和维护一套精简的可执行网络能力组合,平衡功能覆盖范围、部署效率与观测到的用户需求对齐。
- • 我们展示了离线能力选择能显著减少候选API池的大小和工具开销,同时揭示了精简性、直接功能覆盖范围与依赖ReAct回退之间的权衡。
- • 我们展示了动态重选通过调整部署的能力集以适应观测到的运行时需求来缓解这种权衡,以更小的能力集恢复覆盖范围,并在有无ReAct回退的情况下均提高了效率和任务性能。

## 2 相关工作
### 2.1 网络轨迹生成
大规模、基于环境的轨迹提供了可衍生网络智能体能力的原始行为。先前的工作在多个互补维度上扩展了此方法。OS-Genesis通过先探索图形用户界面(GUI)、回顾性合成任务并应用轨迹奖励模型进行质量控制,逆转了传统的“任务优先”收集方法。Explorer结合广泛的网络探索与意图精炼,以大规模生成成功的多模态轨迹。为提高生成数据的可靠性,SynthAgent联合精炼合成任务和演示,以减少不可行的指令以及嘈杂或不匹配的动作,而AutoSurfer则将系统的广度优先探索与基于轨迹的任务合成和精炼相结合,以增加网站覆盖范围。

这些方法侧重于获取更广泛、更多样或更可靠的轨迹语料库。我们的工作以此类语料库作为输入,并解决下一个问题:数千条轨迹中代表的哪些行为应成为部署的工具?具体而言,AutoTailor识别出一组精简的高价值能力,同时排除那些冗余、过于特定、构造不佳或不太可能服务于用户请求的候选。

### 2.2 工具与技能合成
当底层交互被抽象为参数化工具或技能时,轨迹数据就变得可直接复用。现有系统探索了多条通向此抽象的路径。智能体技能归纳(ASI)将原语动作组合为更高级的例程,并在线验证归纳出的程序。SkillWeaver发现并练习网站交互,然后将其提炼为不断增长的可复用API库。WALT则恢复网站中已存在的功能,并将其作为可调用的工具暴露出来,而WebXSkill则从轨迹中挖掘可复用的子序列,并将参数化程序与用于执行和适配的自然语言指导配对。

与这些合成工作相辅相成,《工具幻觉》系统性地研究了工具是否能带来一致的增益,以及工具设计和副作用如何影响不同工具来源、模型、框架和基准下的网络智能体性能。这些工作共同展示了如何创建工具以及为什么工具集质量很重要,但留下了一个开放问题:如何从一个庞大的候选池中构建和维护一个有效的工具库;此外,一些API发现方法并未明确确保或评估覆盖范围。

相比之下,AutoTailor从全面、系统性地收集的轨迹开始,以建立广泛的行为覆盖范围,然后过滤、去重并重选衍生的工具,以在用户需求变化时维持一个精简、高实用性的工具库。

### 2.3 元智能体优化
当智能体面临的请求随时间变化时,仅离线选择能力库是不够的。元智能体优化通过将基础模型周围的制品视为可改进的对象,提供了更广阔的适应性视角。GEPA通过对执行轨迹的反思来演化提示词,并保留沿帕累托前沿的互补候选。AlphaEvolve将类似的迭代模式应用于可执行程序,使用领域特定的评估器来选择有前景的修改。Meta-Harness将优化制品扩展到模型接口代码,通过让外部循环提议器访问源代码、评估分数和先前的执行轨迹来实现。

这些工作共同表明,智能体系统可以在不更新基础模型权重的情况下进行改进,但它们优化的是提示词、程序或接口,而不是已部署工具集的成员构成。相比之下,AutoTailor调整的是能力库本身:它使用观测到的请求、工具使用、回退调用和失败情况来决定添加、保留或移除哪些工具。这随着用户需求的变化改变了智能体可以直接调用的内容,而不仅仅是改变固定能力集的使用方式。

##### 研究空间。轨迹生成提供候选行为;工具与技能合成使其可执行;元智能体优化则支持适应性。然而,先前的工作并未共同解决能力库优化问题:选择哪些合成能力进行部署,并随着需求变化调整该集合。AutoTailor通过离线构建一个经过质量控制、去重和效用排序的MCP工具组合,并在运行时基于观测到的覆盖缺口和使用情况在线重选部署的工具,从而弥补了这一差距。它将精简性、功能覆盖范围、部署成本和用户对齐视为首要目标。

## 3 系统架构
AutoTailor使用一个多智能体架构,将记录的网络轨迹转化为一套精简高效的API集,并根据运行时需求调整部署的API集。系统工作流见图1。在此流水线中,**离线选择模块**生成和过滤源自轨迹的API,而**在线动态重选模块**则识别覆盖缺口并更新活跃的API集。这些模块共同作用,将一个自动生成的、可能冗余且未与用户对齐的API池,转化为一个精简的、响应需求的智能体能力库,在满足新需求时恢复覆盖范围,同时减少了智能体的活跃工具空间。

### 3.1 离线选择模块
离线模块将收集的轨迹转化为可执行的浏览器自动化API,并通过两个选择过滤器进行组织,这些过滤器的灵感来源于先前关于高质量工具集构成的工作。初始API集S_init包含所有生成的API。“质量过滤器”(QF)移除粒度不合适及功能重复的API,产生S_QF;而“使用可能性过滤器”(ULF)在保留能力多样性的同时,保留高实用性的API,产生S_ULF。S_ULF集合初始化在线系统,而S_QF则作为...

相似文章

AutoData: 预训练数据选择的智能体搜索

arXiv cs.AI

AutoData 引入了一个AI智能体,通过搜索可执行算法来自动化大型语言模型的预训练数据选择,超越了人工设计的筛选流程,并提升了下游指标。