无影-浏览器代理:以真实世界为核心的基础长周期浏览器智能体
摘要
无影-浏览器代理是一个面向真实世界长周期浏览器智能体的统一框架,引入了BrowserBench基准测试,并在网络使用任务上实现了最先进的性能。
arXiv:2608.17319v1 公告类型:新
摘要:浏览器智能体在短小、整洁的演示中表现良好,但实际部署根本不同:智能体必须在实时网站上持续做出数十次决策,同时从错误中恢复并导航复杂用户界面。我们认为,弥合这一差距需要在流水线的每个层面进行对齐,包括执行、监督、优化和评估,而不仅仅是规模。我们提出无影-浏览器代理,一个统一框架,旨在解决这些层面的问题。结构化的浏览器工具提供稳定的执行原语和面向决策的上下文管理。反思与UI专用课程监督微调(RUIC-SFT)显式地在恢复轨迹和复杂UI交互上进行训练。发散感知在线GRPO(DAO-GRPO)通过基于势函数的奖励塑形和发散感知步加权,改进了长周期信用分配。最后,我们引入BrowserBench,一个包含350个任务、平均37.9步的双语真实网络基准测试,因为大多数现有基准测试太短,无法暴露长周期故障模式。无影-浏览器代理-27B在WebVoyager上达到80.6%,在Online-Mind2Web上达到66.7%,在BrowserBench上达到65.1%,在网络使用基准测试上建立了新的开源最先进水平。同样的流水线也超越了浏览器使用,展示了强大的通用智能体能力,并在Tau2-Bench、Claw-Eval和BFCL-v4上达到了平均分73.8。
查看缓存全文
缓存时间: 2026/08/19 09:58
# 无影浏览器代理:面向现实世界的基础长周期浏览器代理 来源:https://arxiv.org/html/2608.17319 参见**贡献与致谢**部分获取完整作者列表。 **终端用户智能计算事业部 | 阿里云** ## 摘要 浏览器代理在短周期、界面简洁的演示中表现良好,但实际部署情况存在根本差异:代理必须在实时网站上持续执行数十次决策,同时需要从错误中恢复并应对复杂的用户界面。我们认为,弥合这一差距需要在流程的每个层面(包括执行、监督、优化与评估)实现对齐,而非仅依赖规模扩展。我们提出**无影浏览器代理**,一个统一框架,全面解决上述各层面问题。该框架包含结构化浏览器工具层,提供稳定的执行原语与面向决策的上下文管理;**反思与UI专项课程监督微调**在恢复轨迹与复杂UI交互数据上进行显式训练;**发散感知在线GRPO**通过基于势能的奖励塑形与发散感知步权重,改进长周期信用分配;此外,我们引入**浏览器基准测试平台**,这是一个包含350个任务(平均37.9步)的双语真实网页基准,因为现有基准测试大多任务周期过短,无法暴露长周期失效模式。无影浏览器代理-27B在WebVoyager上达到80.6%、在Online-Mind2Web上达到66.7%、在浏览器基准测试平台上达到65.1%,在浏览器使用基准测试中建立了新的开源最优水平。相同流程也成功迁移至浏览器使用之外的领域,在Tau2-Bench、Claw-Eval与BFCL-v4上平均得分73.8,展现出强大的通用智能体能力。 **图1**:在线浏览器使用基准测试与通用智能体基准测试的性能对比 ## 1 引言 **图2**:浏览器代理在长周期场景下的三大结构性挑战及协同设计方案。(a) 训练数据以成功轨迹为主,但真实长周期执行常涉及错误与绕行,导致恢复行为与复杂UI处理缺乏监督。(b) 长浏览器轨迹常共享较长前缀,仅在少数关键分支步骤产生差异,因此均匀的轨迹级优化会稀释学习信号。(c) 现有基准测试对双语长周期真实网页任务覆盖不足,导致目标部署场景评估不充分。 基于大语言模型构建的浏览器代理正从精选演示迈向真实部署,其中完成任务意味着需在动态变化的网页上持续数十次决策:聚合跨站点信息、填写具有依赖控件的多阶段表单,以及协调跨标签页工作流。然而,现有训练流程与基准测试仍集中于短周期、成功导向的英文交互。为量化这一差距,我们构建了**浏览器基准测试平台**——一个包含350个中英文真实网页任务的双语基准,平均完成步长37.9步。结果令人警醒:即使最强的闭源代理也有约三分之一任务失败,而性能优异的监督模型在轨迹超过50步的任务中成功率不足七分之一(第7.6.6节)。 通过分析这些失败案例,我们识别出三个在长周期场景下相互关联的结构性挑战(如图2所示): 1. **恢复监督缺失**:浏览器代理训练数据以成功轨迹为主,但在长周期场景中错误处理是常态。代理必然遭遇意外跳转、页面瞬时变化与复杂UI控件,需识别执行偏差并恢复目标。仅基于成功演示的训练数据缺乏错误恢复的监督信号。基础监督模型仅能恢复8.5%的检测错误步骤,且日期选择器、级联选择器等复杂控件在自然采集数据中出现稀疏,难以通过规模扩展学到可靠交互策略。 2. **长周期信用分配失效**:当代理未能及时恢复错误时,轨迹延长而监督信号仍局限于最终结果。同一目标的多次执行轨迹常共享长前缀,仅在少数决定性分支步骤产生差异,均匀优化导致学习信号分散于共享片段而非关键决策点。浏览器状态的动态特性进一步放大该问题:导航操作使早期DOM快照失效,页面局部变化更适合以紧凑更新表示,在持续增长的完整轨迹上优化所有步骤迫使策略基于过时状态推理,且在轨迹最长处产生最高token成本。 3. **评估覆盖不足**:现有评估体系未能充分覆盖浏览器代理所需处理的真实部署场景。在线基准测试以英文为主且任务周期较短,未充分测试复杂真实网站的长周期交互。即使强代理在当前评估中表现优异,也可能在更长、更复杂的实际工作流中失败。中文网络因其规模与部署相关性,在基准测试构建中几乎完全缺席。缺乏针对长周期、双语、真实网页任务的评估体系,将无法可靠衡量鲁棒浏览器代理的进展。 我们通过统一流程应对上述挑战,该流程针对相同长周期部署场景协同设计执行基础、监督、优化与评估。核心是**结构化浏览器工具层**,提供经过验证的浏览器操作接口与高效的面向决策的任务级状态管理,在监督数据构建、在线轨迹生成与评估间保持接口一致。 针对三大挑战的具体方案如下: - **反思与UI专项课程监督微调**:在通用演示基础上增加富含反思的恢复轨迹,并系统收集复杂UI交互数据,通过三阶段课程学习逐步强化基础操作、UI交互与自纠正能力。 - **发散感知在线GRPO**:定制化在线强化学习框架,通过引入更密集的进度监督、聚焦行为关键决策,并使训练与执行时的分步决策上下文对齐,改进稀疏浏览器反馈下的长周期优化。 - **浏览器基准测试平台**:构建面向真实中英文网站的长周期双语基准,采用仅目标描述的指令形式与符合部署条件的多步骤任务设计。 实验表明,所提流程在WebVoyager、Online-Mind2Web与浏览器基准测试平台上产生一致且可解释的性能提升。反思与UI专项课程监督微调在恢复相关与复杂UI任务上显著优于纯正面监督,发散感知在线GRPO进一步带来随任务难度与轨迹长度增长的增益。浏览器基准测试平台揭示了聚合分数掩盖的能力差异,定性分析显示生成的代理能从环境反馈中检测错误导航、修正页面假设并在单次任务中完成恢复。 无影浏览器代理-27B在浏览器使用基准测试中建立了新的开源最优水平,其基于工具层的训练方案也成功迁移至Tau2-Bench、BFCL-v4与Claw-Eval等通用工具使用基准。 **主要贡献包括**: 1. 识别长周期浏览器代理部署的三大关联挑战:成功轨迹主导的训练数据缺乏恢复监督、最终结果反馈无法突出决定成功的关键决策、双语长周期真实网页任务评估不足,并通过协同设计流程联合解决。 2. 构建结构化浏览器工具层,作为跨监督训练、在线强化学习与评估的共享执行基础,提供经过验证的工具空间与决策导向的任务级状态管理。 3. 提出反思与UI专项课程监督微调,结合反思恢复监督与UI专项交互数据,通过渐进式混合策略实现课程化监督初始化。 4. 开发发散感知在线GRPO,定制化长周期浏览器任务的在线强化学习框架,改进稀疏反馈下的优化并聚焦行为重要决策。 5. 构建浏览器基准测试平台,包含350个平均37.9步的中英文真实网页任务,弥补现有英文中心长周期在线基准测试的空白。 6. 开源无影浏览器代理系列模型(4B/9B/27B参数规模),在建立浏览器基准测试新最优水平的同时保持强大的通用工具使用能力。 ## 2 相关工作 ### 2.1 浏览器代理 浏览器代理的近期进展受更强基础模型、定位策略与网页专项后训练驱动。通用大语言模型与视觉语言模型已成为现代浏览器代理的核心框架。ReAct确立了多数浏览器代理遵循的"推理-行动"范式;SeeAct展示GPT-4V结合结构化定位可成为通用网页代理;AutoWebGLM通过自动数据收集与强化学习构建网页导航代理。越来越多研究致力于训练浏览器与GUI交互专项代理:UI-TARS系列开发直接感知截图的原生GUI代理模型;FARA、MolmoWeb与ScaleCUA证明通过高效智能体设计或精选演示,紧凑模型也能达到优异性能;OpenWebVoyager探索迭代式真实世界探索与反馈以构建多模态网页代理。 评估已从自托管环境与静态演示扩展至WebVoyager、Online-Mind2Web、VisualWebArena与DeepShop等在线网页基准。尽管进展迅速,现有系统大多孤立关注模型架构或训练算法,未协同解决恢复导向数据构建、稳定长周期在线优化与双语真实网页评估问题。无影浏览器代理通过端到端框架弥合这一差距:浏览器基准测试平台识别能力短板,反思与UI专项课程监督微调提供结构化监督学习初始化,发散感知在线强化学习进一步优化策略。 ### 2.2 计算机使用与通用浏览器代理 除浏览器专项系统外,计算机使用代理致力于训练控制桌面、网页、移动平台通用GUI环境的智能体。OpenCUA通过海量操作系统级交互数据扩展计算机使用监督,实现强大的通用GUI控制;GUI-Owl-1.5构建跨平台GUI理解与动作定位的统一视觉语言代理;UI-Venus系列探索紧凑混合专家GUI代理;EvoCUA证明多轮在线强化学习能显著增强计算机使用代理的通用工具使用能力。同理,Qwen-UI-Agent提供基于UI交互的通用代理;OpenWebRL展示紧凑开源模型通过在线网页多模态强化学习变得具有竞争力。 然而,大多数计算机使用代理针对原子GUI控制或通用计算机使用能力优化,通常在较短周期或单平台设置下评估,未联合解决本研究的三大长周期挑战:易错真实网页执行的恢复监督、稀疏终端奖励下的分支敏感信用分配、双语长周期评估。无影浏览器代理通过基于验证工具层的策略设计与针对性优化,补充了这一研究方向,同时保持竞争力的通用智能体能力。 ### 2.3 智能体强化学习 基于结果的语言推理强化学习成功加速了强化学习在交互式智能体中的应用。GRPO与DAPO等方法通过组相对优势实现无评论家策略优化;Visual-RFT、VLM-R1与UI-R1将强化微调扩展至多模态模型的视觉推理、指代表达理解、检测与GUI任务。两阶段强化学习结合行为克隆,或在大型数据集上训练后通过强化学习适应新环境,已成为高效范式。
相似文章
Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体
Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。
@browser_use:规模化可靠网络代理的时代已经到来。
Browser Use Cloud v4 推出了一个网络代理平台,号称能够解决准确性和成本限制,使得规模化可靠网络代理成为可能,并提供 15 美元免费额度供试用。
WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试
WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。
介绍 B,一个浏览器代理模板!基于 @vercel 的 Eve 构建。为任何智能体提供真正的 Browser Use Cloud 浏览器。查看…
介绍 B,一个开源的浏览器代理模板,基于 Vercel 的 Eve 构建,利用 Browser Use Cloud 为任何 AI 智能体提供真正的网页浏览器。它包含聊天界面和实时浏览器查看功能。
我觉得现在的浏览器代理开始变得不同了。
作者观察到,浏览器代理已从华而不实的演示演变为可靠地执行研究、更新表格、完成工作流等任务,标志着从助手到操作员的转变。