标签
WebRider is a hierarchical framework that formalizes delegated web tasks as intent contracts, preserving persona-conditioned policies through every browsing step. It includes RiderBench, a benchmark of 4,096 live-web contracts, and an 8B action-policy model trained through its guarded interface.
微软发布了 Fara1.5-27B,这是一个 270 亿参数的多模态计算机使用代理,专为网页浏览器设计,基于 Qwen3.5-27B 微调,能够通过截图执行端到端的网页任务。
本文研究了GRPO后训练是否能提升小规模(4B-8B)语言与视觉语言模型网络代理的性能。结果发现了一个受控的零结果:没有任何配置能在已掌握任务上带来可信的提升,且中高学习率会导致性能退化或崩溃,揭示了退化与崩溃状态之间的双重分离。
MAG引入了一个用于多模态Web代理的基准和框架,这些代理既执行任务又生成逐步指南文本,使用截图和接地方案。该工作包括一种GRPO训练方法,几乎将9B代理的成功率提高了一倍。
一篇文章分享从构建能与真实网页应用交互的网页代理中获得的来之不易的经验,提供对挑战和最佳实践的见解。
BrowserCode 在 Odysseys 基准测试中夺得长时网络智能体第一名,展现了在多小时网络工作流中的强劲性能。
Browser Use Beta 在困难的内部网络代理基准测试中取得了先进的结果,使用了 Fable 进行优化和分析。
WebChallenger是一个新的Web智能体框架,通过架构设计而非模型规模来复现人类认知优势,使用开放权重模型无需微调即可在多个基准测试中取得出色性能。
Aitor 通过使用自定义的 Chromium 分支、Firecracker 虚拟机和自定义 Linux 内核,从零构建了新的浏览器基础设施,实现了成本降低3倍、无限扩展和最快的浏览器自动化性能。现在只需 $0.02/小时。
微软发布了终端原生的 Web Agent 框架 Webwright,通过让 LLM 编写 Playwright 脚本来实现网页操作自动化,具有极简架构和 SOTA 性能,并支持多种模型后端和产品集成。
PANDO 是一个网络代理框架,通过在线技能蒸馏提高效率,在 VisualWebArena 任务上减少 58-61% 的令牌使用量,同时优于基线。
WebWatcher 是一个用于深度研究的多模态代理,它利用合成轨迹和强化学习在复杂的视觉与文本信息检索任务中实现了卓越性能。本文还引入了 BrowseComp-VL,这是一个评估多模态代理的新基准。