标签
作者批评浏览器代理因登录界面和干扰而频繁失败,建议使用正规API或Runable等原生连接器来实现更可靠的自动化。
无影-浏览器代理是一个面向真实世界长周期浏览器智能体的统一框架,引入了BrowserBench基准测试,并在网络使用任务上实现了最先进的性能。
本文探讨了训练浏览器代理模型进行顺序决策时的挑战,如错误恢复和记忆问题,并寻求优化训练目标的建议。作者提到了在tinyfish开发的'mako'模型,并邀请社区反馈。
作者分享了 Panerelay 的设计决策,这是一个开源项目,允许 AI 代理控制真实的 Chrome 配置文件,将权限(如站点访问、标签页选择和控制租约)分离,并征求社区对授权边界的反馈。
作者正在构建一个用于AI浏览器代理检测和处理网站漂移的工具,并寻求用户关于痛点和现有解决方案的反馈。
一位开发者对 Rote 进行了基准测试,Rote 是一个浏览器代理的内存管理器,它发送页面差异而非完整重渲染,结果显示与 Browser Use 相比,令牌增长减少了 37%,但在短任务上存在权衡。
Webcmd 是一个开源工具,它教会浏览器代理一次性学习网站导航并重复使用,从而大幅减少重复任务中的token浪费。它支持99个网站,并可在本地运行。
微软AI Frontiers发布了一系列浏览器智能体,能够通过“观察-思考-行动”循环,从像素直接到动作,实现填写表单和预订等功能。提供4B、9B和27B三种参数规模,可在普通硬件上部署。
作者认为,AI智能体在真实网页任务中失败并非因为模型能力弱,而是因为浏览器是为人类设计的,缺乏供智能体使用的隔离、可编程工作空间。
文章批评了当前浏览器AI代理的低效率,因为它们反复解析和推理相同的网站,并提出了一种模型,代理可以重用经过验证的交互路径,以减少代币消耗并提高速度。
微软推出了Fara1.5系列小型浏览器代理(4B、9B、27B),在计算机使用基准测试中取得了最先进的性能,在Online-Mind2Web上得分63%,并超越了Operator和Gemini等更大规模的模型。
作者解释了为什么他们不再使用基于浏览器的LLM代理来浏览Hacker News,而是构建了一个插件(MediaUse),直接获取结构化数据,从而节省令牌,并将模型的重点放在分析而非导航上。
讨论了当前使用无头Chrome加AI层的浏览器代理的架构问题,并介绍了Opera Neon的命令行界面作为替代方案,将AI集成到浏览器中,从而降低令牌开销并提高理解能力。
作者观察到,浏览器代理已从华而不实的演示演变为可靠地执行研究、更新表格、完成工作流等任务,标志着从助手到操作员的转变。
本文证明,网站可以通过分析浏览代理的行为模式和时序数据,识别其背后的大语言模型,在14个前沿LLM上实现了高达96%的F1分数。本文正式定义了这一攻击面,并表明随机时序延迟不足以阻止识别。