@gregpr07: Browser Use Beta 刚刚在我们最难的内部网络代理基准测试中实现了 SOTA。Fable 在优化方面确实令人惊叹…
摘要
Browser Use Beta 在困难的内部网络代理基准测试中取得了先进的结果,使用了 Fable 进行优化和分析。
查看缓存全文
缓存时间: 2026/06/12 08:57
Browser Use Beta 刚刚在我们最难的内测网页 agent 基准测试中达到了 SOTA。
Fable 在优化与评估运行分析方面真的非常出色。它能从运行中提取模型的高度抽象启发式方法,找出那些边缘案例在庞大的 Rust 代码库中产生的原因。
这感觉像是上了一个新台阶——我研究自动研究循环好几个月了,而这是第一个能够在高层真正理解问题的方案!
(另外,竟然一张图就直接搞定,太不可思议了,哈哈)
相似文章
@rsalakhu: 恭喜 @browser_use 团队在 Odysseys(一项极具挑战性的长周期 Web 智能体基准测试)中夺得第一名…
browser_use 团队在 Odysseys 基准测试中夺得第一名,这是一项针对长周期 Web 智能体的挑战性评估,其性能超越了 Opus 4.6 和 GPT-5.4 等模型。
我在一个真实站点上对我的浏览器代理与 Browser Use 进行了基准测试(150次验证运行,同一模型)。发送页面差异而非完整重渲染,使得令牌增长减少了37%。
一位开发者对 Rote 进行了基准测试,Rote 是一个浏览器代理的内存管理器,它发送页面差异而非完整重渲染,结果显示与 Browser Use 相比,令牌增长减少了 37%,但在短任务上存在权衡。
@browser_use:GLM 5.2 刚刚在网站设计上击败了 Fable 5。疯狂的是:GLM 是纯文本模型。它可以构建网站,但无法检查结果……
GLM 5.2 是一个纯文本模型,在与 Browser Use v2 多模态 QA 子代理配合使用时,在网站设计上胜过 Fable 5,从而能够以低成本进行迭代改进。
@ms_aifrontiers: 与MagenticLite一起,我们推出了Fara1.5:一系列小型浏览器代理,参数规模分别为4B、9B和27B。它在Online-Mind2Web上取得了63%的成绩……
微软推出了Fara1.5系列小型浏览器代理(4B、9B、27B),在计算机使用基准测试中取得了最先进的性能,在Online-Mind2Web上得分63%,并超越了Operator和Gemini等更大规模的模型。
@browser_use: BrowserCode 在长时间运行任务上表现出色,它为我们订了披萨
BrowserCode 在 Odysseys 基准测试中夺得长时网络智能体第一名,展现了在多小时网络工作流中的强劲性能。