@browser_use: Astra 在浏览器使用任务中堪称怪兽级选手
摘要
Astra 在 Browser Use Benchmark v2 上取得了 77.3% 的成绩,远超 Opus 5(50.5%)和 GPT-5.6 Sol xhigh(49.1%);在 60 项任务中,Astra 有 22 项获得满分,而 Opus 5 的满分任务数为零。
查看缓存全文
缓存时间: 2026/09/06 12:50
Astra 在浏览器使用方面堪称怪物
Gregor Zunic (@gregpr07): Astra 刚刚碾压了我们最难的基准测试 👀
Browser Use Benchmark v2 的得分如下:
Astra medium: 77.3% Opus 5: 50.5% GPT-5.6 Sol xhigh: 49.1%
60 个任务中有 22 个获得满分。Opus 5 为零。
(fable 拒绝的太多)
相似文章
@browser_use: Opus 5 和 GPT-5.6 Sol 在此不相上下!
Alexander Yue 推出了一项新的浏览器使用基准测试,其中 Opus 5 和 GPT-5.6 Sol 表现相似,强调了基准测试的稳健设计,包括为大语言模型评委提供的经过验证的评分标准。
@browser_use:浏览器使用基准测试 v2 帕累托前沿今日完全重塑 > Claude Opus 5.5:59.4 > GPT‑6 Sol medium:66.9 (3.5...
浏览器使用基准测试 v2 更新了其帕累托前沿,展示了来自 OpenAI 的 GPT-6 模型在性能和成本效益上均超越了来自 Anthropic 的 Claude Opus 5.5。
@browser_use: Grok 4.7 刚刚发布。仍在追赶 DeepSeek Long Horizon Browser Use Benchmark v2 > GPT-6 Astra:80.6 > DeepSeek V4.1…
Grok 4.7 已发布,在 Long Horizon Browser Use Benchmark v2 上相比 Grok 4.6 性能有所提升,但仍显著落后于 DeepSeek V4.1 Flash 和 GPT-6 Astra。
Opus 5.5 与 GPT-6 Astra/Sol 的所有基准测试对比
如图所示,在基准测试对比中,Opus 5.5 的表现优于 GPT-6 Astra 和 Sol,但成本更高。
@rsalakhu: 恭喜 @browser_use 团队在 Odysseys(一项极具挑战性的长周期 Web 智能体基准测试)中夺得第一名…
browser_use 团队在 Odysseys 基准测试中夺得第一名,这是一项针对长周期 Web 智能体的挑战性评估,其性能超越了 Opus 4.6 和 GPT-5.4 等模型。