@browser_use: Astra 在浏览器使用任务中堪称怪兽级选手

X AI KOLs Timeline 模型

摘要

Astra 在 Browser Use Benchmark v2 上取得了 77.3% 的成绩,远超 Opus 5(50.5%)和 GPT-5.6 Sol xhigh(49.1%);在 60 项任务中,Astra 有 22 项获得满分,而 Opus 5 的满分任务数为零。

Astra 在浏览器使用任务中堪称怪兽级选手
查看原文
查看缓存全文

缓存时间: 2026/09/06 12:50

Astra 在浏览器使用方面堪称怪物

Gregor Zunic (@gregpr07): Astra 刚刚碾压了我们最难的基准测试 👀

Browser Use Benchmark v2 的得分如下:

Astra medium: 77.3% Opus 5: 50.5% GPT-5.6 Sol xhigh: 49.1%

60 个任务中有 22 个获得满分。Opus 5 为零。

(fable 拒绝的太多)

相似文章

@browser_use: Opus 5 和 GPT-5.6 Sol 在此不相上下!

X AI KOLs Timeline

Alexander Yue 推出了一项新的浏览器使用基准测试,其中 Opus 5 和 GPT-5.6 Sol 表现相似,强调了基准测试的稳健设计,包括为大语言模型评委提供的经过验证的评分标准。