@browser_use: Opus 5 和 GPT-5.6 Sol 在此不相上下!

X AI KOLs Timeline 工具

摘要

Alexander Yue 推出了一项新的浏览器使用基准测试,其中 Opus 5 和 GPT-5.6 Sol 表现相似,强调了基准测试的稳健设计,包括为大语言模型评委提供的经过验证的评分标准。

Opus 5 和 GPT-5.6 Sol 在此不相上下!
查看原文
查看缓存全文

缓存时间: 2026/08/20 23:01

Opus 5和GPT-5.6 Sol在这项基准测试中旗鼓相当!

Alexander Yue (@Alezander9):
我们与数百名用户交流,将最具挑战性的真实用户任务转化为浏览器使用基准测试

我们投入大量精力构建原子化、可验证、无歧义的LLM评判标准。这是迄今为止最优秀的浏览器智能体基准测试 🧵

Opus 5和GPT-5.6 Sol在这项基准测试中旗鼓相当!

今日我们发布browser-use Cloud的集成功能与触发机制!

你可以这样下达指令:“每当我在Slack的‘alert’频道收到消息,就遍历所有子处理器,并向我发送其状态页面的截图。”

相似文章