browser-agent-benchmark

标签

Cards List
#browser-agent-benchmark

@browser_use: Opus 5 和 GPT-5.6 Sol 在此不相上下!

X AI KOLs Timeline · 2天前 缓存

Alexander Yue 推出了一项新的浏览器使用基准测试,其中 Opus 5 和 GPT-5.6 Sol 表现相似,强调了基准测试的稳健设计,包括为大语言模型评委提供的经过验证的评分标准。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈