@FinanceYF5: 1/ Jev + Mercury 2.5在WebMCP基准测试中近乎“突破”:所有49/49任务完成。模型成本约…
摘要
Jev + Mercury 2.5 AI模型在WebMCP基准测试上完成了所有任务,成本显著低于GPT-6 Astra变体。
查看缓存全文
缓存时间: 2026/09/20 11:12
1/ Jev + Mercury 2.5 几乎“突破”了 WebMCP 基准测试:
所有 49/49 项任务均已完成。
该模型成本相比使用代码执行的 GPT-6 Astra 降低了约 112 倍,相比使用截图操控浏览器的 Astra 降低了约 245 倍。👇
2/ 当 Jev 仅通过浏览器 DOM 操作时,只完成了 25/49 项任务。
接入 WebMCP 后,成绩直接提升至 49/49,成功任务数接近翻倍,同时模型成本还降低了 18%。
真正改变结果的,是 Agent 与网站交互的方式。
3/ 这套组合的分工非常简单:
Jev 负责选择工具。
Mercury 2.5 负责生成搜索词等工具参数。
WebMCP 负责将网站功能转化为清晰、可直接调用的工具。
4/ Jev 可以从一组离散选项中做选择,但无法生成任意文本。
例如,它可以选择 search_products 工具,却无法自行生成具体的搜索词。
因此需要 Mercury 2.5 来补充参数。它每秒可输出 1000 多个 Token,速度快且成本低。
5/ 为什么接入 WebMCP 后效果提升如此显著?
因为多数任务真正困难的部分,在于选择正确的下一步,而非生成工具参数。
WebMCP 将一连串的点击、填表、菜单跳转,压缩为一次明确的工具调用,大幅减少了决策空间。
6/ 25/49 这仅仅表明,在当前基准测试中,这个超快实现的结果尚未代表 Jev 或 Browser Use 能力的上限。
完整的测试与方法已开源且可复现:
https://webmcp.com/benchmark https://github.com/nekuda-ai/WindTunnel… https://github.com/browser-use/jev-ultrafast…
Exa 为互联网构建了一台“时间机器”。
Exa Snapshot 索引了 4000 亿个网页历史快照,使人们能够仿佛置身过去般地搜索互联网。
它已被用于预测模型回测、AI 实验室的强化学习,以及探索 AI 诞生之前的互联网。
相似文章
我对比测试了Jev和gpt-5.6-luna!
本文展示了基准测试比较,显示Jev在49项任务中有42项胜过gpt-5.6-luna,具有更低的延迟和成本,但在文本生成和某些推理方面存在局限性。
@FinanceYF5: GPT-6 Astra 正在席卷互联网。玩Minecraft、设计蛋白质、追踪体育赛事、构建3D…
GPT-6 Astra,一个AI模型,因其在游戏、蛋白质设计、体育追踪和3D世界构建方面的多样应用而走红,并通过10个令人惊叹的案例加以凸显。
GPT-6 Astra 基准测试
本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。
@FinanceYF5: GPT-6 Astra ‘解构’了一台V8引擎,将其转化为互动3D教室。有人只是要求它创建……
GPT-6 Astra通过生成V8引擎的交互式3D可视化展示了其先进功能,使用户能够实时探索其组件和四冲程循环,用于教育目的。
@10xmylife: Tried it out today, and it really works, so we'll go with this plan.
用户测试Jev模型在游戏《杀戮尖塔2》中的表现,其决策速度极快,仅需0.7秒,远超人类和GPT-6 Astra,令人震惊。