@FinanceYF5: 1/ Jev + Mercury 2.5在WebMCP基准测试中近乎“突破”:所有49/49任务完成。模型成本约…

X AI KOLs Following 模型

摘要

Jev + Mercury 2.5 AI模型在WebMCP基准测试上完成了所有任务,成本显著低于GPT-6 Astra变体。

1/ Jev + Mercury 2.5在WebMCP基准测试中近乎“突破”:所有49/49任务完成。模型成本比带代码执行的GPT-6 Astra低约112倍,比使用截图操作浏览器的Astra低约245倍。
查看原文
查看缓存全文

缓存时间: 2026/09/20 11:12

1/ Jev + Mercury 2.5 几乎“突破”了 WebMCP 基准测试:

所有 49/49 项任务均已完成。

该模型成本相比使用代码执行的 GPT-6 Astra 降低了约 112 倍,相比使用截图操控浏览器的 Astra 降低了约 245 倍。👇

2/ 当 Jev 仅通过浏览器 DOM 操作时,只完成了 25/49 项任务。

接入 WebMCP 后,成绩直接提升至 49/49,成功任务数接近翻倍,同时模型成本还降低了 18%。

真正改变结果的,是 Agent 与网站交互的方式。

3/ 这套组合的分工非常简单:

Jev 负责选择工具。

Mercury 2.5 负责生成搜索词等工具参数。

WebMCP 负责将网站功能转化为清晰、可直接调用的工具。

4/ Jev 可以从一组离散选项中做选择,但无法生成任意文本。

例如,它可以选择 search_products 工具,却无法自行生成具体的搜索词。

因此需要 Mercury 2.5 来补充参数。它每秒可输出 1000 多个 Token,速度快且成本低。

5/ 为什么接入 WebMCP 后效果提升如此显著?

因为多数任务真正困难的部分,在于选择正确的下一步,而非生成工具参数。

WebMCP 将一连串的点击、填表、菜单跳转,压缩为一次明确的工具调用,大幅减少了决策空间。

6/ 25/49 这仅仅表明,在当前基准测试中,这个超快实现的结果尚未代表 Jev 或 Browser Use 能力的上限。

完整的测试与方法已开源且可复现:

https://webmcp.com/benchmark https://github.com/nekuda-ai/WindTunnel… https://github.com/browser-use/jev-ultrafast…


Exa 为互联网构建了一台“时间机器”。

Exa Snapshot 索引了 4000 亿个网页历史快照,使人们能够仿佛置身过去般地搜索互联网。

它已被用于预测模型回测、AI 实验室的强化学习,以及探索 AI 诞生之前的互联网。

相似文章

我对比测试了Jev和gpt-5.6-luna!

Reddit r/ArtificialInteligence

本文展示了基准测试比较,显示Jev在49项任务中有42项胜过gpt-5.6-luna,具有更低的延迟和成本,但在文本生成和某些推理方面存在局限性。

GPT-6 Astra 基准测试

Reddit r/singularity

本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。