@rauchg: 我们进行了最新的 Next.js 评估。结果如下:① Opus 5.5 [97%] ② GPT 6 Sol [97%] ③ Fable 5.1 [97%] ④ Grok 4.7 [94%] 不...
摘要
对AI模型在Next.js上的最新评估显示,Claude Opus 5.5、GPT-6 Sol和Fable 5.1在成功率上并列97%,而Grok 4.7为94%,但成本更低。
查看缓存全文
缓存时间: 2026/09/23 10:07
我们进行了最新的 Next.js 评测,结果如下: 1 Opus 5.5 [97%] 2 GPT 6 Sol [97%] 3 Fable 5.1 [97%] 4 Grok 4.7 [94%]
值得注意的是,Grok 的成本仅为2倍至7倍
Next.js (@nextjs): GPT-6 Sol 在 Next.js 评测中首次亮相即达到 97% 的成功率,追平历史最高纪录。
Claude Opus 5.5 同样获得 97%,与 Claude Fable 5.1 并列。在平均成本方面,Opus 在三者中排名最低。
查看完整排行 ↓
相似文章
@browser_use:浏览器使用基准测试 v2 帕累托前沿今日完全重塑 > Claude Opus 5.5:59.4 > GPT‑6 Sol medium:66.9 (3.5...
浏览器使用基准测试 v2 更新了其帕累托前沿,展示了来自 OpenAI 的 GPT-6 模型在性能和成本效益上均超越了来自 Anthropic 的 Claude Opus 5.5。
@rohanpaul_ai: @thehypedotnews 的非常有趣的实验 gpt-6 sol vs grok 4.7 vs gpt-6 astra vs muse spark 1.3 令人惊讶的是如此少的…
这些实验比较了GPT-6 Sol、Grok 4.7、GPT-6 Astra和Muse Spark 1.3等AI模型如何从提示生成浏览器产物,重点展示了GPT-6 Sol以极少的推理即可生成可工作的HTML文件的效率。
@rohanpaul_ai: Grok 4.6 在代理循环效率上击败 GPT-5.6 Sol,在相同的3次构建中花费13.11美元对比20.18美元。Grok 4.6'…
文章报道了一项比较 Grok 4.6 和 GPT-5.6 Sol 在编码任务代理循环效率的实验,显示 Grok 4.6 更具成本效益,模型调用更少且提示缓存有效。
我们让 Grok 4.5、GPT-5.5 和 Claude 构建了相同的应用
本文对 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5 进行了基准测试,让每个模型根据单一提示构建三个交互式应用(3D 魔方、粒子重力沙箱、打砖块游戏),比较它们的一次性编码能力。
@gregpr07: Grok 4.6 性能与 Opus 5 差距在1分以内,成本降低约40%。在7次运行中,解决了106个高难度浏览器任务中的105个。还有一点 …
Grok 4.6 在成本降低40%的条件下,性能接近Opus 5,成功解决106个高难度浏览器任务中的105个,预示着通过强化学习可能实现进一步突破。