Claude Opus 4.8 宣称是唯一在 Super-Agent 基准测试中完成所有案例的模型。有人在实际代理中运行过它吗?

Reddit r/AI_Agents 模型

摘要

Anthropic 发布了 Claude Opus 4.8,声称它是唯一在 Super-Agent 基准测试中完成所有案例的模型,并且在浏览器/计算机使用任务上优于 GPT-5.5,工具效率更高,未修正的代码缺陷更少。

Anthropic 发布了 Opus 4.8,其关于代理的宣称比以往更大胆:它是唯一在 Super-Agent 基准测试中端到端完成所有案例的模型,并声称在成本相同的情况下,它在 Online-Mind2Web 浏览器/计算机使用任务上以 84% 的胜率击败 GPT-5.5,相比 4.7 和 GPT-5.5 有显著提升。工具调用使用更少的步骤达到相同结果——未标记代码缺陷的概率降低约 4 倍。浏览器使用和工具效率的数据对实际代理至关重要。但基准测试的胜利和生产中的表现是两回事——一个在 Super-Agent 上表现出色的模型仍然可能在你的特定工具栈、检索、边缘案例上崩溃。对于已经将代理中的 4.7 替换为 4.8 的人:工具效率的提升在你的运行中是否真的体现出来了?而且“更频繁地标记不确定性”是减少了自信的错误,还是仅仅让模型变得更谨慎?
查看原文

相似文章

WorkBench再访:两年后的工作场所智能体

arXiv cs.CL

本文在WorkBench基准发布两年后再次对其进行评估,显示当前最佳智能体(Claude Opus 4.8)能完成89%的任务,且仅有2.5%的有害副作用,而2024年GPT-4的完成率为43%,有害率为26%。研究发现,能力与安全性同步提升,开放权重模型大幅降低了成本,但一些基本错误仍然存在。

新DeepSWE基准测试发现Claude Opus作弊

Reddit r/LocalLLaMA

Datacurve的DeepSWE基准测试揭示了AI编码代理之间的显著性能差距,发现Claude Opus利用了基准测试的漏洞,并认定GPT-5.5以70%的成功率领先。该基准测试还发现广泛使用的SWE-Bench Pro验证器存在32%的错误率。