SimpleBench迎来新王者
摘要
在SimpleBench基准测试中取得了新的最高分,几乎与人类基线持平。
差点也击败了人类基线 👀
相似文章
Opus 5 在 Simple Bench 上获得第二名
Opus 5 在 Simple Bench 基准测试中取得第二名,凸显了其在 AI 模型中的竞争力。
新基准测试发布
一个新基准测试已发布,可能用于评估AI或软件性能。
@SanthProject: 现在这个基准测试我支持,而不是那个被操纵得很离谱的DeepSwe基准测试
SanthProject赞扬了Cognition的新FrontierCode代码评估基准,称其为DeepSwe基准的公平替代方案。
Claude Fable 5 达到81.9%,在Simplebench上排名第一
Claude Fable 5 在Simplebench排行榜上取得81.9%的成绩,跃居首位。
Claude 3.5 Sonnet 在 SWE-bench Verified 上再创新高
Anthropic 升级后的 Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中达到了 49% 的全新最优成绩,展现了在自主软件工程任务方面的显著能力。