@Suhail: 看到基准测试朝着这个方向发展并不断进步,感到非常兴奋!
摘要
Proximal 发布了 FrontierSWE v2,这是一个更新的超长期编码基准测试,具有扩展的任务和改进的方法,突出了 Claude Fable 5.1 领先的巨大性能差距。
查看缓存全文
缓存时间: 2026/09/03 00:02
看到基准测试朝着这个方向不断进步,真是令人兴奋!
Proximal (@ProximalHQ): 我们正在发布 FrontierSWE v2——这是我们的超长期编程基准测试的升级版本
V2 版本扩展了任务套件并优化了评估方法。我们观察到前沿模型之间存在显著的性能差距,其中 Claude Fable 5.1 遥遥领先
相似文章
@SanthProject: 现在这个基准测试我支持,而不是那个被操纵得很离谱的DeepSwe基准测试
SanthProject赞扬了Cognition的新FrontierCode代码评估基准,称其为DeepSwe基准的公平替代方案。
@swyx:终于发布了!!!@METR_Evals 发现 SWEBench 超半数的结果是无法合并的劣质代码。FrontierCode 代表…
FrontierCode 是 METR 和 Cognition 推出的新编程基准,用于评估 AI 模型在代码可维护性和质量方面的表现,结果显示许多模型会生成无法合并的代码。该基准包含超过 1000 小时的工作量,并表明即使顶尖模型也难以应对,其中 Opus 4.8 在最难的等级上仅获得 13.8%。
@ArizePhoenix: 结果:在内部Code Bench上相比5.2提升了50%,Terminal-Bench 3.0从4.6提升到28.3,DeepSWE v1.1 从…
DeepSWE v1.1在内部Code Bench上提升了50%,并在Terminal-Bench 3.0和Agents' Last Exam上取得了新的SOTA成绩,同时新兴的网络能力发展超出预期。
@cognition:我们对 FrontierCode 方法进行了改进,并发布了 FrontierCode 1.1,其中包含了更清晰的……
Cognition 发布了 FrontierCode 1.1,这是一个用于评估代码质量的更新基准,改进了公平互联网使用和评分标准的指南,同时提供了 Sonnet 5 和 Fable 5 的新模型评分。
更新基准测试:DeepSeek V4 Flash 在 SlopCodeBench(本地)上的表现
用户分享了使用本地量化(antirez imatrix 量化)和 pi 工具在 SlopCodeBench 上对 DeepSeek V4 Flash 的最新基准测试结果,显示性能较之前运行有所提升,但仍比托管 API 慢。