@SanthProject: 现在这个基准测试我支持,而不是那个被操纵得很离谱的DeepSwe基准测试
摘要
SanthProject赞扬了Cognition的新FrontierCode代码评估基准,称其为DeepSwe基准的公平替代方案。
现在这个基准测试我支持,而不是那个被操纵得很离谱的DeepSwe基准测试
查看缓存全文
缓存时间: 2026/06/08 23:29
这才是我能支持的测试基准,而不是那个被严重操纵的DeepSeek基准测试。
Cognition (@cognition): 推出 FrontierCode:一项提高难度与质量的编码评估。每项任务都由领先的开源维护者耗时 40 小时以上完成。
模型编写的代码虽然能运行,但难以维护。我们的评估首次衡量:你真的会合并这段代码吗?
相似文章
@Suhail: 看到基准测试朝着这个方向发展并不断进步,感到非常兴奋!
Proximal 发布了 FrontierSWE v2,这是一个更新的超长期编码基准测试,具有扩展的任务和改进的方法,突出了 Claude Fable 5.1 领先的巨大性能差距。
@denizbirlikci: 要理解我们为什么构建 FrontierCode,请阅读 @METR_Evals 的博客文章,了解为什么"许多通过 SWE-bench 的 PR 不会被合并到主分支……"
Cognition 宣布推出 FrontierCode,这是一个新的代码评估基准,超越了单元测试,衡量代码质量、范围、测试正确性和人类审查者认可度,解决了代理编写通过测试但不可维护的草率代码的问题。
@garrytan: 这是工程评估的新标准
宣布推出 DeepSWE,这是一个新的代理式编码基准测试,揭示了模型之间的真实差异,反映了现实世界开发者的体验。
@ArizePhoenix: 结果:在内部Code Bench上相比5.2提升了50%,Terminal-Bench 3.0从4.6提升到28.3,DeepSWE v1.1 从…
DeepSWE v1.1在内部Code Bench上提升了50%,并在Terminal-Bench 3.0和Agents' Last Exam上取得了新的SOTA成绩,同时新兴的网络能力发展超出预期。
@cognition:我们对 FrontierCode 方法进行了改进,并发布了 FrontierCode 1.1,其中包含了更清晰的……
Cognition 发布了 FrontierCode 1.1,这是一个用于评估代码质量的更新基准,改进了公平互联网使用和评分标准的指南,同时提供了 Sonnet 5 和 Fable 5 的新模型评分。