@SanthProject: 现在这个基准测试我支持,而不是那个被操纵得很离谱的DeepSwe基准测试

X AI KOLs Following 工具

摘要

SanthProject赞扬了Cognition的新FrontierCode代码评估基准,称其为DeepSwe基准的公平替代方案。

现在这个基准测试我支持,而不是那个被操纵得很离谱的DeepSwe基准测试
查看原文
查看缓存全文

缓存时间: 2026/06/08 23:29

这才是我能支持的测试基准,而不是那个被严重操纵的DeepSeek基准测试。

Cognition (@cognition): 推出 FrontierCode:一项提高难度与质量的编码评估。每项任务都由领先的开源维护者耗时 40 小时以上完成。

模型编写的代码虽然能运行,但难以维护。我们的评估首次衡量:你真的会合并这段代码吗?

相似文章

@garrytan: 这是工程评估的新标准

X AI KOLs Following

宣布推出 DeepSWE,这是一个新的代理式编码基准测试,揭示了模型之间的真实差异,反映了现实世界开发者的体验。