@dabit3: FrontierCode 是第一个评估衡量真实软件工程中最重要指标的评测:你是否真的会…

X AI KOLs Following 论文

摘要

FrontierCode 是一个新的编程评估基准,用于衡量代码的可合并性,声称比 SWE-Bench Pro 减少 81% 的误分类错误。任务由 Celery、uppy 和 Mattermost 等开源项目的维护者精心设计。

FrontierCode 是第一个评估衡量真实软件工程中最重要指标的评测:你是否真的会合并这段代码? 结果是比目前最准确的模型排名 SWE-Bench Pro 减少了 81% 的误分类错误。 每个任务都由 Celery、uppy 和 Mattermost 等仓库的实际维护者精心设计。我还鼓励你深入阅读这篇博客文章,它美观且互动性强!
查看原文
查看缓存全文

缓存时间: 2026/06/08 23:28

FrontierCode 是首个衡量真实软件工程中最重要指标的评估系统:你会实际合并这段代码吗?

其分类错误数量比当前最准确的模型排名 SWE-Bench Pro 减少了 81%。

每个任务均由 Celery、uppy 和 Mattermost 等仓库的实际维护者精心设计。我也强烈建议你阅读这篇博客文章——它既美观又具交互性!

Cognition (@cognition): 我们推出 FrontierCode:一个提升难度与质量的编码评估系统。每个任务由顶级开源维护者耗费 40 小时以上完成。

模型会写出能运行但不可维护的粗糙代码。我们的评估率先衡量:你会实际合并这段代码吗?

相似文章

FrontierCode

Hacker News Top

FrontierCode是Cognition AI推出的新基准测试,通过评估合并性(mergeability)来衡量AI模型编写高质量、可维护代码的能力。结果显示,即使是Claude Opus 4.8等顶级模型,在最难子集上的得分也仅为13.4%,这突显了代码质量方面存在的显著差距。