@denizbirlikci: 要理解我们为什么构建 FrontierCode,请阅读 @METR_Evals 的博客文章,了解为什么"许多通过 SWE-bench 的 PR 不会被合并到主分支……"

X AI KOLs Following 工具

摘要

Cognition 宣布推出 FrontierCode,这是一个新的代码评估基准,超越了单元测试,衡量代码质量、范围、测试正确性和人类审查者认可度,解决了代理编写通过测试但不可维护的草率代码的问题。

要理解我们为什么构建 FrontierCode,请阅读 @METR_Evals 的博客文章,了解为什么"许多通过 SWE-bench 的 PR 不会被合并到主分支。"虽然有点旧,但观点仍然成立。 代理经常编写比预期更多的代码——以及更多的垃圾代码。但单元测试无法惩罚那些不必要的更改;通过就是通过,无论附带了多少垃圾。 FrontierCode 通过使用评分更模糊指标的评分标准类型来主动测试这一点,例如: - 范围(SCOPE)——它是否做了超出必要的更改? - 测试正确性(Test correctness)——代理自身的测试是否真的捕获了错误? - 代码质量(Code quality)——人类审查者会批准这个差异吗?(基于人类评分标准的 LLM 判断)
查看原文
查看缓存全文

缓存时间: 2026/06/09 10:46

要理解我们为何构建 FrontierCode,请阅读 @METR_Evals 的博客文章,了解为何“许多通过 SWE-bench 的 PR 无法合并到主分支”。虽然这篇文章有点旧了,但观点依然成立。

智能体常常写出比实际需要更多的代码——以及更多的“垃圾代码”。但单元测试无法惩罚这些不必要的更改;通过就是通过,无论附带了多少垃圾代码。

FrontierCode 通过以下评分规则类型,主动针对更模糊的指标进行测试,例如:

  • 范围(SCOPE) ——是否更改了不应更改的内容?
  • 测试正确性 ——智能体自己的测试是否真的捕捉到了 bug?
  • 代码质量 ——人工审阅者会批准这个 diff 吗?(基于人工评分标准的 LLM 评判)

Cognition(@cognition): 隆重推出 FrontierCode:一个提高难度与质量的编码评估。每个任务由领先的开源维护者花费 40 多小时完成。

模型编写了能运行但不具备可维护性的潦草代码。我们的评估首次衡量:你真正会合并这些代码吗?

相似文章

FrontierCode

Hacker News Top

FrontierCode是Cognition AI推出的新基准测试,通过评估合并性(mergeability)来衡量AI模型编写高质量、可维护代码的能力。结果显示,即使是Claude Opus 4.8等顶级模型,在最难子集上的得分也仅为13.4%,这突显了代码质量方面存在的显著差距。