FrontierCode: 一项提高难度和质量标准的编码评估。
摘要
FrontierCode 是一个新的编码评估基准,旨在提高 AI 代码生成的难度和质量标准。
[https://cognition.ai/blog/frontier-code](https://cognition.ai/blog/frontier-code)
相似文章
FrontierCode
FrontierCode是Cognition AI推出的新基准测试,通过评估合并性(mergeability)来衡量AI模型编写高质量、可维护代码的能力。结果显示,即使是Claude Opus 4.8等顶级模型,在最难子集上的得分也仅为13.4%,这突显了代码质量方面存在的显著差距。
@denizbirlikci: 要理解我们为什么构建 FrontierCode,请阅读 @METR_Evals 的博客文章,了解为什么"许多通过 SWE-bench 的 PR 不会被合并到主分支……"
Cognition 宣布推出 FrontierCode,这是一个新的代码评估基准,超越了单元测试,衡量代码质量、范围、测试正确性和人类审查者认可度,解决了代理编写通过测试但不可维护的草率代码的问题。
@Murderlon: FrontierCode终于发布,一个面向真实世界的编码智能体基准测试。通过广泛的强化流程进行人工验证……
FrontierCode是一个面向编码智能体的全新基准测试,通过人工验证并采用持续评分模型,旨在评估真实世界的性能。
@dabit3: FrontierCode 是第一个评估衡量真实软件工程中最重要指标的评测:你是否真的会…
FrontierCode 是一个新的编程评估基准,用于衡量代码的可合并性,声称比 SWE-Bench Pro 减少 81% 的误分类错误。任务由 Celery、uppy 和 Mattermost 等开源项目的维护者精心设计。
@cognition:我们对 FrontierCode 方法进行了改进,并发布了 FrontierCode 1.1,其中包含了更清晰的……
Cognition 发布了 FrontierCode 1.1,这是一个用于评估代码质量的更新基准,改进了公平互联网使用和评分标准的指南,同时提供了 Sonnet 5 和 Fable 5 的新模型评分。