OpenAI在SimpleBench上出现显著性能回退

Reddit r/singularity 新闻

摘要

OpenAI的模型在SimpleBench基准测试中出现显著性能回退,表明性能下降。

暂无内容
查看原文

相似文章

为何我们不再评估SWE-bench Verified

OpenAI Blog

OpenAI宣布将不再报告SWE-bench Verified分数,理由是两个关键问题:59.4%的失败问题存在有缺陷的测试用例,这些用例拒绝了正确的解决方案;此外,前沿模型在训练过程中已经见过基准测试问题,使得改进更多地反映了训练数据的暴露而非真实能力提升。