OpenAI在SimpleBench上出现显著性能回退
摘要
OpenAI的模型在SimpleBench基准测试中出现显著性能回退,表明性能下降。
暂无内容
相似文章
@OpenAI: 我们审计了SWE-Bench Pro,这是最广泛使用的AI编程基准之一,发现它已无法可靠地衡量前沿…
OpenAI审计了SWE-Bench Pro编码基准,发现约30%的任务存在故障,因此撤回了此前将其作为主要编码评估的建议。
Opus 5 在 Simple Bench 上获得第二名
Opus 5 在 Simple Bench 基准测试中取得第二名,凸显了其在 AI 模型中的竞争力。
像DeepSWE这样的新基准测试现在显示专有模型与开源模型之间存在巨大差距
像DeepSWE这样的新基准测试揭示了专有与开源AI模型之间的显著性能差距,令开源社区感到失望。
@OpenAI:基准分数既反映模型本身,也反映用于运行模型的测试框架和设置。对于长时间运行的智能体,保留…
OpenAI透露,启用保留推理和上下文压缩使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提升了三倍,凸显了测试框架设置对模型性能测量的显著影响。
为何我们不再评估SWE-bench Verified
OpenAI宣布将不再报告SWE-bench Verified分数,理由是两个关键问题:59.4%的失败问题存在有缺陷的测试用例,这些用例拒绝了正确的解决方案;此外,前沿模型在训练过程中已经见过基准测试问题,使得改进更多地反映了训练数据的暴露而非真实能力提升。