GPT-5.6 Sol 在无工具条件下以 pass@5 达到 ZeroBench 人类基线
摘要
据报道,GPT-5.6 Sol 在无工具条件下以 pass@5 达到 ZeroBench 人类基线,这意味着在基准测试中五次尝试中至少有一次成功。
pass@5:如果 5 次尝试中至少有一次正确则得分
pass^5:仅当所有 5 次尝试都正确时才得分
“pass@1”:并非真正的单次尝试 pass@1,而是 5 次尝试的平均得分。
https://zerobench.github.io/
相似文章
GPT 5.6 Sol 基准测试
GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。
我成功让GPT-5.6 Sol在工具调用前停止 - 25/25次(自己试试)
这篇文章描述了一项实验,表明通过设置一个略高于边界的数值阈值,GPT-5.6 Sol可以持续在工具调用前停止,所有25对测试都展示了预期行为。
GPT-5.6 Sol 预览版发布,基准差距超预期
OpenAI 发布了 GPT-5.6 Sol 预览版,显示基准差距超出预期。
GPT-6 Astra 对比 GPT-5.6 Sol:50个真实PR的基准测试,寻求方法论反馈
对GPT-6 Astra和GPT-5.6 Sol在50个真实PR上进行了基准测试,发现Sol检测到了更多错误,而Astra具有更高的精确度和更低的延迟。正在寻求对未来评估的反馈。
GPT-6 Sol 在复杂任务上确认弱于 5.6 Sol,但在成本与效率方面胜出
GPT-6 Sol 在复杂任务上被确认弱于 GPT-5.6 Sol,但在成本与效率方面具有优势