GPT-6 Astra 对比 GPT-5.6 Sol:50个真实PR的基准测试,寻求方法论反馈

Reddit r/artificial 新闻

摘要

对GPT-6 Astra和GPT-5.6 Sol在50个真实PR上进行了基准测试,发现Sol检测到了更多错误,而Astra具有更高的精确度和更低的延迟。正在寻求对未来评估的反馈。

我们对GPT-6 Astra和GPT-5.6 Sol在来自Cal、Sentry、Discourse、Keycloak和Grafana的50个真实PR上进行了基准测试。Sol发现了107个确认的错误,而Astra发现了91个,同时Astra具有更高的精确度和更低的延迟。每一项发现都经过了独立验证。我们下周将进行Fable对Opus的测试,因此在进行下一次评估之前,希望能收到关于这次评估的反馈。如果有人想查看,我会把链接放在评论中。https://preview.redd.it/6hkugycb6poh1.png?width=1080&format=png&auto=webp&s=073833238182e2e36e04a9c8c39f90627adb28b9
查看原文

相似文章

GPT 5.6 Sol 基准测试

Reddit r/singularity

GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。

GPT-6 Astra 基准测试

Reddit r/singularity

本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。