GPT-6 Astra 对比 GPT-5.6 Sol:50个真实PR的基准测试,寻求方法论反馈
摘要
对GPT-6 Astra和GPT-5.6 Sol在50个真实PR上进行了基准测试,发现Sol检测到了更多错误,而Astra具有更高的精确度和更低的延迟。正在寻求对未来评估的反馈。
我们对GPT-6 Astra和GPT-5.6 Sol在来自Cal、Sentry、Discourse、Keycloak和Grafana的50个真实PR上进行了基准测试。Sol发现了107个确认的错误,而Astra发现了91个,同时Astra具有更高的精确度和更低的延迟。每一项发现都经过了独立验证。我们下周将进行Fable对Opus的测试,因此在进行下一次评估之前,希望能收到关于这次评估的反馈。如果有人想查看,我会把链接放在评论中。https://preview.redd.it/6hkugycb6poh1.png?width=1080&format=png&auto=webp&s=073833238182e2e36e04a9c8c39f90627adb28b9
相似文章
GPT 5.6 Sol 基准测试
GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。
GPT-6 Astra 基准测试
本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。
GPT-5.6 Sol 预览版发布,基准差距超预期
OpenAI 发布了 GPT-5.6 Sol 预览版,显示基准差距超出预期。
GPT-5.5 Pro 与 GPT-5.6 Sol 在 MineBench 上的差异
比较 GPT-5.5 Pro 和 GPT-5.6 Sol 在 MineBench 基准测试上的性能
@lateinteraction: 我不得不说,如果GPT-6 Astra以“GPT-6 Sol”的形式发布,并且定价和规模相应调整,我本会相当印象深刻…
一条推文推测了GPT-6模型的假设性能和命名,将其与GPT-5.6 Sol进行比较。