标签
本文探讨了OpenAI的Astra模型在ARC Prize基准测试中的分数不一致性,强调了不同测试框架的差异以及OpenAI发布页面的更改,引发了对评估准确性的担忧。
ARC Prize主席正在征集游戏创意,以测试AI模型Astra在尚未成功的领域能力。
OpenAI声称GPT-6 Astra在AGI基准测试中取得99.9%的高分,实则依赖特定测试框架(Provider Adapter)达成;若使用标准框架测试,得分仅为62.7%。此举暴露出AI模型评估与基准测试透明度存在重大问题。