标签
ARC Prize主席正在征集游戏创意,以测试AI模型Astra在尚未成功的领域能力。
OpenAI声称GPT-6 Astra在AGI基准测试中取得99.9%的高分,实则依赖特定测试框架(Provider Adapter)达成;若使用标准框架测试,得分仅为62.7%。此举暴露出AI模型评估与基准测试透明度存在重大问题。