@reach_vb: Astra 在 MazeBench 上以巨大优势达到最先进水平:
摘要
Astra 在 MazeBench 上取得了最先进的性能,在3D开放世界空间推理评估中显著超越了 GPT-6。
Astra 在 MazeBench 上以巨大优势领先: https://t.co/YEBrBMfcRh
查看缓存全文
缓存时间: 2026/09/08 05:17
Astra 在 MazeBench 上以巨大优势达到当前最优水平:https://t.co/YEBrBMfcRh
💺 (@patience_cave): MazeBench 对决 GPT-6 Astra
Astra 在这项3D开放世界空间推理评估中耗时超过60小时。
最终得分:14%
相似文章
Astra不仅在ARC-AGI-3上达到饱和,而且使用的操作比普通人类更少
GPT-6 Astra在ARC-AGI-3基准测试中取得了最先进的分数,使用Provider Adapter接口得到99.9%的分数,并展示了比人类测试员更少的动作。该模型展示了将不熟悉的环境转换为紧凑符号世界模型以实现高效规划的能力。
@j_dekoninck: GPT-6-Astra 在 MathArena 荣登榜首,预期性能高达90%!同时,它的令牌效率也非常高:…
GPT-6-Astra 在 MathArena 上以90%的预期性能和高令牌效率夺得第一。
GPT-6 Astra Pro 在 MineBench 上创建迷宫
GPT-6 Astra Pro 在 MineBench 上展示了创建一个带有正确解决方案的精美迷宫的能力,突出了先进的AI问题解决技能。
GPT‑6 Astra
OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。
GPT-6 Astra 基准测试
本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。