Astra不仅在ARC-AGI-3上达到饱和,而且使用的操作比普通人类更少
摘要
GPT-6 Astra在ARC-AGI-3基准测试中取得了最先进的分数,使用Provider Adapter接口得到99.9%的分数,并展示了比人类测试员更少的动作。该模型展示了将不熟悉的环境转换为紧凑符号世界模型以实现高效规划的能力。
暂无内容
查看缓存全文
缓存时间: 2026/09/03 20:20
# OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上的表现 | ARC Prize
来源:https://arcprize.org/blog/astra
### 概要
- GPT-6 Astra 在使用我们的标准运行框架(该框架允许模型在整个环境中携带其选择保留的笔记)时,在 ARC-AGI-3 半公开数据集上获得了 62.7% 的成绩,耗资 26K 美元;而在使用提供商适配器运行框架(该框架在请求之间保留不透明的推理状态,并使用压缩技术处理更长的对话,允许模型重用先前的工作)时,获得了 99.9% 的成绩,耗资 19K 美元。
- GPT-6 Astra 在 ARC-AGI-3 上的行动效率超越了人类基准水平。在 96% 的关卡上,它所用的动作次数少于测试人群中的中位数。
- GPT-6 Astra 的一个关键行为是其能够将陌生环境转化为紧凑的符号化世界模型。它将游戏机制表示为逻辑规则,并开发了自己特定领域的语言简写来跟踪状态和规划行动。
## ARC-AGI-3
ARC-AGI-3 是一个用于通过新颖的、抽象的、回合制环境研究智能体智能的基准测试。智能体必须探索、推断目标,并在*无需*明确指令的情况下,构建环境的内部模型以有效规划行动。你可以亲自游玩 ARC-AGI-3(https://arcprize.org/tasks/ls20)。
您的浏览器不支持嵌入式视频。
这些环境仅包含核心知识先验(https://arcprize.org/arc-agi#:~:text=towards%20general%20intelligence.-,Core%20Knowledge%20Priors,-A%20principle%20underlying),并通过与人类参与者的对照测试进行难度校准。人类能够解决 100% 的环境(https://arcprize.org/blog/arc-agi-3-human-dataset)。
ARC-AGI 系列的目标是衡量当前人工智能与 AGI 之间的“残差差距”。我们将 AGI 定义为一个系统能够像人类一样*高效*地获取*任何*人类所能掌握的技能的能力。
ARC-AGI-3 是 ARC-AGI 基准测试系列的第三代(https://arcprize.org/arc-agi)。它测试的是超越 ARC-AGI-1(https://arcprize.org/arc-agi/1)和 ARC-AGI-2(https://arcprize.org/arc-agi/2)的智能体能力。每一代都以前一代为基础进行扩展——随着前沿 AI 能力的进步,我们的基准测试也必须随之进步。
ARC-AGI-3 测试智能体智能的四个组成部分:
- **探索:** 在现实环境中,信息很少被动提供。智能体必须通过与周围环境互动主动获取信息。
- **建模:** 智能体必须将原始观察转化为可泛化的模型,该模型能够预测未来的状态和结果。
- **目标设定:** 智能体必须在仅有稀疏奖励的情况下识别目标未来状态。
- **规划与执行:** 智能体必须规划一条从当前状态到目标的路径,并在新信息出现时进行路线修正。
## Astra 结果
ARC-AGI-3 排行榜显示了 GPT-6 Astra 标准和提供商适配器的结果(https://arcprize.org/results/openai-gpt-6-astra)。GPT-6 Astra 在标准和提供商适配器两种运行框架下都取得了 ARC-AGI-3 的最先进分数。更高的推理级别通常成本*更低*,因为 Astra 用更少的动作解决游戏,从而减少了模型调用和令牌的总数。查看完整结果(https://arcprize.org/results/openai-gpt-6-astra)。
使用我们的标准运行框架(该框架允许模型在整个环境中携带其选择保留的笔记),OpenAI 的 Astra (max) 在 ARC-AGI-3 半公开数据集上获得了 62.7% 的分数(https://arcprize.org/results/openai-gpt-6-astra),耗资 26K 美元。使用提供商适配器运行框架(该框架在请求之间保留不透明的推理状态,并使用压缩技术处理更长的对话,允许模型重用先前的工作),Astra (high) 获得了 99.9% 的分数,耗资 19K 美元。两者均为最先进分数。查看完整排行榜(https://arcprize.org/leaderboard)。
在最大推理强度下,Astra 解决游戏的效率更高,所需动作更少,因此与其它推理强度级别相比,总成本更低。
| 推理强度 | 标准运行框架(允许模型在整个环境中携带其选择保留的笔记) | 提供商适配器运行框架(在请求之间保留不透明的推理状态,并使用压缩技术处理更长的对话,允许模型重用先前的工作) |
| :--- | :--- | :--- |
| max | 62.7%, $26,098 | 98.6%, $17,332x |
| xhigh | 59.3%, $37,317 | 98.4%, $18,147 |
| high | 54.8%, $40,705 | 99.9%, $18,817 |
| medium | 38.6%, $48,090 | 98.4%, $19,285 |
| low | 17.5%, $38,166 | 98.0%, $21,298 |
| none | 35.2%, $49,791 | 96.7%, $23,457 |
为了进行成本比较,在我们的对照测试中,人类参与者每 90 分钟的会话报酬为 115 美元,外加每完成一个游戏 5 美元。参与者每节课大约尝试九个游戏,在获得奖金之前,每个尝试的游戏成本约为 12.78 美元。
这笔费用中的大部分支付的是参与者的时间和参与测试的*意愿*,而非其大脑消耗的能量(这与 AI 相比是更接近的代理指标)。如果仅看大脑能量消耗,并以电价估算,则每小时成本降至约 0.6 美分,或每尝试一个游戏约 0.067 美分。1 (https://arcprize.org/blog/astra#fn-1)
## 分析
除了分数之外,Astra 的回放展示了它如何将陌生的游戏机制转化为有用的工作模型。有三个发现尤为突出:它开发的紧凑代数符号、其与人类相比的行动效率,以及它构建的自定义工具。
### 自定义代数符号
在游玩 ARC-AGI-3 时,Astra 会选择它希望保留哪些策略笔记。它会跟踪物体、坐标、规则和未完成的计划,同时使用为环境生成的自定义特定领域语言符号。
我们在其他模型中(https://x.com/arcprize/status/2080716567760007317)也观察到类似行为,但 Astra 的笔记因其精确性和信息密度而脱颖而出。它将场景提炼成一个紧凑的、类似代码的符号模型:记录物体的位置、它们如何互动,以及具体需要按什么顺序执行哪些动作。这是一种即时的代数速记法,而非成熟的编程语言。例如:
- **游戏状态:** `L8: hub q2 (8↓). Lengths: 14=1...` 记录了关卡、局部旋转索引和机制长度。s5i5,第 219 帧(https://arcprize.org/replay/39d9f100-328a-4121-ad81-ce298e1f9626?frame=219"e=L8%3A+hub+q2+%288%E2%86%93%29.+Lengths%3A+14%3D1%2C+9%3D1%2C+8%3D0%2C+12%3D0%2C+gate7%3D6%2C+gate10%3D7."eFrame=219"ePrefix="eSuffix=+Main+target+requires14%3D13.%0A%0APlan%3A+extend8+to3%3B+retract10+to2%3B+shorten8+to1.+Rot&reasoning=decision)
- **多步计划:** `extend8 to3; retract10 to2; shorten8 to1` 记录了一系列针对颜色 8 和颜色 10 机制的有序更改。s5i5,第 219 帧(https://arcprize.org/replay/39d9f100-328a-4121-ad81-ce298e1f9626?frame=219"e=Plan%3A+extend8+to3%3B+retract10+to2%3B+shorten8+to1.+Rotate+once+to9%E2%86%93%3B+extend9+to2%3B+retract7+to2%3B+shorten9+to1.+Rotate+twice+to14%E2%86%93%3B+extend14+to13."eFrame=219"ePrefix=.+Lengths%3A+14%3D1%2C+9%3D1%2C+8%3D0%2C+12%3D0%2C+gate7%3D6%2C+gate10%3D7.+Main+target+requires14%3D13.%0A%0A"eSuffix=%0A%0AControls+%E2%88%92%2F%2B%3A+14%3D%2853%2F59%2C11%29%2C+8%3D%2839%2F45%2C11%29%2C+9%3D%2839%2F45%2C4%29%2C+10%3D%288%2F14%2C56%29%2C+7%3D%2822%2F28&reasoning=decision)
- **控制键与坐标:** `9−=(39,4), rotate=(49,18), 14+=(59,11)` 将操作映射到执行它们的控制键坐标。s5i5,第 235 帧(https://arcprize.org/replay/39d9f100-328a-4121-ad81-ce298e1f9626?frame=235"e=Controls%3A+9%E2%88%92%3D%2839%2C4%29%2C+rotate%3D%2849%2C18%29%2C+14%2B%3D%2859%2C11%29."eFrame=235"ePrefix=0%3B+gates7%3D2%2C10%3D2.%0A%0ANext%3A+shorten9+to1.+Rotate+twice+to14%E2%86%93%2C+then+extend14+to13.%0A%0A"eSuffix=%0A%0AACTION6+39+4&reasoning=decision)
- **回合与位置:** `Turn 5: P=(24,20), empty, facing west` 将回合计数器与玩家位置、携带状态和朝向结合起来。wa30,第 708 帧(https://arcprize.org/replay/be78fcef-1244-4cf8-b680-0a5e4e8f9afe?frame=708"e=Turn+5%3A+P%3D%2824%2C20%29%2C+empty%2C+facing+west."eFrame=708"ePrefix="eSuffix=+Continue+west+twice+to+%2816%2C20%29%2C+then+lift+crate+%2812%2C20%29.+Cyan%3D%2820%2C24%29%2C+carrying&reasoning=decision)
Astra 在游玩 s5i5 时记录紧凑的符号化笔记。Astra 游玩 `s5i5`(https://arcprize.org/tasks/s5i5),使用其即时的代数速记法来跟踪状态和规划行动。
### 行动效率与人类的比较
在推出 ARC-AGI-3 之前,我们测试了大约 500 名普通公众成员,以建立人类行动效率的基准,或者简单来说,就是人们*多快*解决每个环境。参与者并非因其解谜经验或能力而被挑选。2 (https://arcprize.org/blog/astra#fn-2)
对于每个关卡,我们使用完成该关卡玩家的*中位数*动作次数来定义“人类基准”。这为我们比较人类和 AI 的表现提供了一个参考。需要*更多*动作的 AI 行动效率较低,而需要更少动作的则效率较高。
在提供商适配器运行框架下,Astra (max) **在 96.0% 的关卡上使用了少于人类基准的动作次数**,并且**平均每关卡少用 51.7% 的动作**。这是一个重要的里程碑。这意味着按照 ARC-AGI-3 的行动效率衡量标准,Astra 达到并超越了人类水平。
顺便提一下,在推出 ARC-AGI-3 之前,我们曾假设行动效率将是人类与 AI 之间的分界线。我们预料到即使 AI 解决了某个环境,它可能需要比人类多得多的探索(动作)。这对于暴力破解方法来说仍然成立,但前沿 AI 表现出一种更二元化的模式。一旦前沿 AI “理解”了机制,它通常就能在人类效率范围内执行。
#### Astra 的行动效率与人类的比较
散点图比较了 Astra 在每个完成的 ARC-AGI-3 关卡上使用的动作数与人类基准。每个点代表一个 Astra (max) 完成的关卡。低于实线的点表示动作数少于人类基准。
上图比较了 Astra 完成每个关卡所用的动作数与我们的人类基准。这强化了为什么 ARC-AGI-3 衡量的是行动效率,而不仅仅是任务完成情况。一个仅看完成的分数会告诉我们 Astra 完成了一个环境,但不会告诉我们它*学习*解决这些环境的效率如何。
大多数基准测试只衡量*成本*效率(即使用的计算资源),但*行动*效率衡量的是解决环境所需的交互经验量。
Astra 的结果显示,它需要的与环境的交互次数少于人类基准来执行解决方案。
### 智能体运行框架中的自定义工具
我们也在 PRO-LONG 运行框架(https://github.com/alexisfox7/PRO-LONG)(论文(https://arxiv.org/pdf/2607.20064))中评估了 Astra,这是一个早期的 ARC-AGI-3 红队测试伙伴。在这个高级设置中,Astra 可以访问一个沙盒环境来执行自定义代码。3 (https://arcprize.org/blog/astra#fn-3)
我们观察到 Astra 为每个游戏创建了一套自定义工具:棋盘解析器、游戏状态模型、搜索算法、规划器和持久化笔记。对于更复杂的运行,Astra 甚至生成了小型、特定于游戏的软件库。
例如,在 `tu93`(https://arcprize.org/tasks/tu93)中,这是一个有守卫和移动巡逻队的迷宫类游戏,Astra 从导航开始,构建了 `maze_solver.py`。它在 `combat_solver.py` 中添加了战斗规则,在 `patrol_solver.py` 中建模了移动巡逻队,并使用 `sync_state.py` 将其预测与观察结果进行核对。
检查 Astra 在 PRO-LONG 中的表现很有用,因为我们可以看到它使用*外部*工具能做什么。然而,这代表了与我们的人类对照测试不同的评估条件。我们的测试参与者没有代码解释器、草稿本等,因此 PRO-LONG 的结果应被理解为模型及其工具的综合表现。
Astra 在 PRO-LONG 运行框架中使用自定义迷宫求解器游玩 `tu93`。Astra 在 PRO-LONG 运行框架中游玩 `tu93`。
## 两种运行框架,两个问题
我们用于 ARC-AGI-3 的标准运行框架,询问的是在相同的最小化、供应商中立的接口下,模型的表现如何比较。它提供了解决每个游戏所需的所有信息,但让模型自行决定在其可见笔记中保留什么。我们相信,未来的 AGI 应该能够在这些条件下解决 ARC-AGI-3。共享的接口也为我们提供了一个一致的、苹果对苹果的跨供应商比较。
另外,还有一个独立的问题:当一个模型可以使用其供应商为其设计的上下文管理功能时,它的表现如何?对于 Astra 来说,这意味着在请求之间保留不透明的推理状态(我们看不到的),并使用压缩技术来管理更长的对话。
使用提供商适配器运行框架后,Astra 在 ARC-AGI-3 半公开数据集上的最佳观测分数从 62.7% 提高到了 99.9%。综合公开和半公开数据以及所有推理级别来看,提供商适配器运行在总记录时间上快了约 3.66 倍,并且在两种运行框架都解决的 167 个游戏-推理对中,总令牌使用量减少了 49%。
展望未来,我们将在 ARC-AGI 排行榜上同时报告标准运行框架和提供商适配器运行框架的结果,并清晰标注每个评估条件。我们的开源测试库(https://github.com/arcprize/arc-agi-3-benchmarking)和测试政策(https://arcprize.org/policy)记录了这两种方法。
## ARC-AGI 系列
ARC-AGI-3 仍然是一个对研究人员和智能体探索陌生环境、发现规则并通过互动学习有用的试验场。Astra 的结果也是一个值得庆祝的重大里程碑。从我们的角度来看,Astra 代表了前沿模型能力的一次显著的阶跃式变化。
当我们推出 ARC-AGI-3 时,我们已明确表示(https://arxiv.org/pdf/2603.24621),基准测试饱和并不代表“实现 AGI 的证明”。因此,虽然我们相信 Astra 代表了向泛化能力的重要进步,但我们并不声称它已经实现了 AGI。
ARC-AGI 基准测试系列旨在与前沿 AI 同步演进。这在新兴的研究问题与 AI 能力的进步之间形成了一个反馈循环。ARC-AGI-3 是我们的第一个交互式基准测试,它要求 AI 高效地综合因果世界模型并在没有特定指令的情况下实现目标。Astra 越过了这一门槛。同时,ARC-AGI-3 的范围和格式是严格限定的,其环境具有确定性的、封闭的机制和目标。它并不代表真实世界的复杂性和开放性。
我们正在积极探索那些应该塑造下一代基准测试的问题,包括如何评估递归自我改进和开放式创新。Astra 的进展有助于澄清哪些 AI 能力尚不可及,以及哪些问题仍然悬而未决。
---
感谢 François Chollet, Mike Knoop, Matt Mazur, Ethan Bond 和 Derek Smith 对本文的早期审阅。
1. 假设大脑代谢功率为 20 瓦(https://journals.sagepub.com/doi/10.1177/0271678X17708691),电价为 $0.20/千瓦时:0.020 千瓦 × 1.5 小时 = 0.030 千瓦时,价值 $0.006 每小时,或 $0.006 ÷ 9 ≈ $0.00067 每尝试一个游戏。
2. 参见 ARC-AGI-3 人类测试论文(https://arxiv.org/pdf/2603.24621)。
3. 未观察到试图逃离沙盒的证据。
相似文章
GPT‑6 Astra
OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。
GPT-6 Astra
OpenAI 推出了 GPT-6 Astra,这是一个最先进的 AI 模型,在多个基准测试中获得高分,并在计算机使用、对齐和专业任务方面表现出色,即将向用户推出。
内部人士对Astra能力的看法
一位内部人士评估了GPT Astra的能力,强调其在长期任务、协调、应用学术文献和代码生成方面的优势,并指出在创意写作方面相比前代模型有所改进。
GPT-6 Astra 基准测试
本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。
@OpenAI:这是 GPT-6 Astra。你在电脑上能做的任何事情,Astra 都能为你完成。快速。
OpenAI 宣布 GPT-6 Astra,这是一款能够快速自动化任何电脑任务的新型 AI 模型。