GPT‑6 Astra
摘要
OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。
暂无内容
查看缓存全文
缓存时间: 2026/09/03 23:58
# GPT‐6 Astra
来源:https://simonwillison.net/2026/Sep/3/gpt6-astra/
2026年9月3日 \- 链接博客
**GPT‐6 Astra (https://openai.com/index/gpt-6-astra/)**(来源:(https://news.ycombinator.com/item?id=49554643))GPT\-6 Astra 今日起向部分机构逐步推出,并将在未来几天内面向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也将通过 OpenAI API 和 AWS 提供服务 \- 我本人尚未试用,因此目前没有太多可分享的体验。
其 API 定价与 Claude Fable 5 和 5\.1 相同:每百万输入 token 收费 10 美元,每百万输出 token 收费 50 美元。这显然是 OpenAI 针对 Fable 的竞品,并且在 OpenAI 自行报告的多数基准测试中得分高于 Fable。
最令人印象深刻的是,Astra 在近期(三月发布的)ARC\-AGI 3 基准测试 (https://arcprize.org/arc-agi/3) 中获得了 99\.9% 的成绩 \- 值得注意的是 Fable 5 尚未公布此项结果,且 ARC\-AGI 博客 (https://arcprize.org/blog/astra) 提到,99\.9% 的分数是使用 OpenAI 定制的“Provider Adapter harness”以 1.9 万美元成本达成的,而默认的 ARC\-AGI harness 则以 2.6 万美元成本获得 62\.7% 的成绩。
> Provider Adapter harness 在请求间保留不透明的推理状态,并使用压缩技术处理长对话,使模型能够复用先前的计算成果。
鉴于近期 Hugging Face 事件 (https://simonwillison.net/tags/openai-hugging-face-incident/),Astra 在安全任务方面表现出色并不意外。它在 ExploitBench 中获得 100% 的成绩(GPT\-5\.6 Sol 得分为 78\.5%),在 ExploitGym 中获得 42\.4%(Sol 得分为 30\.3%),并在四次尝试内于 SRE\-Bench 二进制逆向工程测试中获得 99\.2% 的成绩,而 Sol 的成绩为 68\.7%。
它在长上下文处理方面也更胜一筹:在 OpenAI 的八针基准测试中,在 256K–512K token 范围内获得 100% 的成绩,在 512K–1M token 范围内获得 96\.3% 的成绩。OpenAI 或许已克服长上下文处理的一项持续挑战。
但它并非在所有方面都取胜。Artificial Analysis (https://twitter.com/ArtificialAnlys/status/2095595489031000350) 指出,在他们的智能指数上,Astra 仍不及 Fable:
> **智能表现与 GPT\-5\.6 Sol 持平**:GPT\-6 Astra 在智能指数上与 GPT\-5\.6 Sol 同为 61 分,比 Claude Fable 5\.1(最大值加备选方案)低 5 分。该模型也落后于 Meta 新发布的 Muse Spark 1\.3(最大值)。
它在编码代理指数上的表现更佳:
> **引领编码代理指数成本效率前沿**:在最大努力下,GPT\-6 Astra 的成本与 GPT\-5\.6 Sol(最大值)相近,但在指数上得分高出 2 分。就单个任务而言,该模型成本不到 Claude Fable 5 的一半,且分数相同。
一旦获得访问权限,我将撰写更多关于 Astra 的内容。其滚动推出后的 API 模型标签将是 `gpt\-6\-astra`。
相似文章
GPT-6 Astra
OpenAI 推出了 GPT-6 Astra,这是一个最先进的 AI 模型,在多个基准测试中获得高分,并在计算机使用、对齐和专业任务方面表现出色,即将向用户推出。
安全概览: GPT-6 Astra
OpenAI 发布 GPT-6 Astra,这是其能力最强的模型,具备关键网络安全能力,拥有增强的安全措施、改进的鲁棒性和更好的对齐,与之前的模型相比。
GPT-6 Astra 基准测试
本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。
Astra不仅在ARC-AGI-3上达到饱和,而且使用的操作比普通人类更少
GPT-6 Astra在ARC-AGI-3基准测试中取得了最先进的分数,使用Provider Adapter接口得到99.9%的分数,并展示了比人类测试员更少的动作。该模型展示了将不熟悉的环境转换为紧凑符号世界模型以实现高效规划的能力。
OpenAI 的 GPT-6 'Astra' 模型首次输出(阅读时间约 2 分钟)
OpenAI 正在内部测试 GPT-6 'Astra',早期输出显示出强大的编码和视觉创作能力,预计在安全审批后可能会发布。