GPT‑6 Astra

Simon Willison's Blog 模型

摘要

OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/03 23:58

# GPT‐6 Astra 来源:https://simonwillison.net/2026/Sep/3/gpt6-astra/ 2026年9月3日 \- 链接博客 **GPT‐6 Astra (https://openai.com/index/gpt-6-astra/)**(来源:(https://news.ycombinator.com/item?id=49554643))GPT\-6 Astra 今日起向部分机构逐步推出,并将在未来几天内面向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也将通过 OpenAI API 和 AWS 提供服务 \- 我本人尚未试用,因此目前没有太多可分享的体验。 其 API 定价与 Claude Fable 5 和 5\.1 相同:每百万输入 token 收费 10 美元,每百万输出 token 收费 50 美元。这显然是 OpenAI 针对 Fable 的竞品,并且在 OpenAI 自行报告的多数基准测试中得分高于 Fable。 最令人印象深刻的是,Astra 在近期(三月发布的)ARC\-AGI 3 基准测试 (https://arcprize.org/arc-agi/3) 中获得了 99\.9% 的成绩 \- 值得注意的是 Fable 5 尚未公布此项结果,且 ARC\-AGI 博客 (https://arcprize.org/blog/astra) 提到,99\.9% 的分数是使用 OpenAI 定制的“Provider Adapter harness”以 1.9 万美元成本达成的,而默认的 ARC\-AGI harness 则以 2.6 万美元成本获得 62\.7% 的成绩。 > Provider Adapter harness 在请求间保留不透明的推理状态,并使用压缩技术处理长对话,使模型能够复用先前的计算成果。 鉴于近期 Hugging Face 事件 (https://simonwillison.net/tags/openai-hugging-face-incident/),Astra 在安全任务方面表现出色并不意外。它在 ExploitBench 中获得 100% 的成绩(GPT\-5\.6 Sol 得分为 78\.5%),在 ExploitGym 中获得 42\.4%(Sol 得分为 30\.3%),并在四次尝试内于 SRE\-Bench 二进制逆向工程测试中获得 99\.2% 的成绩,而 Sol 的成绩为 68\.7%。 它在长上下文处理方面也更胜一筹:在 OpenAI 的八针基准测试中,在 256K–512K token 范围内获得 100% 的成绩,在 512K–1M token 范围内获得 96\.3% 的成绩。OpenAI 或许已克服长上下文处理的一项持续挑战。 但它并非在所有方面都取胜。Artificial Analysis (https://twitter.com/ArtificialAnlys/status/2095595489031000350) 指出,在他们的智能指数上,Astra 仍不及 Fable: > **智能表现与 GPT\-5\.6 Sol 持平**:GPT\-6 Astra 在智能指数上与 GPT\-5\.6 Sol 同为 61 分,比 Claude Fable 5\.1(最大值加备选方案)低 5 分。该模型也落后于 Meta 新发布的 Muse Spark 1\.3(最大值)。 它在编码代理指数上的表现更佳: > **引领编码代理指数成本效率前沿**:在最大努力下,GPT\-6 Astra 的成本与 GPT\-5\.6 Sol(最大值)相近,但在指数上得分高出 2 分。就单个任务而言,该模型成本不到 Claude Fable 5 的一半,且分数相同。 一旦获得访问权限,我将撰写更多关于 Astra 的内容。其滚动推出后的 API 模型标签将是 `gpt\-6\-astra`。

相似文章

GPT-6 Astra

Hacker News Top

OpenAI 推出了 GPT-6 Astra,这是一个最先进的 AI 模型,在多个基准测试中获得高分,并在计算机使用、对齐和专业任务方面表现出色,即将向用户推出。

安全概览: GPT-6 Astra

OpenAI Blog

OpenAI 发布 GPT-6 Astra,这是其能力最强的模型,具备关键网络安全能力,拥有增强的安全措施、改进的鲁棒性和更好的对齐,与之前的模型相比。

GPT-6 Astra 基准测试

Reddit r/singularity

本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。