GPT-6-Astra:可处理宏大任务(52分钟阅读)

TLDR AI 模型

摘要

GPT-6-Astra是OpenAI推出的重要AI模型,在能力上有显著提升,尤其适用于宏大项目、3D任务和计算机操作,在多项基准测试中超越了以往模型。

Astra可能具有所有模型中最高的原始智能因子。它在3D处理、游戏相关任务、计算机操作和子代理协调方面表现出色。多项基准测试显示其性能较以往所有模型有显著飞跃。虽然在编码性能上相比Sol没有量子飞跃,但它表现非常优秀,并较前代模型有所进步。OpenAI已软性宣布其内部有一个比Astra更高级别的模型。
查看原文
查看缓存全文

缓存时间: 2026/09/14 14:19

# GPT-6-Astra 能完成艰巨任务 来源:https://thezvi.substack.com/p/gpt-6-astra-can-do-ambitious-things Astra 是一个出色的模型。从 Sol 到 Astra 的跨越,比从 Fable 5 到 Fable 5.1 的升级更为显著。这一点意义重大。 Astra 是进行广义上所谓“雄心勃勃的项目”的最佳模型,很可能也是所有模型中原始智能因素最高的。这是目前最大的飞跃。 它在处理三维任务或任何与游戏相关的事务上表现惊人。Astra 在计算机操作和子智能体协调方面同样表现出色。 许多基准测试显示它相比所有前代模型都有巨大飞跃。Astra 强大的领域,可谓独步天下。 但这并不意味着 Astra 在所有方面都自成一档。Fable 5.1 仍是 Claude,Astra 仍属 GPT。如果你对两者有强烈偏好,这种偏好依然成立。出于许多目的,特别是涉及来回讨论时,Fable 5.1 仍是我的首选。Fable 依然是我的主要编辑工具。 如果你想获得最佳答案,应该同时询问两个模型。 常规编码任务的关注度正在下降。Astra 在这方面的飞跃并非量子级的,但它当然非常优秀,并在 Sol 的基础上有所进步。 这是首次关于某个模型“是否达到通用人工智能(AGI)”的辩论显得不那么可笑。我不认为它已达到 AGI,也反对过早使用这一标签的危险,但我不会嘲笑持不同意见的人。 这也是一个奇特的局面,因为 OpenAI 已经暗示他们内部有一个比 Astra 更高一级的模型,正如我在讨论 Navier-Stokes 时将要提到的那样。 > roon(https://x.com/tszzl/status/2095630749403619499)(OpenAI,2026年9月3日):我还没能接近发现 Astra 能力的极限。我想它大概会在几周内过时。roon(https://x.com/tszzl/status/2097630734047658486)(OpenAI,2026年9月9日):结果连一周都没到。 我的建议是,在你遇到最困难的问题时,同时使用 Fable 5.1 和 Astra,并通过实验看看哪个模型在哪些方面对你最有效。 [](https://substackcdn.com/image/fetch/$s_!DtdP!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc618611c-e4b0-4a0a-9f71-a5395bb2dd1a_1672x941.png)Astra 自画像 1. 同时。 (https://thezvi.substack.com/i/214417551/meanwhile) 2. 官方推介。 (https://thezvi.substack.com/i/214417551/the-official-pitch) 3. 价格亲民。 (https://thezvi.substack.com/i/214417551/our-price-cheap) 4. 不必要的夸大。 (https://thezvi.substack.com/i/214417551/unnecessary-overstatement) 5. 分阶段发布。 (https://thezvi.substack.com/i/214417551/paced-rollout) 6. 官方基准测试。 (https://thezvi.substack.com/i/214417551/official-benchmarks) 7. 他人基准测试。 (https://thezvi.substack.com/i/214417551/other-people-s-benchmarks) 8. 思考:快而无慢。 (https://thezvi.substack.com/i/214417551/thinking-fast-without-slow) 9. 先生,你怎敢。 (https://thezvi.substack.com/i/214417551/how-dare-you-sir) 10. 诗歌基准测试。 (https://thezvi.substack.com/i/214417551/poetrybench) 11. 三维世界。 (https://thezvi.substack.com/i/214417551/in-3d) 12. 思考时间。 (https://thezvi.substack.com/i/214417551/time-to-think) 13. 我在组建一个团队。 (https://thezvi.substack.com/i/214417551/i-m-putting-together-a-team) 14. 评论与论文。 (https://thezvi.substack.com/i/214417551/reviews-and-essays) 15. 计算机使用。 (https://thezvi.substack.com/i/214417551/computer-use) 16. 积极反响。 (https://thezvi.substack.com/i/214417551/positive-reactions) 17. AGI。 (https://thezvi.substack.com/i/214417551/agi) 18. Astra 懂数学。 (https://thezvi.substack.com/i/214417551/astra-can-do-the-math) 19. Astra 会编程。 (https://thezvi.substack.com/i/214417551/astra-can-code) 20. 我为改变(游戏)规则而来。 (https://thezvi.substack.com/i/214417551/i-came-to-change-the-game) 21. Astra 还有其他酷炫功能。 (https://thezvi.substack.com/i/214417551/astra-does-other-cool-things) 22. Astra 永不放弃,除非它放弃。 (https://thezvi.substack.com/i/214417551/astra-never-quits-except-when-it-does) 23. 负面反应。 (https://thezvi.substack.com/i/214417551/negative-reactions) 24. 别再模棱两可了。 (https://thezvi.substack.com/i/214417551/stop-it-with-the-hedging) 25. 性格冲突。 (https://thezvi.substack.com/i/214417551/personality-clash) 26. 显示偏好。 (https://thezvi.substack.com/i/214417551/revealed-preference) 27. 双持武器。 (https://thezvi.substack.com/i/214417551/dual-wielding) 待讨论的事项堆积如山,不会减少,因此我想借此机会鼓励大家阅读 Dario Amodei 的这篇优秀文章,《(https://darioamodei.com/post/we-must-pace-the-frontier) 我们必须把控前沿节奏 (https://darioamodei.com/post/we-must-pace-the-frontier) *》。 这是他呼吁的核心内容,包括一项单方面承诺: > 措施如下:1. **嵌入式评估员。** 每家前沿人工智能公司都承诺,为由第三方评估员(如 METR (https://metr.org/))组成的团队提供持续、类似员工的访问权限,其职责是验证遵守安全实践和承诺的情况,报告事件,并帮助评估不仅是已完成的 AI 模型,还包括训练流程和过程的安全性。这是确保任何节奏承诺具备*可验证性*的关键步骤,银行业已有先例,有时会将监管“监督员”与员工一起嵌入。**Anthropic 现在单方面承诺执行此步骤。** 我们希望这能成为更大规模推动工作的一部分,以加倍我们在安全和对齐方面的努力。2. **民主协调。** 民主国家内的前沿 AI 公司协调制定共同的安全标准,并限制不受约束的 AI 进展速率。一些具有影响力的节奏协调形式在法律上具有挑战性,需要政府支持。3. **全球协调。** 美国和其他民主政府尝试在可能的情况下与威权政府进行协调,同时认真对待验证合规性的挑战。 我将在下周全面报道此事。除了这篇文章,目前的队列中至少还包括 Navier-Stokes 和 Astra-2、Anthropic 的失配报告、Anthropic 的反滥用报告、一篇关于个人 AI 与法律的评论文章、一篇名为 Claude Talk 的帖子,以及 Fable 5.1(和 Astra?)模型福利。 好了,回到 Astra。 宣传点是它就是 AGI。 > Greg Brockman (https://www.axios.com/2026/09/03/openai-astra-gpt-6-agi-brockman)(总裁,OpenAI):欢迎来到 AGI 时代 (https://x.com/gdb/status/2096721633876771094)。 Axios:OpenAI 表示 Astra 可以在 KiCad 中设计印刷电路板,在 Unity 中构建 3D 城市场景,在 FreeCAD 和 Blender 中创建汽车变速箱的动画,并从 W-2 表格中填写纳税申报草案。在科学工作中,该模型帮助改进了一个关于素数间隔的数学结果,并在多项生物学、化学、医学和物理学评估中创下新纪录。 Jensen Huang 也称其为 AGI (https://x.com/JensenHuang/status/2096700264569090384),但他称所有东西都是 AGI。 官方的发布视频(3分钟)在 Twitter 上获得了惊人的 1.25 亿次观看。 (https://x.com/OpenAI/status/2095595741528125780) > Dean W. Ball (https://x.com/deanwball/status/2095606590170612206)(OpenAI):Astra 是一项非凡的技术。早期的智能体往往试图抑制我的野心——它们会推动我做“试点”或“概念验证”。后来智能体开始满足我的野心。Astra 是第一个能经常激发我更多野心的智能体。我鼓励你试试它!我认为它是一个非常非常优秀的作家,带有一种“大型模型”的特质。roon (https://x.com/tszzl/status/2096413031978664088)(OpenAI):听起来像个彻头彻尾的推销员,但这是一个长周末,我只想用 Astra 做轨道动力学可视化之类的事情。我得了 Astra 精神病。Tibo (https://x.com/thsottiaux/status/2096101429832552872):Astra 可能是我们最大的竞争优势,尽管它尚未广泛提供。自从我们用上它以来,我们的生产力大幅提升,以至于我们将部分计划提前了 6 个月,并将在 DevDay 而不是明年年中推出。Dominik Kundel 表示 Astra 能在 Codex 中完成所有事情 (https://x.com/dkundel/status/2095972046014673156):使用你所有的应用程序,做更多产品思考,擅长 Blender,无需深度思考就能让你印象深刻,并持续检查自己的工作。他印象非常深刻。 以下是 Astra 根据 Pangram 提供的自我宣传: [](https://substackcdn.com/image/fetch/$s_!5yPA!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fb7c8d59b-e70c-490e-b657-a574a933ea1e_1034x636.png) [](https://substackcdn.com/image/fetch/$s_!VyM9!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ff9ad48aa-99bc-415e-bc7b-395124057fcb_1052x965.png) > Sam Altman (https://x.com/sama/status/2095600005772104059)(CEO OpenAI):GPT-6 Astra 来了。我们希望它能开始赋能新一代的创业、科学发现和建设。我们相信它是世界上用于计算机操作、专业工作、科学、编码、网络安全等方面的最佳模型。我们花了额外的时间以确保能够达到此能力水平所需的安全与对齐标准,但我们认为你会发现它值得等待。它在 FrontierMath 第四层级得分为 98%,在 ARC-AGI 3 得分为 99.9%,在 ExploitBench 得分为 100%。Dr. Parik Patel, BA, CFA, ACCA Esq(最佳回复)(https://x.com/ParikPatelCFA/status/2095610152133021778):我等不及要用这个模型起草邮件了。Mark Chen (https://x.com/markchen90/status/2095597534412673109):GPT-6 Astra 来了!这对我们研究团队来说是一个重大时刻——在预训练、强化学习和后训练方面多年的努力,共同造就了我们迄今为止能力最强、对齐最完善的模型。它可以构建和测试软件,在电脑上的不同应用程序间工作,甚至能帮助你尝试解决开放性的科学问题。几年前感觉还是宏大挑战的能力,如今已成为人们可以实际使用的工具。一个例子就是计算机使用——如果你以前尝试过并觉得它太慢或不够好,我鼓励你再试一次。自 Operator 以来,我们已经取得了长足进步,它现在“就是好用”。我们也让这些系统代你执行更具后果的工作。智能体需要保持与你的目标和价值观一致,思考过程透明,并在任务变得困难时响应监督。我们在 Astra 中在这些行为方面取得了重大进展,并加强了监控,可以阻止潜在的未授权行动。这项工作是此次发布成为可能的原因之一。我认为对齐是 AI 最重要的研究前沿之一,而且远未解决。我们理解和对齐模型的能力必须与模型能力同步发展。我们想给人们更多空间,使用日益强大的工具来思考、建设和发现,同时这些工具仍*在他们的掌控之下*。非常感谢带领我们走到这里的各位研究员和团队。前方还有更多工作,我对我们近期能够实现的目标感到无比兴奋! 和以往一样,科学发现被重点强调。 > Noam Brown (https://x.com/polynoamial/status/2095583211950833768)(OpenAI):在 GPT-6 Astra 的所有用例中,我最兴奋的是科学发现。我们 @OpenAI 还没有把它在数学和科学方面推到极限。我期待每天早上醒来,看看有人用这个模型取得了什么新的科学突破! Noam 引用的早期演示是 Astra 证明存在无穷多对相邻素数,其距离至多为 186 (https://t.co/kegFNJKQrq),这比之前的界限 212(同样来自 OpenAI)要小,尽管对于究竟证明了什么或没证明什么存在一些争议。 > Tejal Patwardhan (https://x.com/tejalpatwardhan/status/2095596797184126976)(OpenAI):希望大家喜欢这个模型! 他们展示了各种酷炫的演示和能力:在金融建模世界杯中表现出色,以4倍于人类的速度处理电子表格,在 KiCad 中进行 PCB 设计,创建汽车变速箱的 3D 模型,填写 1040 表格等等。他们演示了常规任务。这一切都很酷,但我们缺乏对比点。 专业工作的宣传点是 Astra 能处理复杂任务,并严格遵守模板和指令,尤其是在创建演示文稿时。它可以将图像转换成完全相同的电子表格,太好了。 他们重点展示了 Blender 3D 模型,许多其他人也对此印象深刻,参见“三维世界”一节。游戏创建也被证实非常惊艳。 Astra 是一个高级模式 (https://developers.openai.com/api/docs/models/gpt-6-astra)。 标价是每百万输入和输出令牌 10 美元/50 美元。缓存写入是 12.50 美元,仅缓存输入只需 1 美元。 如果你的提示超过 272k 输入令牌,输入价格翻倍,输出价格上涨 50%。 快速模式费用翻倍。 Fable 5.1 的标价也是 $10/$50,但其缓存读取仅需 $0.25。 实际成本取决于令牌效率。Artificial Analysis 认为 Astra 的实际成本仅比 Sol 高约 60%,而且比 Fable 5.1 便宜得多。他们使用的是 Fable 5.1 的 Max 模式,这可能就是问题所在,因为 Max 模式对于 Fable 5.1(据我所知)来说,除了讨论之外的任务通常是个错误选择。 Astra 是一个出色的模型,拥有一些卓越的基准测试成绩。不幸的是,OpenAI 仍然觉得有必要玩弄花招。 这是一个相当糟糕的图表欺诈 (https://openai.com/index/gpt-6-astra/),而且完全没有必要,因为 Astra 在使用标准测试框架时获得了令人印象深刻的 62.7% 的分数。他们自己也提到,Sol 如果使用 Astra 的测试框架,可能得分约 30%。Fable 估计,如果 Opus 使用了类似的框架,得分可能约为 80%,我认为我们应该验证一下。 [](https://substackcdn.com/image/fetch/$s_!XWdi!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F7a0bf5d8-bf17-4080-a5b9-99e4ab277915_930x1034.png) ExploitBench 更奇怪。为什么要强调 100% 的得分?那并不是它更令人印象深刻的基准之一。如果你在 ExploitBench 上得 100%,你就是在 ExploitBench 上作弊了。至少这涉及数据污染,这仍然是作弊。OpenAI 在系统卡中也提到了这一点。再说一次,没有必要这样夸大其词。 他们还使用了 ExploitGym 诱捕程序 (https://openai.com/index/gpt-6-astra/) 作为主要示例,证明 Astra 是他们“最对齐的模型”。正如我在分析模型卡时所讨论的,这个结果并不能说明这一点。你可以认为 Astra 比 Sol 更对齐,对于大多数目的我也同意,但这不是论证的方式。 作为补充,我也注意到这一点,尽管我认为它无关紧要:《财富》报道称,OpenAI 在发布后不久更改了多个模型的列出基准 (https://fortune.com/2026/09/04/openai-quietly-boosts-some-of-astras-evaluation-metrics-amid-rare-delay-in-publication-of-the-modeblog-post-announcement/?utm_campaign=social_share),许多更改后来被撤销。我将使用当前数据。 搞清楚我何时能访问模型非常令人沮丧,部分原因是 OpenAI 将模型选择隐藏在多次点击之后。 > Theo - t3.gg (https://x.com/theo/status/2095649124637163635):说实话,不太喜欢 OpenAI “发布

相似文章

GPT-6 Astra

Hacker News Top

OpenAI 推出了 GPT-6 Astra,这是一个最先进的 AI 模型,在多个基准测试中获得高分,并在计算机使用、对齐和专业任务方面表现出色,即将向用户推出。

GPT-6 Astra

Product Hunt

OpenAI发布GPT-6 Astra,这是其最强大的AI模型,适用于高级推理、软件工程和智能体工作流,具备异步工具调用和中途引导功能,并制定了分阶段推出计划。

GPT-6 Astra:工作智能的下一代

OpenAI Blog

OpenAI发布了GPT-6 Astra,这是一款专为专业工作优化的尖端AI模型,具备在计算机使用、编码和企业工作流方面的高级能力,并提升了安全性和效率。

工作现已触手可及

OpenAI Blog

OpenAI 宣布 GPT-6 Astra,这是一款重大 AI 模型,在计算机使用和软件工程等领域提升能力,旨在通过集成消费者和企业产品,拓展个人和企业所能实现的目标。