在使用GPT-6 Astra一段时间后,我真的开始怀疑OpenAI正朝着错误的方向前进。它…
摘要
一位用户批评GPT-6 Astra在目标明确的任务中表现出色,但在开放式创意场景中表现不佳,同时赞扬Claude Fable在类似领域有更好的表现。
查看缓存全文
缓存时间: 2026/09/22 16:04
在使用GPT-6 Astra一段时间后,我开始严重怀疑OpenAI正朝着错误的方向发展。
它在目标明确、答案固定的任务上表现优异。但在面对开放式的、发散性的或没有标准答案的模糊情境时,就显得相当笨拙。自由探索想法、创作有趣的内容,或是自行判断哪个方向值得深入——这些明显是我感觉它力有不逮的领域。从GPT-5时代起,我就已有这种感受。
许多任务起步时甚至不知道最终目标为何,必须通过逐步探索才能发现。然而GPT似乎总在等你完整地阐述问题并列出所有验收标准。但如果这些都需要我事先想清楚,那么最需要智慧的部分——真正的创造性工作——其实已经由我自己完成了。
我猜想这也解释了为何它热衷于堆砌防御性代码和编写海量测试。测试结果具有明确的通过/失败判定,因此它容易不断围绕这些可验证的产出打转。至于这个方向是否有价值、是否存在更好的可能性,则需要另一种判断力。
而Claude Fable在这类任务上给我带来更好的体验。它从理解你的意图出发,在你尚不成熟的想法基础上延伸,提供你未曾考虑过的可能性。即使没有固定答案,也能推动事态进展。
这让我思考:OpenAI是否过于执着于那些可以评判对错、量化评分的能力?现实世界存在太多毫无标准答案的任务。在自由探索和开放性工作这一维度上——我认为Anthropic确实在引领方向,即便从表面的基准测试中并不显眼。
相似文章
GPT‑6 Astra
OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。
OpenAI的GPT 6 Astra是否真的落后于Fable,甚至Opus?
这篇文章基于对AI Analysis基准测试的讨论,推测OpenAI的GPT 6 Astra是否落后于Fable和Opus等竞争对手。
@0x0SojalSec: Claude Opus 5.5 将超越 OpenAI 的 GPT-6 Astra
一条推文声称,Anthropic 的 Claude Opus 5.5 在性能上将超越 OpenAI 即将推出的 GPT-6 Astra。
Astra在编码中的应用:我们为何又要做这件事?
本文批评了AI模型GPT 6 Astra在软件工程任务中生成低质量代码的行为,尽管其能力令人印象深刻,但暗示AI训练可能奖励任务完成而非输出质量。
GPT-6-Astra:可处理宏大任务(52分钟阅读)
GPT-6-Astra是OpenAI推出的重要AI模型,在能力上有显著提升,尤其适用于宏大项目、3D任务和计算机操作,在多项基准测试中超越了以往模型。