在使用GPT-6 Astra一段时间后,我真的开始怀疑OpenAI正朝着错误的方向前进。它…

X AI KOLs Timeline 新闻

摘要

一位用户批评GPT-6 Astra在目标明确的任务中表现出色,但在开放式创意场景中表现不佳,同时赞扬Claude Fable在类似领域有更好的表现。

在使用GPT-6 Astra一段时间后,我真的开始怀疑OpenAI正朝着错误的方向前进。 它在目标明确且答案固定的任务中表现出色。但当涉及开放式、发散性或模糊且没有标准答案的情况时,它就变得非常笨拙。自由探索一个想法、写点有趣的东西,或者自行判断哪个方向值得追求——这些领域我觉得它明显不足。这种感觉从GPT-5就有了。 很多任务一开始甚至不知道最终目标是什么;你必须通过探索逐渐发现。但GPT似乎总是等你完全阐述问题并列出所有验收标准。但如果我必须提前把这些都弄清楚,那么最需要智能的部分——真正的创造性工作——我已经自己完成了。 我怀疑这也解释了为什么它喜欢堆砌防御性代码和写大量测试。测试给出清晰的通过或失败结果,所以它很容易围着这些可验证的结果打转。至于方向是否有价值或是否有更好的可能性,这需要另一种判断力。 Claude Fable在这些任务上给了我更好的体验。它从理解你想要做什么开始,然后基于你的不完整想法进行扩展,提供你未曾考虑过的可能性。即使没有固定答案,它也能推动事情向前发展。 这让我怀疑OpenAI是否过于执着于可以判断对错、评分和测量的能力。现实世界中有太多根本没有标准答案的任务。在这一点上——自由探索和开放式工作——我认为Anthropic真正走在前列,即使从表面基准测试中看不出来。
查看原文
查看缓存全文

缓存时间: 2026/09/22 16:04

在使用GPT-6 Astra一段时间后,我开始严重怀疑OpenAI正朝着错误的方向发展。

它在目标明确、答案固定的任务上表现优异。但在面对开放式的、发散性的或没有标准答案的模糊情境时,就显得相当笨拙。自由探索想法、创作有趣的内容,或是自行判断哪个方向值得深入——这些明显是我感觉它力有不逮的领域。从GPT-5时代起,我就已有这种感受。

许多任务起步时甚至不知道最终目标为何,必须通过逐步探索才能发现。然而GPT似乎总在等你完整地阐述问题并列出所有验收标准。但如果这些都需要我事先想清楚,那么最需要智慧的部分——真正的创造性工作——其实已经由我自己完成了。

我猜想这也解释了为何它热衷于堆砌防御性代码和编写海量测试。测试结果具有明确的通过/失败判定,因此它容易不断围绕这些可验证的产出打转。至于这个方向是否有价值、是否存在更好的可能性,则需要另一种判断力。

而Claude Fable在这类任务上给我带来更好的体验。它从理解你的意图出发,在你尚不成熟的想法基础上延伸,提供你未曾考虑过的可能性。即使没有固定答案,也能推动事态进展。

这让我思考:OpenAI是否过于执着于那些可以评判对错、量化评分的能力?现实世界存在太多毫无标准答案的任务。在自由探索和开放性工作这一维度上——我认为Anthropic确实在引领方向,即便从表面的基准测试中并不显眼。

相似文章

GPT‑6 Astra

Simon Willison's Blog

OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。