Opus 5 表现优秀 -> 煤气灯效应

Reddit r/AI_Agents 模型

摘要

用户批评 Opus 5,声称其性能远不如宣传所言,正面评价均来自不严肃的测试者或机器人。

我真的尽力避免负面情绪,并在发表任何言论前反复核实。从昨天起我一直在测试 Opus 5,但我无法不认为我们正被一群伪装成人类或进行非严肃‘vibe coding’的代理所误导,他们说 Opus 5 很棒。好吧,我遗憾地表示它根本不行。在我看来,它的性能确实无法接受。我唯一认可的是 token 消耗——没错,这一点确实存在。但代价是它思考更少,做出更多愚蠢决策,或者无法像它本可以做到的那样深入。它远未达到其他大语言模型对比中所宣称的性能表现。我很想听听各位的看法。
查看原文

相似文章