Opus 5 表现优秀 -> 煤气灯效应
摘要
用户批评 Opus 5,声称其性能远不如宣传所言,正面评价均来自不严肃的测试者或机器人。
我真的尽力避免负面情绪,并在发表任何言论前反复核实。从昨天起我一直在测试 Opus 5,但我无法不认为我们正被一群伪装成人类或进行非严肃‘vibe coding’的代理所误导,他们说 Opus 5 很棒。好吧,我遗憾地表示它根本不行。在我看来,它的性能确实无法接受。我唯一认可的是 token 消耗——没错,这一点确实存在。但代价是它思考更少,做出更多愚蠢决策,或者无法像它本可以做到的那样深入。它远未达到其他大语言模型对比中所宣称的性能表现。我很想听听各位的看法。
相似文章
@robinebers: Fable 5 Low 优于 Opus 4.8 Max
用户发帖比较,认为 Fable 5 Low 优于 Opus 4.8 Max,另一用户评论称 Fable 5 回归了但使用方式不当。
Opus 5 据称产生了这些输出
来自名为 Opus 5 的 AI 模型的传闻输出已经出现,但其真实性尚未确认。
@orca_build: Anthropic的新款Opus 4.8在Terminal-Bench 2.1上的得分比GPT 5.5低3.6%……但在UI任务上明显更出色。
Anthropic的Opus 4.8在Terminal-Bench 2.1上比GPT 5.5低3.6%,但擅长UI任务;Orca的编排功能让Codex能将UI任务委托给Claude Code。
Opus 5 基准测试 (ARC-AGI3 上达到 30.2%!!!)
Opus 5 在 ARC-AGI3 基准测试中达到 30.2%,标志着显著的性能提升。
Opus 5 的努力档位并非单调递增。在“高”档以上,编程得分反而下降,Anthropic 自家的迁移指南也这么说。
Anthropic 的 Opus 5 在编程任务上表现出非单调性能;由于不必要的重构,“高”努力档位的表现优于“最大”档。该模型的幻觉率也比 Opus 4.8 高出 6%,并且安全分类器可能会静默回退到旧模型。