@danshipper: 重磅:Claude Opus 5 现已发布!而且……这是一个让人爱不起来的模型。过去一周,我们在@every上对它在c…
摘要
对Claude Opus 5的初步体验显示,它打破了与现有工作流程的向后兼容性,但从零开始时却展现出非凡才华,处于天才模型与通用模型之间的尴尬中间地带。
查看缓存全文
缓存时间: 2026/07/24 23:16
重大消息:Claude Opus 5 现已发布!
然而……这是一个让人难以爱上的模型。
过去一周,我们在 @every 上全面测试了它的编码、写作、知识工作以及内部智能体能力。
它跟指令对着干,任务没完成就停下来,并且普遍不兼容我们现有的技能和插件(如 Compound Engineering)。我们的第一反应是:他们把我的宝贝怎么了?
然后我们删除了现有技能,从零开始。
在没有为早期模型精心设计的工作流后,Opus 5 的表现显著提升,甚至闪现出天才的火花。
以下是我们的 Day 0 初步印象:
- 它像个低配版 Fable。具备 Fable 的许多个性怪癖,却没有 Fable 的天才。
- 它打破了向后兼容性。如果你用现有技能和工作流来使用它,要小心。它经常提前停止或忽略你的指令。
- 如果从零开始,效果会更好。@KieranKlaassen 发现,如果他从头开始,不借助现有技能,就能获得好得多的结果。这个模型需要你花时间围绕它重建工作流——但如果你这么做,就会有回报。
- 中低 effort 效果更好。@KieranKlassenn 还发现,在较低的思考层级下使用 Opus 5 效果更佳。似乎你给它越多时间思考,它就越可能做出恼人的行为。不要仅仅为了更快响应就切换到 Sonnet!试试低思考模式。
我的工作流中保留两个位置:
- 用于最重要、最困难任务的天才模型,目前是 Fable。
- 用于其他所有事情的聪明、快速通才模型,目前是 GPT-5.6。
Opus 5 拥有天才型的人格,但缺乏其顶尖能力。所以它处在一个奇怪的中场地带,在日常工作中没有明确归属。我想我主要会在 Fable token 用完时使用它。
完整的初步印象请见 @every 的下一条推文。
完整初步印象在此:
感谢 @danshipper 的总结。我想我暂时还是坚持用 GPT-5.6。
相似文章
@levie:Claude Opus 5 现已发布,在众多能力上相比 Opus 4.8 有巨大飞跃。在 Box,我们一直在测试…
Claude Opus 5 已发布,在尽职调查、生命科学、法律、技术和医疗保健任务的企业基准测试中,相比 Opus 4.8 显示出显著提升,增益幅度为 12-30%。
Claude Opus 5 基准测试!
一篇介绍即将推出的 Claude Opus 5 AI 模型基准测试结果的文章。
推出 Claude Opus 5
Anthropic 宣布推出 Claude Opus 5,这是一款强大且经济高效的 AI 模型,其智能水平接近 Claude Fable 5,但价格仅为后者的一半,在编程和知识工作基准测试中取得了最先进的结果。
@danshipper: 和往常一样,Claire和我意见一致
Claire Vo 宣布发布 Opus 5,这是一个她不喜欢使用的模型,但在与 Fable 和 GPT-5.6 的盲测中排名最高。Dan Shipper 表示赞同。
推出 Claude Opus 4.6
Anthropic 宣布推出 Claude Opus 4.6,这是其最强大模型的升级版本,旨在提供更好的规划能力、更长的任务记忆以及更高的自主性。