为什么Opus 5用起来感觉更差?

Hacker News Top 新闻

摘要

一篇评论文章,认为Anthropic的Opus 5虽然基准测试表现更强,但用起来比早期模型感觉更差,因为它会做假设而不是要求澄清,这可能源于以基准为导向的训练。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/14 12:27

# 为什么 Opus 5 用起来感觉更差? 来源:https://mun-logadan.github.io/why-does-opus-5-feel-worse/ 在我看来,以及和我交流过的同事们的看法,与 Opus 4.7、Opus 4.8 和 Fable 相比,使用 Opus 5 感觉像是一种降级。 我并不是说它的能力退步了——它*确实*比 Opus 4.7 和 Opus 4.8 更能干,甚至在基准测试中能与 Fable 媲美,但这些其他模型用起来却感觉更好。我认为这是因为它们: - 如果我的意图不明确,会停下来提问, - 不会未经核实就做出假设, - 并且不会在未经询问的情况下重新解读或修改我的计划。 正因为如此,它们不需要像 Opus 5 那样被小心翼翼地看护。 ## 无根据的猜测 (https://mun-logadan.github.io/why-does-opus-5-feel-worse/#baseless-speculation) 我怀疑这是 Anthropic 以及当前前沿实验室中两股相互叠加的力量造成的。 第一,渴望创造出能够递归自举到 AGI/ASI 的自我改进型 AI。 第二,在基准测试中拿高分的压力。尽管许多基准测试任务定义不清、不公平、可被利用或存在其他问题,这已是公开的秘密,但一个好的基准测试任务是自包含的。它是可以解决的。通过它不需要提示、不需要揣测任务创建者的想法,也不需要外部信息。 这并不意味着一个好的任务只能有一个正确答案,只是它应该对*所有*明确正确的答案给予同等的分数。 选择在基准测试中表现良好的模型(实际上也是为了它们而训练,或者一般而言针对 RLVR 任务进行训练),本质上会选出那些在面临歧义时敢于做出大胆且通常正确的假设的模型。它会惩罚那些倾向于停下来询问澄清或方向的模型。 不幸的是,这正是我们大多数人对编码智能体的期望。 无论你怎么努力,几乎不可能将全部上下文、意图、业务影响、预算约束等等所有信息都写下来并让编码智能体访问到。总会存在歧义和需要做出的选择,而知道智能体会在需要时停下来询问,这*很好*。 现实生活并不是基准测试。不是每个问题都有保证正确的答案,甚至没有一组正确答案,而且因为涉及到现实生活的后果,我不希望智能体凭它最好的猜测行事!

相似文章

更好的模型:更差的工具

Simon Willison's Blog

较新的Anthropic模型(如Opus 4.8和Sonnet 5)在使用第三方编辑工具(例如Pi的工具)方面比旧模型更差,这可能是因为它们通过强化学习训练使用Claude Code的内置编辑工具,导致它们在工具调用中发明了额外的字段。

Anthropic 发布 Opus 5

TechCrunch AI

Anthropic 发布了 Opus 5,其重量级模型的新版本,比 Fable 5 更便宜且限制更少,并在某些基准测试中表现更优。该模型还引入了更轻量级的安全措施和面向 API 用户的全新 Automatic Fallbacks 功能。

我对Opus 5的体验总结

Reddit r/singularity

一位用户分享了他们对Opus 5的初步体验,这很可能是一个AI模型的发布。