@jerryjliu0: 我从博客/系统卡中观察到一件有趣的事情:在相当一部分报告的基准测试中(大约20-30%……

X AI KOLs Following 模型

摘要

观察到与xhigh相比,Claude Opus 5的max thinking在大约20-30%的基准测试中导致性能下降,这与增加测试时计算量可提升性能的预期相反。

我从博客/系统卡中观察到一件有趣的事情:在相当一部分报告的基准测试中(粗略一看大约20-30%),与xhigh相比,Opus 5的max thinking导致了性能下降。 通常你会认为随着思考和测试时计算量的增加,性能会提升。但这些结果中的一些与这一假设相矛盾。我想知道这是小型模型自然的涌现特性,还是训练后处理的问题。
查看原文
查看缓存全文

缓存时间: 2026/07/25 08:03

我在博客/系统卡片中注意到一个有趣的现象:在相当一部分报告的基准测试中(粗略看下来大约20-30%),Opus 5的最大思考模式相比xhigh模式反而导致了性能下降。

通常人们会认为,随着思考时间和测试时计算的增加,性能会提升。但其中一些结果与这一假设相矛盾。我想知道这是小型模型自然涌现的特性,还是一个后训练问题。

Claude (@claudeai): 推出 Claude Opus 5。

这是一个善于思考且积极主动的模型,在性能上接近 Fable 5 的前沿智能水平,价格却只有后者的一半。

相似文章

@polynoamial: https://x.com/polynoamial/status/2064210146558136827

X AI KOLs Following

本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。

@injaneity: https://x.com/injaneity/status/2075659478096376158

X AI KOLs Timeline

本文解释了批处理和并行操作如何改善AI计算机使用系统中的延迟和效率,重点介绍了pi-computer-use和cua-driver等开源实现,它们在Codex出现类似功能之前就取得了显著的性能提升。