@jerryjliu0: 我从博客/系统卡中观察到一件有趣的事情:在相当一部分报告的基准测试中(大约20-30%……
摘要
观察到与xhigh相比,Claude Opus 5的max thinking在大约20-30%的基准测试中导致性能下降,这与增加测试时计算量可提升性能的预期相反。
查看缓存全文
缓存时间: 2026/07/25 08:03
我在博客/系统卡片中注意到一个有趣的现象:在相当一部分报告的基准测试中(粗略看下来大约20-30%),Opus 5的最大思考模式相比xhigh模式反而导致了性能下降。
通常人们会认为,随着思考时间和测试时计算的增加,性能会提升。但其中一些结果与这一假设相矛盾。我想知道这是小型模型自然涌现的特性,还是一个后训练问题。
Claude (@claudeai): 推出 Claude Opus 5。
这是一个善于思考且积极主动的模型,在性能上接近 Fable 5 的前沿智能水平,价格却只有后者的一半。
相似文章
@no_stp_on_snek: 有人会晃着成绩卡对我说:9B模型在编程基准测试中碾压了它的基础模型(SWE-bench 69 vs 53)。确实如此。但关于……
一位评论员讨论了9B模型在编程基准测试中的表现,指出虽然在SWE-bench上它击败了基础模型(69 vs 53),但在行为测试和长程测试中优势缩小,说明在基准分布之外收益有限。
@elliotarledge:Claude Fable 5 [max] 在 KernelBench-Hard 上的表现。给我印象最深的核心是 B200 fp8 GEMM:它手动编写了原始的 SM10…
Claude Fable 5 通过为 B200 fp8 GEMM 手动编写 PTX 代码,在 KernelBench-Hard 上取得了顶级结果,超越了其他模型,并在计算密集型形状上达到峰值性能的 44-59%。
@polynoamial: https://x.com/polynoamial/status/2064210146558136827
本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。
@injaneity: https://x.com/injaneity/status/2075659478096376158
本文解释了批处理和并行操作如何改善AI计算机使用系统中的延迟和效率,重点介绍了pi-computer-use和cua-driver等开源实现,它们在Codex出现类似功能之前就取得了显著的性能提升。
@KLieret: Opus 4.8 卡的一项非常有趣的研究:多智能体在 ProgramBench 上并未取得更好的结果,但它们能更快地达到…
Opus 4.8 卡的一项研究表明,虽然多智能体系统在 ProgramBench 上并未取得更好的结果,但它们达到中等解决方案的速度提升了一倍。