@cline: 公开提醒:使用中等思考努力而不是xhigh。Opus 5 中等努力在 FrontierCode 上排名第2,准确率53.4%,每任务成本4.31美元,而…
摘要
一份公共服务公告建议对 Opus 5 AI 模型使用中等思考努力,该模型在 FrontierCode 基准测试中排名第二,比 xhigh 努力设置具有更好的成本效率。
公开提醒:使用中等思考努力而不是xhigh。
Opus 5 中等努力在 FrontierCode 排名第2,准确率53.4%,每任务成本4.31美元,而 xhigh 排名第16,准确率43.6%,每任务成本9.14美元。
成本仅为一半,性能提升10%。 https://t.co/uCvykqVQwo
查看缓存全文
缓存时间: 2026/08/21 07:06
提示:使用中等思考强度而非最高强度。
Opus 5中等强度在FrontierCode上排名第2,准确率53.4%,每任务成本4.31美元;而最高强度排名第16,准确率43.6%,每任务成本9.14美元。
成本减半,效果提升10%。https://t.co/uCvykqVQwo
相似文章
Opus 5 的努力档位并非单调递增。在“高”档以上,编程得分反而下降,Anthropic 自家的迁移指南也这么说。
Anthropic 的 Opus 5 在编程任务上表现出非单调性能;由于不必要的重构,“高”努力档位的表现优于“最大”档。该模型的幻觉率也比 Opus 4.8 高出 6%,并且安全分类器可能会静默回退到旧模型。
@orca_build: Anthropic的新款Opus 4.8在Terminal-Bench 2.1上的得分比GPT 5.5低3.6%……但在UI任务上明显更出色。
Anthropic的Opus 4.8在Terminal-Bench 2.1上比GPT 5.5低3.6%,但擅长UI任务;Orca的编排功能让Codex能将UI任务委托给Claude Code。
@datacurve: Opus 4.8 现已登陆 DeepSWE。在默认高思考投入设置下,其得分比 Opus 4.7 xhigh 高出6%,同时还能降低…
Opus 4.8 现已可在 DeepSWE 上使用,得分比 Opus 4.7 高出6%,并降低了每任务平均成本。
@scaling01: Opus 4.8 是目前最好的编程模型。Cognition 的 FrontierCode 可能是最高质量的编程基准测试……
Cognition 推出了 FrontierCode,这是一个高质量的编程基准测试,超越了单纯的单元测试,用于衡量代码的可维护性、回归安全性和质量,由 20 多位开源开发者精心设计了 150 个任务。
@bcherny: 看到多个基准测试显示Opus是长期运行工作中的最佳模型。自主运行Opus的五个技巧……
关于如何让Anthropic的Claude Opus自主运行数小时或数天的实用技巧,例如使用自动模式、动态工作流和自我验证;还提到了用于长期软件任务的SWE-Marathon基准测试。