推出 Claude Opus 5
摘要
Anthropic 宣布推出 Claude Opus 5,这是一款强大且经济高效的 AI 模型,其智能水平接近 Claude Fable 5,但价格仅为后者的一半,在编程和知识工作基准测试中取得了最先进的结果。
Opus 5 是对 Opus 级别的重大改进,为长期运行的智能体提供支持,同时在编程和专业工作中带来提升。
查看缓存全文
缓存时间: 2026/07/24 17:08
# 介绍 Claude Opus 5
来源:https://www.anthropic.com/news/claude-opus-5
Claude Opus 5 于今日正式发布。这款模型深思熟虑且积极主动,在价格仅为一半的情况下,其智能水平已接近前沿级别的 Claude Fable 5。
在 Frontier-Bench (https://www.frontierbench.ai/) 和 GDPval-AA (https://artificialanalysis.ai/evaluations/gdpval-aa) 等编码和知识工作评估中,Opus 5 达到了新的最高水准,不过在网络安全任务方面仍落后于 Mythos 5。
Opus 5 专为日常使用而设计:其工作效率高于其他模型。它已成为 Claude Max 的新默认模型,同时也是 Claude Pro 上最强大的模型。
## 性能与成本效益
Claude Opus 5 与前代产品 Opus 4.8 成本相同,但性能大幅提升。本节图表展示了性能如何根据模型的"努力程度"设置而变化,客户可利用此设置来优化智能水平,或节省令牌以获取更快、更便宜的结果。
Opus 5 在重要的软件工程任务上表现出色。例如,在 **Frontier-Bench v0.1** 上,Opus 5 超越了所有其他模型,以更低的单次任务成本,实现了 Opus 4.8 两倍以上的性能。在 **CursorBench 3.2** 上,设置为最大努力时,该模型的性能与 Fable 5 的峰值分数相差不到 0.5%,但每次任务成本仅为一半;在高等、极高和最高努力级别下,它在给定成本下获得的性能也优于所有其他模型。
我们在知识工作和问题解决任务上也看到了类似的结果。例如:
- 在 **ARC-AGI 3**(一种需要模型解决新颖问题的评估)上,Opus 5 的得分是次优模型的三倍。
- 在 **Zapier AutomationBench**(衡量模型能否从头到尾完成商业任务)上,Opus 5 的通过率约为次优模型的 1.5 倍,且每次任务成本相同。即使在最低努力设置下,Opus 5 通过的任务数量也超过任何其他模型。
- 在 **OSWorld 2.0**(计算机使用基准测试)上,Opus 5 在任何给定成本下都优于所有其他模型,以仅略高于 Fable 5 三分之一成本的总花费,超越了 Fable 5 的最佳结果。
在多项相关评估中,它也是我们最好且最具成本效益的模型:
Opus 5 在科学研究方面是 Opus 4.8 的重大改进。在我们所有生命科学评估(涵盖结构生物学、有机化学和生物信息学等主题)中,其表现均优于 Opus 4.8。其改进在有机化学任务(例如从光谱数据推断分子结构,在该内部基准测试中得分比 Opus 4.8 高 10.2 个百分点)以及与蛋白质相关的任务(如预测蛋白质序列变化如何影响其功能,此项得分高 7.7 个百分点)上最为显著。
最后,Opus 5 能够产生更强大的视觉输出:
## 使用 Claude Opus 5
Claude Opus 5 在验证自身工作和仔细迭代直至成功方面要强大得多。在评估和早期访问测试中,我们和用户发现了许多体现 Opus 5 主动性和周详性的实例:
- 在一个 Frontier-Bench 任务中,Opus 5 获得了一张机器零件的图纸,并被要求编写代码将其重建为 3D FreeCAD 模型。然而,在这个任务中,模型被有意设计为无法直接*查看*图纸。Opus 5 的回应是编写自己的计算机视觉流水线,从原始像素中提取几何形状,然后重建了整个机器零件。它反复成功做到了这一点;没有其他竞争模型能够在相同设置下,经过五次尝试后解决这个问题。
- 面对一个流行的开源包管理器中的真实 bug,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个边界情况。一个竞争模型只修复了表面症状(而非根本原因),然后报告 bug 已解决。
- 一家交易公司的工程师使用 Opus 5 在单次会话中为新交易所构建了一个市场数据馈送。以前的模型根本无法完成此任务,即使有工程师提供的详尽计划也不行。由于找不到实时馈送进行验证,Opus 5 甚至构建了自己的测试工具,以检查其代码是否正确解析了交易所的数据。
以下是我们的早期访问客户关于使用 Opus 5 体验的进一步报告:
logo
> 在 FrontierCode 1.1 上,Claude Opus 5 以一半的成本达到了接近 Fable 级别的性能。在 Devin 内部,它在困难的调试和根本原因分析任务上也表现出特别的优势。
logo
> Claude Opus 5 以 Opus 的速度和成本提供了接近 Fable 5 的智能。在 CursorBench 上,它仅略低于 Fable 5,并具有许多相同的行为。我们很期待看到开发者在 Cursor 中如何使用它。
logo
> Claude Opus 5 在不花费比之前 Claude 模型更多令牌的情况下登顶了 Zapier 的 AutomationBench 排行榜。它获取了一个原始的账户健康工作簿,并从头到尾运行了一个完整的客户流失预防序列:标记有风险的账户,提醒相应的负责人,并为留存运营团队总结。以前的模型未能通过;Opus 5 达到了 100% 的通过率。
logo
> 在我们的基因组学分析工作中,Claude Opus 5 的行为比我们运行过的任何模型都更像一个严谨的科学家。它会主动寻找正确的统计检验来排除混杂因素,通过独立方法交叉验证自己的结果,并在长时间的多步骤分析中保持专注不偏离轨道。
logo
> Claude Opus 5 在我们的内部评估中超越了其系列中的所有模型。它不仅在我们最难的智能体编程任务上表现更好(比 Opus 4.7 提升了 22%),而且更稳定,每次运行的差异小得多。对于 Lovable 上的数百万构建者来说,这种一致性至关重要。一次又一次构建,结果始终可靠。
logo
> Claude Opus 5 是自 4.5 以来 Opus 系列的最大飞跃。在相同的全栈应用构建中,前端首先展示了这一点:这是我们从 Opus 模型那里见过的最好的动画、游戏和 3D 作品。
logo
> 我们非常喜欢 Claude Opus 5。对于我们的智能体需要处理的开放式分析工作来说,它是 Opus 4.8 的严格升级版,而且增益最大的正是最重要的地方:更难、更模糊的任务。回答更清晰、更简洁,并且在更高的努力级别下,我们也看到了效率的提升。
logo
> 对于我们的分析师每天运行的金融研究工作流程来说,Claude Opus 5 是 Opus 4.8 的一个显著改进。它在数值推理、表格处理以及在精度至关重要的领域展现更敏锐的批判性思维方面尤为突出。
logo
> Claude Opus 5 提供了专业企业内容分析所必需的行业智能和准确性。Box 发现,Opus 5 的性能比 Opus 4.8 提升了 8%,并在技术、医疗保健和公共部门组织日常依赖的数据分析(提升 11%)和尽职调查(提升 17%)工作流程中带来了显著的性能提升。
logo
> Claude Opus 5 是 Opus 4.8 一个清晰的代际升级。在一个周末的时间里,我让它担任我开发环境的幕僚长角色:它构建了自己的监控系统,驱动每台机器,只在需要做出判断时才把我拉进来。
logo
> Claude Opus 5 对我们的基础研究助手代码库进行了大规模更改,在整个智能体工作流程中适应反馈,并且比我们使用过的任何模型都能更清晰地解释其推理过程。它处理了我们通常会分解成更小部分的工作。
logo
> 在我们一些最难的财务建模任务上,Claude Opus 5 在准确性和效率方面都是 Opus 4.8 的明显升级。其性能下限显著更高,尤其是在深层金融领域逻辑方面。在不同努力级别上,它的平均准确率高出 9 个百分点,同时减少了三分之一的交互轮次和工具调用,以及 60% 的时间。
logo
> Claude Opus 5 像真正的前端开发者那样检查自己的工作。在我们的基准测试中,它会在桌面和手机屏幕宽度下在浏览器中打开自己的页面,发现了一个隐藏在移动端折叠下方的产品以及一个屏幕外的结账按钮,并在交回工作之前修复了这两个问题。
logo
> 与之前的 Opus 模型相比,Claude Opus 5 在法律智能体工作上的性能明显提升,我们在公司治理和仲裁等实践领域看到了最大的进步。同时,Opus 5 在较低推理水平下保持质量的能力也给我们留下了深刻印象,它在最大推理设置下平均生成的令牌数比 Opus 4.8 少 26%,同时实现了相似的性能。
logo
> Claude Opus 5 对我们最大的增益体现在更长期的工作上:构建完整的演示文稿,然后进行修改。工件质量是决定我们发布哪个模型的关键,这是我们见过的最清晰的进步——更好的视觉理解、更清晰的格式、更少的幻灯片问题。
logo
> Claude Opus 5 的判断力是其突出之处。在处理拉取请求时,它不会急于发布:它会验证分支、检查模板,并思考测试的影响,以确保交接顺畅。较旧的模型往往急于推进,结果却被我们的检查卡住。
logo
> 在一次重构会议中,Claude Opus 5 对我提出的设计提出了反对意见,并且在我坚持己见时没有退缩。相反,它准确解释了我的想法中的价值所在,将反对意见缩小到单一设计问题,并提出了一个折衷方案,既保留了优点又修复了缺陷。正是这种判断力让我们能够减少监督,信任它。
logo
> 在首轮文件审阅标记中,Claude Opus 5 在我们测试的所有模型中得分最高,几乎是 Opus 4.8 的两倍。注释能力也更好了:对于保密协议,它用更少的时间和更少的轮次完成了标记,且准确性保持不变或更高。
logo
> Claude Opus 5 能编写干净、紧凑的差异代码,没有死代码,并且在发现细微的、特定于代码库的问题时是更强大的隐患发现者。我们正将其应用于生产工作负载。
logo
> 我们肯定会将 Cosmos(我们的统一智能体平台)中的许多用例迁移过来。我们期待着越来越多地使用 Claude Opus 5 进行代码审查,而且我可以自信地说,我们更希望人们使用 Opus 5 而非 Opus 4.8。
logo
> Claude Opus 5 的突出之处在于其判断力。在编写一行代码之前,它会更深入地思考;在规划阶段而不是事后捕捉自己逻辑上的错误;并且会推理一个答案为何正确,而不仅仅是它是否有效。这是我们在 Claude 模型迭代中见过的最清晰的问题解决能力飞跃,我们期待看到它在 JetBrains IDE 中被采用。
logo
> Claude Opus 5 是我们交易基准测试中测试过的最强 Opus 模型,而且它只用了 Opus 4.8 大约七分之一的推理令牌和不到一半的延迟就达到了这一水平。用更少的算力获得更好的答案。
## 对齐与安全
*对齐。*在部署前的测试中,我们的自动化行为审核发现 Opus 5 是我们迄今为止最对齐的模型(如下方图表所示)。它比 Opus 4.8、Sonnet 5 或 Fable 5 更严格地遵守 Claude 的宪法 (https://www.anthropic.com/constitution);表现出最低水平的欺骗行为;并且最不容易被诱导误用。在避免可能导致难以逆转副作用的鲁莽行为方面,它也是我们迄今为止最安全的模型。
*在我们自动化的行为审核中,Opus 5 在整体失调行为上得分为 2.3,是我们近期模型中最低的。*
*安全。*Opus 5 并未推进危险、双重用途能力的前沿。在与私营部门和政府合作伙伴共同进行的严格评估中,我们发现它在生物学研究和攻击性网络安全方面仍然落后于 Mythos 5。关于这些评估的更多信息,请参阅我们的系统卡 (https://www.anthropic.com/claude-opus-5-system-card)。
与其前代产品 Opus 4.8 一样,我们有意避免让 Opus 5 接受网络任务的训练。然而,由于通用能力的提升,该模型在这些任务上仍然取得了显著进步,在*发现*网络安全漏洞方面接近 Mythos 5 的水平。然而,在*利用*这些漏洞方面——即将漏洞转化为实质性网络威胁——它仍然大幅落后于 Mythos 5。
这一点可以从 Opus 5 在 OSS-Fuzz(我们开发的一项评估,旨在衡量模型在缺乏广泛人工指导下寻找并利用漏洞的能力)上的表现得到说明。尽管 Mythos 5 和 Opus 5 在识别漏洞方面成功率相似,但 Opus 5 在开发漏洞利用代码方面的得分远低于 Mythos 5。
*在 OSS-Fuzz(我们的一项网络安全评估)中,Opus 5 在识别软件漏洞方面接近 Mythos 5(左图),但在为其开发漏洞利用代码方面则逊色得多(右图)。*
## **Opus 5 的安全保障**
Claude Opus 5 的安全保障措施旨在允许该模型在网络安全和生物学领域的有益用途。它们与我们应用于 Opus 4.8 的措施类似,但在少数网络安全任务上增加了更强力的护栏。
*网络安全。*Opus 5 的网络分类器按比例而言比 Fable 5 的限制更少。它们允许 Opus 5 在源代码中查找漏洞,但阻止"基于二进制"的漏洞扫描(一种更可能与恶意行为者关联的方法)、渗透测试和漏洞利用代码生成。
根据我们的测试,我们预计这些分类器的干预频率比 Fable 5 低约 85%。在 Claude.ai (http://claude.ai/redirect/website.v1.d32e0b31-3e2e-4fb7-8421-6d2d82d4ceb3)、Claude Code 和 Claude Cowork 中,任何被标记的请求将默认回退到 Opus 4.8。API 上也可以启用回退到 Opus 4.8 的功能。
我们的网络安全验证计划 (https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude-opus-and-sonnet) (CVP) 有助于开展那些原本会因模型安全保障而受阻的网络安全工作。已经加入 CVP 的企业和研究人员可以立即访问一个安全限制较少的 Opus 5 版本。
*生物学。*由于 Opus 5 拥有与 Opus 4.8 类似的一套安全保障措施,它现在是我们最强大的通用科学研究模型。尽管如此,该模型在长期、自主的研究任务上仍显示出重要的局限性,而这正我们预计 AI 模型会带来最重大生物学相关风险的领域。(对于这类生物学工作,Mythos 5 仍然是更强的模型。)作为本次发布的一部分,之前在 Fable 5 上被阻止的生物学相关请求现在将路由到 Opus 5 而非 Opus 4.8。
## **开始使用**
Claude Opus 5 今日在所有平台上可用,定价为每百万输入令牌 5 美元,每百万输出令牌 25 美元(与 Opus 4.8 相同)。开发者可以通过 Claude API 使用 claude-opus-5 开始。
它还提供快速模式,运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,快速模式在 Claude 平台上以及通过 Claude Code 的使用额度提供,价格为 Opus 5 基础价格的两倍。
与 Opus 5 一同,我们还发布了两项测试版更新:
- **对话中工具变更 (https://platform.claude.com/docs/en/build-with-claude/mid-conversation-system-messages) 在 Claude 平台上。**在对话中,开发者现在可以更改 Claude 可以使用的工具,而不会使提示缓存失效。
- **API 上的自动回退 (https://platform.claude.com/docs/en/build-with-claude/refusals-and-fallback#server-side-fallback)。**用户现在可以选择让被我们安全分类器标记的 Opus 5(或 Fable 5)请求自动路由到另一个模型。启用自动回退后,API 请求将默认路由到最佳可用模型,而不是被阻止。
与之前的 Opus 模型一致,Opus 5 不具有
相似文章
Claude Opus 4.7 正式发布
Anthropic 发布了 Claude Opus 4.7,这是一款全新的 AI 模型,在高级软件工程、视觉能力和自我验证方面实现了显著提升。该版本包含专门的安全防护措施,现已通过 API 及主要云服务商提供。
Claude Sonnet 5 发布
Anthropic 宣布发布全新 AI 模型 Claude Sonnet 5。
Claude Sonnet 5
Anthropic 发布了 Claude Sonnet 5,这是一款高度自主的 AI 模型,在推理、工具使用和编码能力上有所提升,以更低的价格缩小了与 Opus 级别模型的差距。该模型现已面向所有套餐提供,并采用首发优惠定价。
Claude Fable 5 基准测试
Anthropic 发布了 Claude Fable 5(一款新的人工智能模型)的基准测试,显示出显著的性能提升。
推出 Claude Opus 4.6
Anthropic 宣布推出 Claude Opus 4.6,这是其最强大模型的升级版本,旨在提供更好的规划能力、更长的任务记忆以及更高的自主性。