Claude Sonnet 5
摘要
Anthropic 发布了 Claude Sonnet 5,这是一款高度自主的 AI 模型,在推理、工具使用和编码能力上有所提升,以更低的价格缩小了与 Opus 级别模型的差距。该模型现已面向所有套餐提供,并采用首发优惠定价。
暂无内容
查看缓存全文
缓存时间: 2026/06/30 18:37
# 介绍 Claude Sonnet 5
来源:https://www.anthropic.com/news/claude-sonnet-5
Claude Sonnet 5 被打造为迄今为止最具代理能力的 Sonnet 模型。它可以制定计划、使用浏览器和终端等工具,并以自主运行的方式达到此前需要更大、更昂贵模型才能实现的水平。
对于许多开发者而言,代理式 AI 时代始于 Sonnet 级别的模型:Claude Sonnet 3.5、3.6 和 3.7 是最早在编码和工具使用方面展现出令人印象深刻能力的模型。然而最近,代理能力方面最明显的进步出现在我们的 Opus 级别模型中。
Sonnet 5 缩小了这一差距:其性能接近 Opus 4.8,但价格更低。与上一代 Sonnet 4.6 相比,在推理、工具使用、编码和知识工作等代理性能的关键方面有显著提升:
Claude Sonnet 5 基准测试表*Sonnet 5 在多项评估中的得分与 Sonnet 4.6 和 Opus 4.8(作为参考的更具通用能力的模型)的对比。Claude Sonnet 5 系统卡 (https://www.anthropic.com/claude-sonnet-5-system-card) 详细报告了更广泛的评估结果。*
我们的安全评估发现,Sonnet 5 的整体不良行为发生率低于 Sonnet 4.6,并且在代理环境中使用通常更安全。评估还显示,其执行网络安全任务的能力远低于我们当前的 Opus 模型。
从今天起,Claude Sonnet 5 在所有计划中均已可用:它是 Free 和 Pro 计划的默认模型,并且可供 Max、Team 和 Enterprise 用户使用。它还在 Claude Code 和 Claude Platform 上可用,并在该平台推出时提供入门定价:每百万输入 token 2 美元,每百万输出 token 10 美元,有效期至 2026 年 8 月 31 日,之后定价将调整为每百万输入 token 3 美元,每百万输出 token 15 美元。开发者可以通过 Claude API (https://platform.claude.com/docs/en/about-claude/models/overview) 使用 `claude-sonnet-5`。
## 使用 Claude Sonnet 5
下图比较了 Sonnet 5、Sonnet 4.6 和 Opus 4.8 在不同努力程度 (https://platform.claude.com/docs/en/build-with-claude/effort) 下,在代理搜索评估 BrowseComp (https://arxiv.org/abs/2504.12516) 和计算机使用评估 OSWorld-Verified (https://xlang.ai/blog/osworld-verified) 上的表现。Sonnet 5(橙色线)相比 Sonnet 4.6(灰色线)有严格改进。Opus 4.8(黄色线)在这些任务上仍是追求更高准确率的首选模型,但 Sonnet 5 为开发者提供了价格更低、质量远超以往的选择。在 Sonnet 5 和 Opus 4.8 之间,用户可以通过调整努力程度来找到成本和性能之间的平衡。
早期访问合作伙伴的反馈是一致的:Sonnet 5 的代理能力远超前代。测试者描述了它如何完成复杂的任务(而之前的 Sonnet 模型往往半途而废),如何在没有明确要求的情况下检查自己的输出,以及如何以有吸引力的价格完成所有这些代理工作:
> 标志
> Claude Sonnet 5 为我们的代理提供了强大的执行层,用于多步骤软件工程工作。它能在混乱的技术上下文中妥善处理持续的编码、工具使用和调试,并且在需要跟进和技术落地的工作流中尤其有用。
> 标志
> 我们交给 Claude Sonnet 5 一个两部分的工作——更新 Salesforce 账户层级,向企业联系人发送发布公告——它从头到尾完成了。过去这往往会中途卡住。对于日常自动化来说,这简直是不假思索的选择。
> 标志
> Claude Sonnet 5 用更少的步骤完成更多工作。输出质量相同,达到目标的步骤更少。它还能干净且一致地拒绝不安全的请求。在 Lovable,我们正在将强大的工具交到数百万构建者手中。一个知道何时拒绝的模型与知道如何构建的模型同样重要。
> 标志
> 我们针对几十个最具挑战性的真实 Pull Request 测试了 Claude Sonnet 5,它独立完成了每一个,并得到了经过测试和验证的结果——让我们的工程师可以专注于判断、决策和最终签批。
> 标志
> 我让 Claude Sonnet 5 调查一个 bug。它未经提示就编写了一个复现测试,实现了修复,然后将修复暂存以确认没有改变时 bug 会再次出现。全都在一次会话中完成。
> 标志
> 使用 Claude Sonnet 5,代理能按计划行事,遵循我们的约定,并交付干净的多步骤变更,而且成本效率很高。
> 标志
> Claude Sonnet 5 在遗留代码上表现最佳——竞态条件、隐藏测试、没人愿意碰的部分。它能追溯到失败的真正根本原因,并交付持久修复,而不是修补症状。
> 标志
> Claude Sonnet 5 在 Eve 的原告律师任务中处于帕累托前沿。我们在法律研究和分析方面看到了最明显的收益,其性价比使迁移成为轻而易举的选择。
> 标志
> ClickHouse 代理实时探索数据并即时生成洞察,因此在测试新模型时,时间到洞察的速度至关重要。Claude Sonnet 5 以更紧凑的步骤进行推理,让我们的用户明显更快地得到答案。这种速度是客户能够感受到的差异。
> 标志
> 在 Pace,我们的计算机使用代理在运营团队已经使用的系统上运行保险工作流程——提交录入、首损通知、损失报告。Claude Sonnet 5 始终能快速采取正确的行动,这正是真实保险工作所需要的。
## 安全评估
我们的部署前安全评估发现,Sonnet 5 总体上比 Sonnet 4.6 有所改进。在代理安全性方面,该模型在拒绝恶意请求和抵御提示注入攻击中的劫持尝试方面表现更好。模型显示出的幻觉率和谄媚率低于 Sonnet 4.6。在我们的自动化行为审计中(测试了广泛的不对齐行为,如与滥用合作、欺骗等),Sonnet 5 总体上得分较低(即更安全)。然而,与能力更强的 Opus 4.8 和 Claude Mythos Preview 相比,它在此评估中的不对齐行为发生率略高。
不同 Claude 模型的不对齐行为发生率*在我们的自动化行为审计中测试的不对齐行为发生率(该审计测试了多种情境下非常广泛的不良行为,完整列表及每个具体行为的结果请参见 Sonnet 5 系统卡 (https://www.anthropic.com/claude-sonnet-5-system-card) 第 6.4 节)。Sonnet 5 的不对齐行为总体发生率低于 Sonnet 4.6,但高于 Mythos Preview 和 Opus 4.8。*
我们没有刻意在网络安全任务上训练 Sonnet 5。它可以执行一些常规的、无害的网络任务,但在测试潜在危险网络技能(如开发软件漏洞利用)的评估中,其表现远不如 Opus 4.8 和 Mythos 5 等模型。下图显示了其中一项评估的得分,该评估测试了模型为 Firefox 浏览器漏洞开发利用程序的能力。Sonnet 5 从未能开发出完整的可用利用程序,但它在**部分**成功方面的比例略高于 Sonnet 4.6。后者的变化很可能是由于通用智能的改进,而非特定训练。
衡量 Claude 模型为 Firefox 147 软件漏洞开发利用程序成功率的分数*衡量模型为 Firefox 147 软件漏洞开发利用程序成功率的分数(该评估是与 Mozilla 合作 (https://www.anthropic.com/news/mozilla-firefox-security) 开发的;所有漏洞已在 Firefox 148 中修复)。对于每个模型,左侧条形图显示模型(在无防护措施下)开发出可用利用程序的频率;右侧条形图显示模型部分成功的频率。两个 Sonnet 模型均未能成功开发出可用利用程序(均得分为 0.0%);Sonnet 5 的部分成功率略高于 Sonnet 4.6。两个 Sonnet 模型的网络能力均远低于 Opus 4.8 和 Mythos 5。完整详情请参见 Sonnet 5 系统卡 (https://www.anthropic.com/claude-sonnet-5-system-card) 第 3.2.4 节。*
由于 Sonnet 5 在这些任务上比其前代略强,我们已默认启用网络安全防护措施。这些防护措施 (https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude)(能够实时检测并阻止危险的网络使用)与 Claude Opus 4.7 和 4.8 中存在的相同(因为我们认为 Sonnet 5 的整体网络安全风险水平较低,所以防护措施不如与 Fable 5 一起推出时那么严格,后者阻止了更广泛的网络安全任务)。¹
我们对 Sonnet 5 在多项安全和能力评估中的完整评估报告在 Claude Sonnet 5 系统卡 (https://www.anthropic.com/claude-sonnet-5-system-card) 中提供。
## 可用性与定价
Claude Sonnet 5 现已全面可用,入门定价为每百万输入 token 2 美元,每百万输出 token 10 美元,有效期至 2026 年 8 月 31 日。之后将转为标准定价:每百万输入 token 3 美元,每百万输出 token 15 美元。² 我们提高了 Chat、Cowork、Claude Code 和 Claude Platform ³ 的速率限制,以适应更高努力水平下的更高 token 使用量;用户可以根据自己的具体项目选择适当的努力水平。
#### 脚注
¹ Sonnet 5 是网络安全验证计划 (https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude) 的一部分,该计划现已在本机 Claude Platform、AWS 上的 Claude Platform 以及 Microsoft Foundry(托管在 Azure 和 Anthropic)中的 Claude 上可用,并即将在 Google Vertex 中的 Claude 上推出。已加入网络安全验证计划的组织将自动获得对 Sonnet 5 的相同访问权限,无需重新申请。总体而言,对于需要减少护栏的网络安全工作,我们推荐使用 Claude Opus 4.8。
² Sonnet 5 是 Sonnet 4.6 的升级版,但使用了更新的分词器,改变了模型处理文本的方式以提高性能(这与我们在 Claude Opus 4.7 中引入的分词器更改类似)。代价是相同的输入可能映射到更多的 token:大致为 1.0–1.35 倍,具体取决于内容类型。入门定价的设置使得向 Sonnet 5 的过渡大致成本中性。
³ 2026 年 4 月 26 日,我们提高了每个使用层级的 Sonnet 和 Haiku 速率限制,并在本机 Claude Platform 上简化为三个层级(Start、Build 和 Scale)。您可以在 Claude Console (https://platform.claude.com/settings/limits) 查看您的层级和当前限制,或阅读文档 (https://platform.claude.com/docs/en/api/rate-limits) 了解更多信息。
- **人类最后的考试:** 我们更新了人类最后考试的评分模型,并将 Sonnet 4.6 的分数更新为 34.6%(无工具)和 46.8%(有工具)。这是其分数与 Sonnet 4.6 发布博客 (https://www.anthropic.com/news/claude-sonnet-4-6) 中报告分数不同的原因。
- **OSWorld-Verified:** 我们对 OSWorld-Verified 评估的运行方式进行了更改,以更准确地反映模型在现实世界中的表现,并将 Sonnet 4.6 的分数更新为 78.5%。这是其分数与 Sonnet 4.6 发布博客 (https://www.anthropic.com/news/claude-sonnet-4-6) 中报告分数不同的原因。
## 相关内容
### Claude Science,面向科学家的人工智能工作台,现已可用
Claude Science 是一个可定制的应用程序,集成了研究人员最常用的工具和软件包,可生成可审计的工件,并提供灵活的计算资源访问。
阅读更多 (https://www.anthropic.com/news/claude-science-ai-workbench)
### 介绍 Claude Tag
Claude Tag 是团队与 Claude 协作的一种新方式。
阅读更多 (https://www.anthropic.com/news/introducing-claude-tag)
### Anthropic 开设首尔办事处,并宣布与韩国 AI 生态系统的新合作伙伴关系
阅读更多 (https://www.anthropic.com/news/seoul-office-partnerships-korean-ai-ecosystem)
相似文章
Claude Sonnet 5 发布
Anthropic 宣布发布全新 AI 模型 Claude Sonnet 5。
Anthropic发布Claude Sonnet 5,以更低成本运行AI代理
Anthropic发布了Claude Sonnet 5,这是一款更强大、更具成本效益的智能代理模型,与OpenAI的GPT-5.6 Sol和Google的Gemini 3.5 Flash竞争,提供更强的自主性和更低的价格。
推出 Claude Opus 5
Anthropic 宣布推出 Claude Opus 5,这是一款强大且经济高效的 AI 模型,其智能水平接近 Claude Fable 5,但价格仅为后者的一半,在编程和知识工作基准测试中取得了最先进的结果。
Anthropic 发布 Claude Sonnet 5,最具代理能力的 Sonnet 模型,定价每百万 tokens $2/$10,有效期至八月
Anthropic 发布了 Claude Sonnet 5,这是迄今为止能力最强的 Sonnet 模型,具备改进的推理、编码和工具使用能力,并减少了幻觉现象。定价为每百万 tokens $2/$10,有效期至八月。
Claude Sonnet 5 的新特性
Anthropic 发布了 Claude Sonnet 5,该模型性能接近 Opus 4.8,价格更低,但采用了新的分词器,使得英文和代码的 token 数量增加约 30%,从而实际上提高了成本。