@rohanpaul_ai: Claude Sonnet 5.5 已发布,在 Terminal-Bench 4.0 上得分 70.6%,相比 Sonnet 5 的 10.3% 有所提升,价格保持不变。更多…
摘要
Anthropic 发布了 Claude Sonnet 5.5,与 Sonnet 5 相比,在基准分数、成本效率和速度方面都有重大改进,在 Terminal-Bench 4.0 上得分 70.6%。
查看缓存全文
缓存时间: 2026/09/29 05:42
Claude Sonnet 5.5 已发布,其在 Terminal-Bench 4.0 上得分 70.6%,较 Sonnet 5 的 10.3% 显著提升,且价格保持不变。
整体而言,由于运行速度更快且所需工具调用减少,每任务成本降低了 30%。
该模型延续了 Sonnet 5 的定价:每百万输入/输出 token 分别收费 2 美元/10 美元,仅为 Opus 5.5 价格的一半。
其节省成本的关键在于减少了单次任务所需的工作量——Anthropic 表示,通过减少 token 数量和工具调用,单任务总成本可降低高达 30%。
输出速度也比 Sonnet 5 提升超过 30%,使 Sonnet 5.5 成为 Anthropic 迄今为止最快的 Sonnet 模型。
用户可调节“工作模式“设置,通过延长推理时间与增加自检步骤来提升任务质量,但单任务成本也会相应增加。
性能榜单背后的经济效益或许更值得关注:在低或中等工作模式下,Sonnet 5.5 能以约十分之一的成本超越 Sonnet 5 的最高分。在 FrontierCode 基准测试中,高工作模式下的 Sonnet 5.5 得分比同设置下的 Sonnet 5 高出约 10 分,而单任务成本仅为后者的十五分之一左右。
Anthropic 将 Sonnet 5.5 定位为适合定义明确的常规任务,例如软件调试、编程、文档制作、创建演示文稿与电子表格,以及设计或优化用户界面。
Claude (@claudeai): 推出 Claude Sonnet 5.5,Claude 5.5 系列的第二款模型。
相较于 Sonnet 5 实现显著升级,运行速度提升超 30%,且多数任务成本降低高达 30%。
相似文章
@bcherny: Sonnet 5.5 修复了 Claude Code 中的一个bug。速度提升30%,使用量减少30%。
Claude发布了Sonnet 5.5,这是对Sonnet 5的更快、更经济的升级,修复了Claude Code中的一个bug。
Claude Sonnet 5 人工分析结果与对比
提供对 Claude Sonnet 5 在各项基准测试中的性能分析和比较。
Claude Sonnet 5 的新特性
Anthropic 发布了 Claude Sonnet 5,该模型性能接近 Opus 4.8,价格更低,但采用了新的分词器,使得英文和代码的 token 数量增加约 30%,从而实际上提高了成本。
Claude Sonnet 5 已发布,与 Opus 4.8 的差距比我预想的要小
Anthropic 发布了 Claude Sonnet 5,其基准测试得分非常接近 Opus 4.8,但价格大幅降低,使其成为代理任务的诱人选择,尽管可能存在实际差距。
Claude Sonnet 5 基准测试
Anthropic的Claude Sonnet 5模型基准测试已发布,显示出性能提升。