@rohanpaul_ai: Claude Sonnet 5.5 已发布,在 Terminal-Bench 4.0 上得分 70.6%,相比 Sonnet 5 的 10.3% 有所提升,价格保持不变。更多…

X AI KOLs Following 模型

摘要

Anthropic 发布了 Claude Sonnet 5.5,与 Sonnet 5 相比,在基准分数、成本效率和速度方面都有重大改进,在 Terminal-Bench 4.0 上得分 70.6%。

Claude Sonnet 5.5 已发布,在 Terminal-Bench 4.0 上得分 70.6%,相比 Sonnet 5 的 10.3% 有所提升,价格保持不变。 总体而言,由于速度更快和工具调用更少,每项任务成本降低 30%。 保持 Sonnet 5 的每百万输入/输出 token $2/$10 费率,是 Opus 5.5 费率的一半。 其节省来自每项任务完成的工作更少,因为 Anthropic 表示更少的 token 和工具调用可将任务总成本降低多达 30%。 输出速度也比 Sonnet 5 快 30% 以上,使 Sonnet 5.5 成为 Anthropic 迄今为止最快的 Sonnet。 用户可以调整努力程度设置,以更高的任务成本换取更长的推理和更多的自我检查。 经济性可能比排行榜更重要。在 Low 或 Medium 努力程度下运行的 Sonnet 5.5,能够以大约每项任务十分之一的成本超过 Sonnet 5 的最高分。在 FrontierCode 上,它说在 High 努力程度下,Sonnet 5.5 的得分比 Sonnet 5 在相同设置下高出约 10 分,同时成本大约只有其十五分之一。 Anthropic 将 Sonnet 5.5 描述为适合相对明确的日常工作,例如软件调试、编码、文档制作、构建演示文稿和电子表格,以及设计或优化界面。
查看原文
查看缓存全文

缓存时间: 2026/09/29 05:42

Claude Sonnet 5.5 已发布,其在 Terminal-Bench 4.0 上得分 70.6%,较 Sonnet 5 的 10.3% 显著提升,且价格保持不变。

整体而言,由于运行速度更快且所需工具调用减少,每任务成本降低了 30%。

该模型延续了 Sonnet 5 的定价:每百万输入/输出 token 分别收费 2 美元/10 美元,仅为 Opus 5.5 价格的一半。

其节省成本的关键在于减少了单次任务所需的工作量——Anthropic 表示,通过减少 token 数量和工具调用,单任务总成本可降低高达 30%。

输出速度也比 Sonnet 5 提升超过 30%,使 Sonnet 5.5 成为 Anthropic 迄今为止最快的 Sonnet 模型。

用户可调节“工作模式“设置,通过延长推理时间与增加自检步骤来提升任务质量,但单任务成本也会相应增加。

性能榜单背后的经济效益或许更值得关注:在低或中等工作模式下,Sonnet 5.5 能以约十分之一的成本超越 Sonnet 5 的最高分。在 FrontierCode 基准测试中,高工作模式下的 Sonnet 5.5 得分比同设置下的 Sonnet 5 高出约 10 分,而单任务成本仅为后者的十五分之一左右。

Anthropic 将 Sonnet 5.5 定位为适合定义明确的常规任务,例如软件调试、编程、文档制作、创建演示文稿与电子表格,以及设计或优化用户界面。

Claude (@claudeai): 推出 Claude Sonnet 5.5,Claude 5.5 系列的第二款模型。

相较于 Sonnet 5 实现显著升级,运行速度提升超 30%,且多数任务成本降低高达 30%。

相似文章

Claude Sonnet 5 的新特性

Simon Willison's Blog

Anthropic 发布了 Claude Sonnet 5,该模型性能接近 Opus 4.8,价格更低,但采用了新的分词器,使得英文和代码的 token 数量增加约 30%,从而实际上提高了成本。