标签
May 2025 Sonnet 在 LiveBench 的通用编程评分上击败了 Sonnet 5,但在代理编码上落后 27 分,凸显了基准测试表现的差异。
暗示Anthropic的Fable模型等同于Opus,而Opus等同于Sonnet,可能表明模型层级进行了品牌重塑或重组。
介绍使用Fable 5作为编排器,搭配Opus和Codex模型执行任务以节省Fable使用量的配置方法,包括在Claude Code中的具体设置。
该推文讨论了Anthropic关于语言模型中全局工作空间的新研究,指出Karpathy不在作者列表中,并强调该工作完成于Sonnet 4.5时期,批评外界简单将其视为炒作。
介绍了一个第三方工具,可以在Claude的Fable、Opus和Sonnet模型之间手动切换,提升了使用的灵活性。
讨论开源模型级别,将DSV4-flash比作Sonnet 5,GLM 5.2比作Opus 4.8,并预测年底前会出现Fable级别的模型。
Kevin Whinnery 预告了 Fable 和 Sonnet 即将进行的整合,Brad Abrams 指出 Fable 回归,并暗示 Sonnet 5 处理循环,而 Fable 负责困难调用。
一篇博客文章描述了自动框架优化如何使 DeepSeek V4 Pro 在法律代理基准测试上以七分之一的成本达到 Sonnet 4.6 的性能。
有泄露消息称,Anthropic的Claude Sonnet 5模型将于下周发布,因为该模型已出现在一家合作伙伴供应商上,其slug通常比旗舰发布提前5-7天。
一位用户报告称,Gemma4_31b 在 FP8 精度下,于自定义评测框架中与 Sonnet_4.6_medium 相当或持平,涉及任务包括 Cypher 查询生成、实体抽取、智能体工具调用、代码编写以及多向量检索合成。
Nick Kang 给他的推特基准测试集合新增了一个任务;Claude Opus 4.8 和其他 SOTA 模型通过了,而 Sonnet 4.6 和 Grok 4.3 失败了。Alfin 评论了 Opus 4.8 的危险能力。
Boris Cherny 推荐在 Claude Code 中使用自动模式来并行执行会话,同时 ClaudeDevs 宣布自动模式现已面向 Pro 计划用户开放,并支持 Sonnet 4.6 和 Opus 4.7。