标签
本文比较了 AI 模型 Gemini 3.7 flash、Sonnet 5 和 Cursor 在基于 React 的黑洞模拟代码生成任务上的表现,强调了它们的输出并详细说明了模拟的科学特性。
一款开源税务引擎在TaxCalcBench上达到96%,超越了之前的模型,并发现了基准测试本身的不一致性。它为AI模型提供了确定性引擎,可用于税务研究和准备。
Anthropic 已将 Claude 的语音模式扩展至其 Opus 和 Sonnet 模型,支持复杂问题解决和实时操作,并提供法语、德语、西班牙语、印地语、印尼语、意大利语、日语、韩语和葡萄牙语等多语言支持。
May 2025 Sonnet 在 LiveBench 的通用编程评分上击败了 Sonnet 5,但在代理编码上落后 27 分,凸显了基准测试表现的差异。
暗示Anthropic的Fable模型等同于Opus,而Opus等同于Sonnet,可能表明模型层级进行了品牌重塑或重组。
介绍使用Fable 5作为编排器,搭配Opus和Codex模型执行任务以节省Fable使用量的配置方法,包括在Claude Code中的具体设置。
该推文讨论了Anthropic关于语言模型中全局工作空间的新研究,指出Karpathy不在作者列表中,并强调该工作完成于Sonnet 4.5时期,批评外界简单将其视为炒作。
介绍了一个第三方工具,可以在Claude的Fable、Opus和Sonnet模型之间手动切换,提升了使用的灵活性。
讨论开源模型级别,将DSV4-flash比作Sonnet 5,GLM 5.2比作Opus 4.8,并预测年底前会出现Fable级别的模型。
Kevin Whinnery 预告了 Fable 和 Sonnet 即将进行的整合,Brad Abrams 指出 Fable 回归,并暗示 Sonnet 5 处理循环,而 Fable 负责困难调用。
一篇博客文章描述了自动框架优化如何使 DeepSeek V4 Pro 在法律代理基准测试上以七分之一的成本达到 Sonnet 4.6 的性能。
有泄露消息称,Anthropic的Claude Sonnet 5模型将于下周发布,因为该模型已出现在一家合作伙伴供应商上,其slug通常比旗舰发布提前5-7天。
一位用户报告称,Gemma4_31b 在 FP8 精度下,于自定义评测框架中与 Sonnet_4.6_medium 相当或持平,涉及任务包括 Cypher 查询生成、实体抽取、智能体工具调用、代码编写以及多向量检索合成。
Nick Kang 给他的推特基准测试集合新增了一个任务;Claude Opus 4.8 和其他 SOTA 模型通过了,而 Sonnet 4.6 和 Grok 4.3 失败了。Alfin 评论了 Opus 4.8 的危险能力。
Boris Cherny 推荐在 Claude Code 中使用自动模式来并行执行会话,同时 ClaudeDevs 宣布自动模式现已面向 Pro 计划用户开放,并支持 Sonnet 4.6 和 Opus 4.7。