sonnet

标签

Cards List
#sonnet

May 2025 Sonnet 在 LiveBench 的编程评分上仍然击败 Sonnet 5。在代理编码上它落后 27 分。那么区别在哪里?

Reddit r/AI_Agents · 2026-07-09

May 2025 Sonnet 在 LiveBench 的通用编程评分上击败了 Sonnet 5,但在代理编码上落后 27 分,凸显了基准测试表现的差异。

0 人收藏 0 人点赞
#sonnet

Fable就是Opus,Opus就是Sonnet,等等?

Reddit r/AI_Agents · 2026-07-07

暗示Anthropic的Fable模型等同于Opus,而Opus等同于Sonnet,可能表明模型层级进行了品牌重塑或重组。

0 人收藏 0 人点赞
#sonnet

@FinanceYF5: 用 Fable 5 做编排器,再用 Opus + Codex 执行任务,可以节省 Fable 的使用量: Fable 5(最高推理强度)= 编排器 Opus = 深度推理子代理 Sonnet = 机械执行子代理 Codex = 同级资深工…

X AI KOLs Following · 2026-07-07 缓存

介绍使用Fable 5作为编排器,搭配Opus和Codex模型执行任务以节省Fable使用量的配置方法,包括在Claude Code中的具体设置。

0 人收藏 0 人点赞
#sonnet

@Jiaxi_Cui: 如果你完整看了论文,会注意到外界关注很高的 Karpathy 并不在 author list 中,因为这是一篇 Sonnet4.5 时期就完成的工作 如果三个月前任何研究员知道了他们内部是这样的进展,别说是反华了,就算 Anthropic…

X AI KOLs Timeline · 2026-07-07 缓存

该推文讨论了Anthropic关于语言模型中全局工作空间的新研究,指出Karpathy不在作者列表中,并强调该工作完成于Sonnet 4.5时期,批评外界简单将其视为炒作。

0 人收藏 0 人点赞
#sonnet

@Saccc_c: 这个是真牛逼和有意思 Claude 模型手动换挡器,可以在Fable、Opus和 Sonnet之间自由切换了

X AI KOLs Following · 2026-07-05 缓存

介绍了一个第三方工具,可以在Claude的Fable、Opus和Sonnet模型之间手动切换,提升了使用的灵活性。

0 人收藏 0 人点赞
#sonnet

@_xjdr:为了更好地理解开源与前沿之间的差距,我发现把DSV4-flash看作是Sonnet级别的模型(与Sonnet 5对比)、GLM 5.2看作是Opus级别的模型(与Opus 4.8对比)会很有帮助。目前还没有Fable级别的模型(我预计到年底会出现至少一个)。

X AI KOLs Timeline · 2026-07-02

讨论开源模型级别,将DSV4-flash比作Sonnet 5,GLM 5.2比作Opus 4.8,并预测年底前会出现Fable级别的模型。

0 人收藏 0 人点赞
#sonnet

@kevinwhinnery: 关于这个话题还有更多内容 - Fable Sonnet.

X AI KOLs Timeline · 2026-07-01 缓存

Kevin Whinnery 预告了 Fable 和 Sonnet 即将进行的整合,Brad Abrams 指出 Fable 回归,并暗示 Sonnet 5 处理循环,而 Fable 负责困难调用。

0 人收藏 0 人点赞
#sonnet

@joelniklaus: 关于框架优化的新博客文章。我们以成本降低 7 倍达到了 Sonnet 4.6 的性能。Fable 5 是第一个……

X AI KOLs Following · 2026-07-01 缓存

一篇博客文章描述了自动框架优化如何使 DeepSeek V4 Pro 在法律代理基准测试上以七分之一的成本达到 Sonnet 4.6 的性能。

0 人收藏 0 人点赞
#sonnet

Claude Sonnet 5 基准测试

Reddit r/singularity · 2026-06-30

Anthropic的Claude Sonnet 5模型基准测试已发布,显示出性能提升。

0 人收藏 0 人点赞
#sonnet

视角:你刚在Claude选择器里找到了Sonnet 6,但依然没有Fable 5回归

X AI KOLs Following · 2026-06-21 缓存

有泄露消息称,Anthropic的Claude Sonnet 5模型将于下周发布,因为该模型已出现在一家合作伙伴供应商上,其slug通常比旗舰发布提前5-7天。

0 人收藏 0 人点赞
#sonnet

Gemma4_31b_fp8 在我自己的评测框架中与 Sonnet_4.6_medium 持平。

Reddit r/LocalLLaMA · 2026-06-08

一位用户报告称,Gemma4_31b 在 FP8 精度下,于自定义评测框架中与 Sonnet_4.6_medium 相当或持平,涉及任务包括 Cypher 查询生成、实体抽取、智能体工具调用、代码编写以及多向量检索合成。

0 人收藏 0 人点赞
#sonnet

@nick_kango: 再加一个任务到我的推特基准测试集合里:) 对了,Opus 4.8 和所有 SOTA 模型都通过了,但我试的时候 Sonnet 4.6 和 Grok 4.3 没有通过…

X AI KOLs Timeline · 2026-05-30 缓存

Nick Kang 给他的推特基准测试集合新增了一个任务;Claude Opus 4.8 和其他 SOTA 模型通过了,而 Sonnet 4.6 和 Grok 4.3 失败了。Alfin 评论了 Opus 4.8 的危险能力。

0 人收藏 0 人点赞
#sonnet

@bcherny: 人们经常问我,充分利用 Claude Code 的最大秘诀是什么。现在我最重要的建议就是:使用自动模式…

X AI KOLs Following · 2026-05-24 缓存

Boris Cherny 推荐在 Claude Code 中使用自动模式来并行执行会话,同时 ClaudeDevs 宣布自动模式现已面向 Pro 计划用户开放,并支持 Sonnet 4.6 和 Opus 4.7。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈