@_xjdr:为了更好地理解开源与前沿之间的差距,我发现把DSV4-flash看作是Sonnet级别的模型(与Sonnet 5对比)、GLM 5.2看作是Opus级别的模型(与Opus 4.8对比)会很有帮助。目前还没有Fable级别的模型(我预计到年底会出现至少一个)。
摘要
讨论开源模型级别,将DSV4-flash比作Sonnet 5,GLM 5.2比作Opus 4.8,并预测年底前会出现Fable级别的模型。
为了更好地理解开源与前沿之间的差距,我发现把DSV4-flash看作是Sonnet级别的模型(与Sonnet 5对比)、GLM 5.2看作是Opus级别的模型(与Opus 4.8对比)会很有帮助。目前还没有Fable级别的模型(我预计到年底会出现至少一个)。
相似文章
@andrewchen:说实话,DSV4 Flash 0731 对比 Opus 4.6 真是太不可思议了:
Andrew Chen 分享了在双 NVIDIA DGX Sparks 上测试 DeepSeek V4 Flash 0731 并与 Opus 4.6 进行比较的兴奋之情。
随着Deepseek V4的发布,我想看看模型规模随时间的变化趋势。开源模型正不断变得更小、更强。按照这一趋势,到明年这个时候,我们很可能就能在消费级笔记本电脑上运行Opus 4.5级别的模型(听起来不太可能?!)。
作者在Deepseek V4 Flash发布后分析了模型规模与性能的趋势,指出开源模型在体积缩小的同时性能不断提升,并预测一年内Opus 4.5级别的模型有望在消费级笔记本上运行。
Claude Sonnet 5 已发布,与 Opus 4.8 的差距比我预想的要小
Anthropic 发布了 Claude Sonnet 5,其基准测试得分非常接近 Opus 4.8,但价格大幅降低,使其成为代理任务的诱人选择,尽管可能存在实际差距。
@FuckAnthropic: 做了对比分析,综合看,DeepSeek V4 Flash-0731 大致是一个 Opus 4.7 - 4.8 之间水平的模型,以极小激活规模进入了前沿 Agent 模型竞争区间,用约 1/12~1/60 的 token 成本进入前沿 Ag…
作者对比分析认为,DeepSeek V4 Flash-0731 在极小激活规模下达到 Opus 4.7-4.8 水平,以极低 token 成本进入前沿 Agent 模型区间,整体超越 GLM-5.2,但短板仍是困难仓库级编程和长时程工程。
@danshipper: 这不对,这是同一个模型。但它会稍微更多地回退到 Opud 4.8,所以基准测试测量的是...
Dan Shipper 认为 Fable 5 模型并没有被削弱,而是更频繁地回退到 Opus 4.8,导致基准测试结果混杂,这与声称严重退化的说法相反。