DeepSeek V4.1 Flash 在 AA 的新基准测试中超越 Astra

Reddit r/LocalLLaMA 新闻

摘要

AA 在 Intelligence Index v4.3 更新中引入了新基准测试,DeepSeek V4.1 Flash 超越 Astra 夺得第一。

https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3 AA 上周作为 Intelligence Index v4.3 更新的一部分推出了新的基准测试——一个全新的私人评估,取代了 τ³。Astra 在其中获得了大量积分,并用这些积分与 Fable 打平,但……看起来我们有了新的王者。因此,他们在三天内两次修改了指数,使 Astra 看起来不比 Fable 差太多,随后一个匿名人士悄悄登顶。
查看原文

相似文章

DeepSeek V4 Flash 0731

Hacker News Top

DeepSeek V4 Flash 0731 展示了其在 ARC-AGI 基准上的结果,突显了 AI 模型在抽象推理方面的进展。

DeepSeek v4 Flash 能力显著提升

Reddit r/LocalLLaMA

DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。