DeepSeek V4.1 Flash 在 AA 的新基准测试中超越 Astra
摘要
AA 在 Intelligence Index v4.3 更新中引入了新基准测试,DeepSeek V4.1 Flash 超越 Astra 夺得第一。
https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3 AA 上周作为 Intelligence Index v4.3 更新的一部分推出了新的基准测试——一个全新的私人评估,取代了 τ³。Astra 在其中获得了大量积分,并用这些积分与 Fable 打平,但……看起来我们有了新的王者。因此,他们在三天内两次修改了指数,使 Astra 看起来不比 Fable 差太多,随后一个匿名人士悄悄登顶。
相似文章
Deepseek v4.1 Flash 在 OpenDesign Arena 上以 1.4% 的成本达到 Astra 得分的 98%
据 OpenDesign Arena 基准测试报告,DeepSeek V4.1 Flash 以仅 1.4% 的成本达到了 GPT-6 Astra 设计分数的 98%。
DeepSeek-V4-Flash-0731 在基准测试中现已大幅超越 DeepSeek-V4-Pro-Preview
DeepSeek 的新 V4-Flash-0731 模型在基准测试中的表现现已远远优于 V4-Pro-Preview,标志着该模型系列取得了显著进步。
DeepSeek V4 Flash 0731
DeepSeek V4 Flash 0731 展示了其在 ARC-AGI 基准上的结果,突显了 AI 模型在抽象推理方面的进展。
DeepSeek v4 Flash 能力显著提升
DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。
DeepSeek V4 Flash 搭配 Antirez Dwarfstar 4 表现惊人
本文强调了在高内存Mac上使用DeepSeek V4 Flash搭配Antirez Dwarfstar 4的出色性能,指出其超越其他AI模型,并减少了对更大系统的需求。