DeepSeek v4 Flash 能力显著提升

Reddit r/LocalLLaMA 模型

摘要

DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。

DeepSeek V4 Flash:预览版 → 2026-07-31 基准测试 预览版 0731 差值 Terminal Bench* 56.9 82.7 +25.8 Toolathlon 51.8 70.3 +18.5 NL2Repo — 54.2 新增 Cybergym — 76.7 新增 DeepSWE — 54.4 新增 Agent Last Exam — 25.2 新增 Automation Bench — 25.1 新增 DSBench-FullStack — 68.7 新增 DSBench-Hard — 59.6 新增 * Terminal Bench 已从 v2.0 → v2.1,因此这一提升并非严格的可比比较。 与 GPT-5.6 Terra 对比 基准测试 GPT-5.6 Terra DeepSeek V4 Flash 优势 Terminal Bench 78.4 82.7 Flash(+4.3) Toolathlon 53.1 70.3 Flash(+17.2) DeepSWE 69.6 54.4 Terra(+15.2) Agents' Last Exam 50.4 25.2 Terra(+25.2) 双方互有胜负,但没有明显赢家……非常有趣! 来源:https://api-docs.deepseek.com/updates/
查看原文

相似文章