@VictorKaiWang1:在 Terminal Bench 2.1 上达到 95.3%,DeepSeek V4 Flash + StateM,在 TB2.1 上为 88.8%

X AI KOLs Timeline 论文

摘要

研究人员使用 DeepSeek V4 Flash 和 StateM 在 Terminal-Bench 2.1 上达到了 95.3% 的准确率,匹配了 GPT-5.6 Sol Max 的性能,并探索了超越模型扩展的智能体改进。

在 Terminal Bench 2.1 上达到 95.3% DeepSeek V4 Flash + StateM,在 TB2.1 上为 88.8%
查看原文
查看缓存全文

缓存时间: 2026/08/18 08:28

在Terminal Bench 2.1上达到95.3%的准确率
Deepseek V4 Flash + StateM,于TB2.1上获得88.8%的成绩

秦子恒 (@henryqin1997):
模型规模化是否是智能体改进的唯一路径?

我们 @henryqin1997 @YaxinLu1997 @VITAGroupUT @VictorKaiWang1 很高兴分享我们的工作:我们通过(采用DeepSeek-v4-Flash达到88.8%,与GPT-5.6 Sol Max持平)$15前沿方案(Frontier Run)在Terminal-Bench 2.1上实现了95.3%的原始准确率。

相似文章

DeepSeek v4 Flash 能力显著提升

Reddit r/LocalLLaMA

DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。