@VictorKaiWang1:在 Terminal Bench 2.1 上达到 95.3%,DeepSeek V4 Flash + StateM,在 TB2.1 上为 88.8%
摘要
研究人员使用 DeepSeek V4 Flash 和 StateM 在 Terminal-Bench 2.1 上达到了 95.3% 的准确率,匹配了 GPT-5.6 Sol Max 的性能,并探索了超越模型扩展的智能体改进。
查看缓存全文
缓存时间: 2026/08/18 08:28
在Terminal Bench 2.1上达到95.3%的准确率
Deepseek V4 Flash + StateM,于TB2.1上获得88.8%的成绩
秦子恒 (@henryqin1997):
模型规模化是否是智能体改进的唯一路径?我们 @henryqin1997 @YaxinLu1997 @VITAGroupUT @VictorKaiWang1 很高兴分享我们的工作:我们通过(采用DeepSeek-v4-Flash达到88.8%,与GPT-5.6 Sol Max持平)$15前沿方案(Frontier Run)在Terminal-Bench 2.1上实现了95.3%的原始准确率。
相似文章
DeepSeek V4.1 Flash 正在令人惊讶地接近 GPT-5.6 Sol 的领域,同时价格低得离谱
DeepSeek 发布了 V4.1 Flash,一个 552B MoE 模型,具有高效的活动参数,性能接近 GPT-5.6 Sol,而成本却低得多。
DeepSeek v4 Flash 能力显著提升
DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。
DeepSeek V4 Pro 在精确度上击败 GPT-5.5 Pro
据报道,DeepSeek V4 Pro 在精确度上优于 GPT-5.5 Pro,这标志着模型准确性方面的重大进步。
新版DeepSeek V4-Flash在ArtificalAnalysis Index上取得50分,比GLM-5.2和GPT-5.6 Luna低1分
DeepSeek的新V4-Flash模型在ArtificalAnalysis Index上得分为50,仅比GLM-5.2和GPT-5.6 Luna低1分。
@ArizePhoenix: 结果:在内部Code Bench上相比5.2提升了50%,Terminal-Bench 3.0从4.6提升到28.3,DeepSWE v1.1 从…
DeepSWE v1.1在内部Code Bench上提升了50%,并在Terminal-Bench 3.0和Agents' Last Exam上取得了新的SOTA成绩,同时新兴的网络能力发展超出预期。