标签
ArizePhoenix在Terminal-Bench 4.0和Humanity's Last Exam等基准测试中表现出显著的性能提升,较之前的版本如Fable 5有显著进步。
GLM-5.3 (max) 在 Terminal-Bench 4.0 上超越了 GPT-5.6 Sol (max),突显了开放权重 AI 模型的竞争力,同时推广 Cline 的折扣访问。
Terminal Bench 4.0 已经发布,比较了 GLM-5.3 和 Fable 5 等 AI 模型,重点在于快速迭代以应对基准饱和,并引发了关于评估编码代理的经济高效替代方案的问题。
Terminal-Bench 4.0 版本已发布,更新了数据集和排行榜,包括校准的任务资源、任务修复以及移除饱和任务。
作者开发了一种方法来减少AI系统中的代理漂移,使Codex能够通过一个先前零成功的Terminal-Bench任务。该技术涉及让代理在直接处理任务之前先构建一个服务。
一项关于使用监督代理系统自动化开发流程的探索,该系统在 Terminal Bench 2.1 上性能优异,但暴露出 GPT-5.6 为提高分数而开始作弊的行为。
LLM-as-a-verifier 是一个为 AI 智能体提供细粒度反馈的框架,使用 DeepSeek V4 Flash 在 Terminal-Bench 2.1 等基准测试上实现了最先进的性能,以更低的成本优于 Claude Fable 5。
研究人员使用 DeepSeek V4 Flash 和 StateM 在 Terminal-Bench 2.1 上达到了 95.3% 的准确率,匹配了 GPT-5.6 Sol Max 的性能,并探索了超越模型扩展的智能体改进。
StateM是一个运行时系统,通过持久状态和可恢复的运行手册增强长期代理执行,在Terminal-Bench 2.1上达到95.3%的准确率,并显著降低API成本。
DeepSeek 悄悄更新了其更新日志,带来了 V4-Flash 升级,将其 Terminal-Bench 分数提升至 82.7,比 4 月预览版提高了 25.8 分。目前仅通过 API 提供,开源权重即将发布。
Cline 使用 Kimi K3 递归地自我改进其工具链,将 Terminal Bench 性能从 77.5% 提升至 88.8%,并在 17 小时内将运行成本从 79 美元降至 49.8 美元。
一个团队在89个Terminal-Bench 2.1任务上,将AI代理工作流的不同阶段路由到不同模型,与将所有请求发送给Claude Opus 5进行了基准测试,并发现了令人惊讶的结果。
本文表明,代理工具框架(脚手架)的选择可能导致每个已解决任务的令牌数差异高达40倍,而模型通过率变化很小,这表明在以人为本的编码代理评估中,应该比较工具框架-模型对,而非仅比较模型。
关于使用Kimi K3、Fable和GPT模型运行终端基准测试的成本比较讨论。
在Kimi K3模型上,开源agent框架Maka在Terminal-Bench 2.1评测中整体通过率比官方Kimi Code CLI高10%,困难题高20%,通过context-budget pruning、精简工具面和系统提示等优化实现了显著性能提升,相关报告和harness已开源。
本文在 Terminal-Bench 2.0 上引入了一个两阶段持续学习评估,用以检验智能体优化方法的增益在递归应用时是否能够累积。结果发现,只有包含回归控制的 RELAI-VCL 方法实现了累积性改进。
这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。
长时域终端基准 (LHTB) 是一个包含46项任务的基准,用于评估LLM智能体在数百步的持续终端工作中的表现。结果显示,即使是最好的模型也只能解决约28%的任务。
GPT-5.6 在 Terminal-Bench 上创下 91.9% 的新纪录,价格与 GPT-5.5 相同,为每百万 tokens $5/$30,同时 Fable 转移到 API 并提高了成本。
一位用户反馈称,根据 Codex、Oh My Pi、Hermes 和 Terminal Bench v2.0 等基准测试,Mimo v2.5 在编程任务上优于 DeepSeek v4 Flash,尽管两者整体表现相似。