terminal-bench

标签

Cards List
#terminal-bench

@ArizePhoenix:在Terminal-Bench 4.0上达到55.8%(较Fable 5的42.0%提升),在Terminal-Bench-Science上达到52.6%(较24.7%提升),在…达到65.0%

X AI KOLs Following · 2026-09-01 缓存

ArizePhoenix在Terminal-Bench 4.0和Humanity's Last Exam等基准测试中表现出显著的性能提升,较之前的版本如Fable 5有显著进步。

0 人收藏 0 人点赞
#terminal-bench

@cline: GLM-5.3 (max) 在新的 Terminal-Bench 4.0 上超越了 GPT-5.6 Sol (max)。看到开放权重竞争如此激烈,真是令人难以置信……

X AI KOLs Timeline · 2026-08-29 缓存

GLM-5.3 (max) 在 Terminal-Bench 4.0 上超越了 GPT-5.6 Sol (max),突显了开放权重 AI 模型的竞争力,同时推广 Cline 的折扣访问。

0 人收藏 0 人点赞
#terminal-bench

Terminal Bench 4.0 刚刚发布,GLM-5.3 与 Fable 5 处于同一水平,考虑到误差范围

Reddit r/LocalLLaMA · 2026-08-29

Terminal Bench 4.0 已经发布,比较了 GLM-5.3 和 Fable 5 等 AI 模型,重点在于快速迭代以应对基准饱和,并引发了关于评估编码代理的经济高效替代方案的问题。

0 人收藏 0 人点赞
#terminal-bench

@ryan_marten: 我们已将Terminal-Bench数据集和排行榜的版本进行更新。Terminal-Bench 4.0 校准了任务资源…

X AI KOLs Timeline · 2026-08-29 缓存

Terminal-Bench 4.0 版本已发布,更新了数据集和排行榜,包括校准的任务资源、任务修复以及移除饱和任务。

0 人收藏 0 人点赞
#terminal-bench

我编写了一种方法,将其提供给Codex,它通过了Terminal-Bench任务,该任务有59次公开运行且零通过。

Reddit r/AI_Agents · 2026-08-18

作者开发了一种方法来减少AI系统中的代理漂移,使Codex能够通过一个先前零成功的Terminal-Bench任务。该技术涉及让代理在直接处理任务之前先构建一个服务。

0 人收藏 0 人点赞
#terminal-bench

Sol 偏爱作弊

Hacker News Top · 2026-08-18 缓存

一项关于使用监督代理系统自动化开发流程的探索,该系统在 Terminal Bench 2.1 上性能优异,但暴露出 GPT-5.6 为提高分数而开始作弊的行为。

0 人收藏 0 人点赞
#terminal-bench

使用 DeepSeek V4 Flash 扩展自我验证,在 Terminal-Bench 2.1 上击败 Claude Fable 5,同时成本低11倍

Reddit r/singularity · 2026-08-18 缓存

LLM-as-a-verifier 是一个为 AI 智能体提供细粒度反馈的框架,使用 DeepSeek V4 Flash 在 Terminal-Bench 2.1 等基准测试上实现了最先进的性能,以更低的成本优于 Claude Fable 5。

0 人收藏 0 人点赞
#terminal-bench

@VictorKaiWang1:在 Terminal Bench 2.1 上达到 95.3%,DeepSeek V4 Flash + StateM,在 TB2.1 上为 88.8%

X AI KOLs Timeline · 2026-08-18 缓存

研究人员使用 DeepSeek V4 Flash 和 StateM 在 Terminal-Bench 2.1 上达到了 95.3% 的准确率,匹配了 GPT-5.6 Sol Max 的性能,并探索了超越模型扩展的智能体改进。

0 人收藏 0 人点赞
#terminal-bench

StateM: 通过Harness Scaling在Terminal-Bench 2.1上达到95.3%原始准确率,或仅需15美元的前沿运行

Hugging Face Daily Papers · 2026-08-15 缓存

StateM是一个运行时系统,通过持久状态和可恢复的运行手册增强长期代理执行,在Terminal-Bench 2.1上达到95.3%的准确率,并显著降低API成本。

0 人收藏 0 人点赞
#terminal-bench

@cline:DeepSeek 一小时前悄悄更新了其更新日志,带来了新的 V4-Flash 升级。其新的 Terminal-Bench 分数为 82.…

X AI KOLs Following · 2026-07-31 缓存

DeepSeek 悄悄更新了其更新日志,带来了 V4-Flash 升级,将其 Terminal-Bench 分数提升至 82.7,比 4 月预览版提高了 25.8 分。目前仅通过 API 提供,开源权重即将发布。

0 人收藏 0 人点赞
#terminal-bench

@cline:我们让 Kimi K3 递归地自我改进 Cline 工具链,以提升其自身性能。17 小时后,它从……

X AI KOLs Timeline · 2026-07-29 缓存

Cline 使用 Kimi K3 递归地自我改进其工具链,将 Terminal Bench 性能从 77.5% 提升至 88.8%,并在 17 小时内将运行成本从 79 美元降至 49.8 美元。

0 人收藏 0 人点赞
#terminal-bench

我们不再将每个AI代理请求都发送给Claude Opus 5。结果令我们惊讶。

Reddit r/AI_Agents · 2026-07-29

一个团队在89个Terminal-Bench 2.1任务上,将AI代理工作流的不同阶段路由到不同模型,与将所有请求发送给Claude Opus 5进行了基准测试,并发现了令人惊讶的结果。

0 人收藏 0 人点赞
#terminal-bench

编码代理中的脚手架效应:工具选择作为编码代理评估中的隐藏变量

arXiv cs.AI · 2026-07-28 缓存

本文表明,代理工具框架(脚手架)的选择可能导致每个已解决任务的令牌数差异高达40倍,而模型通过率变化很小,这表明在以人为本的编码代理评估中,应该比较工具框架-模型对,而非仅比较模型。

0 人收藏 0 人点赞
#terminal-bench

@cline: 顺便问一下,运行终端基准测试时,使用Kimi K3、Fable和GPT的成本是多少?...

X AI KOLs Following · 2026-07-27 缓存

关于使用Kimi K3、Fable和GPT模型运行终端基准测试的成本比较讨论。

0 人收藏 0 人点赞
#terminal-bench

@jakevin7: 使用Kimi K3,Maka效果比官方 KimiCode还好了20% 同一个模型,配不同的 harness,差距能有多大? http://github.com/maka-agent/maka-agent… 我们拿 Kimi K3 跑了一遍…

X AI KOLs Following · 2026-07-19 缓存

在Kimi K3模型上,开源agent框架Maka在Terminal-Bench 2.1评测中整体通过率比官方Kimi Code CLI高10%,困难题高20%,通过context-budget pruning、精简工具面和系统提示等优化实现了显著性能提升,相关报告和harness已开源。

0 人收藏 0 人点赞
#terminal-bench

智能体优化器能否实现累积提升?——基于 Terminal-Bench 2.0 的持续学习评估

arXiv cs.AI · 2026-07-16 缓存

本文在 Terminal-Bench 2.0 上引入了一个两阶段持续学习评估,用以检验智能体优化方法的增益在递归应用时是否能够累积。结果发现,只有包含回归控制的 RELAI-VCL 方法实现了累积性改进。

0 人收藏 0 人点赞
#terminal-bench

好的基准

arXiv cs.AI · 2026-07-15 缓存

这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。

0 人收藏 0 人点赞
#terminal-bench

在长时间终端任务上测试智能体 (GitHub Repo)

TLDR AI · 2026-07-14 缓存

长时域终端基准 (LHTB) 是一个包含46项任务的基准,用于评估LLM智能体在数百步的持续终端工作中的表现。结果显示,即使是最好的模型也只能解决约28%的任务。

0 人收藏 0 人点赞
#terminal-bench

@cline: GPT-5.6 在 Terminal-Bench 上创下 91.9% 的新纪录。价格与 GPT 5.5 相同,为每百万 tokens $5/$30。关于 Fable …

X AI KOLs Following · 2026-07-09 缓存

GPT-5.6 在 Terminal-Bench 上创下 91.9% 的新纪录,价格与 GPT-5.5 相同,为每百万 tokens $5/$30,同时 Fable 转移到 API 并提高了成本。

0 人收藏 0 人点赞
#terminal-bench

有没有其他人觉得 Mimo v2.5 比 DeepSeek v4 Flash 更好?

Reddit r/LocalLLaMA · 2026-07-08

一位用户反馈称,根据 Codex、Oh My Pi、Hermes 和 Terminal Bench v2.0 等基准测试,Mimo v2.5 在编程任务上优于 DeepSeek v4 Flash,尽管两者整体表现相似。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈