我们不再将每个AI代理请求都发送给Claude Opus 5。结果令我们惊讶。
摘要
一个团队在89个Terminal-Bench 2.1任务上,将AI代理工作流的不同阶段路由到不同模型,与将所有请求发送给Claude Opus 5进行了基准测试,并发现了令人惊讶的结果。
我们一直在尝试将代理工作流的不同阶段路由到不同模型,而不是依赖单一的前沿模型。为了验证这是否真的有区别,我们在89个Terminal-Bench 2.1任务上,使用相同的Claude Code测试框架,将其与将所有请求发送给Claude Opus 5进行了基准测试。一些发现确实让我们感到惊讶。完整的基准测试、方法和原始结果见评论。很想知道其他构建AI代理的人是在标准化使用一个模型,还是开始在不同工作流阶段使用不同模型。
相似文章
Claude Opus 4.8 宣称是唯一在 Super-Agent 基准测试中完成所有案例的模型。有人在实际代理中运行过它吗?
Anthropic 发布了 Claude Opus 4.8,声称它是唯一在 Super-Agent 基准测试中完成所有案例的模型,并且在浏览器/计算机使用任务上优于 GPT-5.5,工具效率更高,未修正的代码缺陷更少。
Claude Opus 5 基准测试!
一篇介绍即将推出的 Claude Opus 5 AI 模型基准测试结果的文章。
我让Codex和Claude Opus处理同一个Java AI单体代理项目
一位开发者比较了Codex 5.3和Claude Opus 4.6在自主Java AI代理开发中的表现,发现架构更优雅的模型(Claude)经常产生从未执行过的代码,而更直接、更单调的Codex则通过超时和历史恢复等实用修复改进了实际产品。
GLM-5.2 在 45 个 terminal-bench 编码代理任务上与 Claude Opus 持平,成本不到一半(内含完整方法及失败日志)
GLM-5.2 以更低成本在 45 个编码代理任务上与 Claude Opus 持平,其中 43 个任务结果完全相同。
@dair_ai:一篇关于编程智能体的极具参考价值的基准测试论文。在Claude Code环境中运行的Claude Opus 5仅通过23.9%的测试项……
该论文提出了一种新的编程智能体评估基准,用于衡量其在真实环境中完成实际客户服务任务的能力。