我们不再将每个AI代理请求都发送给Claude Opus 5。结果令我们惊讶。
摘要
一个团队在89个Terminal-Bench 2.1任务上,将AI代理工作流的不同阶段路由到不同模型,与将所有请求发送给Claude Opus 5进行了基准测试,并发现了令人惊讶的结果。
我们一直在尝试将代理工作流的不同阶段路由到不同模型,而不是依赖单一的前沿模型。为了验证这是否真的有区别,我们在89个Terminal-Bench 2.1任务上,使用相同的Claude Code测试框架,将其与将所有请求发送给Claude Opus 5进行了基准测试。一些发现确实让我们感到惊讶。完整的基准测试、方法和原始结果见评论。很想知道其他构建AI代理的人是在标准化使用一个模型,还是开始在不同工作流阶段使用不同模型。
相似文章
Claude Opus 4.8 宣称是唯一在 Super-Agent 基准测试中完成所有案例的模型。有人在实际代理中运行过它吗?
Anthropic 发布了 Claude Opus 4.8,声称它是唯一在 Super-Agent 基准测试中完成所有案例的模型,并且在浏览器/计算机使用任务上优于 GPT-5.5,工具效率更高,未修正的代码缺陷更少。
Claude Opus 5 基准测试!
一篇介绍即将推出的 Claude Opus 5 AI 模型基准测试结果的文章。
我让Codex和Claude Opus处理同一个Java AI单体代理项目
一位开发者比较了Codex 5.3和Claude Opus 4.6在自主Java AI代理开发中的表现,发现架构更优雅的模型(Claude)经常产生从未执行过的代码,而更直接、更单调的Codex则通过超时和历史恢复等实用修复改进了实际产品。
GLM-5.2 在 45 个 terminal-bench 编码代理任务上与 Claude Opus 持平,成本不到一半(内含完整方法及失败日志)
GLM-5.2 以更低成本在 45 个编码代理任务上与 Claude Opus 持平,其中 43 个任务结果完全相同。
@Junioryu136689: Claude Opus 5 在 AI × Bio 领域有何新进展?最大的升级在于广度。Anthropic 报告了其最强的 Claude 结果……
Anthropic 的 Claude Opus 5 在计算生物学、蛋白质建模和湿实验推理方面取得了最先进的结果,使其成为通用型 AI 生物学智能体。