我们不再将每个AI代理请求都发送给Claude Opus 5。结果令我们惊讶。

Reddit r/AI_Agents 新闻

摘要

一个团队在89个Terminal-Bench 2.1任务上,将AI代理工作流的不同阶段路由到不同模型,与将所有请求发送给Claude Opus 5进行了基准测试,并发现了令人惊讶的结果。

我们一直在尝试将代理工作流的不同阶段路由到不同模型,而不是依赖单一的前沿模型。为了验证这是否真的有区别,我们在89个Terminal-Bench 2.1任务上,使用相同的Claude Code测试框架,将其与将所有请求发送给Claude Opus 5进行了基准测试。一些发现确实让我们感到惊讶。完整的基准测试、方法和原始结果见评论。很想知道其他构建AI代理的人是在标准化使用一个模型,还是开始在不同工作流阶段使用不同模型。
查看原文

相似文章

我让Codex和Claude Opus处理同一个Java AI单体代理项目

Reddit r/AI_Agents

一位开发者比较了Codex 5.3和Claude Opus 4.6在自主Java AI代理开发中的表现,发现架构更优雅的模型(Claude)经常产生从未执行过的代码,而更直接、更单调的Codex则通过超时和历史恢复等实用修复改进了实际产品。