你的智能体可能不需要更好的模型,它需要一个更好的循环。

Reddit r/AI_Agents 新闻

摘要

使用Claude Opus 4.8比较智能体运行时的实验表明,运行时效率对性能和成本的影响大于模型本身,强调了AI智能体中更好循环的必要性。TrueForge被突出为一个有用的开源工具,用于检查和优化运行时。

我最近花了很多时间比较智能体运行时,一开始我以为模型会解释大部分差异。但事实并非如此。我将模型固定为Claude Opus 4.8,并通过不同的智能体运行时运行相同的14项任务Enterprise-Bench工作负载。三个运行时都达到了11/14。但运行时看起来大不相同:39分钟 vs 73分钟 vs 96分钟,约3.85M令牌 vs 约13M,282次工具调用 vs 652次,最便宜和最昂贵之间总成本差异约为30%。有趣的是事后查看跟踪记录。很多差异归结于无聊的运行时细节:每次轮次重新发送多少系统提示和工具定义上下文、工具输出如何累积、循环如何积极地探索、重试等。这改变了我对智能体基准测试的看法。基准测试分数实际上衡量的是模型 + 框架 + 提示 + 工具循环,而不仅仅是模型。我一直在使用TrueForge进行这些实验,因为它是开源的,让我能够真正检查和改变运行时,而不是将其视为黑盒。它并不总是更好,更精简的循环在某些较难的任务上探索不足,但它确实是一个非常有用的运行时,适合进行实验。仓库链接在评论中。
查看原文

相似文章