你的智能体可能不需要更好的模型,它需要一个更好的循环。
摘要
使用Claude Opus 4.8比较智能体运行时的实验表明,运行时效率对性能和成本的影响大于模型本身,强调了AI智能体中更好循环的必要性。TrueForge被突出为一个有用的开源工具,用于检查和优化运行时。
我最近花了很多时间比较智能体运行时,一开始我以为模型会解释大部分差异。但事实并非如此。我将模型固定为Claude Opus 4.8,并通过不同的智能体运行时运行相同的14项任务Enterprise-Bench工作负载。三个运行时都达到了11/14。但运行时看起来大不相同:39分钟 vs 73分钟 vs 96分钟,约3.85M令牌 vs 约13M,282次工具调用 vs 652次,最便宜和最昂贵之间总成本差异约为30%。有趣的是事后查看跟踪记录。很多差异归结于无聊的运行时细节:每次轮次重新发送多少系统提示和工具定义上下文、工具输出如何累积、循环如何积极地探索、重试等。这改变了我对智能体基准测试的看法。基准测试分数实际上衡量的是模型 + 框架 + 提示 + 工具循环,而不仅仅是模型。我一直在使用TrueForge进行这些实验,因为它是开源的,让我能够真正检查和改变运行时,而不是将其视为黑盒。它并不总是更好,更精简的循环在某些较难的任务上探索不足,但它确实是一个非常有用的运行时,适合进行实验。仓库链接在评论中。
相似文章
@rohanpaul_ai: 如果管理工作的模型不知道何时重定向、验证或停止,那么强大的编码模型也是不够的。Loop…
LoopArena 将模型作为编码任务的运行时控制器进行基准测试,揭示即使 GPT-5.5 也仅达到 24.69% 的成功率,强调了代理系统中需要更好的控制机制。
@sydneyrunkle: 假设智能体 = 模型 + 工具套件。不幸的是,好的模型越来越贵!所以你需要一个出色的工具套件来…
关于通过改进工具套件组件来优化AI智能体性能的指南,以补偿昂贵的模型成本,重点关注爬山技术。
如果你运行多模型智能体循环,你在哪里划分廉价节点/昂贵节点的界限?
作者分享了一种降低多模型智能体循环成本的策略:使用廉价快速的执行器处理重复节点,并使用强大的规划器进行高层推理,同时分享了在OpenRouter上使用Ling-3.0-flash的经验。
LoopArena:针对循环工程的运行时控制器模型基准测试
LoopArena推出一项基准测试,评估模型在编码代理任务中充当循环工程运行时控制器的表现,结果显示严格成功率较低,但成本显著降低。
最佳智能体模型是懂得何时停止的那一个
文章认为,高效的AI智能体需要克制和明确的“停止条件”,而非无限的自主性,并指出Ling-2.6-1T是一个适合保守规划角色的模型。