如果你运行多模型智能体循环,你在哪里划分廉价节点/昂贵节点的界限?
摘要
作者分享了一种降低多模型智能体循环成本的策略:使用廉价快速的执行器处理重复节点,并使用强大的规划器进行高层推理,同时分享了在OpenRouter上使用Ling-3.0-flash的经验。
最终降低我智能体成本的并不是更好的模型,而是要诚实地面对哪些节点实际上需要聪明的模型。大多数循环都是苦力活:路由这个、调用那个工具、重新格式化那个、遵循规划器已经写好的计划。这些都不需要前沿模型。它需要的是快速、能遵循指令、并且不会在运行三步后就搞砸工具调用的模型。所以我的设置现在是:上面有一个强大的规划器,下面有一个廉价快速的执行器来做重复节点。难点在于执行器,因为廉价模型之所以廉价,部分原因在于它们在长时间的工具调用链上会变得不稳定,而这正是智能体生存的地方。最近我把Ling-3.0-flash放在那个位置(稀疏MoE,约5.1B活跃参数,因此延迟低,而且在这个价格下,它在较长时间运行中的工具调用表现比我预期的要好)。它在OpenRouter上免费使用到8月3日,如果你想试用的话。声明:我确实在那个模型的团队工作,所以请谨慎看待,下面的问题才是我发帖的真正原因。大家是怎么划分界限的?你是按节点类型划分(路由和执行器用廉价模型,规划器用昂贵模型),还是根据每一步的置信度或不确定性来划分,或者干脆让一个模型跑完整个循环并承担成本?我主要想知道,当你把廉价模型放在执行器位置上时,实际会出现什么问题。
相似文章
在测试了本地大语言模型、OpenRouter 以及市面上所有的付费方案之后……我找到了成本效益最高的编程智能体配置方案。
该文章介绍了一种通过将Claude Code接入DeepSeek API来实现低成本AI编程代理的方案,该方案利用提示词缓存技术显著降低token消耗成本,同时保持高水平的推理能力。
将我的智能体拆分为廉价路由模型和高级合成模型,费用降低了约75%
一位开发者将其AI智能体的LLM调用拆分为廉价的路由模型(GPT-OSS 120B)用于工具选择,以及高级模型(gpt-5.4)用于合成,成本降低了约78%,同时保持了输出质量。
AgentRouter:用于成本最优多步骤代理工作流的异构模型路由
AgentRouter 是一个轻量级分类器,用于在代理工作流中将步骤路由到不同的模型层级,与仅使用前沿模型相比,实现了72%的成本降低且质量退化最小。
在模型成本变动后,如何为长时间运行的代理进行路由?
作者在模型成本变动后重新审视代理管道,寻求判断哪些阶段应路由至最强模型路径的信号,以优化性能和成本。
不使用智能体循环,将浏览器智能体成本降低50倍。先规划后执行 + 数据。
描述了一种通过单次规划调用后确定性执行来降低浏览器智能体任务中LLM成本的技术,与标准智能体循环相比,实现了50倍的成本降低。