@omarsar0:在会话中途切换模型是快速推高智能体账单的方式之一。
摘要
一个名为@daridotdev的开放权重自动路由模型已发布,适用于编码智能体,提供缓存感知的模型切换,可将成本降低高达70%,同时保持性能。
查看缓存全文
缓存时间: 2026/07/25 03:59
中途切换模型是抬高智能体账单最快的方式之一。
每次切换都会重置你的提示缓存,一个更便宜的模型反而可能让你花更多钱。
@daridotdev 开发的路由器具备缓存感知能力。它只在实际能省钱时才进行切换,并且可以对接你已在使用 Claude Code、Codex 或任何其他工具链。
这个路由器本身是一个开放权重的 SLM。
Avyay Varadarajan (@avyvar): 今天,我们发布了为编程智能体打造的开放权重、自动路由模型 @daridotdev。
我们在帕累托前沿达到 SOTA,相比 Fable 实现 70% 的成本降低 + 相当的编程性能。
你可以自带评估,选择模型,或使用我们的默认配置。
相似文章
@_avichawla: 一个棘手的LLM面试题:你的代理把所有任务都跑在前沿LLM上,于是你加了一个路由层,将一些简单的调用发送到价格便宜15倍的LLM。
解释了在代理任务中,由于缓存预热问题,模型路由可能无法节省成本,并介绍了一种生产环境下的解决方案——模型亲和性(Model Affinity),以及开源代理Plano,从而实现真正的成本节约。
@julien_c: 模型路由是多模型堆栈中缺失的一层。开源模型在编码方面不断进步,路由帮助它们…
Not Diamond Code 是一款面向长期编码代理的智能模型路由器,为每一步选择最佳模型和推理努力,可将成本降低 20-65%。
一次模型替换悄然破坏了代理的取消功能,因此我构建了一个用于代理行为差异比较的工具
作者描述了一次AI模型替换如何悄然破坏了代理的取消功能,促使他们创建了一个用于比较代理行为差异的工具,以检测此类变化。
如果你运行多模型智能体循环,你在哪里划分廉价节点/昂贵节点的界限?
作者分享了一种降低多模型智能体循环成本的策略:使用廉价快速的执行器处理重复节点,并使用强大的规划器进行高层推理,同时分享了在OpenRouter上使用Ling-3.0-flash的经验。
将我的智能体拆分为廉价路由模型和高级合成模型,费用降低了约75%
一位开发者将其AI智能体的LLM调用拆分为廉价的路由模型(GPT-OSS 120B)用于工具选择,以及高级模型(gpt-5.4)用于合成,成本降低了约78%,同时保持了输出质量。