我构建了一个路由器来削减我的智能体费用。结果发现它只知道如何增加开销。
摘要
一位开发者构建了一个路由器以降低AI智能体成本,但发现它只会升级请求,导致开销增加;有效的节省来自缓存而非路由。
我构建了一个路由器来削减我的智能体费用。然后我实际查看了它的路由方向。8,458个请求被升级了。零个被降级。首先,提供一些规模上的背景。在59,299个请求中,列表价格总计约为5,085美元。不过,这些是在固定费率的Max订阅上运行的。实际现金支出是几百美元,而不是5千美元。我想先明确一点,这里没有人支付了五千美元。中位请求费用为4美分。没有失控,也没有单个巨额调用。只是数以万计的廉价请求累积起来。升级部分占了列表总价中的约1,505美元,所以账单本可以降低大约30%。不是因为路由器不好。而是因为它只向上路由。真正节省资金的是缓存,而不是路由器。未缓存时列表价格将是16,980美元。缓存后是5,085美元。大约减少了70%。而升级会破坏缓存,在我的数据中大约是7倍,这是模型价格表从未向你展示的成本。最令人痛心的是编码器费用的去向。其中72%,即3,218美元,用于最终被取消的任务。一个“修复破损测试”的任务进行了76次尝试,单独就消耗了940美元。最深的自动修复链在我终止前达到了19层深度。所以,我得出的结论是。当你的默认设置已经很便宜时,路由器是一个质量调节器,而不是节省器。成本每件交付物才是关键数字,每次请求的成本只是虚荣指标。如果你也构建了一个,在信任任何节省数字之前,先检查它的实际路由方向。记录这一切的代理是开源的。
相似文章
Ramp Router 声称可将AI成本降低高达30%
Ramp 正在开源其内部 LLM 路由器,该路由器能根据每个请求自动选择最佳模型,以优化成本和性能。
将我的智能体拆分为廉价路由模型和高级合成模型,费用降低了约75%
一位开发者将其AI智能体的LLM调用拆分为廉价的路由模型(GPT-OSS 120B)用于工具选择,以及高级模型(gpt-5.4)用于合成,成本降低了约78%,同时保持了输出质量。
在测试了本地大语言模型、OpenRouter 以及市面上所有的付费方案之后……我找到了成本效益最高的编程智能体配置方案。
该文章介绍了一种通过将Claude Code接入DeepSeek API来实现低成本AI编程代理的方案,该方案利用提示词缓存技术显著降低token消耗成本,同时保持高水平的推理能力。
我开发了一个本地优先的 AI Agent 技能混合路由器(低于 20 毫秒、零 Token、纯 CPU 运行)[P]
Routed 是一款开源、本地优先的 AI Agent 技能混合路由器,纯 CPU 离线运行,结合稠密向量 Embedding、BM25 和精确匹配,可在 20 毫秒内完成提示词路由,无需任何 API 调用。该工具支持 Cursor、Claude Code、MCP 服务器等主流 Agent 环境,刚发布了 v1.1.0,新增多语言支持和 MCP 服务器模式。
Router by Ramp
Router by Ramp 是一款新产品,旨在通过帮助用户管理和减少 API 相关成本来节省 AI 代币使用费用。