$16重构,400步,95%路由到开源MoE
摘要
一位开发者在vLLM上构建了一个路由层,将简单代理步骤路由到廉价的开源MoE模型(21B活跃参数),困难步骤路由到Opus,将400步重构的成本降至15.60美元,成功率达93.4%。
厌倦了160美元的Opus账单,所以我花了一个周末在vLLM 0.8(2xA100,enable_auto_tool_choice)上搭建了一个路由层。让工具调用解析器配合工作比实际路由逻辑花费的时间更长。一旦运行起来,简单的代理步骤会路由到21B活跃参数的MoE模型,困难的步骤则交给Opus。Hunyuan Hy3预览版在一个12,000行Python代码仓库上处理了400步中的380步,每步约0.02美元(总计7.60美元)。Opus处理了剩余的20步,每步0.40美元(总计8美元),所以总共15.60美元。我将常规步骤的推理设置为no_think,这大约减少了30%的token消耗。最终成功率为93.4%。DeepSeek V4达到了类似的准确率,但在搜索循环步骤上运行速度大约慢2倍。14个文件的循环导入重构是它失败的地方。它不断幻觉出不存在的模块路径。腾讯报告在生产中495步工作流中步骤成功率达到99.99%,老实说,对于直接的调用来说确实如此,但复杂的依赖图仍然需要Opus。
相似文章
将我的智能体拆分为廉价路由模型和高级合成模型,费用降低了约75%
一位开发者将其AI智能体的LLM调用拆分为廉价的路由模型(GPT-OSS 120B)用于工具选择,以及高级模型(gpt-5.4)用于合成,成本降低了约78%,同时保持了输出质量。
跨四个LLM层级的代理工作路由:编排器、顾问、深度推理、Premier
作者分享了一个实用的四层LLM路由栈,用于代理工作。其中,快速的编排器处理大部分请求,仅在需要深度推理时才会升级到昂贵的模型,显著降低了成本并提升了交互体验。
低延迟系统中工具制作与自进化LLM代理
本文提出了一种方法,将重复的标准操作流程步骤编译为经过验证、有版本管理的工具,在部署前完成,替代推理时的代码生成。在一个配送中心的报警分类系统中,该方法将p50延迟降低了42%,端到端错误率降低了最多53%。
连续六周每日使用开源桌面Agent Shell的三模型拆分(Haiku三分类器 → Sonnet审查器 → Opus执行器)的真实成本数据与故障记录。
一项为期六周的真实世界实验,使用开源桌面Agent Shell的三模型拆分(Haiku三分类器、Sonnet审查器、Opus执行器),报告了64%的成本降低,并详细描述了诸如上下文膨胀和子Agent失控等故障模式。
我构建了LOLM:一个更低成本、支持实时控制决策和密封运行收据的LLM智能体
LOLM的构建者宣布推出Qira开发的Transformer-SSM混合语言模型与智能体系统,具备实时决策控制器、运行收据、CLI、编码沙箱、MCP支持以及更低成本的托管访问。