为多模型流水线构建路由层,根据优先级为每个请求选择正确的LLM
摘要
一个路由层,根据优先级标志(速度、成本、质量、平衡)使用加权评分自动选择最佳LLM,决策时间低于1毫秒,内置回退、缓存和指标。
如果你正在构建需要链式调用多个LLM的智能体,可能会遇到这种情况:流水线中的每个步骤并不都需要相同的模型。快速提取步骤不需要Opus,最终综合步骤可能不应该使用Flash。但你最终还是会硬编码某个模型,希望它能适用于所有情况。这个路由器允许你为每个请求设置优先级标志(速度/成本/质量/平衡),并通过加权评分自动选择最佳模型。路由决策时间低于1毫秒,因为纯粹是数学计算,没有额外的网络跳转。如果所选模型失败,则自动回退;对重复请求使用Redis缓存;指标端点提供每个模型的p95/p99延迟。该路由基于OpenRouter构建,因此其目录中的任何模型都可使用。将其接入智能体流水线的LLM调用层会非常容易。GitHub仓库在下方评论中👇。本项目使用Neo AI Engineer构建。
相似文章
跨四个LLM层级的代理工作路由:编排器、顾问、深度推理、Premier
作者分享了一个实用的四层LLM路由栈,用于代理工作。其中,快速的编排器处理大部分请求,仅在需要深度推理时才会升级到昂贵的模型,显著降低了成本并提升了交互体验。
聚类、路由、升级:面向成本感知的LLM服务的级联框架
提出了一种面向成本感知的LLM服务的两阶段级联框架,该框架将查询聚类并路由至最具成本效益的模型,然后将低质量输出升级至更强的模型。在降低推理成本的同时,保留了97-99%的准确率。
面向LLM代理中功能等价工具的延迟-质量路由
本文介绍了 LQM-ContextRoute,一种上下文赌博机路由器,用于在 LLM 代理中选择功能等效的工具提供商,平衡延迟和答案质量。它在网络搜索和检索器基准测试上优于基线。
Pro-Router: 面向token的渐进式模型路由与自适应边云协作,实现高效多模态LLM推理
Pro-Router引入了一种面向token的渐进式模型路由方法,用于高效多模态LLM推理,通过自适应边云协作提高吞吐量并降低成本。
LayerRoute: 一种通过LoRA保持质量的自适应层跳过方法,用于高效LLM推理
LayerRoute引入了一种参数高效的自适应transformer层跳过方法,结合了逐层路由与联合LoRA微调,在LLM推理中实现了经过验证的速度提升和质量改进。