标签
HybridInfer引入了针对多层大语言模型推理的热感知强化学习路由器,在真实Android设备上实现了比启发式方法更优的质量和成本效率。
一项研究发现,一个训练用于在模型之间进行选择的LLM路由器学会了任务识别而非难度评估,导致在保留任务上泛化能力差,但基于廉价模型输出的延迟策略带来了更好的性能。
Jev 是一种工具,作为确定性软件和大型语言模型之间的中间层,针对语义判断任务进行了优化。这类任务中,可能的答案是预先设定的,但输入解释需要模糊逻辑,例如在客服工单路由中。
本文是一份工程笔记,从第一性原理重新探讨编码代理的设计,质疑KV缓存对当前架构的影响,并提出新的上下文管理和决策方法。
本文展示了,在大语言模型中,基于复杂度的路由机制因长度信号而偏向非标准英语语体,如 African American English,导致容量分配较低并加剧偏差。
这篇文章探讨了OpenRouter自动提供商路由中遇到的问题,例如模型行为在不同后端之间不一致,并建议使用provider.only等选项来获得更好的控制。
本文提出算法,用于在有限反馈的在线环境中,自适应地将提示路由至LLM专家。该问题被形式化为多臂赌博机问题,旨在最小化遗憾并最大化响应质量。
本文将提示到大语言模型专家的自适应路由建模为具有有限反馈的上下文赌博机问题,提出实现次线性遗憾的算法,并展示高效学习高质量路由策略的能力。
SCX Router 引入了一个基于GLiClass的轻量级模型选择工具,该工具使用解码器-KV分类器和任务本体来路由LLM任务,优化速度、成本和质量,无需自回归生成。
Ramp 推出了 Router,这是一项 AI 模型路由服务,使公司能够通过 API 访问和切换各种大型语言模型,并具备成本优化和基于基准测试的路由功能。
本文介绍了InflationAgent,这是一个为代理型LLM设计的路由系统,它能测量Token通胀,使用思维链分支熵(CoT Branching Entropy)预测任务难度,并优化模型选择以最大化成本精度比,在如GSM8K等基准测试中,以更少的Token实现更高的准确率。
arXiv 上一篇新论文介绍了名为 LLMRouter 的开源库,包含超过 16 种路由器实现和基准测试 xRouteBench,表明学习型路由器可比固定模型基线提升 14.6%。
LLMRouter将LLM路由统一表述为顺序决策过程,并提供了一个用于开发、评估和部署LLM路由器的开源基础设施和基准(xRouteBench)。实验结果表明,学习型路由器相比最强的固定模型基线实现了14.6%的相对提升。
介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。
本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。
Manifest解释了为何弃用其LLM路由器,认为模型路由会引入不可预测性、破坏行为一致性,且无法仅凭提示词推断其复杂性,因此对大多数用例而言,缓存和审慎的模型选择更为有效。
一篇论文提出了一种延迟感知的LLM查询路由器,通过轻量级延迟估计器联合优化延迟、准确性和成本,在保持可比延迟的同时,准确率-成本效用提升高达40%。
一篇新论文提出了VDAR-Router,这是一个面向LLM的难度感知的基于检索的路由框架,能够根据查询难度自适应选择模型,实现更好的成本-性能权衡。