llm-routing

标签

Cards List
#llm-routing

LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施

arXiv cs.CL · 昨天 缓存

LLMRouter将LLM路由统一表述为顺序决策过程,并提供了一个用于开发、评估和部署LLM路由器的开源基础设施和基准(xRouteBench)。实验结果表明,学习型路由器相比最强的固定模型基线实现了14.6%的相对提升。

0 人收藏 0 人点赞
#llm-routing

我如何仅用24GB内存运行193B参数模型

Reddit r/ArtificialInteligence · 4天前

介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。

0 人收藏 0 人点赞
#llm-routing

LLM 路由不是要解决的问题;token 效率才是

Reddit r/AI_Agents · 2026-08-02

本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。

0 人收藏 0 人点赞
#llm-routing

大家都在构建LLM路由器,我们却弃用了自己的

Hacker News Top · 2026-07-31 缓存

Manifest解释了为何弃用其LLM路由器,认为模型路由会引入不可预测性、破坏行为一致性,且无法仅凭提示词推断其复杂性,因此对大多数用例而言,缓存和审慎的模型选择更为有效。

0 人收藏 0 人点赞
#llm-routing

超越准确性与成本:面向动态工作负载的延迟感知LLM查询路由

arXiv cs.AI · 2026-07-22 缓存

一篇论文提出了一种延迟感知的LLM查询路由器,通过轻量级延迟估计器联合优化延迟、准确性和成本,在保持可比延迟的同时,准确率-成本效用提升高达40%。

0 人收藏 0 人点赞
#llm-routing

VDAR-Router: 通过语言化查询难度分析检索的自适应LLM路由

arXiv cs.CL · 2026-07-21 缓存

一篇新论文提出了VDAR-Router,这是一个面向LLM的难度感知的基于检索的路由框架,能够根据查询难度自适应选择模型,实现更好的成本-性能权衡。

0 人收藏 0 人点赞
#llm-routing

面向成本高效的LLM路由的在线学习(6分钟阅读)

TLDR AI · 2026-07-21

Ramp Router 使用 EWMA 评估故障率,通过 Thompson 采样评估延迟,从而选择最便宜的、能在截止时间前完成任务的 LLM 模型和服务层级,在不损失性能的情况下实现 30% 的成本节省。

0 人收藏 0 人点赞
#llm-routing

ContinuityBench:多提供商大语言模型路由中有状态故障转移的基准测试与系统研究

arXiv cs.LG · 2026-07-20 缓存

介绍了ContinuityBench,一个针对多提供商大语言模型路由中有状态故障转移的基准测试与系统研究,提出了新指标(CPR、CLO)和一种历史转发代理架构,实现了99.20%的上下文保留率。

0 人收藏 0 人点赞
#llm-routing

@omarsar0: Google DeepMind关于有效模型路由策略的杰出论文。

X AI KOLs Following · 2026-07-14 缓存

Google DeepMind发布了一篇关于有效模型路由策略的论文,讨论了LLM路由器在准确性和成本方面的评估,但如果模型回答完全相同,这种评估可能毫无意义。

0 人收藏 0 人点赞
#llm-routing

基于代理奖励的上下文感知上下文赌博机用于LLM路由

arXiv cs.LG · 2026-07-13 缓存

本文提出了相关性感知的上下文赌博机算法,利用机器学习模型产生的代理奖励信号进行LLM路由,与标准基线相比,实现了更好的精度-成本权衡和样本效率。

0 人收藏 0 人点赞
#llm-routing

@_avichawla: 一个棘手的LLM面试题:你的代理把所有任务都跑在前沿LLM上,于是你加了一个路由层,将一些简单的调用发送到价格便宜15倍的LLM。

X AI KOLs Timeline · 2026-07-11 缓存

解释了在代理任务中,由于缓存预热问题,模型路由可能无法节省成本,并介绍了一种生产环境下的解决方案——模型亲和性(Model Affinity),以及开源代理Plano,从而实现真正的成本节约。

0 人收藏 0 人点赞
#llm-routing

ComplianceGate:面向受监管行业推理的分类器门控多层LLM路由

arXiv cs.LG · 2026-07-01 缓存

本文介绍ComplianceGate,一个用于LLM推理的分类器门控多层路由系统,通过将请求引导至合适的模型层级,在受监管行业中强制执行合规性。

0 人收藏 0 人点赞
#llm-routing

单次重写足矣:生产环境技能描述优化的经验教训

arXiv cs.CL · 2026-07-01 缓存

本文介绍了一个自动化管道,用于优化企业AI代理中的自然语言技能描述以解决技能冲突,其性能与手动调优相当,速度提升32倍。消融实验表明,使用错误案例的单次LLM重写即可捕获大部分改进,而其他设计选择影响甚微。

0 人收藏 0 人点赞
#llm-routing

Wayfinder Router: 在本地和托管LLM之间确定性路由查询

Hacker News Top · 2026-06-28 缓存

Wayfinder Router 是一个开源的 Python 工具,它根据结构复杂性在本地或托管 LLM 之间确定性路由提示,无需调用任何模型,从而实现离线成本节省。

0 人收藏 0 人点赞
#llm-routing

@Xudong07452910: 很多人用 AI coding 的默认习惯是:直接上最强模型。 同一个任务,Sonnet 做还是 Opus 做?大多数时候这个决策是拍脑袋的。 所以这篇 Agent-as-a-Router 提了一个很现实的问题: 如果不同模型擅长的任务不一…

X AI KOLs Timeline · 2026-06-28 缓存

这篇论文提出Agent-as-a-Router框架,将模型路由转化为动态循环过程,根据任务类型和实时执行反馈选择最合适的LLM,以提升编码任务的性能与成本效率。

0 人收藏 0 人点赞
#llm-routing

路由高原:理解并突破LLM路由器的精度极限

arXiv cs.LG · 2026-06-09 缓存

本文识别了一种'路由高原'现象,即多种LLM路由方法收敛到相似的精度,远低于理想路由器,原因是存在一个可预测性瓶颈,限制了针对特定查询的路由。随后,本文展示了更大的数据集、更强的编码器和微调有助于突破这一高原。

0 人收藏 0 人点赞
#llm-routing

从采样结果到能力分布:重新思考LLM路由的监督

arXiv cs.LG · 2026-06-08 缓存

本文提出DARS,一个从模型行为的分布视角构建路由监督的框架,旨在解决LLM路由中单次标签不可靠的问题。

0 人收藏 0 人点赞
#llm-routing

运行一个全天候AI智能体开发团队:按角色分配不同LLM(Claude/Kimi/MiniMax/GPT),避免每月约2000美元的API费用。设置与常见故障点。

Reddit r/AI_Agents · 2026-06-08

作者描述了一种设置,将不同的AI模型分配给特定角色(规划、编码、审查),以降低全天候自主工程团队的API成本,并分享了常见的故障点,如模型偏离任务和幻觉式所有权归属。

0 人收藏 0 人点赞
#llm-routing

IR3DE: 一种面向大语言模型的线性路由器

Hugging Face Daily Papers · 2026-06-04 缓存

IR3DE 是一种基于岭回归的路由器,可为不同任务选择领域专家大语言模型,在实现具有竞争力的性能的同时,还支持动态添加或移除专家而无需重新训练。

0 人收藏 0 人点赞
#llm-routing

UCCI: 校准不确定性实现成本最优的LLM级联路由

arXiv cs.LG · 2026-05-20 缓存

UCCI提出了一种校准优先的路由器,用于LLM级联,它使用等渗回归将令牌级别的边际不确定性映射到错误概率,在生产级NER任务中实现了31%的成本降低,同时保持微F1=0.91,并将期望校准误差从0.12降至0.03。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈