llm-routing

标签

Cards List
#llm-routing

面向成本高效的LLM路由的在线学习(6分钟阅读)

TLDR AI ↗ · 2026-07-21

Ramp Router 使用 EWMA 评估故障率,通过 Thompson 采样评估延迟,从而选择最便宜的、能在截止时间前完成任务的 LLM 模型和服务层级,在不损失性能的情况下实现 30% 的成本节省。

0 人收藏 0 人点赞
#llm-routing

ContinuityBench:多提供商大语言模型路由中有状态故障转移的基准测试与系统研究

arXiv cs.LG ↗ · 2026-07-20 缓存

介绍了ContinuityBench,一个针对多提供商大语言模型路由中有状态故障转移的基准测试与系统研究,提出了新指标(CPR、CLO)和一种历史转发代理架构,实现了99.20%的上下文保留率。

0 人收藏 0 人点赞
#llm-routing

@omarsar0: Google DeepMind关于有效模型路由策略的杰出论文。

X AI KOLs Following ↗ · 2026-07-14 缓存

Google DeepMind发布了一篇关于有效模型路由策略的论文,讨论了LLM路由器在准确性和成本方面的评估,但如果模型回答完全相同,这种评估可能毫无意义。

0 人收藏 0 人点赞
#llm-routing

基于代理奖励的上下文感知上下文赌博机用于LLM路由

arXiv cs.LG ↗ · 2026-07-13 缓存

本文提出了相关性感知的上下文赌博机算法,利用机器学习模型产生的代理奖励信号进行LLM路由,与标准基线相比,实现了更好的精度-成本权衡和样本效率。

0 人收藏 0 人点赞
#llm-routing

@_avichawla: 一个棘手的LLM面试题:你的代理把所有任务都跑在前沿LLM上,于是你加了一个路由层,将一些简单的调用发送到价格便宜15倍的LLM。

X AI KOLs Timeline ↗ · 2026-07-11 缓存

解释了在代理任务中,由于缓存预热问题,模型路由可能无法节省成本,并介绍了一种生产环境下的解决方案——模型亲和性(Model Affinity),以及开源代理Plano,从而实现真正的成本节约。

0 人收藏 0 人点赞
#llm-routing

ComplianceGate:面向受监管行业推理的分类器门控多层LLM路由

arXiv cs.LG ↗ · 2026-07-01 缓存

本文介绍ComplianceGate,一个用于LLM推理的分类器门控多层路由系统,通过将请求引导至合适的模型层级,在受监管行业中强制执行合规性。

0 人收藏 0 人点赞
#llm-routing

单次重写足矣:生产环境技能描述优化的经验教训

arXiv cs.CL ↗ · 2026-07-01 缓存

本文介绍了一个自动化管道,用于优化企业AI代理中的自然语言技能描述以解决技能冲突,其性能与手动调优相当,速度提升32倍。消融实验表明,使用错误案例的单次LLM重写即可捕获大部分改进,而其他设计选择影响甚微。

0 人收藏 0 人点赞
#llm-routing

Wayfinder Router: 在本地和托管LLM之间确定性路由查询

Hacker News Top ↗ · 2026-06-28 缓存

Wayfinder Router 是一个开源的 Python 工具,它根据结构复杂性在本地或托管 LLM 之间确定性路由提示,无需调用任何模型,从而实现离线成本节省。

0 人收藏 0 人点赞
#llm-routing

@Xudong07452910: 很多人用 AI coding 的默认习惯是:直接上最强模型。 同一个任务,Sonnet 做还是 Opus 做?大多数时候这个决策是拍脑袋的。 所以这篇 Agent-as-a-Router 提了一个很现实的问题: 如果不同模型擅长的任务不一…

X AI KOLs Timeline ↗ · 2026-06-28 缓存

这篇论文提出Agent-as-a-Router框架,将模型路由转化为动态循环过程,根据任务类型和实时执行反馈选择最合适的LLM,以提升编码任务的性能与成本效率。

0 人收藏 0 人点赞
#llm-routing

路由高原:理解并突破LLM路由器的精度极限

arXiv cs.LG ↗ · 2026-06-09 缓存

本文识别了一种'路由高原'现象,即多种LLM路由方法收敛到相似的精度,远低于理想路由器,原因是存在一个可预测性瓶颈,限制了针对特定查询的路由。随后,本文展示了更大的数据集、更强的编码器和微调有助于突破这一高原。

0 人收藏 0 人点赞
#llm-routing

从采样结果到能力分布:重新思考LLM路由的监督

arXiv cs.LG ↗ · 2026-06-08 缓存

本文提出DARS,一个从模型行为的分布视角构建路由监督的框架,旨在解决LLM路由中单次标签不可靠的问题。

0 人收藏 0 人点赞
#llm-routing

运行一个全天候AI智能体开发团队:按角色分配不同LLM(Claude/Kimi/MiniMax/GPT),避免每月约2000美元的API费用。设置与常见故障点。

Reddit r/AI_Agents ↗ · 2026-06-08

作者描述了一种设置,将不同的AI模型分配给特定角色(规划、编码、审查),以降低全天候自主工程团队的API成本,并分享了常见的故障点,如模型偏离任务和幻觉式所有权归属。

0 人收藏 0 人点赞
#llm-routing

IR3DE: 一种面向大语言模型的线性路由器

Hugging Face Daily Papers ↗ · 2026-06-04 缓存

IR3DE 是一种基于岭回归的路由器,可为不同任务选择领域专家大语言模型,在实现具有竞争力的性能的同时,还支持动态添加或移除专家而无需重新训练。

0 人收藏 0 人点赞
#llm-routing

UCCI: 校准不确定性实现成本最优的LLM级联路由

arXiv cs.LG ↗ · 2026-05-20 缓存

UCCI提出了一种校准优先的路由器,用于LLM级联,它使用等渗回归将令牌级别的边际不确定性映射到错误概率,在生产级NER任务中实现了31%的成本降低,同时保持微F1=0.91,并将期望校准误差从0.12降至0.03。

0 人收藏 0 人点赞
#llm-routing

HyDRA: 面向异构LLM池的混合动态路由架构

arXiv cs.CL ↗ · 2026-05-19 缓存

HyDRA是一种面向异构LLM池的混合动态路由架构,能够预测每个查询的细粒度能力需求,并通过不足匹配选择最便宜且能力满足需求的模型,在保持质量的同时实现高达72.5%的成本节省。该架构已部署于GitHub Copilot的VS Code Chat自动模式,并将路由与模型目录解耦,模型变更时无需重新训练。

0 人收藏 0 人点赞
#llm-routing

为多模型流水线构建路由层,根据优先级为每个请求选择正确的LLM

Reddit r/AI_Agents ↗ · 2026-05-12

一个路由层,根据优先级标志(速度、成本、质量、平衡)使用加权评分自动选择最佳LLM,决策时间低于1毫秒,内置回退、缓存和指标。

0 人收藏 0 人点赞
#llm-routing

面向异构大语言模型多智能体系统的迭代式批评与路由控制器

arXiv cs.AI ↗ · 2026-05-12 缓存

本文介绍了一种用于多智能体大语言模型系统的批评与路由控制器,将协调过程建模为序贯决策问题。该方法利用策略梯度优化控制器以实现迭代优化,在表现优于基线方法的同时,降低了对顶级模型的依赖。

0 人收藏 0 人点赞
#llm-routing

@amitiitbhu: 新文章:LLM 路由,阅读链接:https://outcomeschool.com/blog/llm-routing…

X AI KOLs Timeline ↗ · 2026-05-09 缓存

一篇教程博客文章,介绍 LLM 路由——即根据成本、延迟和质量,将用户查询定向到最合适的 LLM 的实践方法。涵盖路由策略、LLM 路由器的结构解析,以及与混合专家模型(Mixture of Experts)的对比。

0 人收藏 0 人点赞
#llm-routing

@heyshrutimishra: 大多数LLM路由器都是静态规则;OrcaRouter 是一个会学习的路由器。它嵌入每个提示,根据过去的…

X AI KOLs Following ↗ · 2026-05-08

OrcaRouter 是一个基于学习的LLM路由器,能够根据质量、成本、速度和可靠性动态地将提示路由到合适的模型,并随着生产流量的增加而持续改进。

0 人收藏 0 人点赞
#llm-routing

RouteProfile:阐明用于路由的LLM配置文件的设计空间

Hugging Face Daily Papers ↗ · 2026-04-30 缓存

本文介绍了RouteProfile,这是一个用于路由系统中LLM配置文件的设计空间,证明了结构化配置文件和查询级信号能够提高路由性能以及对新模型的泛化能力。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈