llm-routing

标签

Cards List
#llm-routing

HybridInfer: 面向设备端、边缘和云的大语言模型热感知强化学习分层路由

arXiv cs.LG ↗ · 14小时前 缓存

HybridInfer引入了针对多层大语言模型推理的热感知强化学习路由器,在真实Android设备上实现了比启发式方法更优的质量和成本效率。

0 人收藏 0 人点赞
#llm-routing

一个学习的LLM路由器得分为0.84 AUC。在每个任务内打乱标签后,得分仍为0.838 [R]

Reddit r/MachineLearning ↗ · 2天前

一项研究发现,一个训练用于在模型之间进行选择的LLM路由器学会了任务识别而非难度评估,导致在保留任务上泛化能力差,但基于廉价模型输出的延迟策略带来了更好的性能。

0 人收藏 0 人点赞
#llm-routing

@akshay_pachaar:Jev 的最佳使用点。(何时使用,何时不使用)Jev 介于规则和大型语言模型之间。最常见的错误是将其视为…

X AI KOLs Timeline ↗ · 2026-09-22 缓存

Jev 是一种工具,作为确定性软件和大型语言模型之间的中间层,针对语义判断任务进行了优化。这类任务中,可能的答案是预先设定的,但输入解释需要模糊逻辑,例如在客服工单路由中。

0 人收藏 0 人点赞
#llm-routing

@yibie: https://x.com/yibie/status/2102183394352247287

X AI KOLs Timeline ↗ · 2026-09-21 缓存

本文是一份工程笔记,从第一性原理重新探讨编码代理的设计,质疑KV缓存对当前架构的影响,并提出新的上下文管理和决策方法。

0 人收藏 0 人点赞
#llm-routing

基于复杂度的大语言模型路由中的语域偏差

arXiv cs.CL ↗ · 2026-09-17 缓存

本文展示了,在大语言模型中,基于复杂度的路由机制因长度信号而偏向非标准英语语体,如 African American English,导致容量分配较低并加剧偏差。

0 人收藏 0 人点赞
#llm-routing

通过自动路由 LLM 选择实现自动省钱

Reddit r/AI_Agents ↗ · 2026-09-12

作者构建了一个基于成本和性能数据自动路由 LLM 选择的系统,旨在优化 AI 支出,并计划将该工具开源。

0 人收藏 0 人点赞
#llm-routing

你想使用OpenRouter吗?

Simon Willison's Blog ↗ · 2026-09-11 缓存

这篇文章探讨了OpenRouter自动提供商路由中遇到的问题,例如模型行为在不同后端之间不一致,并建议使用provider.only等选项来获得更好的控制。

0 人收藏 0 人点赞
#llm-routing

基于有限反馈的LLM专家在线学习

arXiv cs.LG ↗ · 2026-09-10 缓存

本文提出算法,用于在有限反馈的在线环境中,自适应地将提示路由至LLM专家。该问题被形式化为多臂赌博机问题,旨在最小化遗憾并最大化响应质量。

0 人收藏 0 人点赞
#llm-routing

基于有限反馈的LLM专家在线学习

Hugging Face Daily Papers ↗ · 2026-09-05 缓存

本文将提示到大语言模型专家的自适应路由建模为具有有限反馈的上下文赌博机问题,提出实现次线性遗憾的算法,并展示高效学习高质量路由策略的能力。

0 人收藏 0 人点赞
#llm-routing

SCX Router: 流式零样本模型选择——基于解码器-KV分类器和现实世界任务本体

arXiv cs.AI ↗ · 2026-09-03 缓存

SCX Router 引入了一个基于GLiClass的轻量级模型选择工具,该工具使用解码器-KV分类器和任务本体来路由LLM任务,优化速度、成本和质量,无需自回归生成。

0 人收藏 0 人点赞
#llm-routing

IQ Routing

Product Hunt ↗ · 2026-08-27

IQ Routing 是一个轨迹感知的 LLM 路由系统,旨在通过优化基于轨迹数据的任务路由来降低 AI 代理的成本。

0 人收藏 0 人点赞
#llm-routing

Ramp 推出自己的 AI 模型路由器,名为 Router

TechCrunch AI ↗ · 2026-08-20 缓存

Ramp 推出了 Router,这是一项 AI 模型路由服务,使公司能够通过 API 访问和切换各种大型语言模型,并具备成本优化和基于基准测试的路由功能。

0 人收藏 0 人点赞
#llm-routing

并非所有Token都平等:面向代理型LLM系统的通胀感知路由

arXiv cs.CL ↗ · 2026-08-17 缓存

本文介绍了InflationAgent,这是一个为代理型LLM设计的路由系统,它能测量Token通胀,使用思维链分支熵(CoT Branching Entropy)预测任务难度,并优化模型选择以最大化成本精度比,在如GSM8K等基准测试中,以更少的Token实现更高的准确率。

0 人收藏 0 人点赞
#llm-routing

LLMRouter 开源 16+ 路由器库及 xRouteBench

Reddit r/ArtificialInteligence ↗ · 2026-08-15

arXiv 上一篇新论文介绍了名为 LLMRouter 的开源库,包含超过 16 种路由器实现和基准测试 xRouteBench,表明学习型路由器可比固定模型基线提升 14.6%。

0 人收藏 0 人点赞
#llm-routing

LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施

arXiv cs.CL ↗ · 2026-08-10 缓存

LLMRouter将LLM路由统一表述为顺序决策过程,并提供了一个用于开发、评估和部署LLM路由器的开源基础设施和基准(xRouteBench)。实验结果表明,学习型路由器相比最强的固定模型基线实现了14.6%的相对提升。

0 人收藏 0 人点赞
#llm-routing

我如何仅用24GB内存运行193B参数模型

Reddit r/ArtificialInteligence ↗ · 2026-08-06

介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。

0 人收藏 0 人点赞
#llm-routing

LLM 路由不是要解决的问题;token 效率才是

Reddit r/AI_Agents ↗ · 2026-08-02

本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。

0 人收藏 0 人点赞
#llm-routing

大家都在构建LLM路由器,我们却弃用了自己的

Hacker News Top ↗ · 2026-07-31 缓存

Manifest解释了为何弃用其LLM路由器,认为模型路由会引入不可预测性、破坏行为一致性,且无法仅凭提示词推断其复杂性,因此对大多数用例而言,缓存和审慎的模型选择更为有效。

0 人收藏 0 人点赞
#llm-routing

超越准确性与成本:面向动态工作负载的延迟感知LLM查询路由

arXiv cs.AI ↗ · 2026-07-22 缓存

一篇论文提出了一种延迟感知的LLM查询路由器,通过轻量级延迟估计器联合优化延迟、准确性和成本,在保持可比延迟的同时,准确率-成本效用提升高达40%。

0 人收藏 0 人点赞
#llm-routing

VDAR-Router: 通过语言化查询难度分析检索的自适应LLM路由

arXiv cs.CL ↗ · 2026-07-21 缓存

一篇新论文提出了VDAR-Router,这是一个面向LLM的难度感知的基于检索的路由框架,能够根据查询难度自适应选择模型,实现更好的成本-性能权衡。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈