路由应当自养其身:面向经济高效LLM路由的稀疏监督

Hugging Face Daily Papers 论文

摘要

论文提出了SaveRouter,一个稀疏监督的LLM路由框架,它有选择性地获取查询-模型反馈,并在相关查询之间共享能力信息,在保持具有竞争力的路由质量的同时降低监督成本,并将盈亏平衡部署量减少1.9-9.5倍。

大语言模型(LLM)路由通过将每个查询分配给合适的模型来降低服务成本,同时保持回复质量。然而,学习这样一个路由器通常需要在历史查询上执行多个候选模型以收集查询-模型质量反馈,这在部署前就带来了不可忽视的监督成本。现有工作大多关注服务时的效率,却忽视了由此节省的成本是否足以收回这笔前期投入。我们进一步观察到,路由质量往往在收集全部查询-模型反馈之前就已趋于饱和,这表明稠密监督在经济上可能是过度配置的。我们提出SaveRouter,一个稀疏监督的路由框架,它有选择性地获取有信息量的模型反馈,并在相关查询之间共享能力信息,同时保留查询级的细化机制以实现细粒度路由。我们在评估路由时将监督开销与其后节省的服务成本纳入统一考量。在四个路由基准上,主设置仅使用约33%-41%的可用训练反馈,却保持了具有竞争力甚至更优的路由质量,并将盈亏平衡部署量相比最快的常规路由器减少了约1.9-9.5倍。进一步的分析表明,获取更多监督并不总是经济上更优:使服务成本最小化的监督水平,与实现最早回本的监督水平可能并不一致。我们的代码已公开于 https://github.com/LAMDA-Model-Reuse/SaveRouter。
查看原文
查看缓存全文

缓存时间: 2026/09/30 16:17

论文页面 - 路由应当自给自足:面向经济性的 LLM 稀疏监督路由

来源:https://huggingface.co/papers/2609.37402 发布于 9 月 29 日

·

由 https://huggingface.co/Gene-Liu 提交

Lucius (https://huggingface.co/Gene-Liu) 于 9 月 30 日发布

摘要

大语言模型(LLM)路由通过将每个查询分配给合适的模型来降低服务成本,同时保持响应质量。然而,学习这样的路由器通常需要在历史查询上运行多个候选模型,以收集查询—模型质量反馈,从而在部署前产生不可忽视的监督成本。现有工作大多关注服务时的效率,忽略了所得节省是否足以收回这笔前期投入。我们进一步观察到,路由质量往往在收集全部查询—模型反馈之前就已饱和,说明稠密监督在经济上可能是过度配置的。我们提出 SaveRouter,一个稀疏监督路由框架,它选择性地获取有信息量的模型反馈,并在相关查询之间共享能力信息,同时保留查询级别的细化以实现细粒度路由。我们通过综合考虑监督支出和后续服务时节省来评估路由效果。在四个路由基准上,主要设置仅使用约 33%–41% 的可用训练反馈,就能保持具有竞争力甚至更好的路由质量,并将与最快的常规路由器相比的盈亏平衡部署量降低约 1.9–9.5 倍。进一步的分析表明,获取更多监督并不总是经济上更优的:使服务成本最小化的监督水平,可能与最早实现回本的水平不同。我们的代码已公开于 https://github.com/LAMDA-Model-Reuse/SaveRouter。

查看 arXiv 页面 (https://arxiv.org/abs/2609.37402) 查看 PDF (https://arxiv.org/pdf/2609.37402) GitHub13 (https://github.com/LAMDA-Model-Reuse/SaveRouter) 加入合集 (https://huggingface.co/login?next=%2Fpapers%2F2609.37402)

在你的 agent 中获取本文:

hf papers read 2609.37402

还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

没有模型与本文关联

在模型 README.md 中引用 arxiv.org/abs/2609.37402,即可将本文关联到此页面。

引用该论文的数据集 0

没有数据集与本文关联

在数据集 README.md 中引用 arxiv.org/abs/2609.37402,即可将本文关联到此页面。

引用该论文的 Spaces 0

没有 Space 与本文关联

在 Space README.md 中引用 arxiv.org/abs/2609.37402,即可将本文关联到此页面。

收录该论文的合集 0

没有合集收录本文

将本文添加到合集 (https://huggingface.co/new-collection),即可将本文关联到此页面。

相似文章

从早期经验中学习智能体路由

arXiv cs.CL

本文介绍了 BoundaryRouter,这是一个无需训练的框架,通过根据早期经验将查询路由至轻量级推理或完整智能体执行来优化大型语言模型(LLM)智能体的使用。此外,本文还提出了 RouteBench,这是一个用于评估路由性能的基准,显示出在速度和准确率方面的显著提升。