SeLMRoute:基于概率化语义证据的大语言模型路由
摘要
SeLMRoute 提出了一种大语言模型路由框架,将与候选模型无关的语义证据抽取与性能学习解耦。在 LLMRouterBench 上,跨越 15 个数据集和 20 个候选模型,该框架取得了 72.08% 的平均准确率,超越了最强的固定候选模型(69.23%),并同时支持面向性能和成本感知的路由决策。
查看缓存全文
缓存时间: 2026/10/01 16:23
论文页面 - SeLMRoute:面向大语言模型路由的概率化语义证据
来源:https://huggingface.co/papers/2609.34736
摘要
大语言模型(LLM)路由旨在为每个传入的查询选择最合适的模型。现有的大多数路由方法直接从查询嵌入、模型表征、偏好数据或相似样本聚类中学习这一决策。这类方法虽然可能有效,但用于路由的表征很少明确说明查询实际上需要什么。我们提出 SeLMRoute,一个路由框架,将候选模型无关的语义证据提取、候选模型性能学习以及部署目标的应用分离开来。一个决策模型首先针对该查询评估一组可解释的问题,例如其推理需求和对外部知识的使用,每次判断都保留为一个概率分布。由此得到的概率化语义状态被一个轻量级的有监督路由器用来估计候选模型的性能。路由目标在性能估计之后才被应用,这使得同一个语义状态既能支持面向性能的决策,也能支持成本感知的决策。在 LLMRouterBench(15 个数据集、20 个候选模型、11,481 条查询)上,SeLMRoute 平均达到 72.08%±0.45 的准确率,分组五折外推(out-of-fold)评估达到 72.64%,而表现最强的固定候选模型为 69.23%。在所评估的语义、稠密、词法及领域级表征中,该表征取得了最高的平均性能。在另一个涉及 13 个模型的性能-成本设置中,SeLMRoute 在全部五个分组划分上都提升了性能,平均 PerfGain 为 2.66%。我们的代码已开源:https://github.com/Indigma-Innovations/SeLMRoute
查看 arXiv 页面 (https://arxiv.org/abs/2609.34736) 查看 PDF (https://arxiv.org/pdf/2609.34736) GitHub 仓库 (https://github.com/Indigma-Innovations/SeLMRoute) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.34736)
在你的智能体中获取这篇论文:
hf papers read 2609.34736
还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
暂无模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2609.34736,即可将本文链接到此页面。
引用本文的数据集 0
暂无数据集关联本文
在数据集 README.md 中引用 arxiv.org/abs/2609.34736,即可将本文链接到此页面。
引用本文的 Spaces 0
暂无 Space 关联本文
在 Space README.md 中引用 arxiv.org/abs/2609.34736,即可将本文链接到此页面。
包含本文的合集 0
暂无合集收录本文
将本文添加到合集 (https://huggingface.co/new-collection),即可将本文链接到此页面。
相似文章
SLMs 作为多智能体路由器:一种渐进式 SFT 与强化学习方法
本文提出通过渐进式监督微调和强化学习训练小语言模型作为多智能体路由器,相比仅基于意图路由的LLM基线方法,实现了更好的检索相关性和更低的延迟。
LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施
LLMRouter将LLM路由统一表述为顺序决策过程,并提供了一个用于开发、评估和部署LLM路由器的开源基础设施和基准(xRouteBench)。实验结果表明,学习型路由器相比最强的固定模型基线实现了14.6%的相对提升。
一次预训练,随处路由:迈向LLM路由的基础模型
论文提出了RouteFM,一个面向LLM路由的基础模型,通过跨异构环境的情景化预训练学习可复用的路由能力,使一个冻结的路由器仅凭行为上下文即可适应新的领域、模态和候选模型池。在MMR-Bench上,RouteFM仅凭每个候选8条观测就以2.23个质量点领先最强基线,支持'一次预训练、随处路由'的范式。
SEAR:面向弱到强多语言语音选择题的片段证据感知路由
本文介绍了SEAR系统,用于多语言语音选择题,通过片段证据感知路由、监督微调和强化学习,在MLC-SLM挑战赛中实现了90.92%的准确率。
用于鲁棒成对LLM评判的骨干自适应证据路由
BAER引入了一种骨干自适应证据路由方法,用于鲁棒的成对LLM评判,通过根据条件动态选择证据机制,在多个基准测试中实现了更高的准确性。