一次预训练,随处路由:迈向LLM路由的基础模型
摘要
论文提出了RouteFM,一个面向LLM路由的基础模型,通过跨异构环境的情景化预训练学习可复用的路由能力,使一个冻结的路由器仅凭行为上下文即可适应新的领域、模态和候选模型池。在MMR-Bench上,RouteFM仅凭每个候选8条观测就以2.23个质量点领先最强基线,支持'一次预训练、随处路由'的范式。
查看缓存全文
缓存时间: 2026/10/02 04:26
论文页面 - 一次预训练,随处路由:迈向 LLM 路由的基础模型
来源:https://huggingface.co/papers/2609.37362
摘要
大语言模型(LLM)路由旨在将每个查询分配给异构候选模型池中最合适的模型,从而改善 LLM 推理的质量–效率权衡。现有的路由器通常通过局部拟合来学习:路由器针对特定的查询工作负载和候选模型池进行优化,并且当路由环境发生变化时,往往还需要额外的监督或重新训练。我们追问,LLM 路由能否从基础模型的视角出发,学习一种可复用的路由能力,使其能够在不同任务、候选模型和部署条件下进行泛化?为此,我们提出了 RouteFM,它学习从行为上下文中表征匿名的候选模型,并推断其针对特定目标的能力,而不是将路由决策绑定到固定的模型身份或单一环境上。通过对异构路由环境进行情景式预训练,这种能力可以被冻结的路由器直接复用,并且仅通过上下文即可适应新环境。实验证明了在领域、模态、候选模型池和上下文预算发生变化时的迁移能力,其中当行为证据有限时,收益最大。在未参与预训练的 MMR-Bench 上,RouteFM 仅凭每个候选 8 条观测记录,便以 2.23 个质量点超过了最强基线。这些结果支持将 LLM 路由从反复的局部拟合转向“一次预训练,随处路由“的范式。我们的代码已公开:https://github.com/LAMDA-Model-Reuse/RouteFM
查看 arXiv 页面 (https://arxiv.org/abs/2609.37362) 查看 PDF (https://arxiv.org/pdf/2609.37362) GitHub3 (https://github.com/LAMDA-Model-Reuse/RouteFM) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2609.37362)
在你的 agent 中获取本文:
hf papers read 2609.37362
还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 1
AIGNLAI/RouteFM (https://huggingface.co/AIGNLAI/RouteFM)
引用本文的数据集 0
暂无关联本文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2609.37362,即可从本页面链接它。
引用本文的 Spaces 0
暂无关联本文的 Space
在 Space README.md 中引用 arxiv.org/abs/2609.37362,即可从本页面链接它。
包含本文的合集 0
暂无包含本文的合集
将本文添加到合集 (https://huggingface.co/new-collection),即可从本页面链接它。
相似文章
LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施
LLMRouter将LLM路由统一表述为顺序决策过程,并提供了一个用于开发、评估和部署LLM路由器的开源基础设施和基准(xRouteBench)。实验结果表明,学习型路由器相比最强的固定模型基线实现了14.6%的相对提升。
RouteProfile:阐明用于路由的LLM配置文件的设计空间
本文介绍了RouteProfile,这是一个用于路由系统中LLM配置文件的设计空间,证明了结构化配置文件和查询级信号能够提高路由性能以及对新模型的泛化能力。
从早期经验中学习智能体路由
本文介绍了 BoundaryRouter,这是一个无需训练的框架,通过根据早期经验将查询路由至轻量级推理或完整智能体执行来优化大型语言模型(LLM)智能体的使用。此外,本文还提出了 RouteBench,这是一个用于评估路由性能的基准,显示出在速度和准确率方面的显著提升。
Pro-Router: 面向token的渐进式模型路由与自适应边云协作,实现高效多模态LLM推理
Pro-Router引入了一种面向token的渐进式模型路由方法,用于高效多模态LLM推理,通过自适应边云协作提高吞吐量并降低成本。
FlexRouter:为灵活的 LLM 路由学习互补模型集合
FlexRouter 提出了一种以覆盖率为导向的 LLM 路由框架,利用行列式点过程(Determinantal Point Processes)建模模型之间的互补性,最大化至少有一个被选中模型回答正确的概率,同时避免冗余选择和固定的计算预算。