IR3DE: 一种面向大语言模型的线性路由器
摘要
IR3DE 是一种基于岭回归的路由器,可为不同任务选择领域专家大语言模型,在实现具有竞争力的性能的同时,还支持动态添加或移除专家而无需重新训练。
查看缓存全文
缓存时间: 2026/06/10 09:43
论文页面 - IR3DE:大语言模型的线性路由器
来源:https://huggingface.co/papers/2606.06098
摘要
一种基于岭回归的路由方法,在为不同任务选择领域专家大语言模型方面取得了具有竞争力的性能,同时支持动态添加/移除专家模型而无需重新训练。
基础大语言模型在广泛的一般任务上展现出熟练能力,并通过领域专家大语言模型在各类专业任务上取得了显著成果。随着可用大语言模型列表的不断增长,推理路由器被提出用于为每个提示选择最合适的大语言模型。然而,现有路由方法要么在弱到强通用大语言模型之间优化成本,要么需要大量训练来支持领域专业知识路由。本文提出 IR3DE,一种基于岭回归的领域专家路由器,为每个提示提供廉价且快速的路由决策。我们在两种因果语言建模设置(其中所有领域的任务都是下一个词元预测)和一种推理设置(每个领域有其独特的推理任务)中评估了 IR3DE。尽管是一个线性路由器,IR3DE 在两种因果语言建模设置中均达到了与其他基线相当的性能,并在推理设置中超越了它们,归一化性能达到 98.4%。此外,IR3DE 支持添加或移除新的领域专家模型,而无需从头重新训练路由器,从而允许以最小中断服务动态的大语言模型集合。我们的代码位于:github.com/gensyn-ai/IR3DE。
查看 arXiv 页面 (https://arxiv.org/abs/2606.06098) 查看 PDF (https://arxiv.org/pdf/2606.06098) 项目页面 (https://blog.gensyn.ai/look-beyond-one-size-fits-all-llms-with-ir3de/) GitHub2 (https://github.com/gensyn-ai/IR3DE) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06098)
在你的智能体中获取这篇论文:
hf papers read 2606.06098
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.06098 以从此页面链接。
引用该论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.06098 以从此页面链接。
引用该论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.06098 以从此页面链接。
包含该论文的收藏集1
相似文章
LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施
LLMRouter将LLM路由统一表述为顺序决策过程,并提供了一个用于开发、评估和部署LLM路由器的开源基础设施和基准(xRouteBench)。实验结果表明,学习型路由器相比最强的固定模型基线实现了14.6%的相对提升。
VDAR-Router: 通过语言化查询难度分析检索的自适应LLM路由
一篇新论文提出了VDAR-Router,这是一个面向LLM的难度感知的基于检索的路由框架,能够根据查询难度自适应选择模型,实现更好的成本-性能权衡。
Pro-Router: 面向token的渐进式模型路由与自适应边云协作,实现高效多模态LLM推理
Pro-Router引入了一种面向token的渐进式模型路由方法,用于高效多模态LLM推理,通过自适应边云协作提高吞吐量并降低成本。
alexzhang13/rlm
递归语言模型(RLMs)引入了一种与任务无关的推理范式,使语言模型能够通过递归地在输入上调用自身来处理近乎无限的上下文,同时还提供了配套的开源推理引擎和训练环境。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。