SLMs 作为多智能体路由器:一种渐进式 SFT 与强化学习方法
摘要
本文提出通过渐进式监督微调和强化学习训练小语言模型作为多智能体路由器,相比仅基于意图路由的LLM基线方法,实现了更好的检索相关性和更低的延迟。
arXiv:2608.00030v1 公告类型:新
摘要:专业检索代理通常能提供比通用搜索更高质量的结果,但如何为给定查询选择最优代理仍是一个开放问题。当前方法基于推断的主题或意图来路由查询,然而基于意图的选择存在根本性局限:它不利用检索内容的信号,也无法检测到主题匹配的代理产生低相关结果的情况。我们通过监督微调后接强化学习来训练一个小型语言模型,以联合执行代理选择和下游工具调用的结构化参数生成,并使用基于检索相关性和查询-代理主题对齐的分层奖励函数。这使得模型能够从检索性能中学习任务相关的代理适用性:对于哪些查询分布,哪些代理能稳定产生高相关结果;以及在表面主题重叠的情况下,何时应将查询从专业代理转移开。在这样一组有针对性的代理-查询不匹配子集中,训练后的模型NDCG@10达到0.918,而两个仅基于意图路由的LLM基线(Amazon Nova Lite 和 Claude Haiku 4.5)分别为0.539和0.490。总体而言,该模型平均NDCG@10达到0.771(比Nova Lite提高0.177,比Haiku提高0.219),平均选择延迟为120.1毫秒,与Nova Lite相比降低了82.4%。
查看缓存全文
缓存时间: 2026/08/04 07:37
# 小型语言模型作为多智能体路由器:渐进式监督微调与强化学习方法 来源:https://arxiv.org/html/2608.00030 (2026年4月15日) ###### 摘要。 专门的检索智能体通常比通用搜索产生更高质量的结果,但为给定查询选择最优智能体仍然是一个开放问题。当前方法基于推断的主题或意图进行路由,然而基于意图的选择存在根本性局限:它没有纳入检索内容的信号,也无法检测到主题对齐的智能体产生低相关性结果的情况。我们通过监督微调后接强化学习来训练一个小型语言模型,以联合执行智能体选择和下游工具调用的结构化参数生成,使用基于检索相关性和查询-智能体主题对齐的分层奖励函数。这使得模型能够从检索性能中学习任务相关的智能体适配性:哪些智能体对于哪些查询分布可靠地产生高相关性结果,以及何时将查询从专业智能体重定向,尽管表面上存在主题重叠。在一个针对此类智能体-查询错配的子集上,训练后的模型实现了0.918的NDCG@10,而两个仅凭意图路由的LLM基线(Amazon Nova Lite和Claude Haiku 4.5)分别为0.539和0.490。总体而言,它实现了0.771的平均NDCG@10(比Nova Lite高0.177,比Haiku高0.219),平均选择延迟为120.1毫秒,比Nova Lite降低82.4%。 多智能体检索、查询路由、智能体选择、强化学习、小型语言模型、渐进式后训练 ††版权:无††期刊年份:2026††会议:SIGIR 2026第一届智能体索引、检索与排名研讨会(AgentSearch);2026年7月24日;澳大利亚墨尔本††CCS:信息系统 检索模型与排序††CCS:计算方法 强化学习††CCS:信息系统 查询表示 ## 1. 引言 随着AI系统日益依赖专门的检索智能体来回答复杂查询,为给定信息需求选择最合适智能体的任务已成为检索质量的关键决定因素。针对特定领域或数据源量身定制的主题特定检索智能体,通常比宽泛的通用搜索系统产生更高质量的结果(Sugiura和Etzioni,2000(https://arxiv.org/html/2608.00030#bib.bib29))。然而,这种专门化产生了一个选择问题:给定一个能力重叠但各具特色的异构智能体池,系统应如何确定哪个或哪些智能体最能服务特定查询?这个问题,即基于任务相关适配性的检索智能体选择与排序,是一个一流的信息检索挑战,处于查询理解与智能体评估的交叉点。 选择正确的智能体很困难,因为查询简短、常常模糊,并且往往不能完全反映用户信息需求(Broder等,2007(https://arxiv.org/html/2608.00030#bib.bib36);Montazeralghaem等,2020(https://arxiv.org/html/2608.00030#bib.bib20))。一个表面上匹配专业智能体领域的查询,如果触及该智能体专业知识的边界,可能并不会得到该智能体的良好服务。例如,一个处于基因组学和通用生物医学文献交叉点的查询,可能尽管存在主题重叠,却无法由专门的基因组学智能体很好地服务。基于意图的路由(仅根据查询主题选择智能体)无法检测这些错配,因为它从未观察智能体实际检索到了什么。这一局限适用于任何选择器,无论它是专用分类器、基于规则的系统,还是被提示推断查询意图的大型语言模型(Anand等,2023(https://arxiv.org/html/2608.00030#bib.bib2))。 我们认为,智能体选择不仅应基于查询意图,还应基于下游检索性能。通过训练一个接收检索结果质量反馈的选择器,系统可以学习任务相关的智能体适配性:哪些智能体对于哪些类型的查询可靠地产生高质量结果,以及至关重要的是,何时一个专业智能体尽管表面主题对齐却并不适合。这一原则与最近将检索器选择框定为基于下游效用的学习排序问题的工作相关联(Kim和Diaz,2025(https://arxiv.org/html/2608.00030#bib.bib37)),并将联邦搜索中的经典资源选择问题(Shokouhi和Si,2011(https://arxiv.org/html/2608.00030#bib.bib39);Wang等,2025b(https://arxiv.org/html/2608.00030#bib.bib38))扩展到智能体化检索系统环境中,其中智能体通过带有领域特定参数的结构化工具调用来调用。 仅靠监督微调可以教会模型基于查询的内在特征(如主题、关键词和时间信号)来选择智能体。然而,这从根本上受到与纯意图路由相同问题的限制:模型从未观察智能体实际检索到了什么,因此无法学习何时一个主题合适的智能体会产生糟糕的结果。强化学习通过将下游检索质量作为奖励信号直接解决了这一问题,使模型能够发现哪些智能体对哪些查询类型可靠地表现良好,包括表面主题对齐具有误导性的情况。这两个阶段相辅相成:监督微调为强化学习提供了坚实的查询理解基础以进行探索,而强化学习则基于实际有效的下游表现来精炼选择决策。这种渐进式方法使即使是小型语言模型也能超越大型模型的选择质量,因为选择基于经验性的检索性能,而非领域的参数化知识。 在生产级智能体系统中,每个查询都经过选择层,这使得智能体选择的成本和延迟成为扩展的瓶颈。基于LLM的选择器产生大量的每查询推理成本,在数百万次请求中叠加,而其延迟在多步推理链中进一步放大,因为智能体顺序调用多个工具。除了选择器本身,不准确的选择还会带来下游成本:将查询路由到不合适的智能体浪费检索计算资源,在无关结果上消耗token,并可能触发昂贵的回退或重试机制。因此,选择器必须既准确又具有操作效率。小型语言模型满足这两个要求:凭更少的参数,它们提供显著更低的推理延迟和每查询成本(Subramanian等,2025(https://arxiv.org/html/2608.00030#bib.bib21);Belcak等,2025(https://arxiv.org/html/2608.00030#bib.bib12)),并且与渐进式后训练相结合时,它们可以在实时智能体检索所需的延迟和成本预算内达到或超过更大模型的选择质量。 我们的主要贡献如下:(1)我们证明通过强化学习将智能体选择基于检索质量信号能够产生更优的检索结果,训练后的路由器实现平均NDCG@10为0.771,而Nova Lite为0.594,Haiku为0.552。(2)我们表明RL训练的路由器能够识别纯意图路由不可见的智能体-查询错配,在重定向查询上实现0.918的NDCG@10,而Nova Lite为0.539,Haiku为0.490。(3)我们实现了平均选择延迟120.1毫秒,比Nova Lite降低82.4%,使得大规模端到端路由能够在150毫秒以下完成。 ## 2. 相关工作 在本节中,我们回顾与智能体和资源选择、从检索质量中学习、用于智能体选择的查询理解以及渐进式后训练相关的先前工作,因为它们与我们的多智能体路由器设计有关。 ### 2.1. 智能体与资源选择 为给定查询选择合适的源在信息检索中有着悠久的历史。在联邦搜索中,资源选择决定从异构的、不合作的源池中查询哪些搜索引擎,目标是在最小化不必要查询的同时最大化结果质量(Shokouhi和Si,2011(https://arxiv.org/html/2608.00030#bib.bib39))。经典方法依赖集合统计信息、采样文档或查询-资源特征来估计源的相关性(Sugiura和Etzioni,2000(https://arxiv.org/html/2608.00030#bib.bib29))。最近,Wang等人(Wang等,2025b(https://arxiv.org/html/2608.00030#bib.bib38))证明,大型语言模型可以通过使用logit概率对每个资源的适配性进行评分,在零样本和微调设置中执行资源选择,在TREC FedWeb集合上无需人工生成的标签即可实现有竞争力的性能。然而,基于LLM的选择产生大量每查询推理成本,使得当选择层位于每个检索请求的关键路径上时它不切实际。1¹Dhasade等人(Dhasade等,2026(https://arxiv.org/html/2608.00030#bib.bib43))通过RAGRoute解决了这个问题,这是一种用于联邦RAG中动态源选择的轻量级神经分类器,在保持检索质量的同时将查询开销降低高达77.5%。使用较小语言模型进行查询路由也被证明是有效的。Palumbo等人(Palumbo等,2025(https://arxiv.org/html/2608.00030#bib.bib4))提出了一种并行融合架构,其中大型教师模型生成路由决策并蒸馏到较小的学生模型中。除了选择单一源,Ding等人(Ding等,2025(https://arxiv.org/html/2608.00030#bib.bib31))在BEST-Route中证明,跨异构池的自适应路由优于二元路由方法,突显了查询并不总是由单一源最好地服务。我们的工作将此原则扩展到检索领域,支持在查询意图跨越多个领域时选择多个专门智能体。Kim和Diaz(Kim和Diaz,2025(https://arxiv.org/html/2608.00030#bib.bib37))在LTRR中将检索器选择框定为学习排序问题,训练模型根据检索器对下游LLM性能的预期效用增益对其进行排序。他们的工作表明,基于效用的选择优于启发式方法,我们共享这一原则。然而,LTRR使用特征工程模型对同一语料库的不同检索策略(稀疏、稠密、重排序)进行排序,而我们的工作则跨由不同数据源支持的领域专门智能体进行选择,使用通过强化学习训练的语言模型联合生成结构化工具调用参数。 ### 2.2. 从检索质量中学习 基于意图的智能体选择的一个关键局限是,仅凭查询文本不是确定哪个智能体表现良好的可靠基础。搜索查询常常不能完全反映用户信息需求(Broder等,2007(https://arxiv.org/html/2608.00030#bib.bib36);Montazeralghaem等,2020(https://arxiv.org/html/2608.00030#bib.bib20)),检索智能体可能在仅从查询主题看不出的特定优势上有所差异。Mu等人(Mu等,2025(https://arxiv.org/html/2608.00030#bib.bib30))提出了一种无监督的RAG查询路由方法,其中每个查询首先发给单一搜索引擎,然后使用所有引擎建立一个上界,评估指标确定每个查询最适合哪个引擎。虽然这证明了使用检索内容作为路由信号的价值,但它在计算上很昂贵,因为需要查询所有引擎来建立上界。在Deep Retrieval中,Jiang等人(Jiang等,2025(https://arxiv.org/html/2608.00030#bib.bib6))使用强化学习来生成增强查询,以最大化检索性能,使用仅30亿参数的小型语言模型并以检索指标作为奖励。他们的工作表明,以检索质量作为奖励的RL可以通过小模型改善检索结果,我们将这一原则从查询增强扩展到智能体选择:我们学习的不是为重写查询以适配单一引擎,而是学习选择将查询路由到哪个智能体。我们的方法的特点在于使用强化学习将智能体选择决策植根于端到端的检索质量。与优化查询文本或从集合统计中选择智能体不同,RL奖励信号教会模型哪些智能体对哪些类型的查询可靠地产生高质量结果,包括专业智能体尽管表面主题对齐却不适合的情况。 ### 2.3. 用于智能体选择的查询理解 有效的智能体选择不仅需要选择合适的智能体,还需要为其提供结构良好的输入。我们的路由器联合执行智能体选择、关键词提取和时间推断,每一个都借鉴了不同方向的先前工作。给定查询和预定义分类法,查询分类将查询分配到按主题或意图定义的排序类别中(Cao等,2009(https://arxiv.org/html/2608.00030#bib.bib35))。挑战在于查询简短且其内部信息有限(Broder等,2007(https://arxiv.org/html/2608.00030#bib.bib36))。LLM即使在意图未被明确陈述时也显示出理解查询意图的前景(Anand等,2023(https://arxiv.org/html/2608.00030#bib.bib2)),然而它们带来显著的延迟。小型语言模型已证明能够以更低的成本在分类任务上表现良好(Lepagnol等,2024(https://arxiv.org/html/2608.00030#bib.bib10))。历史上,搜索结果被用于改进查询分类,以补偿短查询有限的信息内容(Broder等,2007(https://arxiv.org/html/2608.00030#bib.bib36))。我们采用类似的原则,使用检索质量作为强化学习奖励信号,而非显式特征增强。在解析方面,从查询中派生出的属性不佳可能导致工具调用上下文不足和更高检索成本(Song和Zheng,2026(https://arxiv.org/html/2608.00030#bib.bib33);Chuang等,2023(https://arxiv.org/html/2608.00030#bib.bib34))。传统方法使用命名实体识别来提取显式属性,然而NER常常难以处理查询中未直接提到的隐式属性。Luo等人(Luo等,2023(https://arxiv.org/html/2608.00030#bib.bib1))使用知识图谱来确定隐式查询属性。LLM和较小语言模型已显示出提取实体和时间信号等特征的能力,从而改善工具调用的结构参数(Palumbo等,2025(https://arxiv.org/html/2608.00030#bib.bib4))。我们的目标是在单个小型语言模型中与智能体选择联合执行这种提取,使两个任务都受益于相同的训练信号。 ### 2.4. 用于智能体选择的渐进式后训练 尽管监督微调泛化能力有限(Wu等,2026(https://arxiv.org/html/2608.00030#bib.bib14);Chu等,2025(https://arxiv.org/html/2608.00030#bib.bib7)),它允许模型学习领域内数据,鉴于小型语言模型对多个不同专业领域的参数化知识很少,这尤其有帮助。W
相似文章
SOMA:通过小语言模型实现高效的 LLM 多轮对话服务
本文介绍了 SOMA,这是一种高效的 LLM 多轮对话服务框架,它利用经过软提示和 LoRA 微调适配的小语言模型来降低延迟和成本。
从早期经验中学习智能体路由
本文介绍了 BoundaryRouter,这是一个无需训练的框架,通过根据早期经验将查询路由至轻量级推理或完整智能体执行来优化大型语言模型(LLM)智能体的使用。此外,本文还提出了 RouteBench,这是一个用于评估路由性能的基准,显示出在速度和准确率方面的显著提升。
当大型语言模型发展语言:用于高效多智能体推理的符号通信
本文提出通信语言符号路由(CLSR),多个LLM智能体自主发明并演化紧凑的符号语言进行推理,相比思维链(CoT)实现3-6倍的令牌减少,同时保持准确性。
动态潜路由
动态潜路由(DLR)让LLM通过搜索组合子策略来学习自己的内心独白,其灵感来源于语言的组合性。在低数据微调场景中,DLR达到或优于标准的监督微调。
从受训者到训练者:LLM为多智能体推理强化学习设计的训练环境
本文介绍了LLM-as-Environment-Engineer框架,该框架使LLM能够为多智能体推理任务中的强化学习设计自己的训练环境,实现自我改进训练,其性能超越更大的专有模型。