SWRouter:面向多轮大型语言模型对话的相似度约束窗口路由

arXiv cs.CL 论文

摘要

介绍了SWRouter,一种用于多轮大型语言模型对话的相似度约束窗口路由器,解决了上下文分割和路由评估中的挑战。

arXiv:2609.11414v1 公告类型:新 摘要:大型语言模型表现出互补的优势,这激发了将每个查询分派给最合适的模型的路由方法。尽管现有路由器在单轮设置中有效,但它们不能直接转移到多轮对话中,其中路由性能关键取决于历史上下文如何被分割、保留并纳入当前提示。这引入了两个基本挑战:在上下文构建过程中防止信息丢失和信息混淆,以及在不将模型选择与提示构建质量混淆的情况下评估路由质量。本文中,我们提出了SWRouter,一种用于多轮大型语言模型路由的相似度约束窗口路由器。SWRouter结合了基于相似度的上下文分割机制用于提示构建,以及一个双度量评估框架,该框架将构建准确性与路由器性能解耦。在多轮对话基准测试上的实验表明,SWRouter始终超越强基线,在评估准确性上比最佳单个大型语言模型提高了16.26%,并且比Conv-ID上下文基线额外提高了8.22%。我们的结果强调,多轮大型语言模型路由需要上下文构建和评估的联合设计,而不是单轮路由方法的直接扩展。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:30

# SWRouter:面向多轮大语言模型对话的相似度收缩窗口路由  
来源:https://arxiv.org/html/2609.11414  
CCS:信息系统 检索模型与排序  
CCS:计算方法学 自然语言生成  
CCS:计算方法学 机器学习方法  

Yu Wang  
https://orcid.org/0009-0002-9928-1246  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:上海交通大学 大数据管理与应用系,上海,中国  

Yuchen Li  
https://orcid.org/0000-0002-3869-7881  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:上海交通大学 计算机科学学院,上海,中国;百度公司,北京,中国  

Rui Kong  
https://orcid.org/0009-0003-2889-2266  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:百度公司,北京,中国  

Xinran Chen  
https://orcid.org/0009-0009-9071-1933  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:百度公司,北京,中国  

Jiamin Chen  
https://orcid.org/0009-0003-6674-7764  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:百度公司,北京,中国  

Hengyi Cai  
https://orcid.org/0000-0002-7147-5666  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:百度公司,北京,中国  

Shuaiqiang Wang  
https://orcid.org/0000-0002-9212-1947  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:百度公司,北京,中国  

Jiashu Zhao  
https://orcid.org/0000-0002-1241-0686  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:威尔弗里德·劳雷尔大学,滑铁卢,加拿大  

Yulun Zhang  
https://orcid.org/0000-0002-2288-5079  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:上海交通大学 计算机科学学院,上海,中国  

Zhonghao Lyu  
https://orcid.org/0000-0002-0980-1395  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:香港恒生大学 计算机科学系,香港特别行政区,中国  

Haoyi Xiong  
https://orcid.org/0000-0002-5451-3253  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:百度公司,北京,中国  

Linghe Kong  
https://orcid.org/0000-0001-9266-3044  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:上海交通大学 计算机科学学院,上海,中国  

Jimmy Xiangji Huang  
https://orcid.org/0000-0003-1292-1491  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:约克大学,多伦多,加拿大  

and  

Dawei Yin  
https://orcid.org/0000-0002-0684-6205  
邮箱:[[email protected]](mailto:[email protected])  
所属机构:百度公司,北京,中国  

© , 2025  

###### 摘要  
大语言模型展现出互补的优势,这促使了将每个查询动态分配给最合适模型的路由方法的研究。尽管现有路由器在单轮设置下表现有效,但它们并不能直接迁移到多轮对话中,因为路由性能严重依赖于历史上下文如何被分段、保留并整合到当前提示中。这引入了两个根本性挑战:在上下文构建过程中防止信息丢失与信息混淆,以及在不混淆模型选择与提示构建质量的情况下评估路由质量。本文提出SWRouter,一种用于多轮大语言模型路由的相似度收缩窗口路由器。SWRouter结合了基于相似度的上下文分段机制(用于提示构建)与双指标评估框架(将构建准确性与路由器性能解耦)。在多轮对话基准测试上的实验表明,SWRouter持续超越强基线,在评估准确性上比最佳单个大语言模型提升16.26%,并在Conv-ID Context基线上进一步提升8.22%。我们的结果凸显了多轮大语言模型路由需要上下文构建与评估的联合设计,而非单轮路由方法的直接扩展。  

###### 关键词  
大语言模型,多轮对话,LLM路由,上下文分段,评估框架,模型选择  

## 1. 引言  
大语言模型已成为广泛智能应用的核心基础设施,包括对话助手、代码生成、内容创作,以及日益兴起的AI搜索与智能问答(Li et al., 2025; Chen et al., 2025; Li et al., 2026a)。其快速普及也推动了提高长上下文处理与推理效率的持续努力(Li et al., 2026b; Li et al., 2026c)。与此同时,许多组织开发了自己的大语言模型家族,例如OpenAI的ChatGPT(OpenAI, 2022)、DeepSeek的DeepSeek(DeepSeek-AI, 2024)、Meta的LLaMA(Touvron et al., 2023a)、Google的Gemini(Gemini Team, 2023)以及Anthropic的Claude(Anthropic, 2024)。然而,没有单一模型能在所有任务和应用中始终保持最佳表现。例如,OpenAI的GPT系列以强大的文本生成能力著称(OpenAI, 2022),DeepSeek在数学推理方面表现出色(Shao et al., 2024),而Claude在代码生成与理解方面尤为有效(Anthropic, 2024)。这种异构性激发了对*LLM路由*日益增长的研究兴趣,即动态地将每个查询分配给最合适的模型,而非依赖于一个固定的模型处理所有输入。现有路由方法在单轮设置下已取得有前景的结果,其中路由决策基于单个独立的提示。代表性例子包括在规模相似的模型间进行选择的路由器,如RouterDC(Chen et al., 2024),以及在大小模型间决策的方法,如C2MAB-V(Dai et al., 2024)。然而,直接将这些路由策略应用于多轮对话是根本上困难的,因为在对话系统中,模型选择不仅取决于当前的用户查询,还取决于对话历史如何被分段、保留并整合到提示中。  

图1展示了多轮LLM路由评估中的上下文分段失败和归因偏差。  
图1. 多轮大语言模型路由中两个挑战的图示。  
(a) 上下文构建阶段接收对话历史和当前用户轮次,然后在路由前决定应保留哪些历史轮次。当此步骤遗漏必要历史时,被路由的模型会收到不完整的提示并遭受信息损失;当它在话题转换后仍携带过时轮次时,提示会包含误导性上下文并导致信息混淆。  
(b) 评估阶段仅观察最终的路由响应分数,但该分数由提示构建和模型选择共同决定。高质量的窗口可以提高所有候选LLM的绝对分数,而一个糟糕的窗口即使路由器仍选择了相对最佳模型也会降低这些分数,除非构建质量和路由器性能被分别度量,否则会产生归因偏差。  

在多轮对话中,朴素地使用历史上下文会引入两个根本性挑战。  
- • 首先,缺乏上下文分段机制。当历史信息未被恰当地分段和整合时,路由器可能无法区分相关与不相关的历史上下文。这导致两种具体的失败模式:信息丢失,即省略了当前响应所需的关键历史信息;以及信息混淆,即将过时的上下文错误地带入新话题。如图1所示,缺失先前上下文可能导致基于规则的查询失败,而不正确地重用过时上下文则会在话题转换后降低性能。  
- • 其次,多轮路由器评估中存在归因偏差。在多轮设置下,最终响应质量由两个因素共同决定:上下文构建的质量以及所选模型在构建的提示下的性能。一个构建不佳的提示可能会显著降低所有候选模型的响应,无论选择了哪个模型。相反,即使上下文构建良好,糟糕的模型选择仍可能导致不令人满意的响应。如图1所示,一个构建良好的提示和一个构建不佳的提示可能导致所有候选模型的响应质量出现显著差异(例如,0.9/0.7/0.3 对比 0.09/0.07/0.03)。然而,观察到的推理准确性本身无法表明这种性能变化是来自上下文构建阶段,还是来自训练好的路由器的错误。这混淆了构建质量与路由质量,使得对多轮路由系统的忠实评估变得困难。  

为了解决这些问题,我们提出了SWRouter,一个多轮LLM路由框架,它联合处理上下文构建、路由器训练和评估。SWRouter包含三个紧密耦合的组件:(1) 一个基于相似度的上下文分段机制,在构建提示时选择性地整合语义相关的历史轮次,从而减少信息丢失和信息混淆;(2) 一个可插拔的路由器骨干网络,在构建的提示上使用对比目标进行训练以选择最合适的模型;以及(3) 一个解耦的评估框架,将构建准确性与路由器性能分离,从而能够独立地对每个组件进行忠实评估。我们在多轮对话基准测试上评估了SWRouter,并将其与具有代表性的路由基线和强大的单个LLM进行比较。实证表明,SWRouter持续匹配或超越Conv-ID Context基线,将平均准确性比最佳单个LLM提高了16.26%,并在多轮对话基准测试上比Conv-ID Context基线进一步实现了8.22%的增益。我们的贡献总结如下:  
- • 我们发现多轮对话路由中缺乏上下文分段导致两种具体的失败模式——信息丢失和信息混淆。为了解决这个问题,我们提出了一种基于相似度的提示构建机制,以整合历史和当前信息。  
- • 我们揭示了现有路由器评估协议中的分类偏差,并引入了一个解耦的评估框架,包含三个互补指标:评估准确性、构建准确性和路由器性能。  
- • 我们构建了一个强大的Conv-ID Context基线,并进行了广泛的分布内和分布外评估。SWRouter在多轮基准测试上比最佳单个LLM和Conv-ID Context分别实现了16.26%和8.22%的增益,并在OOD任务上比Conv-ID Context高出2.68%。解耦指标分析进一步证实,增益源于改善的构建准确性($\bar{w}$),而路由器性能($P_{\text{router}} > 1$)验证了在所有设置下有效的模型选择。  

## 2. 背景与动机  
### 2.1. 问题形式化  
在传统的单轮LLM路由中,路由决策仅基于当前提示:给定一个用户查询,路由器选择预期能产生最佳响应的候选模型。然而,在多轮对话中,这个问题变得根本上更具挑战性。路由器不仅必须确定*选择哪个*模型,还必须决定*应保留哪些历史上下文*以及*如何将该上下文整合*到当前提示中。形式上,令$\mathcal{M}=\{M_t\}_{t=1}^T$表示包含$T$个候选LLM的池,$\mathcal{D}_{\text{train}}=\{(x_i,y_i)\}_{i=1}^n$表示训练集,其中$x_i$是当前用户输入,$y_i$是对应的目标答案。在单轮设置下,路由直接在$x_i$上执行。而在多轮设置下,当前轮次应与相关的对话历史一起解释。因此,有效的路由输入不再是原始查询$x_i$,而是一个*上下文增强的查询*$c_i$,它通过将当前轮次与选定的历史信息相结合而构建。更具体地说,对于每个当前查询$x_i$,我们通过将其与语义相关的历史轮次整合来构建组合查询$c_i$。这产生了一个转换后的训练集$\mathcal{C}_{\text{train}}=\{(c_i,y_i)\}_{i=1}^n$,其中$c_i$捕捉了路由应基于的多轮上下文。路由器随后在候选模型池$\mathcal{M}$上产生概率分布,并选择最适合在构建的提示下回答问题的模型。常用符号总结在表1中。  

表1. 符号与定义。  

此形式化突出了单轮和多轮路由之间的一个关键区别:在多轮对话中,路由质量不仅取决于模型选择,还取决于提示构建。如果相关历史被遗漏,被路由的模型可能会因*信息丢失*而失败;如果无关或过时的历史被保留,被路由的模型则可能遭受*信息混淆*。如图1所示,这两种失败模式出现在路由决策本身之前,并直接影响下游响应的质量。  

### 2.2. 单轮LLM路由及其局限性  
在现有的单轮路由方法中,RouterDC(Chen et al., 2024)是一个代表性的方法。它学习一个将输入查询映射到候选LLM概率分布的路由器,并使用双重对比目标优化路由过程。这种设计在单轮场景下有效,因为路由器仅需对单个提示进行独立推理(Chen et al., 2024)。然而,这个假设在多轮对话中并不成立。像RouterDC(Chen et al., 2024)这样的单轮路由器将当前提示作为路由单元,而忽略了提示本身可能因对话历史未被恰当地分段和整合而不完整甚至误导的事实。结果,即使路由器为观察到的输入选择了相对最佳模型,端到端系统仍可能因路由输入构建不佳而失败。这种局限性在我们的情况下尤为重要,原因有二。首先,多轮对话引入了*上下文选择问题*:系统

相似文章