VDAR-Router: 通过语言化查询难度分析检索的自适应LLM路由
摘要
一篇新论文提出了VDAR-Router,这是一个面向LLM的难度感知的基于检索的路由框架,能够根据查询难度自适应选择模型,实现更好的成本-性能权衡。
arXiv:2607.18098v1 公告类型:新
摘要:大型语言模型在实际系统中日益普及,因此高效的模型选择对于降低部署成本变得非常重要。LLM路由作为一种实用解决方案应运而生,它能在期望的成本-性能权衡下将每个输入查询分配到合适的模型。现有路由方法通常根据输入查询的表面语义或嵌入相似性来评估模型适用性。然而,这类方法可能忽略查询的潜在难度,从而导致次优的路由决策。为解决这一挑战,我们提出了VDAR-Router,一种难度感知的基于检索的路由框架。对于每个输入查询,VDAR-Router首先生成明确的难度分析,然后检索具有相似难度分布的历史示例。基于检索到的记录,它评估候选模型的适用性,并通过一个同时考虑性能和成本的奖励函数来选择模型。在三个数据集上的实验表明,VDAR-Router始终优于现有基线,实现了更好的成本-性能权衡。这些结果证明了难度感知检索在无训练LLM路由中的有效性。案例分析进一步表明,明确的查询分析有助于检索更相关的示例,并支持更可靠的路由决策。
查看缓存全文
缓存时间: 2026/07/21 06:47
# 自适应LLM路由:基于显式查询难度分析检索 来源:https://arxiv.org/html/2607.18098 Yu-Chien Tang†, Jun-Chen Hung†, Wen-Chih Peng, An-Zi Yen 国立阳明交通大学 资讯工程学系 台湾新竹 [email protected], [email protected], [email protected], [email protected] ###### 摘要 大型语言模型越来越多地应用于实际系统中,因此高效的模型选择对于降低部署成本至关重要。LLM路由作为一种实用方案出现,旨在为每个输入查询分配一个合适的模型,以在期望的成本与性能之间取得平衡。现有的路由方法通常根据输入查询的表面语义或嵌入相似性来估计模型的适用性。然而,这类方法可能忽略查询的潜在难度,导致路由决策欠优。为应对这一挑战,我们提出了VDAR-Router,一种基于难度感知的检索式路由框架。对于每个输入查询,VDAR-Router首先生成显式的难度分析,然后检索具有相似难度特征的历史样例。基于检索到的记录,它估计候选模型的适用性,并使用同时考虑性能和成本的奖励函数选择模型。在三个数据集上的实验表明,VDAR-Router在成本-性能权衡上持续优于现有基线方法。这些结果证明了难度感知检索对免训练LLM路由的有效性。案例研究进一步表明,显式的查询分析有助于检索更相关的样例,并支持更可靠的路由决策。¹ ¹我们的代码已公开于 https://anonymous.4open.science/r/vdar-router --- **VDAR-Router: 自适应LLM路由 via 显式查询难度分析检索** Yu-Chien Tang†, Jun-Chen Hung†, Wen-Chih Peng, An-Zi Yen 国立阳明交通大学 资讯工程学系 台湾新竹 [email protected], [email protected], [email protected], [email protected] ¹ 这些作者对本文贡献相等。 ## 1 引言 大型语言模型(LLMs)发展迅速,在摘要生成、代码生成和数学推理等广泛任务中表现出色 (Xue et al., 2024; Wang et al., 2024; Tian et al., 2025; Singh et al., 2026)。与此同时,LLMs越来越多地嵌入到智能体工作流中,这些工作流需要规划行动、调用工具、检索信息、检查代码以及做出多步决策 (Yao et al., 2023; Schick et al., 2023; Qin et al., 2024; Zheng et al., 2024),新兴系统如 OpenClaw² 反映了这一实际应用趋势。这些工作流通常需要一系列异构的模型调用,从简单的信息提取到复杂的推理或代码编辑。然而,总是调用最强的模型会迅速耗尽用户预算或服务配额,而依赖便宜但能力较弱的模型则可能对困难查询给出糟糕的响应。由于不同模型在架构、训练数据、参数量级和能力特征上存在差异,它们在任务上表现出不同的优势、成本、延迟和响应特性 (Barandoni et al., 2026),这给在预算内动态识别最适合用户各种查询的模型带来了独特挑战。  图1:使用难度分析而非原始查询来选择模型的示例。 越来越多的研究将LLM路由作为平衡响应质量与推理成本的一种方法。一个常见方向是以二元方式处理路由,即将简单查询分配给便宜模型,复杂查询路由到更强模型 (Chen et al., 2024a; Ding et al., 2024; Ong et al., 2025)。在此基础上,近期方法通过从标注样本、偏好数据或基准性能记录中学习训练路由模型,以预测每个查询最合适的模型 (Chen et al., 2024b; Feng et al., 2025a; Dai et al., 2024; Wang et al., 2025)。其他方法进一步结合检索或难度估计,将输入查询与先前观测到的样本进行比较,或显式建模查询难度以支持路由决策 (Stripelis et al., 2024; Song et al., 2025)。然而,这些现有方法大多仍然严重依赖查询本身作为主要路由信号。路由器通常需要从主要编码表面语义(如主题、措辞或任务类别)的查询表示中学习或检索,而语义相似性并不总能反映与模型选择相关的难度特征。基于这些发现,我们旨在观察回答问题所需的能力以及查询的难度,从而生成细粒度的查询知识。我们假设:如果具有相似难度的查询需要相似的技能才能正确回答,那么每个模型在这些查询上的响应质量应该是相似的,从而为模型路由提供可靠证据。如图1所示,两条算术查询在原始文本中可能看起来不相关,但两者都只需要简单的单步推理。相反,两条网站生成查询在语义上可能相似,但一条可能只需要简单的个人网页,而另一条则需要更复杂的功能、规划和实现细节。在这些情况下,如果路由器了解每个模型在具有相似难度分析的查询上的表现,就能更好地捕捉输入查询的能力排名,从而选择最合适的模型。 在本文中,我们提出VDAR-Router,一种基于难度感知检索的LLM路由框架。给定一个输入查询,VDAR-Router首先分析其难度特征,并利用分析结果表示检索历史上具有相似路由相关挑战的查询。然后,它根据检索到的样本对应的历史性能或偏好信号估计模型适用性。最后,通过联合考虑响应质量和推理成本做出路由决策。这种设计使得VDAR-Router能够在具有共享难度模式的查询之间复用路由证据,同时区分表面相似但需要不同模型能力的查询。总之,我们的贡献有三方面: - 我们引入了一种新颖的LLM路由方法,将查询难度的显式诊断作为检索目标。分析结果也可作为每个路由决策的人可解释元数据。 - 我们提出了VDAR-Router,一个即插即用的基于检索的路由框架。通过将测试查询的难度特征与历史查询匹配,并考虑成本对模型能力顺序进行重新排序,VDAR-Router能够在无需额外训练的情况下估计模型适用性。 - 在三个模型选择数据集上的实验结果表明,VDAR-Router能够有效识别相对模型能力排名,为LLM路由的实践者提供了新的视角。 ## 2 相关工作  图2:VDAR-Router工作流概览。 高效的LLM路由旨在将输入查询导向最合适的模型,近期得到了广泛探索。早期工作主要受LLM部署中成本与质量平衡的驱动,从便宜但能力弱的模型和昂贵但能力强的模型中选择回答模型 (Chen et al., 2024a; Ding et al., 2024; Ong et al., 2025)。这些工作确立了LLM路由的核心直觉:不同查询需要不同级别的模型能力,路由可以利用这种异质性降低成本。 近期工作以监督方式构建路由器框架。RouterDC (Chen et al., 2024b) 使用双重对比学习来学习查询和模型表示以进行LLM选择。GraphRouter (Feng et al., 2025a) 将任务、查询和LLMs表示为异构图,并将路由公式化为边预测问题。一些研究者还利用基于bandit的学习来优化路由策略 (Dai et al., 2024; Wang et al., 2025)。然而,这些方法的共同局限在于依赖训练额外的神经模型,并且每个路由决策的可解释性有限,这可能导致实际部署复杂化。 另一条研究线探索采用检索方法来评估候选LLM是否能够回答查询。Stripelis et al. (2024) 使用KNN检索,并选择在检索到的查询上表现最佳的LLM。IRT-Router (Song et al., 2025) 具有类似思想,并进一步应用项目反应理论(IRT)来估计查询的数值难度并校准LLM的性能排名。与使用查询嵌入不同,我们在显式查询难度分析的嵌入上进行检索,以更好地识别每个LLM在具有类似能力需求的查询上的表现。 ## 3 方法 ### 3.1 预备知识 #### 3.1.1 问题形式化 我们形式化定义训练查询集 \( Q_t = \{q_t^1, q_t^2, \dots\} \),候选LLM集 \( M = \{m^1, m^2, \dots\} \),以及每个LLM在 \( Q_t \) 上的响应性能和成本。路由器的目标是从 \( Q_t \) 中学习,为传入查询 \( q \) 智能选择最优模型 \( m \in M \),同时平衡响应质量和成本。 #### 3.1.2 VDAR-Router 概览 我们提出一个无需训练且易于实现的框架 VDAR-Router,通过难度感知的查询-模型匹配来解决LLM路由问题。如图2所示,我们设计了一个LLM智能体——难度分析器(Difficulty Analyst),用于确定正确回答给定查询 \( q \) 所需的各能力维度上的熟练程度。我们首先通过提示难度分析器离线收集训练查询的难度分析,并将结果嵌入数据库(第3.2节)。在路由时,在生成传入查询的难度分析后,我们检索最相似的难度分析,并根据相应检索查询上的性能和成本对候选模型进行排序(第3.3节)。通过这种方式,每个模型的能力顺序与具有相似难度水平的查询的回答正确性对齐,从而支持更自适应的路由决策。 ### 3.2 难度分析收集 难度分析器的目标是通过识别解决查询所需的能力来估计输入查询的难度特征。我们假设显式推理所需的能力维度及其对应的熟练程度可以使路由器构建更细粒度的查询理解,从而改进LLM选择 (Chen et al., 2025; Yu et al., 2025)。为此,我们设计了难度分析器 \( \mathcal{M} \),用于推断回答给定查询所需的能力程度。受 Minaee et al. (2024) 和 Shi et al. (2025) 的启发,我们考虑七个能力维度:推理、理解、指令遵循、智能体能力、知识检索、编码和多语言能力。这些维度被整合到 \( \mathcal{M} \) 的系统提示中作为分析目标。给定输入查询 \( q \),智能体生成查询难度分析: \[ a = \mathcal{M}(q), \tag{1} \] 其中 \( a \) 描述了查询 \( q \) 在预定义维度上的难度特征和所需能力。为了收集用于路由的难度分析,我们对训练集 \( Q_t \) 中的每个查询 \( q_t^i \) 应用相同的分析过程。生成的难度分析 \( a_t^i \) 由嵌入模型 \( \mathcal{E} \) 编码,并在数据库中建立索引以供后续检索。这种设计使得 VDAR-Router 能够根据难度相似性而非查询相似性进行检索。因此,词汇上不同的查询在需要相似能力时仍能被一起检索以参考模型能力,而表面相似但难度特征不同的查询则能被区分开。³ ### 3.3 测试时难度感知路由 在运行时,对于传入查询 \( q \),难度分析器首先生成其难度分析 \( a \)。然后,生成的分析由相同的嵌入模型 \( \mathcal{E} \) 嵌入,并用于从数据库中检索具有相似难度特征的 top-k 相似分析 \( a_r \)。检索到的 \( a_r \) 被映射回对应的查询 \( q_r \in Q_t \) 以及每个LLM的响应性能,其中性能排名表示每个模型在类似难度查询上的能力顺序。然而,仅选择在 \( q_r \) 上表现最佳的模型可能忽略推理成本的影响,并且总是追求最强但昂贵的模型 (Jitkrittum et al., 2026; Varangot-Reille et al., 2026)。有鉴于此,我们提出通过整合成本并计算奖励 \( R \) 来重新排序模型的顺序: \[ R(m \mid q) = \frac{1}{k} \sum_{i=1}^{k} \alpha \cdot p_m(q_r^i) - \beta \cdot c_m(q_r^i), \tag{2} \] 其中 \( p_m(q_r^i) \) 表示模型 \( m \) 在 \( q_r^i \) 上的性能,\( c_m(q_r^i) \) 表示模型 \( m \) 在 \( q_r^i \) 上的成本(线性归一化到 \([0,1]\))。系数 \( \alpha \) 和 \( \beta \) 控制性能与成本之间的权衡,满足 \( \alpha + \beta = 1 \)。最后,路由器选择奖励最高的候选模型: \[ \hat{m} = \arg\max_{m \in M} R(m \mid q). \tag{3} \] ## 4 实验【注:原文在此处中断,按照论文结构通常还有实验设置、结果分析等,但用户提供的原文只到方法部分,故翻译截止】 【翻译说明】 - 保持所有 URLs 和引用标记不变。 - 技术术语采用中文常用译法,如 "routing" 译为 "路由"、"retrieval" 译为 "检索"、"difficulty-aware" 译为 "难度感知"。 - 模型名称、公司名、产品名 (如 LLM, VDAR-Router, OpenClaw) 保留英文。 - 脚注标记 ¹ 保留,并在末尾提供脚注内容。 - 公式和编号 (1)(2)(3) 保持原样。 - 列表符号 `- •` 转换为中文列表的 `-` 或采用原文格式。
相似文章
超越准确性与成本:面向动态工作负载的延迟感知LLM查询路由
一篇论文提出了一种延迟感知的LLM查询路由器,通过轻量级延迟估计器联合优化延迟、准确性和成本,在保持可比延迟的同时,准确率-成本效用提升高达40%。
Arch-Router:将LLM路由与人类偏好对齐
Arch-Router是一个紧凑型1.5B参数模型,通过将查询映射到用户定义的领域和动作类型,将LLM路由与人类偏好对齐,在主观评估中优于专有模型。
INAR-VL: 面向边缘-云端视觉语言推理的输入感知路由
INAR-VL 提出了一种轻量级路由系统,用于边缘-云端视觉语言推理。该系统根据查询复杂度动态选择边缘或云端模型,在保持接近云端准确率的同时,显著降低延迟和能耗。
面向LLM代理中功能等价工具的延迟-质量路由
本文介绍了 LQM-ContextRoute,一种上下文赌博机路由器,用于在 LLM 代理中选择功能等效的工具提供商,平衡延迟和答案质量。它在网络搜索和检索器基准测试上优于基线。
动态潜路由
动态潜路由(DLR)让LLM通过搜索组合子策略来学习自己的内心独白,其灵感来源于语言的组合性。在低数据微调场景中,DLR达到或优于标准的监督微调。