无需训练的路由:基于可靠性门控的可控比例LLM卸载

arXiv cs.AI 论文

摘要

本文介绍了CARGO,一种无需训练的路由框架,利用本地LLM在采样响应上的推理时一致性来决定何时卸载到云端模型,无需额外训练即可实现可控的协作比例。

arXiv:2607.20481v1 公告类型:新 摘要:本地-云端协作是在资源受限条件下部署大语言模型的实用方法,但现有方法通常依赖训练好的路由器或协作感知的微调,将路由行为绑定到特定的运行模式。在这项工作中,我们证明这种训练可能是不必要的:本地模型在采样响应上的推理时一致性已经为决定何时信任本地执行、何时卸载到更强的云端模型提供了强有力的信号。我们提出了CARGO,一种无需训练的路由框架,通过提示变化采样来估计这种一致性,应用贝叶斯提前停止以实现样本高效的置信控制,并通过轻量级的部署时校准支持任意目标协作比例。在多种推理和问答任务、多个本地LLM系列和规模、以及预训练和微调的本地模型上,CARGO持续优于其他无需训练的基线方法,并在多个场景中超越了有监督学习的路由器。这些结果表明,高效且适应性强的本地-云端协作可以直接从本地模型的内在响应行为中涌现,无需额外训练的路由器。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:01

# 无需训练的推理路由:基于可靠性门控的可控比例大模型卸载

来源:https://arxiv.org/html/2607.20481

陈逸凡1,王世强2,Kevin S. Chan3,王苏4,Christopher G. Brinton1  
1普渡大学  
2埃克塞特大学  
3陆军研究实验室  
4普林斯顿大学  

###### 摘要

本地-云端协同是在资源受限条件下部署大语言模型的实用方式,但现有方法往往依赖训练好的路由器或协同感知的微调,使得路由行为绑定在特定的运行模式上。本文证明此类训练可能并非必需:局部模型在采样回答中自身的推理时一致性已经为决定何时信任本地执行、何时卸载到更强的云端模型提供了强信号。我们提出CARGO,一种无需训练的路由框架,通过提示变体采样估计这种一致性,应用贝叶斯早停实现样本高效的置信度控制,并通过轻量级部署时校准支持任意目标协同比例。在多种推理和问答任务、多个局部LLM系列及规模、以及预训练和微调的局部模型上,CARGO始终优于其他无需训练的基线,并在若干场景下超越了有监督学习路由器。这些结果表明,有效且可适应的本地-云端协同可以直接从局部模型的内在响应行为中涌现,无需额外的训练路由器。

## 1 引言

随着大语言模型(LLM)服务越来越多地部署在边缘设备和其他资源受限平台上,实际系统必须在本地推理的效率与更强云端模型的能力之间取得平衡。在实际部署中,完全依赖云端推理不可取,因为它会引入通信开销、更高延迟、持续性货币成本以及潜在的隐私或连接问题。这些问题在移动设备、本地助手和边缘应用等场景中尤为突出,这些场景通常需要本地响应性和减少对远程基础设施的依赖[30,34,31,16,29]。

本地-云端协同是一种自然的替代方案,既能保留大型远程模型的质量优势,又降低了始终调用云端的成本。例如,轻量级本地LLM可以处理许多常规用户查询,而更困难的需求则选择性地卸载到更强的云端模型[28]。因此,有效本地-云端协同的核心问题是:系统应在何时信任本地模型,又应在何时调用云端协助?

现有方法通过显式路由器或协同感知训练来回答这个问题[9,8],但这些方法通常针对特定运行模式优化协作行为,导致与真实部署场景不匹配——预算、延迟容忍度、后端负载和服务级别目标是随时间变化的。这一局限性表明,卸载不应仅由针对一个固定模式学习的任务特定路由策略决定。相反,有效的本地-云端协同需要一个在部署需求和目标协同比例变化时依然有效的路由原则。具体而言,系统应在本地模型能可靠回答时信任本地推理,否则调用云端协助,同时仍允许根据需要调整总体协同程度。

因此,我们将本地-云端路由建立在局部模型自身推理时可靠性的估计之上。这种估计反映了查询级别的能力,并可在部署时进行校准以满足不同的目标协同比例,例如卸载10%、30%或50%的查询。问题是,这种基于可靠性的路由能否完全无需训练单独的路由器就能实现?这些观察引出了以下研究问题:

系统如何在推理时判断本地模型能否独立可靠地回答查询?核心挑战在于路由决策必须在无法访问真实正确性的情况下做出,仅能基于局部模型在推理时的自身行为。此外,所需的信号应反映模型对问题的内在理解,而非依赖任务特定的监督、重新训练或单独学习到的路由器。因此,难点在于识别一个内在且广泛适用的可靠性信号,该信号在任务、模型系列和部署设置中都有意义。

这样的可靠性信号如何用于使路由在部署时既高效又可适应?可靠性估计本身也消耗计算:收集更多证据可以提高估计的置信度,但代价是更高的延迟和本地推理开销。同时,实际系统需要路由行为能适应变化的协同预算,而不是绑定在单一固定操作点上。因此,难点在于以样本高效的方式利用可靠性信息,同时仍能在部署时灵活控制何时调用云端协助。

我们的关键洞察是:有效的本地-云端路由可能根本不需要训练单独的路由器。通过适当利用局部模型自身的响应行为,可以推导出一种无需训练的路由原则,该原则在多种任务和局部LLM骨干中仍然有效,同时支持灵活的部署时协同。这表明局部模型内在的响应一致性本身就是本地-云端协同的坚实基础,在某些情况下甚至可能比那些针对特定任务属性/分布显式训练的替代方案提供更强的路由信号。

**我们的贡献。** 基于这一洞察,我们提出了协作自适应路由与一致性引导卸载(CARGO),一种无需训练的本地-云端协同框架,用于可控的LLM卸载。CARGO将提示变体下局部响应的一致性转化为校准后的路由策略。它(i) 通过响应稳定性估计局部可靠性,(ii) 通过贝叶斯早停减少不必要的采样,(iii) 通过轻量级部署时校准步骤调整路由行为。由于CARGO仅通过提示和生成输出来运作,它适用于无法进行本地微调或后训练的场景,甚至可以作为推理时包装器添加到现有基于LLM或智能体的应用中。这种设计使一致性引导路由在资源受限环境中变得实用,因为延迟、计算和云端使用预算可能因设备、任务和部署条件而异。

我们的主要贡献如下:

- 我们识别出提示变体下的响应一致性作为本地-云端路由的可迁移推理时可靠性信号,证明其比自报告的置信度或思维链步骤具有更高的正确性和一致性(第2节)。
- 我们引入一种实用的路由流程,结合贝叶斯早停与轻量级校准,减少了可靠性估计所需的本地生成次数,同时无需重新训练即可支持用户指定的协同比例(第3节)。
- 我们证明CARGO在受限云端使用下,在多种任务和本地LLM骨干上实现了强大的准确率。它持续优于无需训练的基线,并在若干设置下超越有监督学习路由器,同时在部署时保持可适应性(第4节)。

**相关工作。** 现有关于资源受限LLM部署中本地-云端协同的工作主要沿两个方向。第一种使用显式路由机制,例如外部分类器、偏好训练路由器或基于置信度和成本的查询选择策略,来决定何时卸载输入[8,19,4,18]。第二种将路由行为集成到局部模型训练本身,在后训练期间训练局部模型同时改进任务性能和卸载决策[3,9]。虽然有效,但这些方法仍然依赖学习到的路由行为,要么通过单独训练的路由模块,要么通过协同感知的后训练。这种学习到的路由器在预算、延迟约束或目标协同比例变化时,获取成本高且部署时僵化。相比之下,我们的焦点在于路由是否可以直接基于从局部模型自身响应行为中提取的内在推理时可靠性信号,而无需训练路由器或为协同微调局部模型。

近期关于自一致性的工作表明,跨多个采样响应的共识是一个强大的推理时信号,可以直接从模型自身的生成行为中提取,无需额外的监督或微调[5,26,23]。除了最初的多数投票公式,后续研究表明这一信号在更一般的生成设置中仍然有用,并且可以通过改进的聚合或置信度感知选择来加强[24]。然而,这些工作主要研究纯本地推理场景,其中跨样本一致性用于选择或完善同一模型的最终答案。本地-云端协同引入了一个新的决策维度:系统不必依赖最佳本地聚合,而是可以将不确定的情况路由到更强的云端模型。这将一致性的角色从答案聚合转向了可靠性感知路由,其中高一致性支持本地执行,低一致性则促使云端协助。由于该决策需要在资源有限的局部模型上进行重复采样,样本高效的一致性估计变得至关重要。

(图1见原文)

图1:CARGO概述。局部模型在提示变体采样下估计一致性,然后应用贝叶斯早停决定是接受局部响应还是卸载到云端。

## 2 动机:用于本地-云端协同的无需训练可靠性信号

本地-云端协同已成为在资源约束下部署LLM的实用范式。在此类系统中,轻量级局部模型处理大多数查询,而更困难的案例则路由到更强的云端模型。因此,核心挑战是设计一种路由机制,对每个查询决定局部响应是否可信任。

(图2见原文)

图2:使用Qwen2.5-7B-Instruct在多个任务上比较推理时路由信号。与思维链步骤和自报告置信度相比,响应一致性表现出更清晰的单调关系与准确性相关,使其成为可靠性引导路由的更强基础。

许多现有方法依赖训练额外的路由模型或微调局部模型以产生校准的置信度分数。然而,这些方法需要任务特定的监督和重新训练,限制了跨领域和部署条件的适用性。因此,我们探究局部模型自身的推理时行为是否已经包含能够区分可靠与不可靠局部预测的信号。为此,我们比较了几个候选信号,并评估它们在任务中与正确性的一致性程度。

**现有自我反思信号。** 一个自然的假设是语言模型在生成过程中会表现出任务难度的隐含指标。两个常用信号是思维链步数和自报告置信度。第一个利用思维链提示下中间推理步骤的数量作为不确定性的代理,基于“更难的问题需要更长的推理”这一启发式[9]。第二个通过输出置信度分数明确要求模型评估自己的答案[27,32,22]。然而,如图2所示,在我们的设定中,这两个信号与正确性的相关性较弱且不稳定,限制了它们作为无需训练路由信号的实用性,除非进行额外的任务特定适应或微调。

**用于可靠性引导路由的响应一致性。** 我们利用自一致性——模型通过样本间的响应一致性来编码自身可靠性——为本地-云端路由开发一种原则性方法。对于给定查询x,LLM通过从词汇表上的概率分布中重复选择下一个token来生成自回归答案;我们将此生成过程称为解码。令A∼P(·∣x)表示最终答案的诱导分布。采样k个响应后,我们得到唯一答案上的计数{cka}a,并定义经验一致性水平:

θ̂_k = max_a c_k^a / k.   (1)

这里,θ̂_k衡量采样响应集中到单个答案的程度。实证上,如图2所示,θ̂_k与正确性的相关性远强于思维链步骤或自报告置信度,高一致性通常对应于局部模型能可靠回答的问题,低一致性则表示模糊性或难度。

**从固定采样到自适应一致性估计。** 一致性作为可靠性信号的有用性不仅取决于如何度量一致性,还取决于如何高效地估计它。标准的自一致性通常对每个查询抽取固定数量的样本K。然而,查询在一致性行为清晰化的速度上有所不同。对于简单查询,仅需少数生成后采样响应就集中到同一答案,因此额外样本提供的路由信息很少。对于困难或模糊的查询,可能需要更多证据才能让系统自信地决定是否应信任局部模型。这一观察表明,基于一致性的路由应自适应地分配采样工作,而非均匀分配。这种自适应性在本地-云端协同中尤为重要,因为重复的本地生成会引入延迟和计算开销,而系统仍必须遵守部署层次的约束,如目标协同比例。与其将K视为

相似文章

从早期经验中学习智能体路由

arXiv cs.CL

本文介绍了 BoundaryRouter,这是一个无需训练的框架,通过根据早期经验将查询路由至轻量级推理或完整智能体执行来优化大型语言模型(LLM)智能体的使用。此外,本文还提出了 RouteBench,这是一个用于评估路由性能的基准,显示出在速度和准确率方面的显著提升。