Pro-Router: 面向token的渐进式模型路由与自适应边云协作,实现高效多模态LLM推理

arXiv cs.AI 论文

摘要

Pro-Router引入了一种面向token的渐进式模型路由方法,用于高效多模态LLM推理,通过自适应边云协作提高吞吐量并降低成本。

arXiv:2608.28726v1 公告类型:新 摘要:多模态大型语言模型(MLLMs)的卓越性能以巨大的计算开销为代价,对实时部署和成本效益构成了重大挑战。现有的模型路由方法要么仅基于粗粒度的请求级特征进行决策,要么花费一次或多次额外的语言模型传递来检查生成的响应,忽略了生成过程中出现的token级不确定性信号。为了解决这些局限性,我们提出了Pro-Router,一种面向token的渐进式模型路由方法,结合自适应边云协作,实现高效的多模态LLM推理。Pro-Router采用两阶段渐进式决策机制。首先,一个轻量级的提示预评分模块在token生成开始之前执行快速预筛选,将明显简单的请求引导至小型模型。其次,一个token感知的验证器读取小型模型生成的每个token的采样概率分布,估计模型对自身输出的信心,从而逐个请求地确定答案是直接发送还是升级到基于云的高精度模型。此外,我们设计了一个自适应边云服务流水线,根据每个设备测量的服务速率调整每次调度,使得边缘和云层都能充分利用,无需手动参数调优,且不受网络延迟的影响。在多个多模态基准数据集和模型上的大量实验验证了Pro-Router的有效性。与其他方法相比,它实现了最高的路由准确性,并将路由速度提高了10倍以上。其服务流水线还实现了比现有模型路由流水线高75%以上的端到端吞吐量。我们的代码可在 https://github.com/xinyuangui2/pro-router 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:38

# Pro-Router:面向token感知的渐进式模型路由与自适应边缘-云协同,实现高效多模态LLM推理
来源:https://arxiv.org/html/2608.28726

###### 摘要

多模态大语言模型(MLLMs)的卓越性能以巨大的计算开销为代价,给实时部署和成本效益带来了重大挑战。现有的模型路由方法要么仅根据粗略的请求级特征做出决策,要么花费一次或多次额外的语言模型推断来检查生成的响应,未能利用生成过程中出现的token级不确定性信号。为解决这些局限性,我们提出Pro-Router,一种面向token感知的渐进式模型路由方法,结合自适应边缘-云协同,实现高效的多模态LLM推理。Pro-Router采用两阶段渐进决策机制。首先,轻量级的提示预评分模块在token生成开始前进行快速预筛选,将明显简单的请求引导至小模型。其次,token感知验证器读取小模型生成的每个token的采样概率分布,估计模型对其自身输出的置信度,以逐个请求地决定是直接返回答案还是升级至云端高精度模型。此外,我们设计了一个自适应的边缘-云服务流水线,根据每个设备实测的服务速率调整每次调度量,从而在无需手动参数调整且不受网络延迟影响的情况下,充分利用边缘和云端资源。在多个多模态基准数据集和模型上的大量实验表明了Pro-Router的有效性。与其他方法相比,它实现了最高的路由准确性,并将路由速度提高了10倍以上。其服务流水线还比现有的模型路由流水线实现了超过75%的端到端吞吐量提升。我们的代码开源于 https://github.com/xinyuangui2/pro-router 。

1 Anyscale
2 密西西比州立大学计算机科学与工程系
3 中国科学院计算技术研究所
4 中国科学院工业人工智能研究所

## 引言

多模态大语言模型(MLLMs)定义了视觉问答、文档和图表理解以及多模态推理领域的最先进水平(Bai et al. 2025;Li et al. 2025;Agrawal et al. 2024),并且正日益成为生产级多模态服务的默认后端。服务这些模型的成本高昂。最先进的大型模型拥有数百亿参数,自回归解码为每个生成的token流经所有加速器(Kwon et al. 2023;Dao et al. 2022),而单张图像会展开成数百甚至数千个token,膨胀了预填充计算和KV缓存占用(Chen et al. 2024b),因此这些模型实际上只能依赖昂贵的云GPU。然而,很大一部分实际流量并不需要它们。一个规模小一个数量级的多模态小语言模型(MSLM)就能很好地回答许多请求(Ong et al. 2025;Ding et al. 2024;Chen, Zaharia, and Zou 2024),而且这样的模型可以轻松部署在成本更低的边缘设备上。

参见标题图1:现有路由方法采取的两种选项。(a) 仅请求路由器仅在生成任何token之前,根据提示对每个请求的难度进行评分;低于阈值的请求进入小模型,其余直接进入大模型。(b) 基于响应的路由器让小模型先回答,然后对每个响应的发送置信度进行评分;置信的响应被发送,其余升级到大模型重新生成。现有模型路由方法按其决策时机划分(图1)。仅请求路由器仅在生成任何token之前,仅根据请求做出决策(Ong et al. 2025;Ding et al. 2024;Tang et al. 2025);它们成本低廉,但不够准确,因为仅凭请求本身无法揭示小模型是否能够实际回答它。基于响应的路由器在小模型生成其答案后进行决策(Chen, Zaharia, and Zou 2024;Kadavath et al. 2022;Aggarwal et al. 2024),这远更具信息量,但每个请求需要花费一次或多次额外的语言模型推断,而这些额外的计算抵消了模型路由的收益。此外,边缘-云协同也已与模型路由(Ding et al. 2024;Tang et al. 2025)以及更广泛的LLM服务(Zhang et al. 2025;Jin and Wu 2025;Hao et al. 2024;Wang et al. 2024a)一起被研究。小模型部署在靠近客户端的廉价边缘设备上,昂贵的大模型部署在云端设备上,一个好的路由算法能够利用两个层级来维持其吞吐量。然而,这些现有的协同流水线在边缘和云端之间频繁交互,使得两个层级相互依赖,因此网络波动会阻塞等待的那一方,并浪费其GPU周期。

为了解决上述问题,我们提出Pro-Router,一种面向token感知的渐进式模型路由框架,结合自适应边缘-云协同,实现高效的多模态LLM推理。轻量级的提示预评分模块在生成任何token之前引导传入流量,使得复杂请求很可能被直接路由至大模型。然后,token感知验证器读取小模型自身解码已产生的逐token采样分布,并逐个请求地决定是接受边缘答案还是将其升级。我们还提出了一种自适应的边缘-云协同流水线:全局调度器按请求难度排序,从简单端馈送小模型,从升级请求和困难端馈送大模型,并根据每个设备报告的服务速率调整每次调度量。主要贡献可总结如下:

- • 我们提出了渐进式路由,这是一种在小模型解码前后均做出决策的两阶段方法。轻量级的提示预评分器仅根据提示引导初始流量,而token感知验证器读取解码token分布以做出最终的发送或升级决策。
- • 我们构建了一个自适应的边缘-云协同流水线,充分利用边缘和云端设备,不受高网络延迟影响,并可扩展到多台设备,所有这些均无需手动调整。
- • 我们在15个基准测试、两种模态、三种模型和四种基线上,针对真实的72B云端目标进行了广泛实验。我们的路由器在生成路由信号的速度比现有方法快10倍以上的同时,实现了最高的路由准确性;我们的流水线比现有的模型路由流水线实现了超过75%的端到端吞吐量提升,在极端网络延迟下保持稳定,并可线性扩展到更多机器。

## 相关工作

模型路由使用能够处理每个请求的模型为其提供服务,它起源于选择性预测和拒绝选项(Chow 1970;Geifman and El-Yaniv 2017;El-Yaniv and Wiener 2010),也源于学习转交(Mozannar and Sontag 2020;Cortes, DeSalvo, and Mohri 2016)。现有方法根据其读取的内容进行决策划分。仅请求路由器仅根据请求决策。RouteLLM(Ong et al. 2025)在人类偏好数据上训练其路由器,Hybrid LLM(Ding et al. 2024)从查询预测小模型和大模型之间的质量差距,RouterDC(Chen et al. 2024c)学习一个对比查询编码器以在候选LLM中选择。PerLLM(Yang et al. 2024)通过边缘-云协同满足用户对准确性和成本的不同需求。近期工作扩展到多模态设置。ECVL-ROUTER(Tang et al. 2025)在场景需求下选择边缘和云端VLM,AVR(Liu et al. 2026)根据语义难度在小VLM和大VLM之间路由计算机使用代理的步骤。由于这些路由器从未观察到小模型的实际答案,它们保持低成本,但其准确性因未知响应而受损。

基于响应的路由方法在小模型回答后进行决策。FrugalGPT(Chen, Zaharia, and Zou 2024)在答案*文本*上训练一个基于DistilBERT的评分器,捕捉其表面形式。Hu et al. 2026b的工作利用MLLM为边缘-云提供语义增强的自适应路由。SAEC(Tian and Yang 2026)提出了一种场景感知的增强型边缘-云协同路由框架。AIVD(Hu et al. 2026a)可以通过灵活路由大型和小型模型来动态平衡准确性和效率。Moa-off(Yang et al. 2025)引入了一种模态感知的异构路由机制,自适应地在边缘和云端之间分配计算。P(True)(Kadavath et al. 2022)重新询问模型其自身答案是否为真,AutoMix(Aggarwal et al. 2024)多次采样一个少样本自验证器来估计验证概率。观察响应使得这些方法更准确,但每个请求都要花费一次或多次额外的语言模型推断。

## 方法

图2展示了Pro-Router的整体设计和工作流程,它通过在边缘部署的多模态小语言模型(MSLM)和基于云端的多模态大语言模型(MLLM)之间动态路由每个请求,实现高效的多模态LLM推理。具体而言,Pro-Router遵循两阶段渐进式路由机制。第一阶段是一个轻量级的提示预评分模块,在生成前分析每个传入请求并为其分配早期难度估计;请求进入一个按此估计排序的已评分输入缓冲区,最简单的请求由运行在边缘设备上的MSLM服务。第二阶段是token感知验证器,在边缘解码期间读取MSLM已产生的逐token采样分布,并累积模型对其自身输出的置信度。根据此信号,Pro-Router逐个请求地决定是接受边缘答案还是将其升级至升级缓冲区。升级的请求连同已评分输入缓冲区中的困难请求一起被发送到基于云端的MLLM进行高精度推理。同时,通过跟踪边缘和云端设备的实测吞吐量并相应调整每次调度量,自适应的边缘-云协同流水线使两者都保持高度利用。通过这种渐进式路由和自适应服务策略,Pro-Router在高效利用边缘和云端设备的同时,实现了低延迟的高路由准确性,并且在不同网络延迟和集群规模下都表现稳健。

图3:token感知验证器的结构。

### 面向Token感知的渐进式路由

我们通过定义一个收益函数来形式化路由目标,该函数封装了推理准确性、响应延迟和系统资源利用之间的内在权衡。部署架构包括Nc台云端设备,每台设备的名义容量为Li(单位:每秒请求数),以及Ne台边缘设备,容量为Sj。由于动态网络条件和波动的工作负载,这些容量的实际可用部分由ηLi, ηSj ∈ [0,1]表征,表示每台云设备和边缘设备的有效利用率。小模型回答的每个请求都会获得一个发送置信度p,当p ≥ τ时发送,其中阈值τ预先通过在验证集上校准确定。设发送率为s = Pr[p ≥ τ],即验证器接受小模型答案,从而使请求完全在边缘服务的概率;剩余的1-s升级到云端。在发送的请求中,条件准确率a = Pr[correct | p ≥ τ],每个错误发送的答案会带来惩罚λ。则流水线的收益为:

G = ∑_{i=1}^{Nc} ηLi Li + ∑_{j=1}^{Ne} ηSj Sj · s(a - λ(1-a))

其中第二行将s和a因子化,因为一个验证器服务所有小模型设备,因此两者都是全局优化的,不随机器变化而变化。

公式(1)在两个方向上增长:更高的发送率s和更高的路由准确性a。发送率在简单请求到达小模型、困难请求直接前往大模型时上升,这是一个在生成前就可做出的决策;准确性在做出最终决策的模块本身准确时上升,这需要仅在生成后才可获得的证据。两个时刻的两个方向需要两种机制,这正是渐进式路由所提供的:一个轻量级的提示预评分器在生成前评估请求难度,以及一个token感知验证器在生成后进行决策。

现有的仅提示路由器对提示运行语言模型(Ong et al. 2025;Ding et al. 2024;Tang et al. 2025),这表明提示本身已携带强烈的难度信号,但这样的模型在此处是过度的:预评分器只需要快速且大致正确,因为它引导流量而非做出决定,并且任何与加速器竞争的模型都会降低公式(1)中的ηS。

相似文章

Arch-Router:将LLM路由与人类偏好对齐

Papers with Code Trending

Arch-Router是一个紧凑型1.5B参数模型,通过将查询映射到用户定义的领域和动作类型,将LLM路由与人类偏好对齐,在主观评估中优于专有模型。