EntroRouter:通过熵调控学习高效模型路由

arXiv cs.CL 论文

摘要

EntroRouter 提出了一个单轮模型路由框架,利用熵调控来平衡准确性和计算成本,在降低 48.25% 成本的同时,达到了最强专家模型 98.3% 的准确率。

arXiv:2606.29424v1 公告类型:新 摘要:模型路由通过在不同能力的模型之间进行选择,来平衡解决方案的准确性和计算成本。虽然最近的多轮框架将推理与规划交错进行,但我们识别出一种结构性的失效模式,称为 Trust Region Collapse。我们证明,推理与路由的深度耦合,加上稀疏监督下强预训练先验的主导地位,会导致退化局部最优,使得有能力的专家被系统性抑制。为了解耦这些过程,我们提出了 $\textbf{EntroRouter}$,一个将熵调控作为核心目标的单轮路由框架。我们首先通过 Soft Supervision 初始化策略,拟合合适模型的分布以建立用于探索的高熵先验。随后,我们使用 Soft Anchor 稳定强化学习,该锚点利用离线能力估计在安全信任区域内协调受控的熵收缩。大量实验表明,EntroRouter 在保留最强专家模型 98.3% 准确率的同时,将计算成本降低了 48.25%。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:31

# 通过熵调控学习高效模型路由
来源:https://arxiv.org/html/2606.29424
Kaiyi Zhang¹¹,²¹¹Equal Contribution.,Xueliang Zhao³¹¹Equal Contribution.,Zhuocheng Gong⁴ Wei Wu²222Corresponding author: Wei Wu and Yankai Lin.,Yankai Lin¹222Corresponding author: Wei Wu and Yankai Lin. 
¹高瓴人工智能学院,中国人民大学 ²蚂蚁国际 ³香港大学 ⁴蚂蚁集团
🖂{kyzhang, yankailin}@ruc.edu.cn, [email protected]

###### 摘要
模型路由通过在不同能力的模型之间进行选择,来平衡求解准确性与计算成本。尽管最近的多轮框架将推理与规划交错进行,但我们发现了一种结构性的失败模式,称为**信任区间坍缩**。我们证明,推理与路由的深度耦合,在稀疏监督下被强预训练先验的主导地位所加剧,会导致退化局部最优,即能力强的专家被系统性抑制。为了解耦这些过程,我们提出**EntroRouter**,一个将熵调控作为核心目标的单轮路由框架。我们首先通过**软监督**初始化策略,拟合一个合适模型的分布,以建立用于探索的高熵先验。随后,我们使用**软锚点**稳定强化学习,该锚点利用离线能力估计,在安全信任区间内实现受控的熵收缩。大量实验表明,EntroRouter保留了最强专家准确率的98.3%,同时将计算成本降低了48.25%。

EntroRouter: 通过熵调控学习高效模型路由
Kaiyi Zhang¹¹,²¹¹Equal Contribution.,Xueliang Zhao³¹¹Equal Contribution.,Zhuocheng Gong⁴ Wei Wu²222Corresponding author: Wei Wu and Yankai Lin.,Yankai Lin¹222Corresponding author: Wei Wu and Yankai Lin. 
¹高瓴人工智能学院,中国人民大学 ²蚂蚁国际 ³香港大学 ⁴蚂蚁集团
🖂{kyzhang, yankailin}@ruc.edu.cn, [email protected]

## 1 引言
大型语言模型(LLM)的快速发展在部署中引入了一个关键权衡:更大的模型(如Qwen3-235B)虽然具有卓越的推理能力,但会带来高昂的计算成本和延迟。相反,较小的模型(如Qwen3-4B)效率高,但在复杂任务上常常表现不佳。这种权衡促使了模型路由系统的发展,其目标是在不牺牲求解质量的前提下,为给定查询动态选择最具成本效益的模型Chen et al. (2023 (https://arxiv.org/html/2606.29424#bib.bib3)); Šakota et al. (2024 (https://arxiv.org/html/2606.29424#bib.bib17))。当前研究探索了两种主要范式来解决这一路由问题:迭代式多轮智能体Zhang et al. (2025 (https://arxiv.org/html/2606.29424#bib.bib23))和确定性单轮分类器Ong et al. (2024 (https://arxiv.org/html/2606.29424#bib.bib14))。然而,尽管架构不同,我们发现这两种范式都经常遭受一种统一的结构性病理:**过早的熵坍缩**。这种未能恰当管理策略不确定性(无论是在动作空间还是标签空间)的失败,阻止了路由器的探索和学习最优成本-准确率前沿。

新兴的多轮范式(如Router-R1)表现为**动作空间中的坍缩**。具体来说,路由器充当一个决定何时查询外部专家的智能体。然而,通过在数学领域的实证复现,我们观察到强化学习(RL)过程常常将调用外部专家的概率驱动到零(如图1所示 (https://arxiv.org/html/2606.29424#S1.F1))。我们证明这是一种源于规划与执行耦合的结构性失败模式。当小型路由器无法理解来自大型专家的分布外推理轨迹时,被其强大的预训练先验所主导,它实际上会忽略专家的响应。结果,RL优化器将专家调用视为高成本、零收益的动作,过早收敛到拒绝路由的确定性策略。我们将这种现象称为**信任区间坍缩**。

与此并行,传统的单轮方法则遭受**标签空间中的相应坍缩**。这意味着在最终选择中,路由器被迫过早承诺于一个僵化的确定性选择。现有基线Ong et al. (2024 (https://arxiv.org/html/2606.29424#bib.bib14))依赖于硬监督(如独热标签),迫使路由器模仿单一的“最佳”模型。这人为压制了问题难度固有的模糊性。通过在有监督微调(SFT)期间过早迫使目标概率分布坍缩到尖锐的决策边界,路由器丧失了捕捉细微权衡所需的表征熵,从而使策略容易过拟合。

请参阅图注
图1: 信任区间坍缩的实证观察。尽管冷启动微调成功,后续的RL过程迅速将调用外部模型(Qwen3-4B/8B)的概率抑制到零。这是一种过早的熵坍缩,实际上放弃了专家求解器。

为了解决这些熵管理的双重失败,我们提出**EntroRouter**,一个将熵调控视为一等目标的框架。我们采用单轮路由范式,并引入一个旨在协调探索与利用的两阶段训练流程。首先,为了防止硬基线典型的标签空间坍缩,我们通过**软监督**(§3.2 (https://arxiv.org/html/2606.29424#S3.SS2))初始化路由器。我们不是拟合一个确定性标签,而是在可行模型的分布上进行训练。这建立了一个高熵先验,保留策略识别难度模糊性的能力。其次,在RL阶段,我们使用源自离线能力估计的**软锚点**(§3.3 (https://arxiv.org/html/2606.29424#S3.SS3))来正则化优化。关键的是,这一机制具有双重目的:它定义了一个安全信任区间,防止策略漂移到退化状态;同时引导路由器在该区间内快速最小化熵。这使得模型能够从探索性的SFT状态过渡到可决策、高成本效益的策略,自信地选择可靠的专家。我们在7个严格的数学推理基准上广泛评估了EntroRouter。值得注意地,EntroRouter保留了最强固定专家基线准确率的98.3%,同时将计算成本降低了48.25%。此外,我们的框架对分布外任务表现出强大的泛化能力。在广泛认可的基准上,EntroRouter将成本降低了40.5%,同时相对准确率保持在最强固定专家基线准确率的95.4%以内。

我们的主要贡献有三方面。
第一,我们形式化了多轮路由遭受**信任区间坍缩**的一个充分条件,这是一种强路由器先验压制专家使用的失败模式。
第二,我们提出**EntroRouter**,一个编排**受控熵收缩**过程的框架。它利用软监督建立高熵探索先验,并采用软锚点在安全信任区间内正则化RL优化。
第三,我们通过在数学基准和分布外数据集上的大量实验验证了我们提出方法的有效性。

## 2 预备知识
在本节中,我们在马尔可夫决策过程(MDP)框架下形式化LLM路由问题。我们建立了全文中使用的符号,并回顾了以Router-R1 Zhang et al. (2025 (https://arxiv.org/html/2606.29424#bib.bib23))为代表的主流多轮路由范式,它作为我们分析的主要基线。

### 2.1 问题形式化
我们将模型路由任务形式化为一个序列决策过程,其中策略模型(**路由器**)在每一步选择一个推理模型(**专家**)来求解用户查询。令xx表示输入查询,M={m1,m2,...,mK}\mathcal{M}=\{m_{1},m_{2},\dots,m_{K}\}表示路由器可选候选模型集合。我们把这个过程定义为一个元组⟨S,A,P,R⟩\langle\mathcal{S},\mathcal{A},\mathcal{P},\mathcal{R}\rangle。这一路由过程根据策略和所选模型生成一条轨迹τ=(s0,a0,...,sL)\tau=(s_{0},a_{0},\dots,s_{L})。元组的组成部分定义如下。

**状态空间(S\mathcal{S})**包含状态st∈Ss_{t}\in\mathcal{S},表示时间步tt时的累积上下文,初始化于用户查询s0=xs_{0}=x。

**动作空间(A\mathcal{A})**定义为A=M∪{mself}\mathcal{A}=\mathcal{M}\cup\{m_{\text{self}}\},包括外部候选模型和路由器自身(mselfm_{\text{self}})。

关于**转移动态(P\mathcal{P})**,状态更新取决于所选动作:如果路由器进行内部推理(即at=mselfa_{t}=m_{\text{self}}),则生成输出oto_{t},状态更新为st+1=st⊕ots_{t+1}=s_{t}\oplus o_{t},其中⊕\oplus表示序列拼接;若为外部委托(即at∈Ma_{t}\in\mathcal{M}),路由器制定查询qtq_{t},接收由外部模型ata_{t}生成的响应oto_{t},并将交互包含进状态,更新为st+1=st⊕qt⊕ots_{t+1}=s_{t}\oplus q_{t}\oplus o_{t}。

最后,**奖励函数(R\mathcal{R})**平衡求解正确性与计算成本。我们将一条轨迹的总回报定义为R(τ)=racc−λ⋅CtotalR(\tau)=r_{\text{acc}}-\lambda\cdot C_{\text{total}},其中racc∈{0,1}r_{\text{acc}}\in\{0,1\}是终态时解正确性的稀疏二元指示,Ctotal=∑tC(at)⋅|ot|C_{\text{total}}=\sum_{t}C(a_{t})\cdot|o_{t}|表示累积的基于token的成本,其中C(at)C(a_{t})是ata_{t}的每token成本。

路由器的目标是学习一个策略πθ(a∣s)\pi_{\theta}(a\mid s),最大化期望回报:J(θ)=Eτ∼πθ[R(τ)]J(\theta)=\mathbb{E}_{\tau\sim\pi_{\theta}}[R(\tau)]。在这个形式化中,λ\lambda是一个控制准确率与成本权衡的超参数。我们假设推理成本与模型能力之间存在正相关关系。我们假设M\mathcal{M}仅包含有效前沿模型,从而排除某个候选模型既更昂贵又在功能上劣于另一个的情况。在最简单的场景(**单步路由**)中,路由器仅基于初始查询xx选择模型,无需中间推理步骤。

### 2.2 多轮路由范式
最近的研究进展,如Router-R1 Zhang et al. (2025 (https://arxiv.org/html/2606.29424#bib.bib23)),将路由任务推广到序列设置。在这种范式中,路由器扮演一个智能体,将内部推理步骤(at=mselfa_{t}=m_{\text{self}})与外部模型调用(at∈Ma_{t}\in\mathcal{M})交错进行。与路由器仅充当调度器的单步路由不同,这一框架要求路由器有效地**解释**和**整合**外部模型的输出oto_{t}以更新状态并向求解推进。关键的是,这种形式化将**路由决策**与路由器自身的**推理执行**交织在一起。因此,策略的潜力受限于路由器吸收复杂信息的能力,而这一过程常常被其自身预训练先验的主导地位所阻碍。正如下一节所示,这种依赖关系可能导致结构性失败,其中路由器由于顽固的内部先验和稀疏结果奖励下的能力不匹配,难以优化成本-准确率权衡。

## 3 方法论
请参阅图注
(a) 阶段I:基于软监督的SFT
请参阅图注
(b) 阶段II:带有软锚点的强化学习
图2: EntroRouter训练框架概述。
(a) 阶段I:基于软监督的SFT。我们采用软监督策略以防止过早的策略坍缩。一个弱探测模型mprobem_{\text{probe}}判断查询难度:对于复杂查询(场景A),我们将训练目标分布在Mtopk\mathcal{M}_{\text{topk}}中所有合格专家上,有意维持一个高熵策略以保留探索能力。
(b) 阶段II:带有软锚点的强化学习。我们通过使用基于期望的奖励来精炼策略,该方法使用GRPO。通过用**软锚点**(πref\pi_{\text{ref}})正则化更新,我们将路由器约束在一个安全信任区间内,同时惩罚熵以从宽泛的探索状态过渡到可决策、高置信度的路由状态。

我们首先定义多轮路由中观察到的理论失败模式(§3.1 (https://arxiv.org/html/2606.29424#S3.SS1))。受此分析启发,我们提出**EntroRouter**,一个将路由视为单轮决策过程的框架。具体来说,我们的方法建立在一个两阶段训练流程之上:在第一阶段,我们通过将概率质量分布在多个可行模型上(而非分配单个硬标签)来初始化策略。这种**保持熵**的初始化防止过早收敛,并保留进一步探索的能力(§3.2 (https://arxiv.org/html/2606.29424#S3.SS2))。随后,我们通过RL微调策略,使用源自离线能力估计的参考分布来正则化更新。这一阶段在安全信任区间内实现了**熵收缩**,动态优化求解正确性与计算成本之间的权衡,同时锐化最终路由决策(§3.3 (https://arxiv.org/html/2606.29424#S3.SS3))。

### 3.1 多轮路由中的策略退化
我们识别出在多轮路由范式下,在稀疏结果监督和强路由器预训练先验条件下可能出现的严重不稳定性。尽管进行了冷启动微调,后续的RL过程常常将使用强模型的概率驱动到零,实际上放弃了专家求解器。结果,策略的探索前沿坍缩到一个退化的局部最优,即“总是拒绝升级”,我们将这种现象称为**信任区间坍缩**。从信息论的角度看,这表现为一种病态的、过早的策略熵降低:路由器迅速收敛到一个确定性的、低熵的拒绝状态,从而消除了发现更好策略所需的探索方差。我们将这种坍缩归因于规划与执行的功能性混淆,这引发了一条因果链,其特点是三个不同的阶段。

**第一阶段:**当专家模型响应路由器的请求生成复杂的推理轨迹时,较小的路由器常常难以理解该逻辑,因为该轨迹相对于其自身的训练分布是**分布外**的。

**第二阶段:**被自身预训练先验所主导,路由器实际上忽略了专家提供的上下文,转而使用自身有限的能力生成解决方案。

相似文章

TimeRouter:高效自适应的时间序列基础模型路由

arXiv cs.LG

TimeRouter 提出了一种高效的时间序列基础模型路由框架,利用轻量级判别路由和选择性门控,无需大型语言模型(LLM)开销即可自适应选择最佳专家模型,在 GIFT-EVAL 排行榜上达到了最先进水平。

通过有限专家库实现通信高效的专家路由

arXiv cs.LG

本文提出了一种针对稀疏混合专家(MoE)模型中通信高效专家路由的信息论框架,将门控机制视为随机信道,并推导实用的互信息估计器以分析有限专家库上的准确率-速率权衡。