FlyRoute:通过数据飞轮实现自适应任务路由的自我进化代理画像
摘要
FlyRoute是一种自我进化的画像框架,通过动态更新来自实际流量的代理能力描述,改进多智能体系统中基于LLM的任务路由,相比静态画像取得了显著的准确率提升。
arXiv:2605.22057v1 Announce Type: new
摘要:企业路由器将查询分配给专家代理,然而部署的画像在代理演变(提示、工具、模型)时保持静态,且开发者很少更新描述或示例。我们提出FlyRoute,一种自我进化的画像框架,从实际流量中增长能力证据:派遣候选,将成功配对质量门控到每个代理的成功存储中,定期将证据提炼为习得的能力描述,并将这些描述连同BM25检索到的成功案例注入到LLM路由器中。为了使这个飞轮数据高效,FlyRoute引入了一种有针对性的探索策略,结合了画像不确定性、BM25相关性和词汇新颖性,仅对合理的查询优先处理未充分画像的代理,并避免冗余的证据收集。在我们专有的企业开发者支持数据集实验中,使用真实路由查询,FlyRoute将相同骨干的零样本LLM路由器从72.57%提升到78.04%,每个代理仅需五个种子查询,显示画像检索已经加强了冷启动路由。在通过飞轮流式处理7,211个带标签的训练查询后,准确率上升到89.83%(比零样本提升17.26个百分点;比冷启动提升11.79个百分点),在四个专家领域下,单一金标准测试查询的标准路由准确率均有一致提升。
查看缓存全文
缓存时间: 2026/05/22 08:45
# FlyRoute:通过数据飞轮实现自演化智能体画像,用于自适应任务路由
来源:https://arxiv.org/html/2605.22057
李荣君 周子瑜 吴一航
华为技术有限公司 IT 创新与研究中心
\{lirongjun3, zhouziyu8\}@huawei\.com
wuyihang2@h\-partners\.com
###### 摘要
企业路由器将查询分配给专家智能体,然而已部署的画像保持静态,而智能体(提示词、工具、模型)不断演化,开发者也很少及时更新描述或示例。本文提出 FlyRoute,一个自演化的画像框架,能够从真实流量中积累能力证据:分配候选智能体,通过质量门控将成功的(查询,智能体)对存入每个智能体的成功案例库,定期将证据蒸馏为学习到的能力描述,并将这些描述与 BM25 检索到的成功案例一起注入 LLM 路由器。为使这一飞轮数据高效,FlyRoute 引入了一种目标导向的探索策略,该策略结合了画像不确定性、BM25 相关性和词汇新颖性,优先为合理的查询探索描述不足的智能体,避免冗余证据收集。在我们专有的企业开发者支持数据集(包含真实已路由查询)上的实验中,FlyRoute 将同一骨干网络的零样本 LLM 路由器从 72.57% 提升至 78.04%(每个智能体仅使用 5 条种子查询),表明画像检索已能增强冷启动路由。在通过飞轮流式处理 7,211 条带标签的训练查询后,准确率提升至 89.83%(相对于零样本提升 17.26 个百分点;相对于冷启动提升 11.79 个百分点),在四个专家领域上,单金标准测试查询的标准路由准确率均保持一致提升。
## 1 引言
多智能体系统(MAS)已成为构建智能应用的有力范式,通过将复杂问题分解为由专门智能体处理的子任务来实现(Park et al., 2023 (https://arxiv.org/html/2605.22057#bib.bib8))。在这些系统中,路由器——负责决定哪个专家智能体应处理给定查询——对整体性能起着关键作用。现有的路由方法,无论是基于有监督编码器路由器(Simonds et al., 2024 (https://arxiv.org/html/2605.22057#bib.bib28))、嵌入相似度(Piskala et al., 2025 (https://arxiv.org/html/2605.22057#bib.bib27))还是基于结构的学习方法(Zhao and others, 2026 (https://arxiv.org/html/2605.22057#bib.bib9)),都共享一个共同假设:每个智能体的能力可以在注册时准确描述,并且此后保持稳定。这一假设在真实企业部署中因两个原因而失效。
首先,**智能体开发者通常无法提供准确的能力描述**。在实践中,智能体的行为由其系统提示词、可访问的工具以及底层模型共同决定——这些都在积极开发中。编写精确的自然语言描述,说明智能体能做什么和不能做什么,非常耗时;即使提供了,随着智能体的演化,这些描述也会迅速过时。同样,代表性示例也难以精心挑选:开发者可能不知道哪些查询最能刻画智能体的能力边界。
其次,**智能体能力在部署后会发生改变**。开发者可能更新智能体的提示词以处理新场景,集成新工具以扩展其能力范围,或切换到更强大的模型。当这种情况发生时,当初向路由器注册的原始画像不再反映智能体的实际行为,但路由器仍基于过时信息做出决策。
我们观察到,这两个问题的根本原因在于当前智能体画像的**静态性**:能力通常在注册时捕获,很少随智能体在生产环境中的演化而修改。这激发了一种根本不同的方法——让系统通过实际交互来发现并持续更新智能体能力。关键洞察在于:**用户查询是探查智能体能力的最佳探针**:当查询被分配给一个智能体,且响应被评估为高质量时,我们就获得了直接证据,表明该智能体能够处理这类查询。随着时间的推移,累积的证据形成了丰富且经验驱动的画像,该画像始终是最新的,因为它源自智能体当前的实时行为,而非静态描述。
参见图注
图 1:FlyRoute 闭环数据飞轮:自适应画像、不确定性驱动的探索和画像感知的路由。
在本文中,我们提出 FlyRoute,一个自演化的智能体画像框架,它将部署交互转化为持续更新的路由证据。我们的主要贡献如下:
- • 我们识别并形式化了**自演化智能体画像**问题:从部署交互中构建并持续更新智能体能力描述,而非依赖静态的开发者提供的描述。
- • 我们提出了一种在有限单次查询分配下的不确定性驱动探索策略,该策略结合了画像不确定性、词汇层面的查询–智能体相关性以及冗余感知的新颖性,以针对描述不足的智能体。
- • 实验表明,在相同骨干网络下,FlyRoute 将整体路由准确率从 72.57%(零样本 LLM 路由器)提升至冷启动时的 78.04%(每个智能体 k=5 条种子查询),并在通过飞轮流式处理所有 7,211 条训练查询后进一步提升至 89.83%。路由器始终将查询分配给跨越四个企业部署领域中匹配度最高的专家智能体。
## 2 相关工作
#### 基于性能的路由。
基于性能的路由主要是在模型之间分配请求,以平衡质量、成本和延迟。先前的工作构建了级联和预算感知的选择器(Chen et al., 2023 (https://arxiv.org/html/2605.22057#bib.bib16); Ding et al., 2024 (https://arxiv.org/html/2605.22057#bib.bib10))、基于基准或偏好训练的路由函数(Shnitzer et al., 2023 (https://arxiv.org/html/2605.22057#bib.bib11); Ong et al., 2024 (https://arxiv.org/html/2605.22057#bib.bib17))、兼容性嵌入(Zhuang et al., 2025 (https://arxiv.org/html/2605.22057#bib.bib18); Chen et al., 2024 (https://arxiv.org/html/2605.22057#bib.bib15))、通用或基于图模型的模型舰队路由器(Jitkrittum et al., 2025 (https://arxiv.org/html/2605.22057#bib.bib12); Feng et al., 2024 (https://arxiv.org/html/2605.22057#bib.bib22)),以及在线或置信度感知的分配策略(Wang et al., 2025 (https://arxiv.org/html/2605.22057#bib.bib21); Chuang et al., 2025 (https://arxiv.org/html/2605.22057#bib.bib13); Zhang et al., 2025a (https://arxiv.org/html/2605.22057#bib.bib31))。相关系统还通过对候选 LLM 进行排序、混合或约束感知选择来提升输出质量(Jiang et al., 2023 (https://arxiv.org/html/2605.22057#bib.bib23); Piskala et al., 2025 (https://arxiv.org/html/2605.22057#bib.bib27))。这些方法假设预先已知一组基础模型,并且不维护企业专家智能体的部署演化能力画像。ICL-Router(Wang et al., 2026 (https://arxiv.org/html/2605.22057#bib.bib14))是最近似的工作:它将探针导出的查询–模型历史总结为紧凑的上下文向量,用于无需重训练的模型选择。与 ICL-Router 不同,FlyRoute 针对的是从实时流量中持续修订的演化画像,而非离线探针。
#### 基于任务的路由。
基于任务的路由为每个查询选择最合适的专家智能体或领域专家。现有系统使用有监督的领域分类器或基于奖励提炼的路由器(Simonds et al., 2024 (https://arxiv.org/html/2605.22057#bib.bib28); Lu et al., 2024 (https://arxiv.org/html/2605.22057#bib.bib19))、基于规划器的工具和专家调用(Shen et al., 2023 (https://arxiv.org/html/2605.22057#bib.bib20); Yao et al., 2023 (https://arxiv.org/html/2605.22057#bib.bib26); Wu et al., 2023 (https://arxiv.org/html/2605.22057#bib.bib24); Hong et al., 2024 (https://arxiv.org/html/2605.22057#bib.bib25))、查询与智能体画像之间的嵌入相似度匹配,以及利用偏好、系统结构或显式理由的 LLM 增强或图增强路由器(Tran et al., 2025 (https://arxiv.org/html/2605.22057#bib.bib29); Zhang et al., 2025b (https://arxiv.org/html/2605.22057#bib.bib30); Zhao and others, 2026 (https://arxiv.org/html/2605.22057#bib.bib9))。上述所有方法都依赖于注册时固定不变的**静态智能体画像**;FlyRoute 针对的是一个正交且尚未充分探索的问题:智能体能力边界在部署后发生变化,且画像必须从路由流量中修订。我们将基线集中在相同骨干网络的比较上,以隔离演化画像的价值,因为像 TCAR(Zhao and others, 2026 (https://arxiv.org/html/2605.22057#bib.bib9))这样具有静态初始化的任务路由器在我们的流式协议下无法直接比较。
#### 智能体画像与能力发现。
能力表征仍是一个研究较少的领域。大多数路由工作假设开发者在注册时提供准确的描述(Zhao and others, 2026 (https://arxiv.org/html/2605.22057#bib.bib9)),这在一再更新智能体时会变得脆弱。FlyRoute 借鉴了赌徒风格探索中的预算感知精神(Lattimore and Szepesvári, 2020 (https://arxiv.org/html/2605.22057#bib.bib39)),在描述不足的智能体之间分配有限的分配预算,以高效构建其画像。这与主动学习(Settles, 2012 (https://arxiv.org/html/2605.22057#bib.bib36))不同,主动学习是选择**示例**来标注以训练固定分类器;FlyRoute 则是选择要探查哪些**智能体**,并将接受的证据纳入持续演化的能力画像中。
## 3 方法
### 3.1 概述
FlyRoute 遵循图 1 (https://arxiv.org/html/2605.22057#S1.F1) 中的闭环。当新智能体加入时,它注册最少的信息——名称、可选的种子描述和少量种子示例——系统会初始化一个空画像(§3.2 (https://arxiv.org/html/2605.22057#S3.SS2))。对于每个传入查询,路由模块决定将查询分配给哪些智能体,平衡利用(选择具有强画像的智能体)和探索(将查询分配给画像不确定的智能体以收集更多证据)(§3.3 (https://arxiv.org/html/2605.22057#S3.SS3))。在所选智能体生成响应后,质量门控决定哪些查询–智能体对进入成功案例库(§3.2 (https://arxiv.org/html/2605.22057#S3.SS2));我们在默认实现中,在训练流上使用**LLM-as-Judge**实例化该门控。系统定期将累积的证据蒸馏为精细化的能力描述。这创建了一个自我强化的循环:更好的画像 → 更好的路由 → 更高质量的反馈 → 更好的画像。
#### 任务形式化。
每个基准示例将一个查询 $q$ 与恰好一个监督专家 $a^{\star} \in \mathcal{A} = \{a_1, \ldots, a_N\}$ 配对,保留路由准确率衡量部署路由器是否预测出 $a^{\star}$。在训练回放时,FlyRoute 仍将利用候选与探索探针合并为一个有界的分配集合 $\mathcal{S} \subseteq \mathcal{A}$,因此多个专家可能会回答;质量门控决定哪些 $(q, \text{agent})$ 对值得更新成功案例库(§3.2 (https://arxiv.org/html/2605.22057#S3.SS2)),而标注的 $a^{\star}$ 仅用于评估。
### 3.2 自适应智能体画像
智能体画像是 FlyRoute 维护的核心工件:它不是依赖开发者提供的静态描述,而是随着系统积累部署证据而持续演化,每个路由决策都直接基于当前的画像状态。
#### 画像结构。
每个智能体 $a_i$ 维护一个画像 $\mathcal{P}_i$,包含三个要素:
- • **种子描述** $d_i^{\text{seed}}$:开发者注册时提供的自然语言描述。这可能不完整或不准确,但它是冷启动路由的初始信号。
- • **学习到的描述** $d_i^{\text{learn}}$:从累积的成功案例中自动蒸馏出的精细化能力描述。初始为空,一旦智能体积累足够证据后生成。
- • **成功案例库** $\mathcal{E}_i = \{(q_j, r_j, s_j)\}$:查询–响应对的集合,附带质量分数 $s_j \geq \theta$,其中 $\theta$ 是质量阈值。
#### 冷启动。
当新智能体 $a_i$ 注册时,系统仅需要名称、可选的种子描述(可能是一句粗略的摘要)以及少量种子示例(最少 5 条)。画像初始化为 $\mathcal{P}_i = (d_i^{\text{seed}}, \emptyset, \mathcal{E}_i^{\text{seed}})$,其中 $\mathcal{E}_i^{\text{seed}}$ 包含种子示例。学习到的描述留空,路由器依赖种子描述,直到收集到足够的证据。
#### 画像更新。
当查询 $q$ 被分配给智能体 $a_i$ 并生成响应 $r_i$ 后,**质量门控**给出分数 $s_i \in [0,1]$。若 $s_i \geq \theta$,则将三元组 $(q, r_i, s_i)$ 添加到成功案例库:
$$\mathcal{E}_i \leftarrow \mathcal{E}_i \cup \{(q, r_i, s_i)\}$$
(1)
#### 能力蒸馏。
随着成功案例库增长,原始示例变得过多,无法直接用于路由提示词中。我们定期将累积证据蒸馏为精细化的能力描述。具体来说,每新增 $M$ 条成功案例,我们以 LLM 为提示,提供智能体的种子描述(可选地加上之前的学习摘要)、最近的成功案例,并请求生成更新的**学习到的描述** $d_i^{\text{learn}}$,以捕捉智能体基于经验证据**实际**擅长什么——这可能与开发者注册时的措辞不同。蒸馏步骤将画像压缩为适合路由的自然语言,并能揭示部署后未记录的能力变化。在路由时,**活跃描述** $d_i$(如果有学习到的描述则用,否则用种子描述)**始终**被注入 LLM 路由器的系统提示中,同时附带 BM25 检索到的成功案例,因此分类器既看到全局摘要,也看到来自 $\mathcal{E}_i$ 的查询相关局部词汇邻居。
### 3.3 不确定性驱动的探索
构建智能体画像的一种朴素方法是将每个查询广播给所有智能体,但这会造成浪费——很多查询对某些智能体不相关,而且对每个查询调用每个智能体的成本过高。相反,始终路由到最知名的智能体(纯利用)会使得新智能体或已更新智能体缺乏构建画像所需的证据。FlyRoute 引入了一种不确定性驱动的探索策略,高效地针对画像构建。
#### 画像不确定性。
我们使用基于成功案例库大小的画像不确定性来量化智能体 $a_i$ 应承受多少探索压力:
$$U(a_i) = \frac{1}{1 + |\mathcal{E}_i|^\alpha}$$
(2)
其中 $|\mathcal{E}_i|$ 是质量门控成功的案例数量,$\alpha$ 控制衰减率。少数案例支撑的画像具有高 $U(a_i)$,fav相似文章
从早期经验中学习智能体路由
本文介绍了 BoundaryRouter,这是一个无需训练的框架,通过根据早期经验将查询路由至轻量级推理或完整智能体执行来优化大型语言模型(LLM)智能体的使用。此外,本文还提出了 RouteBench,这是一个用于评估路由性能的基准,显示出在速度和准确率方面的显著提升。
RouteProfile:阐明用于路由的LLM配置文件的设计空间
本文介绍了RouteProfile,这是一个用于路由系统中LLM配置文件的设计空间,证明了结构化配置文件和查询级信号能够提高路由性能以及对新模型的泛化能力。
奖励驱动的大语言模型代理工作流:融合POMDP路由与自我修正的自主决策
本文提出了一种奖励驱动的大语言模型代理工作流,融合了POMDP路由与自我修正奖励模型,在ALFWorld和WebShop等基准测试中任务成功率提升了24.5%。
通过失败轨迹进行基于策略的自我进化以实现智能体安全对齐
本文提出了 FATE,这是一种基于策略(on-policy)的框架,它利用失败轨迹通过自我进化和感知帕累托前沿的优化来增强使用工具的 LLM 智能体的安全性和性能。
SLMs 作为多智能体路由器:一种渐进式 SFT 与强化学习方法
本文提出通过渐进式监督微调和强化学习训练小语言模型作为多智能体路由器,相比仅基于意图路由的LLM基线方法,实现了更好的检索相关性和更低的延迟。