MERA:面向大规模智能体系统的模型演化与技能自适应路由
摘要
MERA 提出了一种面向 LLM 智能体的多周期自适应方法,通过将执行验证的演示蒸馏到 SkillBook 并对 LoRA 适配器进行微调来改进小模型,并采用基于路由器的部署和验证器支持的回退。实验表明,Qwen2.5-Coder-1.5B 在 HumanEval++MBPP 上的通过率从 28.7% 提升至 49.7%,同时以更低的成本保留了大部分质量。
查看缓存全文
缓存时间: 2026/08/12 08:28
# MERA:面向规模化智能体系统的模型进化与技能自适应路由
Source: https://arxiv.org/html/2608.10333
\\correspondence
yuhangyao8@gmail\.com, tianyu@gradient\.network\\sourcecodehttps://github\.com/yh\-yao/MERA\-Evolve
Yuhang Yao4,†\\daggerZeyu Wang6Wanyi Chen2Tongyun Yang3Yuhang Han5 Jie Xiao1Chengke Bao1Tianyi Zhao1Lynn Ai1Eric Yang1Tianyu Shi1,†\\dagger1Gradient2Soochow University3Independent Researcher4Carnegie Mellon University 5Shanghai Jiao Tong University6University of California, Los Angeles †\\dagger通讯作者
###### 摘要
LLM 智能体在单个任务中会执行异构的模型调用序列:某些调用需要仔细推理,而另一些则是诸如格式化或工具参数构造之类的结构化步骤。先前的路由方法利用这种不对称性,将简单调用分配给更便宜的小模型,将困难调用分配给大模型。此类策略降低了推理成本,但小模型自身能力未变,因此可实现的成本节省仍受限于学生模型已能解决的问题范围。MERA 则反过来直接改进小模型本身,以单次模型调用作为适配单元。在每个周期中,MERA 回放失败的学生模型调用,获取经执行验证的教师演示,将重复出现的过程蒸馏到迭代更新的 SkillBook 中,并借助监督微调及可选的 GRPO 微调学生 LoRA 适配器。路由作为部署的支撑机制:改进后的学生模型在经成本校准的路由器之后提供服务,并带有验证器支持的降级回退;只有当联合回放保持任务质量时,候选 SkillBook、适配器或路由器才会被接纳。实验上,四个周期的适配将 Qwen2.5-Coder-1.5B 在保留的 HumanEval++MBPP 上的通过率从 28.7% 提升到 49.7%。在验证器支持的回退机制下,部署策略在 60.8% 的“始终使用 Luna”成本下保持 88.3% 的通过率。在 TAU-2 上,微调后的 Qwen3.5-2B 从 14/35 提升到 18/35,并与未适配的 4B 模型相当。这些结果表明,验证器支持的多周期适配能够提升小模型能力,而不仅仅是围绕固定学生模型进行路由。
## 1 引言
语言模型智能体执行异构的模型调用链。单个任务可能包含困难的推理或策略敏感决策,但也包含许多结构化步骤:提取、格式化、工具参数构造、后处理、澄清以及模板化摘要。每次调用都使用最强模型固然可靠,但成本高昂。相反,仅在用户任务层面路由一次又过于粗糙,因为工作流中容易和困难的部分往往并存。近期工作通过提示、工具使用、规划、搜索和智能体优化改进了智能体(react2023;toolformer2023;lats2024;toolllm2023;agentoptimizer2024;gptswarm2024),但生产系统还需要机制来适配工作流中的模型、路由和可复用技能。
这对已部署的智能体系统构成了实际张力。适配所需的轨迹天然在线产生,但直接从原始轨迹修改服务策略存在风险:更便宜的模型可能静默失败,学习到的适配器可能在罕见案例上回退,可复用模板可能仅在窄提示签名下安全。因此,有用的进化循环需要将观察与接纳分离。它应当以单个调用为粒度收集证据,更新多个候选组件,并且仅当回放显示组合策略仍满足验证约束时,才接纳由此产生的运行时状态。
MERA 通过将单次模型调用作为适配单元来解决这一问题。在运行时,仅基于输入的路由器在强模型、便宜模型和专用模型之间选择;技能层可以为重复出现的局部结构调度稳定模板;验证器通过回退保护质量。这种设计保持服务简单:路由器不依赖隐藏的智能体状态,不安全的向下路由由验证纠正。更重的逻辑转移到离线,在那里回放轨迹以决定哪些提示是容易的、哪些失败应成为训练示例、哪些重复模式足够稳定而成为技能。
智能体工作负载异构多步骤任务智能体执行路由、技能、验证在线轨迹提示、输出、验证器结果SkillBook签名成功统计LLM 更新困难示例适配学习到的路由器便宜 vs. 强路由联合回放门接纳下一运行时状态下一轮
图 1:MERA 概览。在线轨迹驱动定期的 SkillBook、LLM 更新和路由器轨道;其组合状态通过联合回放评估得以接纳。图1 (https://arxiv.org/html/2608.10333#S1.F1)显示了由此产生的反馈循环。在线轨迹驱动更新轮次,其中 SkillBook 统计、路由器训练和 LLM 适配共享证据。在一个周期内,我们使用遵循依赖关系的 Skill→\\rightarrowLLM→\\rightarrowRouter 调度:适配器使用当前 SkillBook 过程训练,路由器最后拟合,使其标签反映当前周期的学生模型结果。组合状态仅在联合回放评估后才被接纳,因此路由、技能提升和适配器更新由端到端效果评判,而非孤立组件指标。
我们的贡献是一种验证器支持的多周期协议,从共享可执行轨迹改进小模型;路由和 SkillBook 是安全部署的支撑机制。在 582 个保留的 HumanEval++MBPP 任务(3 个种子)上,四个周期的适配将 Qwen2.5-Coder-1.5B 从 28.7% 提升到 SFT 下的 44.2%,并在匹配的 SFT+GRPO 下提升到 49.7%。结合可执行验证和 GPT-5.6 Luna 回退,部署策略在 60.8% 的“始终使用 Luna”成本下保持 88.3% 的通过率。在 TAU-2 上,适配后的 Qwen3.5-2B 从 14/35 提升到 18/35,并与未适配的 4B 端点相当,尽管该比较统计功效不足。金融盈亏平衡分析进一步将适配成本与服务节省联系起来。因此,MERA 首先是一种进化协议:它提升小模型能力,而不仅仅是围绕固定学生模型路由。
## 2 相关工作
运行时循环调用序列化提示本地上下文路由器强模型 / 便宜模型 / 专用学生模型技能选择器可选模板调度执行LLM 调用工具使用验证器模式成功回退回退迭代更新循环轨迹存储提示输出验证器日志步骤切片规范化调用状态SkillBook签名统计模式LLM 更新困难示例SFT / GRPORouter 更新可执行标签阈值联合回放接纳 / 下一轮Skill→\\rightarrowLLMLLM→\\rightarrowRouter接纳迭代依赖。每轮更新 SkillBook、LLM 适配器,然后是共享轨迹上的路由器(Skill→\\rightarrowLLM→\\rightarrowRouter)。接纳取决于联合回放评估。
图 2:MERA 的详细方法视图。运行时路由保持仅输入且受验证器保护;更新轨道共享轨迹并通过联合回放被接纳。LLM 路由。先前关于模型路由的工作研究如何在成本-质量权衡下跨模型池调度请求。FrugalGPT 式级联、学习路由器以及基于偏好或不确定性的选择器使用提示特征、预测质量或显式路由目标来决定何时便宜模型足够、何时需要更强模型(frugalgpt2024;routellm2024;dekoninck2025routing;bestroute2025)。近期系统进一步考虑升级模型层级、多轮路由和答案聚合,而非一次性调度(llmat2025;routerr12025)。这些文献确立了路由作为降低推理成本的实用机制,但大多数设置路由整个用户请求或单轮示例。决策单元通常是提交给模型的提示,而非较长智能体执行过程中的内部调用。
智能体优化。智能体研究一直聚焦于通过工具使用、推理-行动循环、执行时搜索以及智能体图或函数的自动化优化来提升智能体能力(react2023;toolformer2023;lats2024;toolllm2023;agentoptimizer2024;gptswarm2024)。近期的后训练和基于环境的方法也从交互轨迹或模拟反馈训练智能体(autopdl2025;agentgymrl2026)。这些方法改进了智能体的策略、规划器或工具使用行为。它们通常将模型选择、路由和可复用过程视为固定工程选择,或评估单一的改进智能体策略。它们没有直接解决已部署智能体应如何利用自身执行轨迹随时间更新模型混合和路由策略的问题。
模型专业化与可复用技能。蒸馏、逐步监督、小模型适配、反思式自我训练以及显式技能库构建都旨在复用从更强模型或成功轨迹中学到的行为(distillingstepbystep2023;agentr2025;skillx2026)。这些方法表明,更小的模型和外部化技能可以捕获有用的结构。然而,其成功常作为独立训练或基准结果报告。在已部署的智能体系统中,专业化是有条件的:学生模型或技能仅在其保持可靠的切片上有用,失败可能需要触发回退而不是静默进入生产。
工具使用智能体的评估。用于接地网页交互、工具使用、多跳工具、智能体-用户交互、计算机控制以及软件工程的基准为衡量智能体行为提供了日益逼真的环境(webshop2022;toolllm2023;toolhop2025;taubench2025;osworld2024;swebench2024)。这些基准很有价值,因为许多失败可以通过工具、任务断言、执行结果或自然语言评判器检查。同时,它们暴露了一个部署困难:随着工具生态系统增长和工作流变长,单个用户请求包含许多异构步骤,其中只有一部分适合更廉价执行或专业化。
这些方法各自的局限不在于孤立地缺乏路由器、技能或后训练方法。缺失的系统层是一种保守机制,将它们在运行中的智能体内部连接起来:轨迹应识别重复的调用类型,在困难示例上训练或更新学生模型,以相同粒度更新路由器,并仅通过带验证器回退的回放接纳所有更改。MERA 通过将执行轨迹视为 SkillBook 统计、调用级路由和模型适配的共享监督来弥补这一空白。MERA 不仅围绕固定小模型路由,而是在回放显示组合路由器、技能状态和适配器保持任务质量时扩展廉价执行范围。
## 3 方法
### 3.1 运行时路由
MERA 将服务路径与更新路径分离。在运行时,路由器仅观察当前调用的序列化提示,并在强模型、便宜模型以及可选专用学生模型之间选择。技能选择器可以为重复出现的局部结构(如格式化、提取或单工具参数构造)调度稳定模板。所选模型产生输出,验证器检查模式有效性、工具调用合法性、可执行测试或下游成功。如果验证失败,调用回退到更强模型,并记录完整事件。
这种仅输入的路由器有意保持受限。它避免将路由决策耦合到隐藏智能体状态或实现特定的工具轨迹,使接口更容易跨智能体框架部署。可靠性改由执行后的验证器和回退路径保护。其结果是 MERA 可以保守起步:早期路由器可能优先考虑低风险的不安全向下路由,而回放和 SkillBook 证据逐渐识别可廉价服务的区域。
### 3.2 轨迹产物
更新循环基于从运行时执行或回放收集的完整轨迹。MERA 将每条轨迹规范化为步骤切片,包含提示、局部上下文、工具模式、生成输出、验证器结果、重试次数、回退元数据以及任何技能分配。这些切片产生三条证据流。SkillBook 记录重复提示签名的成功和失败统计。学习路由器在提示文本上训练,使用由可执行小模型结果导出的便宜/强标签。LLM 适配器在选定的困难示例上训练,这些示例是便宜执行失败或路由器和 SkillBook 不一致的地方。
因此,同一片切片可以支持不同更新,而无需强制组件共享相同监督格式。路由器示例可以保持仅输入,而 LLM 示例保留执行步骤所需的上下文。技能示例按重复局部结构分组,而非仅按标签分组。
算法 1MERA 运行时和迭代更新循环1:路由器
RR,模型注册表
M\\mathcal\{M\},SkillBook
K\\mathcal\{K\},验证器
VV
2:对于每个智能体调用
xtx\_\{t\}do
3:选择模型
mt←R\(xt\)m\_\{t\}\\leftarrow R\(x\_\{t\}\)和可选技能
kt∈Kk\_\{t\}\\in\\mathcal\{K\}
4:执行
yt←mt\(xt,kt\)y\_\{t\}\\leftarrow m\_\{t\}\(x\_\{t\},k\_\{t\}\)
5:如果
V\(xt,yt\)V\(x\_\{t\},y\_\{t\}\)失败则
6:回退到更强模型
7:结束如果
8:记录
\(xt,yt,mt,kt,V\(xt,yt\)\)\(x\_\{t\},y\_\{t\},m\_\{t\},k\_\{t\},V\(x\_\{t\},y\_\{t\}\)\)
9:结束对于
10:对于每个更新轮次do
11:将轨迹规范化为步骤切片
12:按所选调度更新 SkillBook、路由器和 LLM 适配器
13:运行联合回放;仅当质量保持时接纳
14:结束对于
### 3.3 调度更新
算法1 (https://arxiv.org/html/2608.10333#alg1)总结了该循环。每个更新轮次在共享轨迹上刷新三个轨道,且顺序遵循数据依赖而非任意安排。LLM 适配器训练和查询时会将 SkillBook 过程前置到其提示中,因此在一个周期内 SkillBook 更新必须先于 LLM 适配(Skill→\\rightarrowLLM);并行训练两者将使适配器在过时过程上拟合。路由器放在最后,使其标签反映当前周期的技能状态和小模型结果。这产生了我们全程使用的规范 Skill→\\rightarrowLLM→\\rightarrowRouter 调度;由于循环迭代,任何残留的陈旧性都由下一周期吸收。
这种设计使 MERA 能够区分科学效应与系统效应。图2 (https://arxiv.org/html/2608.10333#S2.F2)使依赖结构明确:运行时执行产生轨迹切片,三个更新轨道消费这些切片的不同证据产物,回放仅接纳组合状态。因此,评估分别报告直接小模型质量、预路由之前的表现、验证与回退、端任务质量以及归一化成本。这防止高级联通过率被误认为强独立模型能力或准确预路由。
### 3.4 操作性组件定义
在代码生成实现中,SkillBook 是外部程序性提示记忆,而非响应缓存或适配器权重。签名函数将任务映射到两个粗粒度数据集级键:humaneval 和 mbpp。每个渲染条目将静态任务格式指令与有界成功示例以及基于示例的重复陷阱和模式结合起来。它被前置到新任务前,且绝不为相同提示返回存储答案。
路由器监督也在操作上落地。当当前小模型在给定验证器下的角色表现达到足够可靠性时,任务被视为可廉价处理。相似文章
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。
@dair_ai:// 面向多智能体系统的元技能演化 // 多智能体系统能否在不触及...的情况下提升编排能力?
Skill-MAS提出了一种在无需修改模型权重的情况下,为多智能体系统演化元技能以提升编排能力的方法,实现了跨任务和LLM的可迁移性能提升。
ERSkill: Evolving for Skill-Guided Adaptive Memory Retrieval
Introduces ERSkill, a retrieval-centric framework for self-evolving, skill-guided adaptive memory access in LLM agents. It co-evolves retrieval skills and a routing policy, substantially outperforming strong baselines across agent memory benchmarks.
@dair_ai: // MetaSkill-Evolve // 关于自我改进代理的优秀论文。大多数自我改进代理重写代理所做的并……
MetaSkill-Evolve 引入了一个递归的双时间尺度框架,用于LLM代理,使其能够同时进化任务技能和改进过程本身,在OfficeQA、SealQA和ALFWorld基准测试上取得了显著的准确性提升。
从记忆到技能:基于证据的长期LLM智能体协同进化治理
MSCE是一种免训练框架,将LLM智能体的经验组织为三个记忆层次,并将其转化为带有证据链接的可复用技能,优于现有的记忆增强和技能增强基线。