Maestro:利用强化学习编排分层模型-技能集成
摘要
Maestro是一个基于强化学习的框架,能够动态组合冻结的专家模型和技能集成,处理多模态任务,使用4B参数编排器实现70.1%的平均准确率,超过GPT-5和Gemini-2.5-Pro。
查看缓存全文
缓存时间: 2026/05/22 06:38
论文页面 - Maestro:强化学习编排层级模型-技能集成
Source: https://huggingface.co/papers/2605.22177
摘要
一个由强化学习驱动的编排框架可动态组合专家模型和技能以处理多模态任务,在低计算开销下实现卓越性能。
大型语言模型(LLMs)和模块化技能的激增赋予了自主智能体日益强大的能力。现有框架通常依赖单一LLM和固定逻辑来与这些技能交互。这引出了一个关键瓶颈:不同的LLM在不同领域各有优势,但当前的框架未能利用模型和技能的互补优势,从而限制了下游任务的性能。在本文中,我们提出Maestro(面向专家技能定向强化编排的多模态智能体),这是一个由强化学习(RL)驱动的编排框架,将异构多模态任务重新定义为在层级模型-技能注册表上的序列决策过程。Maestro并非将所有知识整合到单一模型中,而是训练一个轻量级策略来动态组合冻结专家模型和双层技能库的集成,在每一步决定是否调用外部专家、选择哪个模型-技能对以及何时终止。该策略通过基于结果的RL进行优化,无需步骤级监督。我们在涵盖数学推理、图表理解、高分辨率感知和领域特定分析的十个代表性多模态基准上评估了Maestro。仅使用4B编排器,Maestro就达到了70.1%的平均准确率,超过了GPT-5(69.3%)和Gemini-2.5-Pro(68.7%)。关键的是,学到的协调策略可以泛化到未见过的模型和技能而无需重新训练:将域外专家加入注册表后,在四个具有挑战性的基准上取得了59.5%的平均成绩,优于所有闭源基线。Maestro还保持了高计算效率和低延迟。源代码可在 https://github.com/jinyangwu/Maestro 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2605.22177) 查看 PDF (https://arxiv.org/pdf/2605.22177) GitHub5 (https://github.com/jinyangwu/Maestro) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.22177)
在你的智能体中获取此论文:
hf papers read 2605.22177
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
Jinyang23/Maestro-4B 5B• 更新于约3小时前 (https://huggingface.co/Jinyang23/Maestro-4B)
引用此论文的数据集0
没有链接此论文的数据集
在数据集的README.md中引用arxiv.org/abs/2605.22177以从此页面链接它。
引用此论文的Space0
没有链接此论文的Space
在Space的README.md中引用arxiv.org/abs/2605.22177以从此页面链接它。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
50% OpenClaw,50% 自定义封装 = 快乐的管道!
作者分享了他们使用 OpenClaw 和自定义防护栏构建生产级多智能体系统的经验,重点介绍了静默失败和非确定性的挑战。
我用一个POMDP风格的状态-动作图替换了我们智能体的CLAUDE.md,任务成功率提升16到20个百分点
一位AI智能体开发者用基于POMDP的状态-动作图替换了平面的Markdown配置文件,在更低的token成本下将任务成功率从约78%提升到约95%。
网络匿名已悄然消亡,却无人提及
本文表明,大型语言模型可以通过跨平台匹配非结构化文本,对化名在线账户执行完全自动化的大规模去匿名化,在90%精确率下实现高达68%的召回率,使先前的实际匿名性变得过时。
VLD-RAG:面向长篇幅、视觉丰富多页文档的智能视觉语言检索增强生成
本文提出 VLD-RAG,一种用于在长篇幅、视觉丰富文档上进行问答的智能多模态检索增强生成框架。它使用保留页面的索引和验证器引导的智能体工作流,改进跨页证据检索和推理,在 LongDocURL 和 MMLongBench-Doc 等基准测试上优于以往的基于视觉的基线方法。
指令微调模型在局部重用人句法方面超过人类
本文研究了指令微调大型语言模型中的句法趋同现象,发现它们在对话上下文中重用人句法的频率超过人类自身,并且指令微调增加了对句法模式的依赖。