@dair_ai:// 面向多智能体系统的元技能演化 // 多智能体系统能否在不触及...的情况下提升编排能力?

X AI KOLs Following 论文

摘要

Skill-MAS提出了一种在无需修改模型权重的情况下,为多智能体系统演化元技能以提升编排能力的方法,实现了跨任务和LLM的可迁移性能提升。

// 面向多智能体系统的元技能演化 // 多智能体系统能否在不改变单个权重的情况下提升编排能力? 自动MAS生成一直陷入两种糟糕的选择之间。推理时方法使用冻结的前沿模型,但从未从过去的运行中学习。训练时方法可以学习,但受限于小模型的能力。 Skill-MAS则走第三条路。 它将编排能力视为一种可演化的元技能,通过多轨迹 rollout 和选择性反思的闭环进行优化,将经验提炼为策略层面的原则,而非记忆化的痕迹。 在四个基准测试和四个不同的LLM上,演化出的元技能可以迁移到未见过的任务和其他模型上,因为诀窍存在于策略层面的文本中,而非任何单个模型的权重中。 你可以保留前沿模型,同时积累经验。 论文:https://arxiv.org/abs/2606.18837 在我们的学院中学习构建高效的AI智能体:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/06/22 09:33

// 多智能体系统的元技能进化 // 能否在不改变任何模型权重的情况下,让多智能体系统的编排能力变得更强?自动 MAS 生成长期陷入两种糟糕选项的困境。推理时方法使用冻结的前沿模型,但无法从过去运行中学习。训练时方法能够学习,但受限于小模型的能力上限。Skill-MAS 开辟了第三条路径。它将编排能力视为一种可进化的元技能(Meta-Skill),通过一个封闭循环不断优化:多轨迹展开(Multi-Trajectory Rollout)和选择性反思(Selective Reflection),将经验提炼为策略层面的原则,而非记忆化的轨迹。在四个基准测试和四种不同大语言模型上的实验表明,进化后的元技能能够迁移到未见过的任务和其他模型上,因为知识以文本形式存在于策略层面,而非任何单个模型的权重中。你保留了前沿模型,同时还能不断积累经验。论文:https://arxiv.org/abs/2606.18837
在我们的学院学习构建有效的 AI 智能体:https://academy.dair.ai


Skill-MAS: 面向自动多智能体系统的元技能进化

来源:https://arxiv.org/html/2606.18837

何海林♠,杨琦♢,秦成伟♠††感谢:通信作者 [email protected] (https://arxiv.org/html/2606.18837v1/mailto:[email protected])
♢蚂蚁集团,♠香港科技大学(广州)

摘要

基于大语言模型(LLM)的自动多智能体系统(MAS)生成已成为解决复杂任务的关键前沿。然而,现有方法面临着模型能力经验保留之间的两难困境。推理时 MAS 利用冻结的前沿大语言模型,但重复进行相同的搜索,无法从过去经验中学习。相反,训练时 MAS 通过梯度更新将经验内化,但受限于小模型的能力上限,并且难以扩展到强大的前沿大语言模型。为了弥合这一差距,我们提出了 Skill-MAS,这是一种新颖的第三条路径,它将高级编排能力概念化为一种可进化的元技能,从而将经验保留与参数更新解耦。Skill-MAS 通过一个封闭优化循环来改进这种架构知识:(1)多轨迹展开在当前元技能下为每个任务采样行为分布;(2)选择性反思自适应地选择优先任务,并应用分层对比分析将系统经验提炼为可泛化的、策略层面的原则。在四个复杂基准测试和四种不同大语言模型上的广泛实验表明,Skill-MAS 不仅取得了显著的性能提升,而且保持了良好的成本-性能权衡。进一步分析表明,进化后的元技能具有高度的鲁棒性,并且在不同任务和不同大语言模型之间表现出强大的可迁移性。

1 引言

基于大语言模型的多智能体系统(MAS)通过协作在解决复杂任务方面展现了显著的效果(Xu 等,2025;Lin 等,2025;Wu 等,2025;Huang 等,2026)。然而,为高度异构的任务手动设计特定的智能体角色、通信拓扑和工作流程是劳动密集型的,且难以扩展(Chen 等,2025a;Lin 等,2026)。因此,自动 MAS 作为一个关键方向出现,旨在自动生成和优化多智能体架构(Ye 等,2025;Tran 等,2025;Ke 等,2025a)。

参见图 1:MAS 范式概览。(a)-(b)现有推理时和训练时 MAS 的对比,展示了模型能力与经验保留之间的两难困境。(c)可进化的 Skill-MAS 通过迭代进化元技能弥合了这一差距,成功地将高能力大语言模型与经验保留能力相结合。(d)成本-性能权衡分析,突出了 Skill-MAS 作为自动 MAS 更好的“第三条路径”。

基于编排知识的获取和保留方式,现有的自动 MAS 主要分为两条不同的路径¹,每条路径都在模型能力经验保留之间进行权衡。第一条路径是推理时编排(Ke 等,2025b;Ruan 等,2026),它将冻结的前沿元智能体与迭代搜索算法相结合以优化 MAS。虽然这种方法受益于最先进大语言模型的强大推理能力,但其优化过程本质上是经验无关的。元智能体在没有累积记忆机制的情况下运行。它在不同运行中重复相同的搜索和生成过程,无法保留或迁移从先前失败中学到的宝贵诊断经验(Yang 等,2026a)。第二条路径是训练时编排(Su 等,2025;Ke 等,2026),它通过在精心策划的编排数据集上微调小模型(通常为 7B 参数)来参数化编排能力。尽管这条路径使模型能够通过梯度更新内化经验,但它受到小模型能力上限的限制。此外,它需要大量高质量的训练数据,这很难扩展到或利用专有的、超大型前沿模型(>>100B),而这些模型拥有最强的推理能力(Rank 等,2026)。因此,这一困境引发了一个关键问题:是否存在第三条路径,能够将经验保留与参数更新解耦,从而使冻结的前沿元智能体能够跨任务逐步学习和优化其编排专长?

社区内新兴的“技能”范式为这个问题提供了一种潜在解决方案(Xiong 等,2026;Si 等,2026;Vish 等,2026)。通过将能力抽象为结构化的自然语言文档(例如,SKILL.md),智能体可以通过迭代进化实现这些技能的逐步增强(Zhang 等,2026a;Li 等,2026)。然而,现有的技能发现和进化工作主要集中在单智能体场景。例如,MemSkill 为记忆智能体迭代挖掘和优化记忆管理技能(Zhang 等,2026b)。即使扩展到 MAS,技能分析仍然严格局限于子智能体层面,仅关注复杂系统内单个任务执行智能体如何被抽象为相应技能(Li, 2026;Alzubi 等,2026)。然而,我们观察到元智能体的高级编排行为同样可以被建模为一种可进化的技能(§3.1)。通过采用这种视角,我们可以成功赋予元智能体迭代学习的能力。
为此,我们提出了Skill-MAS,它将元智能体的编排能力概念化为一种可进化的元技能,编码了涵盖任务分解、智能体工程和工作流程编排的策略层面原则。然后,Skill-MAS 通过一个包含两个阶段的封闭优化循环来优化这种元技能。首先,多轨迹展开在当前技能下对每个任务执行多个独立展开,将单次试验结果转换为分布统计数据,从而将真实能力与执行随机性分离。其次,选择性反思通过联合不确定性-难度分数和自适应肘部截断来优先处理最不稳定和困难的任务。然后,它应用分层对比分析(先任务内、再跨任务)来诊断系统性失败模式,并将得到的证据用于优化元技能,同时保留其三模块骨架。经过多轮迭代后,选择性能最佳的技能进行最终评估。
为了验证 Skill-MAS 的有效性,我们在四个具有挑战性的基准测试上进行了评估,涵盖深度研究、专家级数学、多跳问答和真实世界交互场景。使用四种大语言模型作为元智能体,我们将 Skill-MAS 与最先进的推理时和训练时自动 MAS 进行了比较。实验结果表明,Skill-MAS 在提供显著性能的同时,保持了更好的成本-性能权衡。我们的进一步分析表明,进化后的元技能编码了可泛化的编排策略,并且在未见过的任务和不同的基础大语言模型之间表现出强大的可迁移性。这些发现共同突出了我们新范式的重要性:用持续进化的元技能增强静态的元智能体。
我们的主要贡献总结如下:

  • • 我们开创了一种新的自动 MAS 范式,将高级编排行为概念化为一种可进化的元技能,使冻结的前沿大语言模型能够在无需昂贵参数更新的情况下优化架构知识。
  • • 我们提出了 Skill-MAS,通过多轨迹展开和选择性反思迭代进化元技能,将经验提炼为可泛化的编排原则。
  • • 广泛的实验表明,我们的 Skill-MAS 取得了更好的成本-性能权衡,并且元技能具有高度可迁移性。

2 相关工作

2.1 自动 MAS

推理时方法利用冻结前沿大语言模型的强大推理能力作为元智能体(Wang 等,2025b;Zhang 等,2025)。通过将这些模型与复杂的提示和搜索算法相结合,这些方法旨在发现有效的 MAS,而无需改变底层模型权重(Ferrag 等,2025)。例如,AFlow 使用蒙特卡洛树搜索等搜索算法在智能体工作流的广阔空间中进行导航(Zhang 等,2024)。同时,另一部分工作消除了对验证集的需求。例如,EvoAgent 通过进化原理将单个专家智能体扩展为多智能体协作网络(Yuan 等,2025)。AOrchestra 基于层次化任务分解动态填充节点属性(Ruan 等,2026)。MAS-Zero 引入自反思反馈循环来优化 MAS 拓扑(Ke 等,2025b)。在这些框架中,元智能体在每次迭代中执行相同的搜索例程,并且在结构上无法实现跨历史编排轨迹的经验学习(Li 等,2024;He 等,2025a)。

训练时方法通过从历史轨迹中学习,教会编排器(一个小型大语言模型)一次性生成多智能体配置(Ye 等,2025;Su 等,2025)。例如,ScoreFlow 使用直接偏好优化的一种变体将定量反馈直接注入训练过程(Wang 等,2025c)。MAS² 训练模型掌握自生成和自纠正工作流(Wang 等,2025a),而 MAS-Orchestra 将 MAS 构建建模为通过 GRPO 优化的顺序函数调用任务(Ke 等,2026)。尽管这种方法为掌握编排能力提供了一条学习路径,但参数优化需要大量复杂的编排轨迹集合(Dang 等,2026)。更关键的是,由于微调或强化学习相关的天文级计算成本,这种范式极难扩展到那些强大的前沿大语言模型(>>100B)(Rank 等,2026)。与这两类不同,Skill-MAS 开辟了第三条路径:将元智能体的编排视为一种可进化的元技能,逐步赋能元智能体生成更优的 MAS。

2.2 技能进化与分析

新兴的“技能”范式通过将操作能力抽象为结构化的自然语言文档(Yang 等,2026b),为智能体自我改进提供了强大的机制。这使得智能体能够通过进化将经验提炼为可重复使用的原则(Wu 等,2026)。当前文献主要集中在单智能体场景下的执行级技能进化。诸如 MemSkill(Zhang 等,2026b)和 Trace2Skill(Ni 等,2026)等框架强调通过分析历史交互轨迹提取特定于任务的例程,范围从记忆管理到多跳推理。其他方法论,包括 Skill0(Lu 等,2026)、D2Skill(Tu 等,2026)和 SKILLRL(Xia 等,2026),将技能发现与策略优化相结合,允许智能体从环境反馈中内化启发式知识。
当技能范式扩展到多智能体系统时,研究仍聚焦于子智能体层面(Pan 等,2026)。例如,CoEvoSkills(Zhang 等,2026a)和 EvoSkill(Alzubi 等,2026)迭代优化任务执行智能体的可执行角色,而最近关于基于角色的技能库的研究则探讨如何通过层次化路由来组织这些子智能体技能(Li, 2026)。与以往专注于执行级技能进化的研究不同,我们将元智能体的高级编排行为概念化为一种元技能(Meta-Skill),这是一种可进化的制品,捕获了元层面的架构知识。

3 方法论

相似文章

SkillFlow:流程驱动的递归技能演化用于智能体编排

arXiv cs.AI

SkillFlow 提出了一种基于流程驱动的递归技能演化框架,用于基于大语言模型的智能体编排,采用 Tempered Trajectory Balance 来防止策略崩溃并提供透明的信用分配。在 14 个数据集上的实验表明,在问答、数学、代码和决策制定任务中,该框架显著优于基线方法。

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。

SkillClaw:让技能通过智能体进化器集体进化

Papers with Code Trending

SkillClaw 提出了一个框架,用于多用户 LLM 智能体系统中的集体技能进化,通过聚合交互和反馈,实现自主更新和跨用户知识转移,以提升整个生态系统的性能。