多智能体RL何时能提升LLM工作流?工作流、规模与策略共享的权衡

arXiv cs.AI 论文

摘要

本文研究了端到端强化学习训练何时能改善多智能体LLM工作流,比较了不同工作流、任务和模型规模下的共享策略与隔离策略训练,揭示了条件性权衡。

arXiv:2605.24202v1 Announce Type: new 摘要:多智能体LLM工作流通过专门角色路由推理以提高最终任务准确性,但联合训练这些角色与强化学习会以难以理解的方式变得不稳定。我们研究了多智能体LLM工作流的端到端RL训练何时能超越其基础模型,比较了所有角色更新一个策略的共享策略训练与每个角色拥有自己参数的隔离策略训练。我们的实验矩阵涵盖了Eval-Opt、Voting和Orch-Workers工作流,数学和代码任务,以及三个模型规模(0.6B、1.7B、4B)。我们发现多智能体RL通常会优于基础模型,但收益共同取决于工作流、任务和规模,而非仅策略共享。隔离策略往往达到更高的峰值准确度,但更常跌入终端准确度悬崖,而共享策略训练并不能消除失败;它将失败重新分布为性质不同的模式。然后,我们通过工作流拓扑和策略路由引发的角色级梯度动力学来解释这些模式中最强的部分:在隔离策略下,共享提示上的并行同角色代理会放大各角色梯度,并在Voting和Orch-Workers工作流中驱动终端退化;在共享策略下,不对称的每步梯度质量会导致共享策略被主导角色捕获,从而产生因任务和工作流而异的失败特征。总之,实证图谱及其潜在机制表明,策略共享通过不同渠道引导训练压力而非提供统一稳定性,使其成为具有工作流和任务条件性权衡的设计选择。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:06

# 何时多智能体强化学习能提升LLM工作流?工作流、规模与策略共享的权衡
来源:https://arxiv.org/html/2605.24202
Yifan Zeng¹, Yiran Wu², Yaolun Zhang¹ Wentian Zhao³, Kun Wan³, Qingyun Wu²,⁴, Huazheng Wang¹,⁴ ¹俄勒冈州立大学 ²宾夕法尼亚州立大学 ³Adobe公司 ⁴AG2AI公司 \{zengyif, zhanyaol, huazheng.wang\}@oregonstate.edu \{yiran.wu, qingyun.wu\}@psu.edu, \{wezhao, kuwan\}@adobe.com

###### 摘要

多智能体LLM工作流通过将推理过程路由到专业化角色来提升最终任务准确率,但使用强化学习联合训练这些角色的过程存在不稳定性,且其成因尚不清晰。本文研究了端到端RL训练多智能体LLM工作流何时能改进其基础模型,比较了**共享策略**训练(所有角色更新同一策略)与**隔离策略**训练(每个角色拥有独立参数)。我们的实验矩阵涵盖Eval-Opt、Voting和Orch-Workers三种工作流、数学和代码两类任务,以及三种模型规模(0.6B、1.7B、4B)。我们发现,多智能体RL通常能改进基础模型,但增益取决于工作流、任务和规模的共同作用,而非仅由策略共享决定。IP通常能达到更高的峰值准确率,但也更容易出现最终的准确率悬崖式下降;而SP训练并不能消除失败,只是将失败重新分布到不同模式中。随后,我们通过工作流拓扑和策略路由导致的角色级梯度动力学,解释了其中最强的模式:在IP下,共享提示的并行同角色智能体会放大每个角色的梯度,导致Voting和Orch-Workers工作流出现最终退化;在SP下,非对称的每步梯度质量导致共享策略被主导角色捕获,从而在不同任务和工作流中产生不同的失败特征。综合来看,实证图谱及其底层机制表明,策略共享是将训练压力路由到不同渠道,而非提供统一的稳定性,因此它是一项设计选择,具有工作流和任务条件的权衡。

## 1 引言

多智能体LLM工作流已成为一种常见的推理时手段,用于提取比单次前向传递更强的能力,通常将生成、评估、聚合或委派分解到多个模型调用中(Yang等人,2026 (https://arxiv.org/html/2605.24202#bib.bib19);Wu等人,2023 (https://arxiv.org/html/2605.24202#bib.bib25);Madaan等人,2023 (https://arxiv.org/html/2605.24202#bib.bib23);Wang等人,2023 (https://arxiv.org/html/2605.24202#bib.bib24))。与此同时,基于可验证奖励的强化学习(RLVR)已成为提升大语言模型推理能力的标准方法,在数学和代码任务上取得了显著成功(Shao等人,2024 (https://arxiv.org/html/2605.24202#bib.bib8);Guo等人,2025 (https://arxiv.org/html/2605.24202#bib.bib32);Yu等人,2025 (https://arxiv.org/html/2605.24202#bib.bib26);Zhao等人,2025a (https://arxiv.org/html/2605.24202#bib.bib5))。最近,RLVR已被应用于训练多步LLM智能体,其中任务成功可通过回合结束时的一个结果信号来评估(Jin等人,2025 (https://arxiv.org/html/2605.24202#bib.bib2);Wei等人,2025 (https://arxiv.org/html/2605.24202#bib.bib3);Wang等人,2025 (https://arxiv.org/html/2605.24202#bib.bib4))。这一进展自然延伸到了多智能体系统,其中工作流由多个交互组件组成,最终的可验证结果可为系统的端到端优化提供奖励信号。

近期工作已开始将群体相对策略优化(Shao等人,2024 (https://arxiv.org/html/2605.24202#bib.bib8))扩展到多智能体场景(Zhao等人,2025b (https://arxiv.org/html/2605.24202#bib.bib1);Liu等人,2025 (https://arxiv.org/html/2605.24202#bib.bib9);Hong等人,2025 (https://arxiv.org/html/2605.24202#bib.bib10);Chen等人,2025 (https://arxiv.org/html/2605.24202#bib.bib11);Feng等人,2026 (https://arxiv.org/html/2605.24202#bib.bib13))。这些研究表明RL可应用于特定的多智能体工作流,如辩论、搜索或层次化工具使用,但并未系统性地揭示多智能体RL何时能提升性能,以及训练成功或失败的原因。因此,本文提出了一个更广泛的问题:**强化学习何时能改进多智能体工作流,以及哪些训练动力学能解释最终结果?**

为回答这个问题,我们进行了系统性研究,涵盖**三种工作流**(Eval-Opt、Voting和Orch-Workers)、**三种模型规模**(0.6B、1.7B、4B)、**两类任务**(数学和代码),以及**两种策略共享策略**(每个角色使用一个共享策略,或每个角色使用独立策略)。每个实验条件均与同规模同任务的基础模型基线以及单智能体RL基线进行比较,从而将多智能体训练带来的增益与单智能体RL本身已产生的增益区分开来。图1 (https://arxiv.org/html/2605.24202#S1.F1)展示了所研究的工作流拓扑和策略路由。

图1:工作流拓扑和策略路由。三种工作流(Eval-Opt、Voting、Orch-Workers),每种均在**隔离策略**(每个角色一个πrole)或**共享策略**(所有角色共用一个πshared)下训练,并采用共享结果奖励的GRPO循环。

通过这一设计,我们获得了关于多智能体RL训练何时优于基础工作流的三个实证洞察:(1) 多智能体RL训练通常能改进基础模型,但策略共享策略的选择在天花板与地板之间呈现权衡:**隔离策略**路由往往能达到更高的峰值准确率,但更易出现后期训练退化;而**共享策略**路由在上行空间上较为保守,但仍受后期训练漂移的影响。(2) 联合训练是否有帮助以及帮助程度,取决于工作流和任务的共同作用,而非仅由策略共享这一维度决定:相同的策略共享选择在Eval-Opt、Voting和Orch-Workers工作流中,以及在数学和代码任务中,产生的结果不同。(3) **SP训练会重新分布退化而非消除它**,并且某些SP失败模式在token级训练指标中隐藏,仅在回合正确性层才显现(§3 (https://arxiv.org/html/2605.24202#S3)、§4 (https://arxiv.org/html/2605.24202#S4))。随后,我们通过工作流拓扑和策略路由所诱发的两个角色级梯度机制,解释了这些洞察中最强的部分:**隔离策略下的梯度放大**和**共享策略下的角色捕获**(§5 (https://arxiv.org/html/2605.24202#S5))。

## 2 相关工作

##### **LLM工作流的多智能体RL训练**。

将强化学习(尤其是GRPO (Shao等人,2024 (https://arxiv.org/html/2605.24202#bib.bib8)))扩展到多智能体LLM系统的工作日益增多。一条研究线为不同的多智能体工作流结构开发了GRPO风格训练目标。AT-GRPO (Zhao等人,2025b (https://arxiv.org/html/2605.24202#bib.bib1))引入了基于智能体和轮次的分组及树结构采样;MAGRPO (Liu等人,2025 (https://arxiv.org/html/2605.24202#bib.bib9))将LLM协作形式化为具有集中式群体相对优势和分散式执行的Dec-POMDP;M-GRPO (Hong等人,2025 (https://arxiv.org/html/2605.24202#bib.bib10))通过轨迹对齐处理层次化多智能体系统中可变长度子智能体调用;MHGPO (Chen等人,2025 (https://arxiv.org/html/2605.24202#bib.bib11))为多智能体搜索管道设计了异质群体优势。另一条研究线研究系统层面的策略适应和强化微调,包括MPDF (Yang和Thomason,2025 (https://arxiv.org/html/2605.24202#bib.bib14)),它通过基于排序的RL学习用于智能体协商的自适应元策略;以及MARFT (Liao等人,2025 (https://arxiv.org/html/2605.24202#bib.bib12)),它提供了一个结合LoRA适配器的多智能体强化微调概念框架。最近的另一个方向分析了多智能体RL中的优化稳定性;例如,Dr. MAS (Feng等人,2026 (https://arxiv.org/html/2605.24202#bib.bib13))指出了由跨智能体全局优势归一化引起的梯度范数不平衡问题,并提出了智能体级归一化。总体而言,这些方法通过引入针对特定工作流模式或优化问题的算法组件,推动了多智能体RL的发展。我们的工作是互补性的:我们不提出新的训练算法,而是进行一项受控的跨工作流、跨规模、跨任务的实证研究,包含基础模型和单智能体RL对照,并通过工作流拓扑和策略路由诱发的角色级梯度动力学来解释观察到的最强模式。

##### **LLM RL中的多样性崩溃和角色漂移**。

近期几项工作涉及单策略和多智能体LLM RL中的相关症状。Long等人 (2025 (https://arxiv.org/html/2605.24202#bib.bib36))将可验证奖励下的多样性崩溃视为一个发散选择问题,并主张用能更好保留样本多样性的替代方案来替代前向KL。Wang等人 (2026 (https://arxiv.org/html/2605.24202#bib.bib37))通过轻量级协议级监控检测并修复多智能体协作中的角色漂移。Zhang等人 (2025 (https://arxiv.org/html/2605.24202#bib.bib38))则处理了多智能体推理中智能体贡献不足的相反病理现象,即一个智能体主导而其他智能体退化为被动角色。我们的工作是结构性的:我们识别出哪些工作流拓扑和策略路由选择首先会导致角色漂移,并通过梯度机制(**隔离策略下的梯度放大**、**共享策略下的角色捕获**)解释观察到的最强模式。

## 3 实验设置

我们的实验组织为一个受控网格,覆盖四个维度:任务、模型规模、策略路由策略和工作流(图1 (https://arxiv.org/html/2605.24202#S1.F1))。任务维度涵盖数学推理和代码生成场景;模型维度改变底层基础模型的大小;策略路由维度比较共享策略和隔离策略;工作流维度评估具有不同角色结构和通信模式的三种拓扑。这一网格使我们能够分离来自任务领域、模型规模、策略在角色间的共享方式以及智能体系统本身拓扑的影响。每个工作流–任务–规模–策略配置均使用固定种子训练一次,并包含一个未经训练的基础模型评估和一个在相同任务和规模下训练的单智能体强化学习对照。这些对照允许后续分析区分一般性RL诱发的漂移与多智能体交互特有的漂移。训练采用GRPO (Shao等人,2024 (https://arxiv.org/html/2605.24202#bib.bib8)),未使用显式的KL惩罚与参考策略对比:每个训练步骤对每个问题抽取 n=8 次工作流 rollout,并在所得rollout组内计算相对优势。

**数据集**。我们使用 DAPO-Math-17K (Yu等人,2025 (https://arxiv.org/html/2605.24202#bib.bib26)),简称 Math;以及 DeepCoder (Luo等人,2025 (https://arxiv.org/html/2605.24202#bib.bib29)),简称 Code。Math评估多步数学推理能力,Code评估面向代码的问题解决能力。**模型**。在两个任务中,底层模型家族均为 Qwen3 (Yang等人,2025 (https://arxiv.org/html/2605.24202#bib.bib31)),具体取三个规模:Qwen3-0.6B、Qwen3-1.7B 和 Qwen3-4B。跨规模使用相同的模型家族使架构固定,同时允许我们测试角色专业化、策略漂移和工作流级行为随模型容量增加如何变化。

### 3.1 多智能体工作流

我们研究三种多智能体工作流:Eval-Opt、Voting 和 Orch-Workers。
*Eval-Opt* 是一个双角色工作流,包含一个生成器和一个评估器。生成器产生初始答案,评估器对答案进行判断,给出裁决和评语,并可能引发修订。该工作流测试将解决方案生成与评估分离是否会创造有用的角色专业化,还是会导致一个角色主导优化动态。

*Voting* 是一个双角色工作流,包含三个生成器和一个聚合器。三个生成器独立产生候选答案,聚合器从中选择或组合。该工作流引入了同角色多样性:三个生成器位置扮演相同的功能角色,但对同一提示可能产生不同输出。因此,我们不仅追踪聚合器的最终决策,还追踪生成器答案的分布、聚合器的选择行为,以及三个生成器输出上的 pass@k 预测。

*Orch-Workers* 是一个三角色工作流,包含一个编排器、三个工作器和一个合成器。编排器提出计划或分解,工作器生成候选解决方案或部分响应,合成器产生最终答案。与 Voting 类似,该工作流包含同角色多样性,但重复角色出现在更明显的层次化管道中。这使得 Orch-Workers 有助于研究在相同的结果级训练信号下,协调角色和工作器角色是否以不同方式漂移。

### 3.2 策略共享策略

我们比较两种策略路由策略:**共享策略(SP)** 和 **隔离策略(IP)**。在 SP 下,工作流中的所有角色使用一个共享策略,因此来自生成器、评估器、聚合器、编排器、工作器和合成器的梯度都更新相同的参数。该设置测试一个策略能否支持多个对话和功能角色而不会产生角色干扰。在 IP 下,每个不同的角色被分配一个自己的角色特定策略适配器。同角色多样性不会创建单独的适配器:例如,Voting 中的三个生成器共享一个生成器适配器,Orch-Workers 中的三个工作器共享一个工作器适配器。因此,IP 按角色类型而非单个智能体实例来隔离策略。这种设计让我们能够在比较角色专门化学习与完全共享学习的同时,保持对重复同角色智能体的处理方式在各工作流中一致。

### 3.3 分析协议

分析遵循论文的结构。§4 (https://arxiv.org/html/2605.24202#S4) 比较工作流–任务–规模–策略网格中的结果。§5 (https://arxiv.org/html/2605.24202#S5) 使用角色级和轨迹级证据来解释最强的实证模式,尤其是**隔离策略**训练的高天花板低地板行为以及**共享策略**训练下观察到的失败再分布。§A.6 (https://arxiv.org/html/2605.24202#A1.SS6) 将这些发现转化为设计启示和监控建议。

## 4 结果

表 1:跨任务×规模×工作流矩阵的验证准确率(%),包含单智能体RL(SA-RL)基线。每个单元格报告峰值验证准确率;IP和SP残差为MA-RL减去SA-RL的百分点。SA-RL与工作流无关,每个(任务,规模)块报告一次。Code缩写为DeepCoder。

我们展示了多智能体RL训练在工作流、规模、任务和策略共享矩阵上的实证图景。§4.1 (https://arxiv.org/html/2605.24202#S4.SS1) 确立多

相似文章

@rohanpaul_ai: 斯坦福新论文指出,在同等推理预算下,单个LLM通常比多个……更好地解决多跳问题

X AI KOLs Timeline

一项新的斯坦福论文显示,在同等推理token预算下,单个LLM在多跳推理任务上通常优于多智能体系统,而多智能体设置带来的提升往往来自更多计算而非架构优势。该论文利用数据处理不等式解释为什么交接中的信息丢失会损害多智能体性能,并指出上下文质量是多智能体系统能够提供益处的关键因素。