Co-RL: 多智能体强化学习中多样化群体涌现的无监督推理
摘要
Co-RL是一个合作多智能体框架,通过对等推导的奖励,实现语言和视觉语言模型的无监督推理改进,减少对ground-truth标签的依赖,并通过增加群体多样性缓解训练崩溃。
arXiv:2608.17253v1 公告类型:新
摘要:强化学习(RL)已成为改进语言和视觉语言模型推理能力的强大方法,但其最成功的应用仍然严重依赖于ground-truth监督(例如,可验证的奖励)。此类注释的获取成本高昂,并且随着推理能力超越人类可靠评估的范围,变得越来越稀缺。自奖励RL通过使模型能够从自己的输出中推导奖励信号来减少这种依赖。然而,仅基于自生成反馈进行训练可能会强化现有偏差和次优行为,降低响应多样性,并最终导致同质化响应和训练崩溃。在这项工作中,我们展示了无监督推理可以通过合作多智能体训练涌现。我们引入Co-RL,这是一个框架,其中多个解耦模型(不共享参数)同时通过使用从对等方推导的奖励进行RL优化。我们进一步表明,通过异构模型家族、大小和改写训练样本增加群体多样性,可以减少驱动自我强化反馈循环的相关错误。这种多样性持续提高推理性能,保持行为多样性,并缓解训练崩溃。在纯文本和多模态领域,Co-RL一致优于基础模型和先前的无标签方法,同时匹配或超越监督方法,而无需访问任何ground-truth标签。具体而言,Co-RL在LLMs的七个纯文本基准测试中平均提升3.0-8.6%,在VLMs的四个多模态基准测试中平均提升2.3-7.2%。代码可在https://github.com/DrStranded/Co-RL获取。
查看缓存全文
缓存时间: 2026/08/19 10:25
# Co-RL:多智能体强化学习中多样化协同体自发涌现的无监督推理
来源:https://arxiv.org/html/2608.17253
作者:岳新边、田韵杰
单位:埃克塞特大学、字节跳动
邮箱:{yijiangli, nuno}@ucsd.edu
戴富
单位:埃克塞特大学、字节跳动
黄天骏、石媛媛、肖子昂、努诺·瓦斯康塞洛斯、叶江
单位:约翰斯·霍普金斯大学、加州大学圣地亚哥分校
### 摘要
强化学习已成为提升语言与视觉-语言模型推理能力的重要方法,但其显著成效仍高度依赖真实标签监督(如可验证奖励)。这类标注数据获取成本高昂,且随着模型推理能力超越人类可靠评估的范围,标注数据会日益稀缺。自奖励强化学习通过让模型从自身生成结果中提取奖励信号,降低了对外部监督的依赖。然而,仅基于自生成反馈进行训练可能强化现有偏见与次优行为、降低响应多样性,最终导致同质化输出和训练崩溃。本研究证明,无监督推理能力可通过协作式多智能体训练自发涌现。我们提出Co-RL框架,其中多个独立优化的模型(不共享参数)通过同伴提供的奖励信号进行强化学习优化。我们进一步证明,通过引入异构模型架构、不同规模以及改写训练样本等方式增加协同体多样性,能够减少驱动自我强化反馈循环的相关性错误。这种多样性持续提升推理性能,保持行为多样性并缓解训练崩溃。在纯文本和多模态任务中,Co-RL始终优于基础模型与现有无标签方法,且在多个场景下达到或超越监督学习方法的性能,无需任何真实标签。具体而言,Co-RL在七个纯文本基准测试中为大语言模型带来平均3.0–8.6%的性能提升,在四个多模态基准测试中为视觉-语言模型带来2.3–7.2%的提升。代码开源于:https://github.com/DrStranded/Co-RL。
---
### 1 引言
基于可验证奖励的强化学习已成为提升大语言模型推理能力的有效方法[40, 17],但其成功仍严重依赖真实标签监督。随着模型推理能力接近或超越人类可靠评估的边界[76],获取此类监督数据的成本将急剧增加。自奖励强化学习通过从模型自身完成结果中提取奖励(如与其多数投票预测的一致性[88]、自确定性[87]、预测熵[51],或在改写输入/移动平均策略下的跨一致性[84])来减少对外部监督的依赖。但这些信号始终局限于单模型自身的预测范围。缺乏外部参考的情况下,自我强化可能放大现有偏见与次优行为,降低响应多样性,最终导致输出同质化甚至训练崩溃。这引出了一个核心问题:**模型如何在没有任何真实标签监督的情况下获得足够独立的改进信号?**
本研究证明,该信号可源自独立训练的模型。由于不同模型的错误并非完全相关,每个模型都能提供其他模型无法从自身生成中获得的修正性反馈。我们因此从独立模型中提取学习信号,为每个智能体提供**去相关监督**:由独立更新权重产生的目标,不易重复其自身偏见[3, 37]。
基于此洞见,我们提出Co-RL——一种协作式多智能体无标签强化学习方法。多个不共享参数的独立模型通过同伴提供的奖励同步优化。给定无标签提示,每个智能体采样多个完成结果,通过多数投票[63]聚合成伪答案。随后,一个智能体的完成结果针对另一智能体的伪答案获得奖励,并基于GRPO[55]或REINFORCE++[28]进行策略优化。与策略和奖励来自同一模型的自奖励方法不同,Co-RL从独立更新的伙伴模型获取监督,从而打破放大模型自身偏见的反馈循环。
协同体教学效果取决于其错误的差异性。高度相似的模型往往产生相关错误,可能强化相同的错误答案。因此,协同体多样性对Co-RL的有效性至关重要。我们尽可能扩展这种多样性:使用不同架构族与预训练权重、不同模型规模,以及不同输入形式(如改写提示[84])。这些差异使智能体接触不同的归纳偏置与决策边界,减少相关错误,增强协同体间的修正信号。
通过将多智能体纳入训练循环,Co-RL天然构成多智能体强化学习框架。但与基于辩论或迭代通信的现有方法[20, 38]不同,Co-RL仅需在奖励阶段进行智能体间交互,且无需外部大语言体裁判或可学习奖励模型[69, 49, 77]。该框架轻量且对称:每个智能体同时作为学习者与监督源,所有智能体可在单次训练中同步提升。
在纯文本与多模态领域、多样化模型族及训练场景中,Co-RL持续超越基础模型与现有无标签方法,并在多个场景中达到或超过监督学习性能,且无需真实标签。在覆盖数学推理、编码与知识密集型推理的七个纯文本基准测试中,Co-RL为四个大语言模型带来平均3.0–8.6%的性能提升,超越最强自奖励基线0.8–2.0%。该优势一致延伸至多模态推理:Co-RL为五个参数规模从2B到12B的视觉-语言模型在MathVision、MathVerse、MathVista和We-Math基准测试中带来2.3–7.2%的提升。在CoMAS[69]的控制评估设置下,Co-RL以仅一半的智能体数量平均超越现有方法4.0%。这些结果表明,跨智能体监督无需依赖标签监督或外部裁判,即可在不同模态、模型族和推理任务中提供有效通用的学习信号。
### 2 相关工作
**自奖励强化学习**
尽管基于可验证奖励的强化学习能有效提升大语言模型推理能力[55, 17, 74],但其对高质量真实标签的依赖仍是主要瓶颈[76]。近期研究探索从无标签数据中学习的自奖励机制。其中一个主要方向仅从模型自身行为中提取奖励信号,如多数投票[63]、自一致性[88]、自确定性[87, 36]或预测熵[51, 78]。该方向延续了自奖励模型[75]与自博弈监督[13]的早期研究,并包含无监督自训练[67, 21]、基于模型自身判断的自修正[66],以及零数据自进化(一个或多个模型自主生成训练课程)[85, 29, 41]。然而,由于这些方法仅依赖单模型视角,可能强化并放大现有偏见与错误,且缺乏外部修正信号,常导致严重训练崩溃。
**协同训练、跨视角监督及其起源**
使用第二视角监督学习者是长期存在的思想。协同训练表明两个条件独立视角可相互教学[3],后续分析显示高度相似的视角倾向于强化相同错误:两个视角越相似,越容易在相同错误上达成一致[37]。相关原理支撑自监督表征学习(通过增强、动量目标或停止梯度操作防止崩溃[9, 25, 4])与深度互学习(对等网络提供相互监督[82])。协同奖励[84]将这一洞见引入无标签强化学习,通过改写问题或缓慢更新的模型副本获取奖励。但由于两个视角源自同一模型,其错误仍强相关,仅部分满足有效两视角学习所需的独立性。
**多智能体强化学习**
多种方法通过让多个模型交互来提升推理能力。在推理阶段,多智能体辩论与圆桌共识让模型相互批判与修正[20, 38, 6, 57],通用编排框架将此类智能体组合为流程[65, 83, 32]。近期研究方向转向训练智能体:CoMAS将大语言体裁判评分的交互转化为奖励[69],MAPoRL与MARFT基于可学习或共享奖励协同训练智能体[49, 39],其他系统直接强化或引导多智能体协作[48, 10, 86, 77, 11]。
**面向多模态推理的基于可验证奖励的强化学习**
该方法已快速扩展至视觉-语言模型,基于R1风格的规则奖励支撑了广泛方法族[30, 56, 22, 43, 47, 50, 72, 60]。现有工作主要通过课程或感知感知奖励[18, 73, 58]、数据增强与选择[42, 62],以及监督-强化分阶段训练[19, 5]来改进奖励设计与训练稳定性,但仍普遍假设存在可验证标签。无标签多模态强化学习仍待探索,现有方法同样依赖单模型自身信号[64]。跨视角监督在此尤其具有潜力,因为视觉-语言模型很少共享视觉编码器:InternViT[12]、SigLIP[23]或原生分辨率编码器[2, 81, 80]常与不同大语言模型配对,形成独特的模型族。
### 3 基础知识
#### 3.1 面向推理的强化学习
给定提示 \(x \sim \mathcal{D}\),自回归语言模型 \(\pi_\theta\) 根据 \(\pi_\theta(y \mid x) = \prod_{t=1}^T \pi_\theta(y_t \mid x, y_{<t})\) 生成响应 \(y = (y_1, \ldots, y_T)\)。优化目标为最大化期望奖励 \(R(x, y)\):
\[
\max_\theta \mathbb{E}_{x \sim \mathcal{D}, y \sim \pi_\theta(\cdot \mid x)} [R(x, y)]
\]
基于策略梯度的方法计算梯度:
\[
\nabla_\theta J(\theta) = \mathbb{E}_{x \sim \mathcal{D}} \left[ \mathbb{E}_{y \sim \pi_\theta(\cdot \mid x)} \left[ \sum_{t=1}^T \nabla_\theta \log \pi_\theta(y_t \mid x, y_{<t}) \cdot A(x, y) \right] \right]
\]
其中 \(A(x, y)\) 为优势函数。REINFORCE++[28] 使用广义优势估计与基线减少方差:
\[
A(x, y) = \sum_{t=1}^T \gamma^{T-t} r_t - b(x)
\]
其中 \(r_t\) 为逐步奖励,\(b(x)\) 为状态依赖基线。组相对策略优化[55]进一步引入组内归一化:
\[
\hat{A}_i = \frac{r_i - \text{mean}(\{r_j\})}{\text{std}(\{r_j\})}
\]
其中 \(\{r_j\}\) 为同提示下多个完成的奖励集合。
#### 3.2 多智能体协同学习
设有两个智能体 \(A\) 与 \(B\),其策略参数分别为 \(\theta_A\) 与 \(\theta_B\)。每个智能体 \(i\) 从其策略 \(\pi_{\theta_i}\) 采样完成 \(y^{(i)}\),并基于同伴 \(j\) 的伪答案(通过多数投票获得)计算奖励 \(r^{(i)} = R(y^{(i)}, \hat{y}^{(j)})\)。更新规则为:
\[
\theta_i \leftarrow \theta_i + \alpha \nabla_{\theta_i} \log \pi_{\theta_i}(y^{(i)} \mid x) \cdot \hat{A}^{(i)}
\]
其中 \(\hat{A}^{(i)}\) 为归一化优势。该过程交替进行直至收敛。
#### 3.3 协同体多样性的影响
设智能体 \(A\) 对提示 \(x\) 的正确率为 \(p_A\),智能体 \(B\) 的正确率为 \(p_B\)。假设两者错误不相关,则 \(A\) 的完成与 \(B\) 的伪答案一致的概率为 \(p_A p_B + (1-p_A)(1-p_B)\)。奖励函数为二元反馈:
\[
R(y, \hat{y}) =
\begin{cases}
1 & \text{if } y = \hat{y} \\
0 & \text{otherwise}
\end{cases}
\]
期望奖励可表示为:
\[
\mathbb{E}[R] = p_A p_B + (1-p_A)(1-p_B)
\]
策略梯度方向与期望奖励成正比。当 \(p_A \approx p_B\) 时,系统趋于稳定点;若 \(p_A \gg p_B\),智能体 \(A\) 将主导优化。为避免退化,需确保智能体间足够差异。
定义参数 \(K\) 为投票样本数,则正确率为 \(p\) 的智能体在 \(K\) 次采样中获得多数正确的概率为:
\[
q_K(p) = \sum_{\lceil K/2 \rceil \leq C \leq K} \binom{K}{C} p^C (1-p)^{K-C}
\]
定义正向更新幅度为:
\[
\phi_K(p) = \eta \cdot p(1-p) \cdot \mathbb{E}_{C \sim \text{Bin}(K,p)} \left[ \frac{\sqrt{C(K-C)}}{K} \right] > 0
\]
则系统动力学简化为:
\[
\dot{p}_A = q_K(p_A) \phi_K(p_B), \quad \dot{p}_B = q_K(p_B) \phi_K(p_A)
\]
#### 证明
完整证明见附录。关键结论为:当智能体差异足够大时,系统能收敛到高性能均衡;若差异过小,则易陷入低性能自强化循环。该分析为Co-RL中协同体多样性设计提供理论依据。相似文章
DyCo-RL: 动态跨模态协调用于视觉推理
本文指出,视觉推理中的失败往往源于思维链生成过程中视觉与文本证据之间的动态跨模态协调崩溃。它介绍了DyCo-RL,一个强化学习框架,通过奖励有效的跨模态协调来提升推理性能。
CORA:通过一致性导向推理对齐分析与弥合多模态RLVR中的思考-答案差距
本文分析了大型视觉语言模型中多模态可验证奖励强化学习(RLVR)中的思考-答案不一致性,并提出CORA方法,该方法引入了一致性奖励模型和混合奖励优势拆分,以提高忠实性和任务性能。
IB-RL:面向策略性对话智能体的隔离式双边强化学习
本文提出隔离双边强化学习(IB-RL),该方法让两个对话角色通过联合采样轨迹共同演化,同时各自独立优化自身奖励。该方法解决了策略性对话中强化学习的静态对手不匹配问题,并在 Vehicle TeleSales 和 Deal-or-No-Deal 基准上展现了对未见对手更强的泛化能力。
SocialRL:通过多轮强化学习和奖励设计提升大语言模型的社会智能
本文介绍了SocialRL,一个多轮强化学习框架,通过延迟奖励传播和细粒度过程奖励增强大语言模型的社会智能,显著改善了对话系统的目标完成度。
CoRA: 面向可靠思维链推理的置信度-理由对齐
本文介绍了CoRA,一种基于GRPO的强化学习框架,旨在将LLM的置信度与生成的理由对齐,以提高思维链推理的可靠性,在多个基准测试中将不对齐误差降低了高达26.51%。