FBOS-RL:反馈驱动的双目标协同强化学习
摘要
本文提出FBOS-RL,一个反馈驱动的双目标协同强化学习框架,通过使用反馈引导的探索和两个相互增强的训练目标——面向利用的策略对齐(EPA)和面向探索的能力培养(ECC)——来提升训练效率和性能上限,优于GRPO在大语言模型对齐和推理中的表现。
arXiv:2605.20256v1 发布类型:新
摘要:强化学习已成为对齐和释放大规模模型推理能力的基石。其核心是GRPO及其变体的训练循环在rollout采样和策略更新之间交替。与监督学习不同,其中每个梯度步骤都锚定于显式的地面真值目标,在此设置中更新模型参数的最优梯度方向先验未知;因此采样阶段获得的优质rollout充当了指导每次参数更新的隐式“教师”。然而,GRPO采用简单的采样方案,将所有rollout条件设定为相同的原始提示。当任务超出策略模型当前能力时,此采样方案很少产生优质rollout,导致策略模型在更新参数时缺乏有意义的梯度方向,从而使训练停滞。为解决此问题,我们提出FBOS-RL,一种反馈驱动的双目标协同强化学习框架。具体来说,我们让模型基于环境提供的反馈进行反馈引导的探索增强,并在此基础上设计两个相互增强的训练目标:面向利用的策略对齐(EPA)和面向探索的能力培养(ECC)。大量实验表明,EPA和ECC可以相互增强,形成正向飞轮效应,显著提升训练效率和强化学习的最终性能上限。具体来说,在相同数量的rollout下,FBOS-RL比GRPO和基于反馈的基线学习速度更快,最终达到更高的性能上限,同时在训练过程中表现出更高的策略熵和更低的梯度范数。
查看缓存全文
缓存时间: 2026/05/21 06:20
# FBOS-RL: 反馈驱动的双目标协同强化学习 来源:https://arxiv.org/html/2605.20256 张希凯¹ 李永志³ 肖力康¹ 张英泽¹ 程艳华³ 陈全³ 姜鹏³ 吴文俊²,¹ 刘柳²,¹∗ ¹北京航空航天大学杭州国际创新研究院 ²北京航空航天大学人工智能学院 ³快手科技 ###### 摘要 强化学习(RL)已成为对齐和激发大规模模型推理能力的关键方法。其核心在于,GRPO及其变体的训练循环在*rollout采样*和*策略更新*之间交替:策略首先从其动作空间中采样rollout,然后根据这些rollout计算的优势值更新参数。与每个梯度步骤都锚定在显式真实目标上的监督学习不同,在此设置中,更新模型参数的最优梯度方向并非先验已知;因此,采样阶段产生的高质量rollout充当了隐式“教师”,指导着每次参数更新。然而,主流的RL算法(如GRPO)采用一种简单的采样方案,即所有rollout都基于相同的原始提示。当任务超出策略模型当前能力时,这种采样方案很少能产生高质量rollout,导致策略模型在更新参数时缺乏有意义的梯度方向,从而造成训练停滞。为解决此问题,我们提出**FBOS-RL**,一种**反馈驱动的双目标协同**强化学习框架。具体而言,我们让模型根据环境提供的反馈进行**反馈引导的探索增强**,并在此基础上设计两个相互促进的训练目标:**面向利用的策略对齐**(EPA)和**面向探索的能力培养**(ECC)。大量实验表明,EPA和ECC能够相互促进,形成正反馈飞轮,显著提升强化学习的训练效率和最终性能上限。具体来说,在相同的rollout预算(即相同的训练步数)下,FBOS-RL的学习速度远快于GRPO和基于反馈的基线方法,并最终达到更高的性能上限,同时在训练过程中保持更高的策略熵和更低的梯度范数。 **脚注:** 通讯作者:[email protected] ## 1 引言 强化学习(RL)在大语言模型(LLM)的对齐和推理微调中扮演着关键角色[6, 7, 8, 15, 4]。本质上,GRPO及其变体的训练过程在两个阶段之间交替:*rollout采样*和*策略更新*[5, 4, 28]:模型首先在其动作空间中采样以获取多个rollout,然后根据这些rollout及其优势值更新策略参数。与直接向显式真实目标更新的监督学习不同,在此设置中,模型在参数更新时无法先验地知道最优梯度方向。模型在采样阶段偶然采到的高质量rollout实际上扮演着引导参数更新的“教师”角色。只有当模型采样到优于当前行为的rollout时,参数更新才能获得更好的梯度方向,从而推动模型能力向前发展。 尽管主流RL算法在实践中取得了经验上的成功,但当前主流的大规模模型RL算法(如GRPO及其变体)[4, 12, 15] 在采样阶段普遍采用一种单一且盲目的采样范式:给定原始提示,模型直接基于该提示生成多个rollout[4, 12]。这种范式有一个关键限制:当面对超出模型当前能力的复杂任务时,模型往往会陷入低效采样状态,很少能采样到高质量的rollout(就像猴子在打字机上乱敲,即使在宇宙终结前也无法产生莎士比亚全集,见图1)。在这种情况下,单一的标量奖励只能告诉模型其当前策略“表现不佳”,但无法指出“为什么”不佳或“如何改进”(类似于学生做练习题却得不到任何对过往错误的解释,进步缓慢)[14]。由于模型在采样阶段无法获得高质量rollout作为优化锚点,其在参数更新时就会失去可靠的梯度方向,最终导致训练效率低下甚至长期训练停滞[23, 24, 22]。 查看图标题 图1:对标准GRPO式RL中rollout采样阶段的一个类比说明:猴子在打字机上随机敲键产生莎士比亚作品的可能性极低。同样,当提示超出策略当前能力时,简单的采样策略很少能产生高质量rollout,导致训练失去有意义的梯度锚点。 为解决此问题,我们提出**FBOS-RL:反馈驱动的双目标协同强化学习**。FBOS-RL的核心创新在于,通过反馈的引导,增强了rollout采样阶段,并在此基础上设计了两个相互促进的训练目标,即**面向利用的策略对齐**(EPA)和**面向探索的能力培养**(ECC)。通过交替优化这两个目标,FBOS-RL形成了一个正向自举飞轮,从而显著提升强化学习的训练效率和最终性能上限。尽管最近的一些工作尝试在采样阶段引入外部反馈,但大多数仅将反馈视为数据增强的手段,即利用反馈生成更高质量的数据然后让模型模仿[9, 10, 11, 29],而忽略了培养模型自身根据反馈采样更好rollout的能力。相比之下,FBOS-RL不仅利用反馈来提升采样阶段获得的rollout质量,而且明确将“理解反馈并纠正错误”本身作为一个额外的强化学习目标。通过两个训练目标的交替优化,形成了一个正向自举飞轮,同时提升了训练效率和最终性能上限。 我们的贡献总结如下: - • 我们指出了主流强化学习算法(如GRPO)在rollout采样阶段的低效性和盲目性,并提出了一种交互式采样机制,即反馈引导的探索增强,有效打破了复杂推理任务上的低效采样瓶颈。 - • 我们提出了**反馈驱动的双目标协同强化学习(FBOS-RL)**框架。通过设计两个相互促进的训练目标(面向利用的策略对齐和面向探索的能力培养),形成了正向自举飞轮,显著提升了强化学习的训练效率和最终性能上限。 - • 在多个数据集以及不同系列和规模的模型上进行的大量实验验证了FBOS-RL能够显著提升强化学习的训练效率和最终性能上限。同时,FBOS-RL避免了熵崩塌,保持了更高的策略熵,并且表现出更低的梯度范数,表明其更强的探索能力和更好的训练稳定性。 ## 2 相关工作 ### 2.1 面向LLM推理的强化学习 强化学习(RL)已成为对齐LLM并激发其推理能力的核心工具[6, 7, 8]。基于PPO[5],可扩展的算法如GRPO[4]和DAPO[12]在数学和代码推理方面取得了显著进展,例如DeepSeek-R1[15]。为了改进信用分配,过程奖励模型[13, 16]和隐式过程奖励[32]提供了步骤级的监督,而ProRL[22]和熵感知优化[24]通过延长或稳定训练拓展了推理边界。然而,越来越多的研究指出,主流强化学习流程中的rollout采样阶段本质上是盲目的:rollout仅从原始提示中采样,单一的标量奖励只能表明策略“表现不佳”,却无法指出“为什么”或“如何改进”[14]。最近的研究证实,标准强化学习难以将策略推至基础模型的推理边界之外[23],并强调了探索这一未被充分研究的角色[28, 25]。缓解方法包括反向课程[31]、树搜索引导的强化学习[27]、从负面数据中学习[21]、测试时计算缩放[30]以及自我对弈或自我奖励方案[26, 20]。然而,驱动梯度的rollout仍然由单一的、无反馈的通道产生,核心的盲目性问题仍未得到解决。 ### 2.2 反馈驱动的自我改进和自我纠正 另一条补充性的研究路线探讨了自然语言反馈如何帮助LLM改进其输出。Self-Refine[9]和Reflexion[10]在推理时使用自我批评或口头反思,而自我批评模型[19]、学习自我纠正[18]以及工具增强批评如CRITIC[17]进一步表明,基于反馈的条件生成提高了输出质量。最近的工作直接训练自我纠正行为,例如SCoRe[11]和递归内省[29]。早期的研究警示,LLM在没有外部基础的情况下无法可靠地进行自我纠正[14],这促使了可验证信号[16, 13]的出现。离策略引导方法如LUFFY[3]额外重新加权重要性比率,以放大对关键低概率令牌的学习。然而,这些方法中的大多数要么将反馈视为推理时的脚手架,要么视为模仿的数据,很少形成反馈增强探索与底层策略优化之间的闭环;由此产生的提示分布偏移通常被忽略,导致出现有偏的梯度。这一根本性限制限制了模型根据实时反馈信号迭代改进其行为的能力。 ## 3 反馈驱动的双目标协同强化学习 在本节中,我们介绍FBOS-RL,即反馈驱动的双目标协同强化学习框架,其整体流程如图2所示。FBOS-RL在单个策略模型πθ上执行强化学习,不依赖任何外部模型。它通过两个相互促进的训练目标显著提升了训练效率和可达到的性能上限,共同形成了一个正向自举飞轮。FBOS-RL的每个训练步骤分为三个阶段:**初始探索**阶段、**反馈引导的探索增强**阶段和**双目标协同训练**阶段,下面我们依次详细说明。 查看图标题 图2:我们的反馈驱动的双目标协同强化学习(FBOS-RL)框架概览。在采样阶段,策略首先从原始提示q生成n个初始rollout;一个基于规则的验证器为每个rollout返回自然语言反馈,然后将其与q及rollout拼接,形成用于第二轮反馈引导采样的反馈增强提示(FAP)。在优化阶段,两个互补的目标被协同优化:通过FA-GRPO实现的面向利用的策略对齐(EPA)和面向探索的能力培养(ECC),共同诱导出一个正向自举飞轮。 ### 3.1 初始探索 在**初始探索**阶段,对应于图2中最左侧的"步骤1:初始探索"模块,策略模型πθ独立并行采样n个初始rollout {ansi¹}ᵢ₌₁ⁿ ∼ πθ(·|q),仅基于原始提示q。每个rollout ansi¹(i∈[n])随后由一个基于规则的验证器进行评估,该验证器返回一个标量奖励ri¹和一个自然语言反馈Fi¹,该反馈明确指出了当前答案中的缺陷(例如,违反约束的特定推理步骤、错误的中间结果或违反要求的输出格式)。与单一的标量奖励不同,Fi¹提供了可操作、定位错误的信息,不仅告诉模型ansi¹是次优的,而且还告诉它**为什么**以及**在哪里**出错了。 ### 3.2 反馈引导的探索增强 为了提升采样阶段所采rollout的质量,使模型在参数更新时能够获得更高质量的梯度引导
相似文章
IB-RL:面向策略性对话智能体的隔离式双边强化学习
本文提出隔离双边强化学习(IB-RL),该方法让两个对话角色通过联合采样轨迹共同演化,同时各自独立优化自身奖励。该方法解决了策略性对话中强化学习的静态对手不匹配问题,并在 Vehicle TeleSales 和 Deal-or-No-Deal 基准上展现了对未见对手更强的泛化能力。
基于不一致人类反馈的可靠性感知LLM对齐
提出可靠性引导的偏好优化(RGPO)方法,通过估计标注者可靠性并基于共识动态调整训练,处理LLM对齐中的不一致人类反馈,性能优于标准RLHF方法。
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
从求解器反馈到忠实计划:基于多角色强化学习的符号规划
本文提出了一种利用求解器反馈的多角色强化学习框架,用于将自然语言转换为PDDL规范以进行符号规划,与现有方法相比,提高了成功率和忠实度。
面向进度与可靠性的智能体强化学习组策略优化
ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。