PIRL:从开环探索到闭环强化学习 [R]

Reddit r/MachineLearning 论文

摘要

介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。

TL;DR:大多数强化学习后训练算法优化当前批次后便继续前进。但一次更新后,新策略真的变得更好吗?我们引入了策略改进强化学习(PIRL)及其实际实现——策略改进策略优化(PIPO),这是一个即插即用的框架,让强化学习训练能够回顾过去,验证之前的更新,并相应地强化或纠正它。 为什么当前的强化学习后训练常常是“开环”的?诸如 PPO、GRPO、GSPO、DAPO、在策略蒸馏和自我蒸馏等方法在学习信号的构建方式上有所不同。但它们大多遵循相同的模式:从当前策略中采样一个批次。计算奖励、优势或蒸馏目标。更新策略。进入下一个批次。更新可能会改善局部目标,但这并不一定意味着得到的策略实际上更好。有限的采样、生成的随机性、噪声反馈以及不完美的局部信用分配都可能将策略推向无益的方向。如果没有显式检查更新的结果,训练可能会漂移、变得不稳定甚至崩溃。这就是我们所说的开环强化学习优化。 PIRL:将策略改进本身作为目标 PIRL 引入了一个缺失的反馈信号:连续策略之间的实测性能增益。传统方法只问局部目标是否改进,而 PIRL 还问策略性能是否真的提升。累积的策略改进目标与最终任务性能保持一致,提供了强化学习后训练的闭环视角。 PIPO:两阶段闭环更新 PIPO 将这一想法转化为一个实用的、即插即用的算法。阶段 1 — 探索 基础算法正常运行。无论是 PPO、GRPO、DAPO 还是自蒸馏目标,它都使用其原始的局部归因信号来更新策略。模型沿着基础算法当前认为有用的方向进行探索性步骤——但该方向不一定正确。阶段 2 — 回溯验证 在下一次迭代中,PIPO 评估更新后的策略,并将其性能与滑动窗口历史锚点进行比较。这产生了一个策略改进反馈信号:如果性能提升,PIPO 会强化并巩固之前的更新。如果性能下降,PIPO 会抑制或纠正相应的学习方向。重要的是,PIPO 不会取代基础算法的局部信用分配。它增加了第二层反馈,用于验证前一次更新的实证效果。用一句话概括:如果有帮助,就强化它;如果有害,就纠正它。 实验结果 在数学推理、代码生成、工具使用和自我蒸馏方面,当添加到 PPO、群体相对优化方法和自蒸馏目标时,PIPO 带来了一致的增益。实验还表明,训练稳定性在不同随机种子下得到改善,整体挂钟效率更高,在可比或适度增加的训练时间内,PIPO 达到了更高的准确率。PIPO 被设计为一个通用的闭环层,而不是现有强化学习后训练算法的替代品。我们很想知道强化学习社区的想法——特别是关于回溯验证以及策略改进是否应成为一类训练信号。 📄 论文:Policy Improvement Reinforcement Learning 💻 代码:github.com/JacckMa/pipo_verl
查看原文

相似文章

近端策略优化

OpenAI Blog

# 近端策略优化 来源: [https://openai.com/index/openai-baselines-ppo/](https://openai.com/index/openai-baselines-ppo/) OpenAI 我们推出了一类新的强化学习算法——近端策略优化(PPO),其性能与最先进的方法相当或更优,同时实现和调优都要简单得多。由于易用性和良好的性能,PPO 已成为 OpenAI 的默认强化学习算法。[策略梯度

AIPO:通过与主动交互学习推理

arXiv cs.CL

本文介绍了 AIPO,一种强化学习框架,通过允许模型在探索过程中主动咨询协作智能体,从而克服能力边界,提升大语言模型的推理能力。

基于关键感知自反馈重试的智能体强化学习

arXiv cs.AI

PivoARL是一个自反馈重试框架,它识别LLM智能体轨迹中的关键错误回合,实现局部重试以降低交互成本并提高学习效率。在多个智能体和问答基准测试上,该方法显著优于基线方法。