ExpRL:面向LLM中期训练的探索式强化学习
摘要
ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。
查看缓存全文
缓存时间: 2026/06/16 15:32
论文页面 - ExpRL:面向LLM中期训练的探索性强化学习
来源:https://huggingface.co/papers/2606.17024 ExpRL:面向LLM中期训练的探索性强化学习
如果参考解能够在完全不展示给策略的情况下为模型进行强化学习提供初步引导,会怎样?
我们提出ExpRL,一种基于强化学习的中期训练方法,它利用人类编写的参考解作为密集奖励脚手架,而非模仿目标。参考解对策略保持隐藏——一个LLM评判器根据参考解对模型自身的在线推理进行评分,奖励部分进展和有用的中间步骤,而这些是稀疏的最终答案奖励从不加权的。关键在于一个简单的非对称性:模型根据参考解验证进展的能力,远强于从零生成完整解的能力。
两种变体:ExpRL-Outcome(对完整轨迹给予密集奖励)和ExpRL-Process(对前缀给予密集奖励以实现更精细的信用分配)。两者都在稀疏奖励强化学习开始之前,就扩展了模型在解决策略(pass@k)上的覆盖范围。
在困难数学推理任务上(4B Qwen3-Instruct策略),ExpRL作为强化学习预热超越了SFT、稀疏GRPO和自蒸馏,并为下游强化学习提供了更强的初始化——ExpRL-Process在AIME-2026上达到约63%,而最强基线为58.75%。它还增加了验证、自我修正和回溯能力,并扩展到混合领域(数学/科学/编程)以及小型4B评判器预热大型8B策略。
欢迎讨论——期待您的反馈!
相似文章
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。
预训练期间的RL探索:重新审视LLM训练的策略优化
哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。
重新思考大语言模型推理中的强化学习:关键在于稀疏策略选择,而非能力学习
本文挑战了强化学习(RL)能为大语言模型(LLM)教授新推理能力的假设,论证其作用实则是在高熵决策点进行稀疏策略选择。本文提出了 ReasonMaxxer,这是一种无需强化学习的方法,以显著更低的训练成本实现了与完整强化学习相当的性能。
LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR
本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。
从受训者到训练者:LLM为多智能体推理强化学习设计的训练环境
本文介绍了LLM-as-Environment-Engineer框架,该框架使LLM能够为多智能体推理任务中的强化学习设计自己的训练环境,实现自我改进训练,其性能超越更大的专有模型。