ExpRL:面向LLM中期训练的探索式强化学习

Hugging Face Daily Papers 论文

摘要

ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。

稀疏奖励强化学习(RL)已成为提升LLM推理能力的标准工具,但其成功在很大程度上取决于基础模型中的覆盖范围。在实践中,模型通常通过针对精选推理轨迹的中期训练来为RL做好准备,这些轨迹教会了有用的基本技能,如分解、验证或自我纠正。尽管有效,但该策略需要手动指定模型应学习的内容,并且尚不清楚这种基本覆盖是否足以应对更困难的问题,这些问题需要将这些技能组合成更广泛的解决方案策略。我们研究了一种更自动化的方法:使用大量人工编写的问答数据集进行基于RL的中期训练。我们的方法ExpRL不将参考答案视为模仿目标,而是将其用作奖励支架:参考答案对策略隐藏,仅用于构建针对特定问题的评分标准,以判断策略上的推理轨迹。策略从原始问题提示中采样,而LLM评判员将采样的推理轨迹与参考答案进行比较,并分配结果级或过程级的密集奖励。这使得ExpRL能够强化部分进展、有用的中间简化以及有用的推理行为,而这些是稀疏的最终答案奖励通常无法提升的。在具有挑战性的数学推理任务上,ExpRL比SFT、稀疏奖励GRPO和自蒸馏产生了更强的RL启动效果,并为后续的稀疏奖励RL提供了更好的初始化。额外的混合领域实验进一步表明,ExpRL可以扩展到最初的纯数学设置之外。
查看原文
查看缓存全文

缓存时间: 2026/06/16 15:32

论文页面 - ExpRL:面向LLM中期训练的探索性强化学习

来源:https://huggingface.co/papers/2606.17024 ExpRL:面向LLM中期训练的探索性强化学习

如果参考解能够在完全不展示给策略的情况下为模型进行强化学习提供初步引导,会怎样?

我们提出ExpRL,一种基于强化学习的中期训练方法,它利用人类编写的参考解作为密集奖励脚手架,而非模仿目标。参考解对策略保持隐藏——一个LLM评判器根据参考解对模型自身的在线推理进行评分,奖励部分进展和有用的中间步骤,而这些是稀疏的最终答案奖励从不加权的。关键在于一个简单的非对称性:模型根据参考解验证进展的能力,远强于从零生成完整解的能力。

两种变体:ExpRL-Outcome(对完整轨迹给予密集奖励)和ExpRL-Process(对前缀给予密集奖励以实现更精细的信用分配)。两者都在稀疏奖励强化学习开始之前,就扩展了模型在解决策略(pass@k)上的覆盖范围。

在困难数学推理任务上(4B Qwen3-Instruct策略),ExpRL作为强化学习预热超越了SFT、稀疏GRPO和自蒸馏,并为下游强化学习提供了更强的初始化——ExpRL-Process在AIME-2026上达到约63%,而最强基线为58.75%。它还增加了验证、自我修正和回溯能力,并扩展到混合领域(数学/科学/编程)以及小型4B评判器预热大型8B策略。

欢迎讨论——期待您的反馈!

相似文章

预训练期间的RL探索:重新审视LLM训练的策略优化

arXiv cs.LG

哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。