解密语言模型的强化学习后训练
摘要
本文剖析了大型语言模型的强化学习后训练算法,探讨了基础模型分布、奖励信号粒度和提示多样性如何影响后训练结果。
arXiv:2608.24949v1 公告类型: 新
摘要: 强化学习(RL)后训练已成为提升大型语言模型(LLMs)能力的强大框架,实现了令人印象深刻的推理、数学和编码能力。然而,对许多研究人员和从业者来说,经典强化学习的原则仍然是一个'黑匣子'。在这项工作中,我们解构了RL后训练算法,逐步调查每一步,以澄清表面之下实际发生的事情。通过在一个受控且简化的环境中隔离可验证奖励(Verifiable Rewards)的RL机制,我们研究了RL结果如何受到基础模型先验分布、奖励信号粒度、提示分布多样性和模型规模的影响。我们使用策略输出分布的熵作为透镜,比较通过预训练、SFT和RL后训练学习到的分布,揭示每个阶段如何塑造模型确定性。我们的研究阐明了这些选择如何相互作用影响后训练成功。例如,我们展示了所谓的'虚假奖励'的效果取决于用于后训练的提示分布。我们还提供了为什么RL后训练的成功取决于基础模型是否已经将足够的概率质量置于期望行为之上的见解,将其与RL中的经典探索概念联系起来。最终,我们提供这本入门手册作为资源,供NLP社区中希望将RL作为工具箱中工具的人使用。
查看缓存全文
缓存时间: 2026/08/27 09:28
# 解密语言模型强化学习后训练
来源:https://arxiv.org/html/2608.24949
Saket Gollapudi
隶属机构:华盛顿大学
Sankar Harilal
隶属机构:华盛顿大学
Min Jang
隶属机构:华盛顿大学
Jacob Morrison
隶属机构:华盛顿大学
隶属机构:艾伦人工智能研究所
Sewoong Oh
隶属机构:华盛顿大学
Natasha Jaques
\*贡献均等
隶属机构:华盛顿大学
###### 摘要
强化学习后训练已成为增强大型语言模型能力的强大框架,实现了令人瞩目的推理、数学和编程能力。然而,对许多研究人员和实践者而言,经典强化学习的原理仍是一个"黑箱"。本文解构了强化学习后训练算法,深入调查每个步骤以阐明其表面之下的实际运作。通过在受控简化环境中隔离具有可验证奖励的强化学习机制,我们研究了强化学习结果如何受到基础模型先验分布、奖励信号粒度、提示分布多样性及模型规模的影响。我们使用策略输出分布的熵作为视角,比较通过预训练、监督微调和强化学习后训练学习到的分布,揭示每个阶段如何塑造模型的确定性。我们的研究阐明了这些选择如何相互作用并影响后训练效果。例如,我们展示了所谓的"虚假奖励"效应取决于后训练所用的提示分布。同时,我们深入分析了强化学习后训练的成功为何取决于基础模型是否已对期望行为赋予足够概率质量,并将其与强化学习中经典的探索概念联系起来。最终,我们提供这份入门指南作为资源,供希望将强化学习纳入其工具箱的NLP社区同仁使用。
††网站:https://minjang10.github.io/demystifying-rl-finetuning-web/
代码:https://github.com/sankarh-1/demystifying-rl-finetuning
## 1 引言
强化学习已迅速成为大型语言模型后训练的主导框架,对于使模型与人类意图对齐、增强推理能力及确保安全性至关重要。然而,其快速普及,加上理解大型语言模型强化学习后训练需要同时精通经典强化学习和自然语言处理,导致文献中对其机制和能力存在若干误解。本文旨在深入剖析强化学习后训练的运作机制。
图1展示了后训练算法的概况。总体而言,这是一个迭代过程,使用可能不可微的奖励信号来塑造语言模型的输出分布。给定提示时,从模型采样响应,根据其质量分配标量奖励,并调整模型参数以鼓励更高奖励的响应。我们的目标是通过精心控制的实验研究该算法的每个组件,展示如何操纵基础模型分布、提示分布和奖励函数均会影响后训练模型达成特定目标的成功率。
*参见标题*
图1:强化学习后训练流程概述。
我们的实验隔离了基础分布、提示分布和奖励函数的特定影响。我们排除了算法变体范围,参考大量现有强化学习算法选择及提升性能的工程技术(参见等)。
对于已经精通强化学习的研究者而言,我们得出的部分结论可能看似显而易见。然而,我们指出大型语言模型强化学习后训练的若干方面使其区别于经典强化学习,需要特别关注。首先,强化学习后训练无需从头探索以发现高奖励行为,而是利用强大的先验知识。所学习的策略以基础语言模型初始化,并被约束以保持接近该基础参考策略,从而防止语言漂移。如我们将展示的,基础模型分布对后训练结果产生强烈影响。其次,后训练尝试修改词元级概率,通常使用话语或回合级奖励。优化多轮对话中的行为可能涉及超过10,000个动作的序列,而过去经典强化学习中备受瞩目的成功案例仅限于250-3,000个动作。因此,后训练代表了前所未有的规模下的强化学习应用,有时由于底层语言模型的复杂性而表现出令人惊讶且非直观的结果。
由于KL约束,大型语言模型后训练可理解为在预训练分布内重新分配概率质量。为分析这些分布偏移,我们跟踪训练过程中策略的熵,以及分配给某些感兴趣行为的概率质量,这使我们能够直接比较预训练、监督微调和直接偏好优化如何塑造模型输出分布,以及每个阶段对干扰的抵抗能力。虽然先前工作已研究了强化学习如何通过对基础模型行为重新分配概率质量来学习,但我们的目标是通过实验操纵基础模型分布来研究其发生的原因和时机。
为证明这些现象,我们使用受控序列生成设置,其中可以精确测量概率偏移和任务成功率,利用简单的强化学习可验证任务(生成目标字符串和解决数学问题)系统性地改变基础模型的预训练分布。使用监督微调,我们增加基础模型中目标字符串的概率,同时否定该过程以破坏基础模型中的这一知识。针对不同规模的模型,我们分析了这些干预措施如何在不同奖励信号(包括稀疏、密集和随机奖励)和不同提示分布(包括窄推理数据集和用于Tulu-3的广泛预训练分布)下影响后训练。尽管经过简化,该设置能够对基础模型分布等因素如何影响结果进行精确分析,这在全规模大型语言模型后训练中是不可能实现的。
综合来看,这些结果为强化学习后训练背后的机制提供了更清晰的图景。我们希望本文能作为有用入门指南,供希望获得更多专业知识或深化理解如何开发更有效后训练流程的读者参考。
## 2 相关工作
强化学习后训练在对齐和推理方面已被证明非常有效。然而,近期工作揭示了看似矛盾的发现和误解,我们的实验旨在澄清这些问题。例如,Shao等人展示了令人惊讶的结果:对于某些基础模型族,使用虚假(随机或错误)奖励的强化学习仍能在数学基准测试上产生性能提升。这导致一些人怀疑许多后训练成功可归因于这种"虚假"现象。相反,我们的框架表明该效应受提示分布控制:将训练限制在窄提示分布可提高该领域内的性能(如果模型已对正确答案赋予高概率),而使用随机奖励训练宽泛提示分布会增加策略熵并降低能力。
同时,关于强化学习是否能够训练模型学习新行为,或者仅增强基础模型中已存在正确行为的问题被提出。优秀工作表明,如直接偏好优化等在固定数据集上操作的离线方法倾向于将概率质量集中在基础模型中已具有高似然的响应上。但对于探索生成新数据的在线强化学习是否如此?虽然先前工作已研究了强化学习如何通过对基础模型行为重新分配概率质量来学习,但我们的目标是通过实验操纵基础模型分布来研究其发生的原因和时机。我们发现,毫不奇怪,基础模型中采样给定响应的概率强烈影响通过后训练学习该响应的难易程度,因为基础模型分布影响后训练期间采样哪些响应,从而影响强化学习所需的探索质量。换言之,初始概率可忽略不计的行为难以发现和强化,这一观点与"覆盖原则"等理论框架一致。然而,我们表明该限制严格限于稀疏奖励设置。使用足够密集且正确的奖励函数,强化学习后训练可以成功教授模型基础模型中支持可忽略不计的新行为。虽然这一结果在经典强化学习中广为人知,但在近期后训练文献中受到严重质疑。通过系统性地改变这些组成部分,我们的工作调和了这些看似矛盾的发现。完整文献综述见附录B。
## 3 背景:语言模型的强化学习
我们将文本生成过程建模为有限时域马尔可夫决策过程,定义为元组。其中,是可能状态集,是可能动作集,是奖励函数,是有限规划时域深度。转移函数定义为给定动作和状态时到达状态的概率。请注意,对于在人类用户交互对话中部署的大型语言模型,取决于人类的策略和响应。因此,为实现精确分析,我们关注强化学习可验证奖励设置,其中我们试图学习自回归语言模型策略,并映射定义如下:
- •状态:长度不超过的所有可能词元序列(提示加上已生成的词元)。
- •动作:模型词表(所有可能的下一个词元)。
- •转移:确定性步骤,将下一个词元附加到当前上下文,即(其中是连接运算符)。
- •时域:模型最大词元生成限制。
- •奖励函数:应用于生成序列的确定性验证器(例如,数学的二元正确性)。
虽然该公式与经典强化学习视角下的顺序决策一致,但文本生成结构诱导了一个显著简化且确定性的系统,在序列级而非中间步骤分配可验证奖励。从强化学习角度看,这对应于上下文老虎机的简化设置;从自然语言处理视角看,该问题通常被视为学习完整序列上的概率分布,其中强化学习后训练有效重塑该分布以响应奖励信号。
**过程奖励模型**:评估中间推理步骤并为逻辑里程碑奖励部分分数,实现步骤级信用分配。如我们将展示的,这能够迭代重塑模型输出分布,以探索基础模型中低概率的行为,从而在稀疏奖励设置中不会被探索或学习。
**策略学习**:在后训练期间,语言模型充当随机策略,由权重参数化。给定从数据集提取的提示,模型生成词元序列。目标是最大化期望奖励,同时保持接近参考策略以防止奖励攻击和语言流畅性下降。形式化地,目标为:
$$U(\pi_\theta)=\mathbb{E}_{x\sim\mathcal{D},y\sim\pi_\theta}\left[\frac{1}{c}r(x,y)-D_{\rm KL}(\pi_\theta\|\pi_{\rm ref})\right]$$
其中是提示数据集,表示KL散度,是缩放常数,和是基于提示的条件策略。
## 4 强化学习后训练机制
强化学习后训练算法依赖于三个组件:基础模型、奖励函数和精选提示数据集。为系统性地研究每个元素如何影响学习动态,我们在受控自然语言处理沙盒中进行两个针对性实验阶段。
第一阶段通过训练模型可靠地...相似文章
超越 GRPO 与策略内蒸馏:语言模型后训练的经验性“稀疏至稠密”奖励原则
本文提出了一种用于语言模型后训练的经验性“稀疏至稠密”奖励原则,主张应使用稀疏奖励配合稀缺的标注数据进行教师模型发现,并使用稠密奖励通过蒸馏进行学生模型压缩。作者证明,这种连接稀疏强化学习与策略内蒸馏的分阶段方法,在数学基准测试中优于在部署规模模型上直接运行 GRPO 的效果。
在中间训练阶段使用自生成数据可提升语言模型中强化学习的性能
本文探讨了在大型语言模型的中间训练阶段使用多样化的自生成数据如何提高强化学习的有效性,尤其是在推理任务方面。
面向小规模语言模型智能体的稳健强化学习
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。
面向小规模语言模型智能体的鲁棒强化学习
本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。
从预训练到后训练的推理理解
本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。