一层足够吗?单个Transformer层即可媲美全参数RL训练

Hacker News Top 论文

摘要

本文系统性地研究了LLM的RL后训练中每层的贡献,发现仅训练单个中间Transformer层即可恢复甚至超越全参数RL的性能提升,且在不同模型和任务上呈现一致模式。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/02 14:06

# 一层就够了吗?训练单个Transformer层可媲美全参数强化学习训练  
来源:https://arxiv.org/html/2607.01232  

Zijian Zhang  
明尼苏达大学  
zha00175@umn\.edu  

Rizhen Hu  
北京大学  
xshrz123@gmail\.com  

Athanasios Glentis  
明尼苏达大学  
glent007@umn\.edu  

Dawei Li  
明尼苏达大学  
li004678@umn\.edu  

Chung\-Yiu Yau  
明尼苏达大学  
cyau@umn\.edu  

Hongzhou Lin  
Amazon  
hongzhou\.lin89@gmail\.com  

Mingyi Hong  
明尼苏达大学  
mhong@umn\.edu  

###### 摘要  

强化学习(Reinforcement Learning, RL)已成为大语言模型(LLM)后训练的核心环节,但关于RL如何通过不同Transformer层进行适配的机制仍知之甚少。现有方法通常统一更新所有模型参数,隐含地假设每一层对RL后训练所获增益的贡献相似。本研究通过系统性地逐层分析RL训练,对这一假设提出了挑战。令人惊讶的是,我们发现**训练单个Transformer层**即可恢复全参数RL训练所获的大部分增益,某些情况下甚至能超越后者。为量化这一现象,我们引入了**层贡献值**,即单独训练某一层所能恢复的全RL增益占比。在七个跨越两个模型系列(Qwen3、Qwen2.5)、三种RL算法(GRPO、GiGPO、Dr. GRPO)以及多个任务领域(包括数学推理、代码生成和智能体决策)的模型中,我们观察到了一个高度稳定的模式:**RL增益高度集中于一小部分Transformer层,在很多情况下甚至集中在一个层上**。更引人注目的是,这种结构模式始终如一:高贡献层集中在Transformer堆叠的中部,而靠近输入和输出端的层贡献显著较低。由此产生的层排名在不同数据集、任务、模型系列和RL算法之间均保持强相关性。我们的发现有两个重要意义。首先,它揭示了RL后训练中一个此前未被认识的结构特性:大部分RL增益集中在少数Transformer层中,而非均匀分布于整个网络。其次,它为改进RL训练提供了新机遇。基于上述观察,我们开发了简单的**层感知训练策略**,这些策略持续优于标准全参数RL训练,而层专门化模型的集成则通过互补行为带来额外增益。综合而言,我们的结果为RL如何改变大语言模型提供了新见解,并为理解和改进RL后训练提供了新视角。  

参见图注  

图1:(a)本文研究的所有七个模型中的**层贡献值**(定义见§2.2 (https://arxiv.org/html/2607.01232#S2.SS2)),相对于深度归一化相对层位置(0 = 第0层,1 = 第L\-1层)绘制。每个数据点对应在单个Transformer层上执行RL训练而冻结其余所有层时的结果。y轴度量单层训练恢复的全参数RL增益的比例。实线表示完整逐层扫描的模型;虚线表示训练了代表性层子集的模型。尽管涵盖两个模型系列、三种RL算法和两个任务领域(数学推理与智能体任务),所有七个模型均展现出相同的结构:位于网络深度约40%–60%的层持续获得最高贡献值,部分甚至超越全参数RL训练(绿色阴影区域)。(b)三个Qwen3模型(NuminaMath\-CoT,数学基准)的性能对比。*最佳引导*表示§4 (https://arxiv.org/html/2607.01232#S4)中层贡献引导策略中的最佳结果:即提高高贡献层的学习率或仅选择训练这些层。百分比标注表示相对于全RL增益的额外增益。仅训练这些高贡献层在三种规模下均持续优于全参数RL训练。  

## 1 引言  

基于可验证奖励的强化学习(RLVR)(Guo等人,2025 (https://arxiv.org/html/2607.01232#bib.bib2);Yang等人,2025 (https://arxiv.org/html/2607.01232#bib.bib3))已成为大语言模型(LLM)后训练的核心组成部分,显著推动了数学推理、代码生成和智能体决策能力的提升(Yu等人,2025 (https://arxiv.org/html/2607.01232#bib.bib8);Shao等人,2024 (https://arxiv.org/html/2607.01232#bib.bib7))。尽管大量工作致力于开发更有效的RL目标、奖励模型和优化算法,但关于一个更基础的问题——**RL增益在网络的哪个部分产生**——我们仍然知之甚少。  

现有的RL后训练方法联合更新所有Transformer层,几乎无法揭示预训练模型的不同部分如何对RL带来的改进做出贡献。理解这种逐层结构不仅对于解释RL如何重塑预训练语言模型至关重要,而且有助于揭示RL适配是否具有某种可利用的底层结构,从而进一步改善RL后训练。  

在本研究中,我们对RL后训练进行了系统性的逐层探究。令人惊讶的是,我们发现**单个Transformer层**通常能够恢复全参数RL训练所获的大部分增益,有时甚至能超越后者。这一发现挑战了“RL改进源于整个网络的协调适配”这一直觉。相反,我们的结果表明,RL后训练的大部分收益集中在极少数Transformer层中。  

我们的研究自然联系到一个日益增长的研究方向,该方向显示预训练LLM在深度上高度不均匀。先前的研究表明,Transformer层扮演着截然不同的角色:移除某些层会导致严重退化,而其他层的影响则相对较小(Zhang等人,2024 (https://arxiv.org/html/2607.01232#bib.bib19);Song等人,2026 (https://arxiv.org/html/2607.01232#bib.bib14);Nepal等人,2025 (https://arxiv.org/html/2607.01232#bib.bib20))。在监督微调中也观察到类似的逐层异质性,其中参数更新和适配行为在不同层间存在显著差异(Pan等人,2024 (https://arxiv.org/html/2607.01232#bib.bib15);Shi等人,2025 (https://arxiv.org/html/2607.01232#bib.bib21))。这些观察催生了多种层感知优化策略,包括逐层采样(Pan等人,2024 (https://arxiv.org/html/2607.01232#bib.bib15))、自适应层选择(Liu等人,2026 (https://arxiv.org/html/2607.01232#bib.bib16);Kumar等人,2025 (https://arxiv.org/html/2607.01232#bib.bib17))和层感知对齐方法(Shi等人,2025 (https://arxiv.org/html/2607.01232#bib.bib21))。值得注意的是,被识别为重要的层在不同数据集和训练设置下往往保持高度一致性(Shi等人,2025 (https://arxiv.org/html/2607.01232#bib.bib21)),这表明预训练LLM具有稳定的逐层结构组织。然而,这些研究主要关注推理时行为和监督微调。RL后训练是否展现出类似的结构性模式,在很大程度上仍未被探索。  

为了描述这一现象,我们对RL后训练进行了系统性的逐层研究。对于一个具有\(L\)个Transformer层的LLM,我们使用RL独立训练每一层,同时冻结其余所有层,并将所得改进与标准全参数RL训练的结果进行比较。我们引入了一个简单的度量指标,称为**层贡献值**,用于衡量单独训练某一层能够恢复的全RL增益比例。这一框架使我们能够直接量化各层对RL后训练所获增益的贡献。  

我们的实验揭示了两项引人注目的发现。首先,各层的贡献值在网络中差异巨大。表现最佳的单个层能恢复高达114%的全参数RL训练增益,而最弱的层则恢复不足30%。其次,这种差异高度结构化而非随机。在七个跨越两个模型系列(Qwen3, Qwen2.5)、三种RL算法(GRPO, GiGPO, Dr. GRPO)以及三个任务领域(包括数学推理、代码生成和智能体决策)的模型中,高贡献层一致地集中在Transformer堆叠的中部,而靠近输入和输出端的层贡献显著较低。此外,对于固定模型,逐层贡献值排名本身在不同训练数据集(NuminaMath\-CoT vs. DeepScaleR,Spearman \(\rho=0.76\))甚至不同任务(NuminaMath\-CoT vs. DeepCoder,Spearman \(\rho=0.59\);见图3 (https://arxiv.org/html/2607.01232#S3.F3))之间都保持强相关性。综合起来,这些发现指向RL后训练中一个此前未被认识的结构特性:**大部分RL增益集中在少数Transformer层中**。  

这些发现有两个重要意义。首先,它们揭示了RL后训练中一个此前未被认识的结构特性。与“RL改进源于整个网络的协调适配”这一直觉相反,我们的结果表明,RL后训练的大部分收益集中在一个小而稳定的Transformer层子集中。其次,这种结构可以在算法上加以利用。在层贡献值的引导下,我们开发了简单的层感知训练策略,优先处理高贡献层,并持续优于标准全参数RL训练。例如,在Qwen3\-8B上,仅训练贡献值最高的十个层,在数学推理基准测试上平均准确率达到69.1%,而全参数RL训练为66.4%。此外,在不同层上训练的模型表现出互补的问题求解行为,通过多数投票将它们组合起来,会带来超越全参数基线的额外增益。  

总之,我们的主要贡献包括:  
- **• RL适配是集中的。** 我们展示了RL增益在Transformer层间高度不均匀分布。值得注意的是,训练单个层可以恢复全参数RL训练所获的大部分增益,有时甚至能超越后者。  
- **• 层贡献值遵循一致的结构。** 我们引入了层贡献值的概念,并建立了高贡献层一致地集中在Transformer网络中部这一规律,该规律在模型规模、模型系列、RL算法、数据集和任务领域上均成立。  
- **• 对RL后训练的启示。** 我们展示了所发现的层结构可用于改进RL后训练。简单的层感知策略(优先训练高贡献层)持续优于标准全参数训练,而即使是仅训练中间层的免配置文件启发式方法也能达到相当或更优的性能。此外,在不同层上训练的模型表现出互补行为,通过多数投票组合它们能带来超越全参数基线的额外增益。  

## 2 预备知识  

### 2.1 RLVR与GRPO  

基于可验证奖励的强化学习(RLVR)通过最大化具有客观可验证答案的任务上的期望奖励来优化语言模型策略\(\pi_\theta\)。在给定提示\(x\)的情况下,模型生成响应\(y \sim \pi_\theta(\cdot|x)\),然后由一个奖励函数\(r(x,y)\)基于答案正确性返回二元信号进行评价。在本研究中,我们采用组相对策略优化(GRPO)(Shao等人,2024 (https://arxiv.org/html/2607.01232#bib.bib7)),该方法无需学习价值网络即可估计优势。对于每个提示\(x\),GRPO从当前策略中采样一组\(G\)个响应\(\{y_1,\ldots,y_G\}\),并计算每个响应的组归一化优势值:  

\[
\hat{A}_i = \frac{r(x,y_i) - \text{mean}(\{r(x,y_j)\}_{j=1}^G)}{\text{std}(\{r(x,y_j)\}_{j=1}^G)}
\tag{1}
\]

然后通过最大化一个剪辑后的替代目标来更新策略:  

\[
\mathcal{L}_{\text{GRPO}}(\theta) = \mathbb{E}_{x,\{y_i\}}\left[\frac{1}{G}\sum_{i=1}^G \min\left(\rho_i \hat{A}_i,\; \text{clip}(\rho_i, 1-\epsilon, 1+\epsilon) \hat{A}_i\right)\right]
\tag{2}
\]

其中\(\rho_i = \pi_\theta(y_i|x) / \pi_{\theta_{\text{old}}}(y_i|x)\)是重要性采样比率。  

### 2.2 单层训练与层贡献值  

为了研究RL后训练如何与预训练LLM的不同部分交互,我们采用了一种受控的逐层训练框架,独立隔离每个层的适配行为。对于一个具有\(L\)个Transformer层\(\{\theta_0, \theta_1, \ldots, \theta_{L-1}\}\)、嵌入参数\(\theta_{\text{emb}}\)和语言模型头\(\theta_{\text{head}}\)的LLM,标准全参数GRPO通过计算整个参数集\(\theta = \{\theta_{\text{emb}}, \theta_0, \ldots, \theta_{L-1}, \theta_{\text{head}}\}\)上的梯度\(\nabla_\theta \mathcal{L}_{\text{GRPO}}(\theta)\)来联合更新所有参数。在我们的单层训练框架中,我们改为隔离单个层\(\theta_k\),并仅更新其参数:  

\[
\theta_k \leftarrow \theta_k - \alpha \nabla_{\theta_k} \mathcal{L}_{\text{GRPO}}(\theta), \quad \text{所有其他参数冻结。}
\tag{3}
\]

注意,梯度\(\nabla_{\theta_k} \mathcal{L}_{\text{GRPO}}(\theta)\)是通过整个网络反向传播计算的,因此依赖于所有层;只有**参数更新**被限制在层\(k\)上。在实践中,这可以通过在PyTorch中将除目标层\(\theta_k\)之外的所有参数的`requires_grad`设置为`False`来实现。该过程对每个层\(k \in \{0,\ldots,L-1\}\)独立重复,从而隔离每个层吸收RL诱导改进的能力。然后,每个得到的模型在同一组领域内基准上进行评估,以获得性能分数。  

为了量化每个层捕获RL诱导改进的能力,我们定义了**层贡献值**。设\(S_k\)表示在层\(k\)上训练的模型的领域内性能,即领域内基准的平均分数。设\(S_{\text{base}}\)表示原始预训练模型(未经过任何RL训练)的性能,\(S_{\text{full}}\)表示标准全参数GRPO训练后模型的性能。层\(k\)的贡献值为:  

\[
\mathcal{C}(k) = \frac{S_k - S_{\text{base}}}{S_{\text{full}} - S_{\text{base}}}.
\tag{4}
\]

层贡献值为1.0表示单层训练完全匹配全参数训练的增益;值超过1.0表示单层训练超越全参数训练。

相似文章

Dominant-Layer ZO:单一层主导LLMs的零阶微调

arXiv cs.LG

本文揭示了LLM的零阶微调主要由单个解码层主导,该层可通过激活异常值识别,并且仅微调该层即可达到或超越全模型微调的效果,同时带来高达4.52倍的加速。

预训练期间的RL探索:重新审视LLM训练的策略优化

arXiv cs.LG

哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。