单层就够了吗?训练单个Transformer层可媲美全参数强化学习训练

Hugging Face Daily Papers 论文

摘要

一项研究发现,Transformer中的强化学习收益集中在单个中间层,仅训练该层即可在多个模型和任务上匹配或超越全参数强化学习训练。

强化学习(RL)已成为大型语言模型(LLM)后训练的核心组成部分,但关于RL适应如何分布在各Transformer层之间,我们知之甚少。现有方法通常统一更新所有模型参数,隐含地假设每一层对RL后训练获得的收益贡献相似。在这项工作中,我们通过对RL训练进行系统的逐层研究来挑战这一假设。令人惊讶的是,我们发现训练单个Transformer层可以恢复全参数RL训练所获得的大部分收益,在某些情况下甚至能超越。为了量化这一现象,我们引入了“层贡献”这一指标,它衡量单独训练一个层所能恢复的全参数RL改进的比例。在涵盖两个模型家族(Qwen3, Qwen2.5)、三种RL算法(GRPO, GiGPO, Dr. GRPO)以及包含数学推理、代码生成和智能体决策在内的多个任务领域的七个模型中,我们观察到了一个非常稳定的模式:RL收益高度集中在一小部分,甚至在许多情况下是单个Transformer层中。更引人注目的是,同样的结构模式始终如一地出现:高贡献层集中在Transformer堆栈的中部,而靠近输入和输出端的层贡献显著较少。由此得到的层排名在不同数据集、任务、模型家族和RL算法之间保持高度相关。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:52

论文页面 - 一层就够了吗?训练单个Transformer层可匹敌全参数强化学习训练

来源:https://huggingface.co/papers/2607.01232

摘要

Transformer模型中的强化学习适应显示出高度集中在中层的改进,而非所有层的均匀参数更新。

强化学习(https://huggingface.co/papers?q=Reinforcement%20learning)已成为大型语言模型(LLM)后训练的核心组件,但关于RL适应如何分布在Transformer层(https://huggingface.co/papers?q=transformer%20layers)中的理解仍然很少。现有方法通常均匀更新所有模型参数,隐含假设每一层对RL后训练获得的增益贡献相似。在这项工作中,我们通过系统性的逐层RL训练研究挑战了这一假设。令人惊讶的是,我们发现训练单个Transformer层可以恢复全参数RL训练(https://huggingface.co/papers?q=full-parameter%20RL%20training)所取得的大部分增益,在某些情况下甚至超越它。为了量化这一现象,我们引入了层贡献(https://huggingface.co/papers?q=layer%20contribution)这一指标,用于衡量单独训练某一层所恢复的完整RL改进的比例。在涵盖两个模型家族(Qwen3、Qwen2.5)、三种RL算法(GRPO(https://huggingface.co/papers?q=GRPO)、GiGPO(https://huggingface.co/papers?q=GiGPO)、Dr. GRPO(https://huggingface.co/papers?q=Dr.%20GRPO))以及包括数学推理(https://huggingface.co/papers?q=mathematical%20reasoning)、代码生成(https://huggingface.co/papers?q=code%20generation)和智能体决策(https://huggingface.co/papers?q=agentic%20decision-making)等多个任务领域的七个模型上,我们观察到一种极其稳定的模式:RL增益高度集中在一小部分(甚至在许多情况下仅单个)Transformer层(https://huggingface.co/papers?q=transformer%20layers)中。更显著的是,相同的结构模式持续出现:高贡献层集中在Transformer堆叠的中部,而靠近输入和输出端的层贡献显著较小。由此产生的层排序在不同数据集、任务、模型家族和RL算法之间保持强相关性。

查看arXiv页面(https://arxiv.org/abs/2607.01232)查看PDF(https://arxiv.org/pdf/2607.01232)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.01232)

在你的Agent中获取此论文:

hf papers read 2607\.01232

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2607.01232可从本页链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2607.01232可从本页链接。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2607.01232可从本页链接。

收录此论文的收藏集0

没有收藏集收录此论文

添加此论文到收藏集(https://huggingface.co/new-collection)以从本页链接。

相似文章

基于强化学习的智能体Transformer可证明地学会搜索

arXiv cs.LG

本文从理论上研究了基于Transformer的策略如何从随机树环境中的强化学习训练动态中获得搜索能力。研究表明,一个双头Transformer可以实现深度优先搜索,并且在深度分阶段课程下,这种机制会自然地从稀疏奖励信号中涌现。