单层就够了吗?训练单个Transformer层可媲美全参数强化学习训练
摘要
一项研究发现,Transformer中的强化学习收益集中在单个中间层,仅训练该层即可在多个模型和任务上匹配或超越全参数强化学习训练。
查看缓存全文
缓存时间: 2026/07/09 07:52
论文页面 - 一层就够了吗?训练单个Transformer层可匹敌全参数强化学习训练
来源:https://huggingface.co/papers/2607.01232
摘要
Transformer模型中的强化学习适应显示出高度集中在中层的改进,而非所有层的均匀参数更新。
强化学习(https://huggingface.co/papers?q=Reinforcement%20learning)已成为大型语言模型(LLM)后训练的核心组件,但关于RL适应如何分布在Transformer层(https://huggingface.co/papers?q=transformer%20layers)中的理解仍然很少。现有方法通常均匀更新所有模型参数,隐含假设每一层对RL后训练获得的增益贡献相似。在这项工作中,我们通过系统性的逐层RL训练研究挑战了这一假设。令人惊讶的是,我们发现训练单个Transformer层可以恢复全参数RL训练(https://huggingface.co/papers?q=full-parameter%20RL%20training)所取得的大部分增益,在某些情况下甚至超越它。为了量化这一现象,我们引入了层贡献(https://huggingface.co/papers?q=layer%20contribution)这一指标,用于衡量单独训练某一层所恢复的完整RL改进的比例。在涵盖两个模型家族(Qwen3、Qwen2.5)、三种RL算法(GRPO(https://huggingface.co/papers?q=GRPO)、GiGPO(https://huggingface.co/papers?q=GiGPO)、Dr. GRPO(https://huggingface.co/papers?q=Dr.%20GRPO))以及包括数学推理(https://huggingface.co/papers?q=mathematical%20reasoning)、代码生成(https://huggingface.co/papers?q=code%20generation)和智能体决策(https://huggingface.co/papers?q=agentic%20decision-making)等多个任务领域的七个模型上,我们观察到一种极其稳定的模式:RL增益高度集中在一小部分(甚至在许多情况下仅单个)Transformer层(https://huggingface.co/papers?q=transformer%20layers)中。更显著的是,相同的结构模式持续出现:高贡献层集中在Transformer堆叠的中部,而靠近输入和输出端的层贡献显著较小。由此产生的层排序在不同数据集、任务、模型家族和RL算法之间保持强相关性。
查看arXiv页面(https://arxiv.org/abs/2607.01232)查看PDF(https://arxiv.org/pdf/2607.01232)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.01232)
在你的Agent中获取此论文:
hf papers read 2607\.01232
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.01232可从本页链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2607.01232可从本页链接。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.01232可从本页链接。
收录此论文的收藏集0
没有收藏集收录此论文
添加此论文到收藏集(https://huggingface.co/new-collection)以从本页链接。
相似文章
一层足够吗?单个Transformer层即可媲美全参数RL训练
本文系统性地研究了LLM的RL后训练中每层的贡献,发现仅训练单个中间Transformer层即可恢复甚至超越全参数RL的性能提升,且在不同模型和任务上呈现一致模式。
训练Transformer:初始化时每层权重W = V·Uᵀ,揭示语料库确定的最优秩 — 寻找arXiv背书人 (cs.LG) [D]
本文为Transformer提出原生因子化权重(Native Factorized Weights),即每个线性层从初始化开始就训练为两个低秩矩阵的乘积。实验表明,存在一个由语料库决定的最优秩,可最小化验证损失,并形成一个泛化区间,以更少的参数超越密集基线模型。
@a1zhang: Transformer难以泛化到未明确训练过的任务。相反,我们在2026年提出,它…
文章提出,通过精心设计的harness来诱导组合,Transformer可以泛化到新任务,而无需模型本身具备泛化能力。研究表明,RLMs可以从短任务泛化到8-32倍长的任务,并且跨领域泛化。
@lateinteraction: “训练框架”开始与神经架构模糊,在谁承载实现泛化的归纳偏差方面…
研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。
基于强化学习的智能体Transformer可证明地学会搜索
本文从理论上研究了基于Transformer的策略如何从随机树环境中的强化学习训练动态中获得搜索能力。研究表明,一个双头Transformer可以实现深度优先搜索,并且在深度分阶段课程下,这种机制会自然地从稀疏奖励信号中涌现。