小规模语言与视觉语言模型网络代理中GRPO的学习率门控失败:受控零结果及其机制
摘要
本文研究了GRPO后训练是否能提升小规模(4B-8B)语言与视觉语言模型网络代理的性能。结果发现了一个受控的零结果:没有任何配置能在已掌握任务上带来可信的提升,且中高学习率会导致性能退化或崩溃,揭示了退化与崩溃状态之间的双重分离。
arXiv:2607.12640v1 公告类型:新发布
摘要:基于可验证奖励的强化学习,特别是组相对策略优化(GRPO),现在通常会在有监督检查点上运行,以期产生更强的智能体。我们探究了它是否能提升小规模(4B至8B)语言与视觉语言模型网络代理的技能,或者它主要只是重塑了监督模型已有的行为。在一个包含18次运行的对照网格中,我们变化了学习率、KL权重、随机种子、初始化和裁剪设置,结果没有任何配置能在代理已基本掌握的任务上可信地提升强监督基线的成功率。在文本轨道上,中高学习率使其可信地变差。该零结果在配对测试、25个评估种子、6个训练种子、配方变化、文本和Set-of-Marks截图观察以及将主干扩展到8B的情况下均成立;可信的损害是文本轨道的发现,在Set-of-Marks下仅为名义上的。为了证明零结果反映了设置而非管道故障,我们在奖励可通过采样达到的任务上运行了相同的框架、奖励和配方,结果成功率提升了22个百分点,且配对区间排除零。因此,GRPO只在有提升空间时才有帮助,即采样策略已经比贪心策略更成功。然后我们解释了失败原因。中等学习率导致代理退化,高学习率导致崩溃,这两种状态形成双重分离:嫁接技术将退化状态定位到注意力层和MLP块,而崩溃状态无法追溯到任何单一组,且主导权重移动的嵌入变化在因果上是惰性的。在4B规模下,后期层的有效秩在两个方向上追踪能力;在8B规模下两者分离。这种耦合是小型模型特有的,因此我们报告其为规模依赖的。
查看缓存全文
缓存时间: 2026/07/15 04:20
# 学习率门控的GRPO在小规模语言与视觉语言模型Web智能体中的失败:一个受控零结果及其机制 来源:https://arxiv.org/html/2607.12640 陈冠全¹,蔡志熙²,梁云浩³,魏汉君³,倪世文⁴,张庆浩⁵ ¹独立研究者 ²莫纳什大学 ³中国科学院大学 ⁴深圳先进技术大学 ⁵釜山国立大学 通讯作者:[email protected] (https://arxiv.org/html/2607.12640v1/mailto:[email protected]) ###### 摘要 基于可验证奖励的强化学习,尤其是群体相对策略优化(GRPO),现在通常会在监督检查点上运行,以期获得更强的智能体。我们探究这是否能给一个4B到8B量级的小型语言与视觉语言模型Web智能体带来技能提升,还是主要重塑了监督模型已有的行为。通过一个包含18次运行的受控网格(变化学习率、KL权重、随机种子、初始化和剪裁),没有一种配置能在智能体已基本掌握的任务上可信地提高强监督基线的成功率。在文本轨道上,中等至高的学习率会使其可信地变差。在配对检验、25个评估种子、6个训练种子、配方变更、文本和Set-of-Marks截图观察,以及将骨干扩展到8B的情况下,零结果依然成立;可信的损害是文本轨道的发现,在Set-of-Marks下仅为名义上的。为了证明零结果反映了设置而非管道故障,我们在奖励可通过采样达到的任务上运行相同的框架、奖励和配方,结果成功率提高了22个点,且配对区间排除了零。因此,GRPO仅在存在上升空间时才有效,这意味着采样策略的成功率已经高于贪婪策略。然后我们解释这种失败的原因。中等学习率会使智能体退化,高学习率则会使其崩溃,这两个区域形成双重分离:通过权重嫁接,退化区域定位到注意力层和MLP块,而崩溃区域无法追溯到任何单个组,且主导权重变化的嵌入变化在因果上是惰性的。在4B规模下,晚期层的有效秩在两个方向上跟踪能力;而在8B规模下,两者分离。这种耦合特属于较小模型,因此我们将其报告为依赖于规模的。 # 学习率门控的GRPO在小规模语言与视觉语言模型Web智能体中的失败:一个受控零结果及其机制 陈冠全¹,蔡志熙²,梁云浩³,魏汉君³,倪世文⁴,张庆浩⁵ ¹独立研究者 ²莫纳什大学 ³中国科学院大学 ⁴深圳先进技术大学 ⁵釜山国立大学 通讯作者:[email protected] (https://arxiv.org/html/2607.12640v1/mailto:[email protected]) ## 1 引言 请参见图注图1:问题和答案一览。GRPO在智能体已掌握的任务上没有带来可信的增益,但同样的配方在奖励可通过采样达到的任务上获得了22个点的提升。 使用强化学习进行后训练已成为语言和多模态智能体的常规做法。首先训练监督模型遵循任务格式,然后针对可验证奖励运行GRPO或其近亲(Shao等人,2024 (https://arxiv.org/html/2607.12640#bib.bib1);Yu等人,2026 (https://arxiv.org/html/2607.12640#bib.bib2);Liu等人,2025 (https://arxiv.org/html/2607.12640#bib.bib3)),希望将能力推至监督训练单独所能达到的水平之上。对于Web智能体,其吸引力是直接的,因为轨迹可以廉价地根据任务成功性进行评分,而提升数学和编码模型的配方预计也能提升点击、打字和导航的智能体(Qi等人,2025 (https://arxiv.org/html/2607.12640#bib.bib6))。然而,仍不清楚的是,这第二阶段是否为小型语言与视觉语言模型智能体增添了新技能,还是主要锐化了监督模型已经能够做出的选择(Chen等人,2026 (https://arxiv.org/html/2607.12640#bib.bib13))。这在实际中很重要。如果强化学习增加了能力,那么更多投资是合理的;如果它仅锐化了监督模型已有的行为,那么精力应放在更好的监督或蒸馏上。 我们在严格控制下研究这样一个智能体:一个驱动Web智能体的4B语言与视觉语言模型(Bai等人,2025 (https://arxiv.org/html/2607.12640#bib.bib10)),在MiniWoB基准测试(Shi等人,2017 (https://arxiv.org/html/2607.12640#bib.bib7);Liu等人,2018 (https://arxiv.org/html/2607.12640#bib.bib8))上运行。保持框架、奖励和任务集固定,我们扫描了实践者会调整的强化学习选择,并用干净的贪婪解码和配对检验对每个运行进行评分。结果为零。在18次运行的网格配置中,没有一种能在智能体已基本掌握的任务上可信地超越监督,一旦学习率离开一个狭窄的低带,智能体就会变差。这一零结果也是稳健的。它经受了增加评估和训练种子、增加网格遗漏的计划和组大小选择、从文本观测切换到Set-of-Marks截图,以及将骨干扩展到8B的考验。图1 (https://arxiv.org/html/2607.12640#S1.F1) 预览了本研究及其结果。 对零结果的一种解读是管道已损坏或动力不足,无法在任何地方提升。阳性对照排除了这一点。使用相同的框架、奖励和配方,我们选择奖励可通过采样达到的任务,即模型在温度下已经比贪婪解码更频繁地成功,然后重新训练。在那里,智能体提升了多达22个点,配对区间排除了零。当采样策略已经能击败贪婪策略时,GRPO会改进智能体;而当贪婪策略是两者中更好的时,GRPO停滞不前,这正是胜任的监督智能体所处的状态。实践者可以通过首先衡量采样成功与贪婪成功之间的差距来采取行动,并在此差距非正时对强化学习期望甚小。对于一个胜任的小型Web智能体,额外技能来自监督或蒸馏,而非更多的强化学习。 然后我们打开模型探究有害区域的原因。低学习率产生的更新真实但过小,无法改变行为;中等学习率使智能体退化;高学习率则使其崩溃。这两种失败是不同的损伤。退化区域破坏了晚期层的有效秩(Roy and Vetterli, 2007 (https://arxiv.org/html/2607.12640#bib.bib11)),同时保持早期层完整,而崩溃区域将秩保持在该监督水平或以上,而是破坏读出,我们在近两千个固定状态上确认了这种反转。为了检验这种相关性是否具有因果性,我们进行权重嫁接。从初始化恢复注意力层或MLP块可以修复退化的智能体,而恢复嵌入(其漂移主导了原始权重变化)则毫无作用,这表明计算块是失败的位置,并排除了嵌入尽管其大幅移动(Ilharco等人,2022 (https://arxiv.org/html/2607.12640#bib.bib12))的可能性。反向解读,同样的探针显示晚期层秩随能力而上升(在智能体提升处)和下降(在退化处),因此在4B规模下,秩在两个方向上跟踪技能。在8B规模下,这种耦合被打破,我们如实报告。 我们选择单一基准测试是刻意的,并且源于可解释性目标。机制性解释需要保持除干预之外的一切固定,以便有效秩或成功率的改变可归因于学习率而非环境中的未控制变化。MiniWoB提供了这种控制。其任务在种子下是确定性的,其成功检查是精确的,并且其涵盖的界面技能广度(从点击、打字到选择、导航)使其成为对Web智能体行为的广泛探针,而非狭窄探针。像WebArena(Zhou等人,2024 (https://arxiv.org/html/2607.12640#bib.bib9))这样的基准更接近部署,但引入了难以保持恒定的运行间变化,并且这种变化会混淆本研究依赖的归因。我们将MiniWoB视为可清晰读取机制的受控环境,并明确说明这在通用性上的代价。 我们的贡献如下: 1. 1. 受控零结果:在18次运行的网格和若干稳健性检查中,GRPO未可信地增加胜任的小型语言与视觉语言模型Web智能体的技能,且较高的学习率可信地移除了技能。 2. 2. 阳性对照将零结果的原因识别为上升空间条件,并提供一个可事先应用的采样成功与贪婪成功的简易检验。 3. 3. 对失败作为学习率门控的双重分离的机制性解释,通过权重嫁接因果定位,并证明主导的嵌入漂移是相关性的红鲱鱼。 4. 4. 证据表明晚期层有效秩在4B规模下双向跟踪能力,而在8B规模下分离,作为依赖于规模的特性报告。 5. 5. 一整套配对统计、等价检验和可解释性测量,发布出来以便他人自行检查零结果。 ## 2 相关工作 表1:本研究的三个实验、每个实验背后的原则及其目的。第3节 (https://arxiv.org/html/2607.12640#S3) 指定了方法和统计;结果在后续章节中呈现。 基于可验证奖励的强化学习推动了推理模型最近的进展,GRPO(Shao等人,2024 (https://arxiv.org/html/2607.12640#bib.bib1)),加上如解耦剪裁(Yu等人,2026 (https://arxiv.org/html/2607.12640#bib.bib2))和较少偏差的优势估计(Liu等人,2025 (https://arxiv.org/html/2607.12640#bib.bib3))等在近端策略优化目标(Schulman等人,2017 (https://arxiv.org/html/2607.12640#bib.bib4))之上的细化,现在是一个标准配方。这些增益是否反映了真正的新能力还是对基础模型已经能产生的行为的锐化,尚存争议,有证据表明强化学习通常无法将模型扩展到采样已经达到的范围之外(Chen等人,2026 (https://arxiv.org/html/2607.12640#bib.bib13))。该问题主要在推理基准上通过pass@k进行争论。我们将其带到交互式智能体,并像实践者那样,针对智能体自身的监督基线进行提问。 对于Web智能体,监督和强化学习管道都已提高了交互基准上的成功率,从MiniWoB环境(Shi等人,2017 (https://arxiv.org/html/2607.12640#bib.bib7);Liu等人,2018 (https://arxiv.org/html/2607.12640#bib.bib8))到更大的WebArena(Zhou等人,2024 (https://arxiv.org/html/2607.12640#bib.bib9)),在线课程方法报告了进一步的收益(Qi等人,2025 (https://arxiv.org/html/2607.12640#bib.bib6))。这一系列工作表明强化学习可以帮助Web智能体。但它并未解决是否能帮助一个小型语言与视觉语言模型智能体完成其已学会解决的任务,而这是一个胜任的部署系统通常所处的状态,也是我们在此隔离的状态。 我们的机制分析建立在读取模型内部状态的工具之上。有效秩(Roy and Vetterli, 2007 (https://arxiv.org/html/2607.12640#bib.bib11))衡量一个表示实际使用的方向数量,在权重空间中的编辑表明通过重新组合参数组可以移动行为(Ilharco等人,2022 (https://arxiv.org/html/2607.12640#bib.bib12))。我们将这些转化为因果测试而非相关性测试:我们从其初始化恢复一个单一组件组,保留其余部分,然后重新衡量成功,这将携带失败的参数与仅仅移动最多的参数分开。 两个空白点激发了这篇论文。锐化问题尚未通过与其自身监督起点的受控比较和匹配的阳性对照为智能体解决,并且在报告强化学习零结果的地方,很少在权重层面解释。我们解决这两个问题。我们为一个小型语言与视觉语言模型Web智能体建立受控零结果,使用阳性对照表明零结果是任务的属性而非训练管道的属性,并在单个权重组层面给出失败的因果解释。据我们所知,这是第一个将Web智能体的受控强化学习零结果与其发生原因的机制配对的研究。 ## 3 实验设置 我们的目标是决定GRPO是否为胜任的小型语言与视觉语言Web智能体添加技能,以及当不添加时解释原因。设计直接遵循。我们固定单个智能体、环境、奖励和任务集,以便任何成功率的改变都追溯到强化学习选择而非设置,并且在该固定框架上,我们运行了表1 (https://arxiv.org/html/2607.12640#S2.T1) 中总结的三个实验。本节其余部分指定了智能体和奖励(第3.1节 (https://arxiv.org/html/2607.12640#S3.SS1))、GRPO配方和网格(第3.2节 (https://arxiv.org/html/2607.12640#S3.SS2))、使零结果可信的评估和统计(第3.3节 (https://arxiv.org/html/2607.12640#S3.SS3)),以及可解释性探针(第3.4节 (https://arxiv.org/html/2607.12640#S3.SS4))。 ### 3.1 智能体、环境和奖励 智能体是Qwen3-VL,规模为4B和8B(Bai等人,2025 (https://arxiv.org/html/2607.12640#bib.bib10)),在MiniWoB上运行(Shi等人,2017 (https://arxiv.org/html/2607.12640#bib.bib7);Liu等人,2018 (https://arxiv.org/html/2607.12640#bib.bib8))。在每一步,策略πθ读取一个观测并从一个紧凑的词汇(点击、打字、选择、导航和显式的finish)中发出一个动作,直至固定的步骤预算。两种观测轨道共享所有其他逻辑:*文本*轨道序列化页面,以及*Set-of-Marks*轨道(Yang等人,2023 (https://arxiv.org/html/2607.12640#bib.bib14))呈现带有编号标记的截图。控制网格和机制使用文本轨道;Set-of-Marks轨道是模态检查。奖励是一个稀疏二元终端信号,广播给情节的每一步, \[ r(\tau)=\mathbf{1}\!\left[\operatorname{success}(\tau)\right]\in\{0,1\}. \] (1) ### 3.2 GRPO配方和控制网格 对于每个训练提示,策略采样一组G个轨迹。按照Liu等人 (2025 (https://arxiv.org/html/2607.12640#bib.bib3)),优势是组均值中心的奖励,不除以组标准差, \[ A_i = r_i - \frac{1}{G}\sum_{j=1}^G r_j. \] (2) 当前策略与产生轨迹的策略之间的每个令牌重要性比率为 \[ \rho_c(\theta)=\frac{\pi_\theta(y_c\mid x,y\]\\displaystyle=\frac{1}{N}\sum_n\mathbf{1}\!\big[\textstyle\max_v p_{n,v}>\tau\big]. \] 因果嫁接从初始化恢复一个组件组 \(\mathcal{G}\),注意力、MLP或嵌入,并重新评估, \[ \theta' = \theta,\quad \theta'_\mathcal{G} \leftarrow \theta^{\mathrm{init}}_\mathcal{G},\qquad \text{recovery} = \mathrm{SR}(\theta'). \] (14) 最后,一个任务的上升空间是采样与gr
相似文章
面向小规模语言模型智能体的鲁棒强化学习
本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。
大语言模型顺序后训练中的表征坍塌
本文研究了大型语言模型在顺序后训练中的表征坍塌现象,表明重复的适应阶段会压缩内部表征,降低可塑性和域外泛化能力。作者提出了轻量级干预措施,在不牺牲行为增益的前提下保留未来的可学习性。
面向小规模语言模型智能体的稳健强化学习
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。
超越英语的GRPO:非英语与多语言环境中GRPO的大规模研究
这项大规模研究调查了非英语和多语言环境中的GRPO,发现以母语进行推理训练与英语训练之间差距较小,并显示出强大的跨语言迁移能力,尽管效果取决于模型和语言。
LC-GRPO:利用朗之万校正弥合基于流的GRPO训练-推理差距
本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。