面向小规模语言模型智能体的稳健强化学习
摘要
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。
arXiv:2607.25091v1 公告类型:新
摘要:使用强化学习对齐参数范围为70M至500M的小语言模型(SLM)通常被认为不稳定,但底层失效机制尚未被系统研究。在最新研究中,使用近端策略优化(PPO)训练了十五种(模型,语料库)配置。实验包括在TinyStories、CNN/DailyMail和Wikitext-103语料库上训练的Pythia-70M、160M、410M以及SmolLM2-135M、360M。在小规模语言模型中识别出三种可复现的失效模式:标准PEFT/TRL流水线中的静默LoRA参数冻结、使用bfloat16时重要性比率的数值溢出,以及由于奖励模型错误导致的灾难性策略崩溃。这些问题通过合并并重新初始化适配器技术、在PPO更新期间使用float32精度,以及包含奖励白化、重要性比率保护和权重回滚的三层安全机制得到解决。本文提出了容量余量假说,该假说认为PPO在SLM规模上的性能既依赖于流畅的监督模型(困惑度PPL<20),也依赖于有区分力的奖励信号,而非模型参数数量。所提出的系统在所有实验中均稳定收敛,并在具备流畅先验和有效奖励信号的配置中,相比SFT基线提升了偏好胜率。此外,它在显著减少训练数据需求的同时,性能超越了指令调优基线。所有检查点、偏好数据集和训练脚本均已公开发布$^{\S}$。
查看缓存全文
缓存时间: 2026/07/29 09:53
# 面向小型语言模型智能体的鲁棒强化学习 来源:https://arxiv.org/html/2607.25091 Md Rezwanul Haque¹, Md\. Milon Islam², 以及 Fakhri Karray¹,³ ¹作者来自加拿大滑铁卢大学电气与计算机工程系模式分析与机器智能中心,邮编 N2L 3G1。(电子邮件:[email protected]\*)。 ²作者来自孟加拉国库尔纳工程技术大学计算机科学与工程系。(电子邮件:milonislam@cse\.kuet\.ac\.bd, milonislam@uwaterloo\.ca)。 ¹,³作者来自加拿大滑铁卢大学电气与计算机工程系模式分析与机器智能中心,邮编 N2L 3G1,以及阿联酋阿布扎比穆罕默德·本·扎耶德人工智能大学机器学习系。(电子邮件:karray@uwaterloo\.ca, fakhri\.karray@mbzuai\.ac\.ae)。 ###### 摘要 使用强化学习对齐参数范围在 70–500M 的小型语言模型(SLM)通常被认为不稳定,但潜在的失败机制尚未得到系统研究。在最新的研究中,使用近端策略优化(PPO)训练了十五种(模型,语料库)配置。实验涵盖了在 TinyStories、CNN/DailyMail 和 Wikitext-103 语料库上的 Pythia-70M、160M、410M 以及 SmolLM2-135M、360M 模型。在小规模语言模型中识别出了三种可复现的失败模式:标准 PEFT/TRL 流水线中静默的 LoRA 参数冻结、使用 bfloat16 时重要性比率的数值溢出,以及由奖励模型误差导致的灾难性策略崩溃。针对这些问题,我们采用了合并并重新初始化的适配器技术、PPO 更新期间的 float32 精度,以及一个包含奖励白化、重要性比率防护和权重回滚的三层安全机制。本文提出了容量裕度假说,该假说认为,SLM 规模的 PPO 性能既依赖于一个流畅的监督模型(PPL<20),也依赖于一个有区分度的奖励信号,而非模型参数数量。所提出的系统在所有实验中均稳定收敛,并在具有流畅先验和提供信息量的奖励信号的配置中,相较于 SFT 基线提高了偏好胜率。此外,它在需要显著更少训练数据的情况下,性能优于指令微调基线。所有检查点、偏好数据集和训练脚本均已公开发布§。 11footnotetext: §源代码:https://github\.com/rezwanh001/SLM-RL-Agents 模型检查点:https://huggingface\.co/mr3haque/SLM-RL-Agents 偏好数据集:https://huggingface\.co/datasets/mr3haque/SLM-RL-Agents-Data ††footnotetext: \*通讯作者:Md Rezwanul Haque。 ††footnotetext: ©2026 年 IEEE 国际系统、人与控制论会议(SMC)论文集,美国华盛顿州贝尔维尤。版权 2026 由作者所有。 ## I. 引言 参数范围在 70–500M 的小型语言模型(SLM)适用于资源受限、注重隐私的人机系统中的设备端智能体。与数十亿参数的模型不同,SLM 能在常见硬件上实现实时推理,便于在边缘设备上部署用于诸如摘要、受控生成和对话等任务的智能体系统。通过强化学习对齐 SLM 智能体对于机器学习与系统工程均至关重要,因为 PPO 控制回路必须在学习信号微弱且策略容量有限的规模下保持稳定。参数超过 1000 亿的模型已在各项基准测试中达到人类级别性能\[4 (https://arxiv.org/html/2607.25091#bib.bib1)\]。然而,高昂的训练和部署成本使其难以在学术实验室和边缘部署的应用中使用。数据整理和架构改进缩小了 SLM 与大型模型之间的性能差距\[7 (https://arxiv.org/html/2607.25091#bib.bib3),2 (https://arxiv.org/html/2607.25091#bib.bib4),1 (https://arxiv.org/html/2607.25091#bib.bib5),13 (https://arxiv.org/html/2607.25091#bib.bib6),25 (https://arxiv.org/html/2607.25091#bib.bib11)\],这使得参数少于 5 亿的模型成为设备端推理的实用选择。这一简化表述为涉及工具使用和多轮交互的更高级应用提供了稳定性基础。然而,SLM 的对齐仍然是一个开放的研究问题。基于人类反馈的强化学习(RLHF)\[5 (https://arxiv.org/html/2607.25091#bib.bib15),17 (https://arxiv.org/html/2607.25091#bib.bib14)\]是对齐大规模模型的标准方法,但其在参数少于 5 亿的模型上的应用仍然有限。PPO\[20 (https://arxiv.org/html/2607.25091#bib.bib13)\]在此模型规模下通常被认为不稳定,常导致梯度爆炸和奖励崩溃。因此,通常使用监督微调(SFT)或直接偏好优化(DPO)\[18 (https://arxiv.org/html/2607.25091#bib.bib12)\]替代,而未探究 PPO 不稳定的根本原因。本文利用这一假设来判定经典 PPO 是否能有效支持小型语言模型智能体,并识别稳定训练的技术要求。智能体被表示为一个参数化策略 π\_θ\[20 (https://arxiv.org/html/2607.25091#bib.bib13)\],该策略从离散动作空间中选择动作,并从环境中接收标量奖励。本研究考虑的十五种配置采用单轮形式的马尔可夫决策过程(MDP)。在此设置下,动作空间由词汇表 V 定义,时间范围 T 由以序列结束标记结束的单轮组成,奖励在终止状态提供。实证评估仅限于单轮情况,而多轮交互框架随本文一起发布。本文通过端到端系统的实证研究来探讨这一问题。五个基础模型(Pythia-70M、160M、410M 以及 SmolLM2-135M、360M)\[2 (https://arxiv.org/html/2607.25091#bib.bib4),1 (https://arxiv.org/html/2607.25091#bib.bib5)\]在三个不同数据集(TinyStories\[7 (https://arxiv.org/html/2607.25091#bib.bib3)\], CNN/DailyMail\[16 (https://arxiv.org/html/2607.25091#bib.bib16)\], 和 Wikitext-103\[15 (https://arxiv.org/html/2607.25091#bib.bib17)\]) 上使用完整的 SFT → 奖励模型 → PPO 循环进行训练。此过程生成了十五个完全训练好的配置。所有超参数在所有实验中保持一致,以研究模型容量和领域难度的影响。这种方法使我们能够区分特定配置的问题与一般的结构性失败模式。识别出三种特定于小规模架构的工程失败模式。首先,在 Transformer 强化学习(TRL)库\[24 (https://arxiv.org/html/2607.25091#bib.bib18)\]的某些参数高效微调(PEFT)实现中,低秩适配(LoRA)参数被静默注册为不可训练。其次,bfloat16 算术在参数少于 2 亿的模型中会产生概率比率溢出。第三,无界的奖励值与无裁剪的 Kullback–Leibler(KL)惩罚相结合,可能导致策略生成不连贯的输出。针对这些失败案例,我们采用了合并并重新初始化的方法、训练期间的 float32 精度,以及包含奖励白化和权重回滚机制的多层安全框架。我们提出了*容量裕度假说*,认为 PPO 的有效性取决于流畅的 SFT 先验和有区分度的奖励信号,而非模型参数数量。所提出的系统在性能上与公开可用的指令微调基线(包括 SmolLM2-Instruct\[1 (https://arxiv.org/html/2607.25091#bib.bib5)\] 和 Qwen2\.5-Instruct\[25 (https://arxiv.org/html/2607.25091#bib.bib11)\])相当,同时使用的训练数据显著更少。本研究的主要贡献如下: 1. 识别了 SLM 规模下 PPO 的三种可复现失败模式:PEFT 中的静默 LoRA 梯度冻结、bfloat16 重要性比率溢出,以及奖励驱动的策略崩溃。针对性地提出了具体解决方案,并组织成一个三层控制论安全框架。 2. 在十五种配置中评估了容量裕度假说。结果表明,SLM 规模下 PPO 的有效性取决于 SFT 流畅度与奖励可区分性的组合,为从业者提供了决策规则(PPL\_SFT < 20)。 3. 发布了一个可复现的对齐框架,包括十五个检查点、偏好数据集、训练脚本、一个交互式验证应用程序以及一个用于多轮智能体扩展的前向兼容系统。 本文其余部分组织如下。第二部分回顾相关工作。第三部分描述方法和稳定框架。第四部分介绍实验设置。第五部分展示并分析实验结果。第六部分讨论实际意义,第七部分总结全文。 ## II. 相关工作 使用 SFT、奖励建模和 PPO\[5 (https://arxiv.org/html/2607.25091#bib.bib15),22 (https://arxiv.org/html/2607.25091#bib.bib19),17 (https://arxiv.org/html/2607.25091#bib.bib14),20 (https://arxiv.org/html/2607.25091#bib.bib13)\] 的 RLHF 应用在参数规模为 1\.3–1750 亿的模型上已发展成熟 \[23 (https://arxiv.org/html/2607.25091#bib.bib21)\]。然而,其在 70–5 亿参数规模上的行为受到的关注有限。现有的 SLM 对齐研究主要集中在通过 SFT\[7 (https://arxiv.org/html/2607.25091#bib.bib3),2 (https://arxiv.org/html/2607.25091#bib.bib4),1 (https://arxiv.org/html/2607.25091#bib.bib5)\] 开发高质量的监督模型,或使用避免显式强化学习过程的偏好学习方法,如 DPO\[18 (https://arxiv.org/html/2607.25091#bib.bib12)\], KTO\[8 (https://arxiv.org/html/2607.25091#bib.bib22)\], 和 GRPO\[21 (https://arxiv.org/html/2607.25091#bib.bib23)\]。虽然这些替代方法减少了训练不稳定性,但它们移除了显式奖励模型,而奖励模型对于智能体系统中的诊断透明度至关重要。 使用 LoRA\[10 (https://arxiv.org/html/2607.25091#bib.bib24)\] 和 QLoRA\[6 (https://arxiv.org/html/2607.25091#bib.bib25)\] 的参数高效训练通常通过 TRL 库\[24 (https://arxiv.org/html/2607.25091#bib.bib18)\]实现,是一种标准方法。然而,在小规模模型层面可能会发生静默梯度流问题。类似地,自适应 KL\[26 (https://arxiv.org/html/2607.25091#bib.bib26)\], 广义优势估计 (GAE)\[19 (https://arxiv.org/html/2607.25091#bib.bib27)\], 和 NEFTune\[11 (https://arxiv.org/html/2607.25091#bib.bib28)\] 等稳定化技术是从大规模模型借鉴而来,未在 SLM 规模上进行充分评估。 本研究提供了一种不同于基于 DPO/GRPO 方法的研究方向。本工作并非提出新的优化目标,而是识别了标准 PPO 在 SLM 规模下的可复现失败模式,并为从业者提供了工程解决方案,以保持标量奖励信号的诊断价值。 ## III. 方法论 我们实施了一个三阶段 RLHF 系统,包括监督微调、Bradley–Terry 奖励建模以及带有 KL 散度惩罚的 PPO。每个阶段都针对参数少于 5 亿的模型进行了定制。整体数据流以及用于确保训练稳定性的三种工程机制如图 1 所示。 参考图注 图 1: 用于对齐小型语言模型智能体的端到端 RLHF 流水线。 该流水线由五个顺序阶段组成:(0) 数据整理,通过截断、打乱和不匹配生成偏好对;(1) SFT 训练,生成监督先验 π\_SFT;(2) 使用 Bradley–Terry 目标训练奖励模型;(3) PPO 优化,应用合并并重新初始化的过程以及三层安全机制(奖励白化、重要性比率上限和权重回滚)以减少规模相关的失稳;(4) 使用保留提示进行评估。实线箭头表示主要数据流,红色虚线箭头表示控制信号(例如,KL 参考),点状箭头表示流入每个阶段状态框的梯度。彩色点表示操作模式(蓝色:学习;金色:推理)。 *侧边栏注释:* r̂(s,a) 是来自 Bradley–Terry 模型 r\_φ(p,y) 的奖励,并且 (s,a) 在单轮设置中简化为 (p,y);Φ 和 J 分别表示更新算子和 PPO 目标 J(θ),两者均与文中使用的 CDF Φ 和 MDP 元组 M 不同。 智能体策略 π\_θ 在一个有限时间范围的 MDP M = (S, A, P, R, T) 内运行。状态 s\_t ∈ S 被表示为一个结构化元组,包含任务提示、生成的令牌、外部观测值、轮次索引以及剩余预算。动作空间 A 由四种不同的动作类型组成:词汇表令牌生成 a ∈ V、带参数的外部工具调用、澄清性查询生成以及终止。转移函数 P 对于词汇表生成和终止是确定性的,对于工具调用是随机的,并且在所有情况下都依赖于历史。奖励 R 由三个部分组成:基于确定性检查的可验证部分、从 Bradley–Terry 模型 r\_φ 获得的偏好部分,以及基于与 SFT 先验的每个令牌 KL 散度的塑形部分。十五个实证配置使用 M 的单轮形式,其中 T = 1,A = V,P 是确定性的,奖励仅在终止状态提供,并且观测集为空。在这种形式下,状态简化为上下文 (x, y<...)。 #### 数据整理 偏好数据集 D\_pref = {(p, y\_w, y\_l)\_i} 包含提示 p、获胜响应 y\_w 和失败响应 y\_l 的三元组。这些是从 SFT 阶段生成的,避免了随机偏好设置。使用了三种扰动方法:(i) 令牌截断——在随机位置截断响应序列;(ii) 句子级打乱——重新排列句子以破坏叙述流;(iii) 域不匹配——将响应替换为来自不同领域的数据点。偏好标签由基于规则的评估者确定,优先选择更长的序列,因为假设在早期训练中,流畅的输出比不完整的输出更受偏好。这种方法确保了成对偏好数据中的信号强度足以进行可重复的比较实验。 #### 监督微调 (SFT) 对于每个基础模型,我们在相应数据集上以自回归方式微调所有参数。我们使用标准的交叉熵损失函数。SFT 模型 π\_SFT 为后续的奖励模型和策略优化提供了基础先验。SFT 阶段还包括一个验证步骤,我们计算每个模型-数据集组合在保留集上的困惑度 (PPL)。经验上,我们在 TriviaQA 和 LAMBADA 上线性投射每个模型的 PPL 以进行验证。 #### 奖励模型 (RM) 奖励模型 r\_φ 使用 Bradley–Terry 目标进行训练,以最大化偏好排序概率: [数学公式] 其中 σ 是逻辑斯蒂函数,r\_φ(p, y) 是标量奖励值。与 SFT 阶段不同,我们为每个提示保持固定长度的响应,以确保比较的公平性。该模型在整个流水线中充当奖励信号。 #### 近端策略优化 (PPO) 策略 π\_θ 使用 PPO\[20 (https://arxiv.org/html/2607.25091#bib.bib13)\] 进行优化,并通过 KL 散度惩罚对 SFT 先验进行正则化。目标函数为: [数学公式] 其中 ρ\_t = π\_θ(a\_t|s\_t) / π\_SFT(a\_t|s\_t) 是重要性权重,Â\_t 是使用广义优势估计 (GAE\[19 (https://arxiv.org/html/2607.25091#bib.bib27)\]) 计算的估计优势值,ϵ 是裁剪范围,而 β 控制 KL 惩罚的强度。我们使用简单的线性 KL 惩罚,而非自适应 KL\[26 (https://arxiv.org/html/2607.25091#bib.bib26)\],以简化实验设置。该公式在保持经典 PPO 简单性的同时,加上了标准 KL 正则化项。 **失败模式 1 – 静默 LoRA 冻结** 在 TRL 库\[24 (https://arxiv.org/html/2607.25091#bib.bib18)\] 的某些参数高效微调 (PEFT) 实现中,当使用 LoRA 适配器进行训练时,LoRA 参数有时会被静默标记为不可训练。这会导致梯度不流向适配器权重,使得策略在随机初始化附近保持不变。作者观察到,在 `config.py` 或 `peft_config.json` 中显式设置 `peft_config.inference_mode = False` 可以在所有实验设置中正确启用 LoRA 参数的可训练性。 **失败模式 2 – 降低精度中的数值不稳定性** PPO 重要性比率 ρ\_t = exp(log π\_θ - log π\_SFT),在 bfloat16 精度下计算时,可能遭受灾难性抵消。这是因为两个相似对数概率之间的差值由于有限的七位尾数而丢失数值精度。
相似文章
面向小规模语言模型智能体的鲁棒强化学习
本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。
小型RL控制器与大型语言模型:RL引导的测试时自适应采样
本文将大型语言模型的自适应采样建模为马尔可夫决策过程,并训练一个轻量级强化学习控制器来平衡正确性、延迟和计算成本,从而实现了更好的权衡。
小语言模型顺序个性化的持续学习:稳定性监测分析
本文针对小语言模型的顺序LoRA个性化展开研究,通过检查点级评估来监测任务性能和遗忘情况,并表明轻量级参考集诊断可以揭示不稳定性模式。
PACE: 双时间尺度自进化小语言模型智能体
PACE 提出了一种双时间尺度框架,用于小语言模型智能体的自进化,协调低风险的提示精炼与高风险的控制器逻辑更新,在多个基准上实现了高达 +9.2% 的相对提升。
强化递归语言模型(18分钟阅读)
本文探讨了利用强化学习微调小型(4B)递归语言模型(RLM)从科学文档中选取证据,结果表明经过强化学习训练的4B模型在模型大小和成本仅为其一小部分的情况下,达到了与Claude Sonnet 4.6相当的性能。