@askalphaxiv: “FlashREINFORCE:无批评器单次采样异步强化学习用于智能语言模型” 本文认为可扩展的智能体强化学习…
摘要
FlashREINFORCE 引入了一种无批评器、单次采样的异步强化学习框架,用于智能语言模型,通过立即从每个轨迹学习来提高稳定性和效率。
查看缓存全文
缓存时间: 2026/09/16 05:58
FlashREINFORCE:无需评论家网络的单次采样异步强化学习框架,面向智能语言模型
本文提出,可扩展的智能体强化学习无需对同一提示进行多次采样,而能在每条轨迹完成后立即学习。
该方法结合了跨独立提示的奖励中心化、针对陈旧轨迹的序列级信任区域,以及样本均值优化——使较长的失败轨迹不会主导训练过程。由此构建出一种稳定、无需评论家网络的学习机制,每个提示仅需一次采样。
这种方法将基于群体的强化学习(在相同提示上重复采样以消耗计算资源)转变为异步强化学习:每次采样覆盖一个新提示,立即成为训练数据,使智能体能以更少的采样计算从更多样化的经验中学习。
https://alphaxiv.org/abs/2609.flashreinforce-asynchronous-rl-agentic-models…
FlashREINFORCE:无需评论家网络的单次采样异步强化学习框架,面向智能语言模型
来源:https://www.alphaxiv.org/abs/2609.flashreinforce-asynchronous-rl-agentic-models
摘要
异步强化学习适用于采样时间不规则的长周期智能体,但基于群体的相对更新需要对每个提示进行重复采样。然而,基于群体的采样在固定采样预算下限制了提示覆盖范围,并引入了群体同步障碍。每个提示仅采样一次避免了这些限制,但也消除了能减少方差的群体基线,使得更新噪声更大,且在陈旧、变长轨迹上更易不稳定。我们提出了 FlashREINFORCE,一个基于 One-Batch REINFORCE、序列信任区域和样本均值优化的无评论家网络、单次遍历框架。这些组件在保持提示覆盖范围和符号反馈的同时,控制了策略漂移和长度放大的负面更新。实验表明,FlashREINFORCE 在 DeepSeek-R1-Distill-Qwen-1.5B 上以约四次更新的策略滞后性,稳定完成了6000次更新。在 Qwen2.5-Math-1.5B 上,它在五个基准测试中达到38.0的平均准确率,以一半的采样次数(256k 对比 512k)超越了已报道的 GRPO 基线 1.7 个百分点。Python 工具实验扩展到了300亿参数的混合专家模型 Qwen3-30B-A3B,在策略滞后八次更新的情况下训练稳定。在 Qwen2.5-7B-Instruct 上,FlashREINFORCE 保持了工具使用能力(而 GRPO 停止了工具调用),并在 ALFWorld 的已见/未见任务上达到了98.3%/96.5%的成功率。
AI 概览
本文的重要性
当语言模型需要进行多步推理、调用工具或与环境交互时,使用强化学习进行训练会变得更加困难。采样轨迹的长度可能差异巨大:一个智能体可能快速完成,而另一个可能花费数千个 token 进行推理或等待工具结果。在异步训练系统中,完成的轨迹在可用后会立即发送给学习者,通常是由较旧版本的策略生成的。
FlashREINFORCE 提出了一种无评论家网络的方法来学习这些异步、时间不均的轨迹。其核心设计选择是每个提示恰好使用一次采样,而不是对响应进行分组采样并比较。它结合了批次中心化奖励、陈旧轨迹的序列级过滤以及每条轨迹的损失归一化。
FlashREINFORCE 训练曲线,展示了评估准确率和基于累积更新的平滑三检查点均值。 图 1:已报道的长链推理训练保持稳定,评估性能在约6000次累积更新中持续提升。
因此,本文的贡献既是算法层面的,也是系统层面的。它解决了如何高效使用异步数据的问题,无需依赖价值函数评论家网络、同步响应组或对同一批次进行重复优化。
现有强化学习方法的挑战
许多语言模型强化学习方法使用对同一提示的多个响应。例如,GRPO 和 RLOO 估计一个响应相对于其采样同代响应的好坏。这种相对比较充当了方差减少基线:得分高于群体平均值的响应获得正面反馈,而得分低于平均值的响应获得负面反馈。
群体采样在长周期智能体设置中有两个重要缺点。
首先,固定的采样预算被重复消耗在相同的提示上。如果系统生成 G 条轨迹,基于群体的训练可能只覆盖了 G 个独立提示所能达到提示多样性的一小部分。其次,群体方法引入了同步障碍。即使某些轨迹已完成,学习者可能也需要等待组内的所有响应。
基于评论家网络的方法通过学习价值估计避免了其中一些局限,但为具有稀疏或终端奖励的长序列训练一个可靠的评论家网络本身就很难。随着策略变化或环境分布偏移,评论家网络也可能变得不准确。
FlashREINFORCE 则回归到 REINFORCE 评分函数估计器,但修改了其用法以适应异步语言模型训练。它从当前批次的平均奖励中构建基线,并使用一个完整批次进行一次优化器更新。
每个提示一次采样与符号反馈
假设一个批次包含 B 条已完成的轨迹,其中轨迹 i 获得标量奖励 R_i。FlashREINFORCE 计算批次均值并中心化每个奖励:
R̄ = (1/B) * Σ_{j=1}^B R_j, A_i = R_i - R̄
此处,A_i 用作该轨迹的优势值。高于批次均值的轨迹获得正面反馈,低于均值的则获得负面反馈。
这种区分对于二进制奖励尤为重要。如果成功轨迹获得奖励1,失败轨迹获得奖励0,未经中心化的单样本 REINFORCE 更新可以强化成功案例,但不会直接抑制失败案例。只要批次中包含足够的成功轨迹使均值大于0,批次中心化就会给失败轨迹一个负优势值。
该基线简单且不需要单独训练的价值模型。它也适用于非二进制奖励,其中 A_i 的符号表示轨迹的表现是高于还是低于当前批次平均值。
该方法并不声称解决了精细的信用分配问题。仅凭终端奖励,轨迹中的所有 token 初始时共享相同的标量优势。本文侧重于防止这种粗糙信号被陈旧数据或异常长的序列放大。
修正陈旧的行为策略
在异步训练中,轨迹由行为策略 μ_i 生成,而学习者更新一个更新的策略 π_θ。该方法在收集时记录每个采样 token 的行为概率。对于轨迹 i 中的 token t,它计算重要性比率:
ρ_{i,t}(θ) = exp[ log π_θ(a_{i,t} | h_{i,t}) - log μ_i(a_{i,t} | h_{i,t}) ]。
其中 a_{i,t} 是采样动作,h_{i,t} 是其历史。该比率增加了在学习者策略下比在行为策略下更可能的动作的影响,并降低了概率已下降的动作的影响。
本文强调,行为概率必须在轨迹生成时存储。之后重新计算旧概率可能无法重现实际采样分布,因为推理引擎、路由决策、数值设置或训练与推理实现可能不同。
为保证数值稳定性,实现时在 float32 中计算 log 比率,将其限制在 -30 到 30 的区间内,然后取指数。与 PPO 不同,FlashREINFORCE 不使用基于 token 的比率裁剪作为其主要的信任区域机制。
序列级信任区域
重要性采样在行为生成的历史上修正了动作概率,但它并未完全修正这些历史是由陈旧策略产生的这一事实。行为策略越旧,当前模型就越有可能偏离生成该轨迹的分布。
FlashREINFORCE 通过一个序列级准入测试来解决这个问题。对于每个采样动作,它比较行为概率 p 和当前策略概率 q。它将采样动作视为一种结果,所有其他词表 token 视为另一种结果,产生伯努利 KL 散度近似:
d_{i,t} = p * log(p/q) + (1-p) * log((1-p)/(1-q)), D̄_i = (1/T_i) * Σ_{t=1}^{T_i} d_{i,t}。
其中 T_i 是轨迹 i 中的 token 数量。轨迹仅在满足以下条件时被接受:
D̄_i ≤ δ。
生成的二进制掩码 m_i 应用于完整轨迹。如果序列未通过门控,则丢弃其 token 贡献;如果通过,则该轨迹作为一致的训练样本被保留。
这不同于基于 token 的局部过滤。Token 掩码可能独立地移除早期或晚期的 token,即使后续 token 仍是在原始行为策略生成的历史上进行评估的。序列级拒绝将整个存储的轨迹视为一个离线策略对象。本文的理论讨论将这一选择与轨迹上累积的策略移动联系起来。
该门控是一个实用的诊断工具,而非完全保证。因为它只检查采样动作的概率,并将剩余词表聚合为一类,所以它是完整分类 KL 散度的近似。通过门控并不能证明完整的策略分布是接近的。
样本均值优化
最后一个组件改变了 token 损失的聚合方式。FlashREINFORCE 不是将批次中所有 token 一起平均,而是先平均每条轨迹内的 token,然后平均各轨迹:
L = -(1/B) * Σ_{i=1}^B m_i * A_i * (1/T_i) * Σ_{t=1}^{T_i} stopgrad(ρ_{i,t}) * log π_θ(a_{i,t} | h_{i,t})。
这使得每条被接受的轨迹获得大致相等的权重。在传统的基于 token 的均值减少下,一条 token 数量多一倍的轨迹大约贡献双倍的梯度。当一条较长的失败轨迹获得负优势值时,这可能是不可取的,因为其失败信号可能压倒较短的样本。
该方法还在丢弃数据前使用一个完整的批次优化器更新。在几个连续的 minibatch 更新中重复使用同一个采样批次,会导致策略在剩余样本仍是离线策略时发生变化。新鲜的单批次更新减少了这一额外的不匹配来源。
一个简化的实现如下所示:
实证结果
本文评估了数学推理、Python 工具使用和交互式决策。
在使用1460个 MATH 问题训练的 DeepSeek-R1-Distill-Qwen-1.5B 上,策略滞后约四次更新,该方法在6000次更新中保持稳定。已报道的 AIME24/25 平均准确率从21.7%提高到33.7%。响应长度在训练过程中下降,而熵值稳定下来而非崩溃。
序列信任区域对此稳定性有贡献。在一个后续对比实验中,使用信任门控的配置达到了33.7%,而没有门控的版本为30.6%。未门控的运行显示出更高的训练-推理 KL 散度,并停止有效改进。
在 Qwen2.5-Math-1.5B 上,FlashREINFORCE 使用256,000次采样在五个基准测试上达到38.0%的均值,而已报道的 GRPO 基线使用512,000次采样达到36.3%。该结果并非在每个基准测试上都更好,但在 Minerva、AIME2025 和 OlympiadBench 上表现更强。
工具使用实验对长周期交互提供了更直接的测试。在使用 Python 的 Qwen2.5-7B-Instruct 上,FlashREINFORCE 在600次更新中持续进行工具调用,平均每条轨迹3.25次调用。在已报道的对比中,GRPO 在约200次更新后停止了工具调用。在300亿参数的 Qwen3 混合专家模型上,在匹配的采样预算下,FlashREINFORCE 达到了67.1%,而 GRPO 为60.3%,同时 FlashREINFORCE 运行时的策略滞后更大。
跨策略更新的异步训练变体对比,包括序列门控 FlashREINFORCE、更宽松的门控、无门控、重放和 GRPO。 图 2:已报道的曲线显示,序列门控的 FlashREINFORCE 在异步策略滞后下保持相对稳定。
在 ALFWorld 上,该方法在12,800条轨迹后,在已见游戏上达到98.3%的成功率,在未见游戏上达到96.5%。这些数字超过了已引用的 GRPO 和 C-RF 结果,但本文指出这些对比不一定是完全受控的复现。
独特之处与尚存问题
FlashREINFORCE 的独特之处在于:它使用每个提示一次独立采样,这区别于基于群体的方法;它使用批次奖励均值而非学习的价值估计器,这区别于基于评论家网络的方法;它通过序列级准入而非主要依赖基于 token 的比率裁剪来控制漂移,这区别于 PPO 风格的方法;最后,其样本均值减少防止了序列长度决定轨迹的权重。
消融研究支持了这三个设计选择。移除负面反馈严重损害了工具使用学习并导致工具调用消失。基于 token 的均值减少导致了更长的响应、更多的截断和更少的工具调用。与序列级门控相比,基于 token 的局部信任掩码不稳定。
几个局限性影响了结论的普适性。终端奖励仍然提供粗糙的 token 信用分配。KL 门控仅是采样动作的近似,而样本均值归一化有意改变了标准 REINFORCE 目标的权重。基于熵的过滤提供了适度的可选收益,但在激进应用时变得有害。评估也仅涵盖有限的一组环境,且部分基线来自先前使用不同系统和同步条件的工作。
总体而言,本文提供了一个紧凑的异步智能体训练方案:收集独立轨迹,在新批次中中心化奖励,拒绝偏离其行为策略过远的序列,并为每条被保留的轨迹赋予相等权重。其主要价值在于展示了这些选择如何使单次采样、无评论家网络的强化学习能够用于长周期的语言模型行为。
重新思考 LLM 强化学习中的信任区域 (https://www.alphaxiv.org/abs/2602.04879)
这项工作直接启发了 FlashREINFORCE 的序列级信任机制和基于散度的准入规则。本文特别借鉴了 DPPO 对重要性采样、散度控制以及 token 与序列信任决策的分析。
Penghui Qi, Xiangxin Zhou, Zichen Liu, Tianyu Pang, Chao Du, Min Lin, and Wee Sun Lee. 重新思考 LLM 强化学习中的信任区域. arXiv preprint arXiv:2602.04879, 2026. 4, 6, 11, 12, 17
长周期 LLM 强化学习中的信任区域掩码 (https://www.alphaxiv.org/abs/2512.23075)
信任区域掩码是一种密切相关的方法,用于处理策略漂移下的长周期语言模型强化学习中的序列级准入。FlashREINFORCE 明确使用了其累积漂移视角,并将其作为拒绝完整轨迹而非…的关键动机引用。
相似文章
EfficientRollout:用于RL推演的系统感知自推测解码
EfficientRollout是一个系统感知的自推测解码框架,通过使草稿模型适应不断变化的策略并优化推测解码机制,加速LLM的强化学习推演,将延迟降低高达19.6%。
Z.ai的稳定异步强化学习(13分钟阅读)
本文介绍了单rollout异步优化(SAO)技术,用于解决LLM后训练中异步RL的稳定性和异策略挑战,并证明SAO在智能体编码和推理基准测试上持续优于GRPO。
注解作为 Rollout:视频 MLLMs 的高效可扩展强化学习
OraRL 通过将标注整合为 oracle rollout,改进了视频多模态语言模型的强化学习后训练,实现了更高的样本效率和性能,无需思维链生成。
@ziv_ravid: 刚刚读到清华大学/Z.AI关于异步强化学习用于智能体的新论文(arXiv:2607.07508)。它是在……几周后发布的
讨论了一篇来自清华大学/智谱AI的关于异步强化学习用于智能体的新论文,并指出他们之前的GLM-5.2模型使用了评论家而不是GRPO。
@_akhaliq: LiteResearcher — 面向深度研究智能体的可扩展代理RL训练框架
LiteResearcher是一个可扩展的强化学习训练框架,专为深度研究智能体设计。