陈旧但稳定:用于稳定异步强化学习的陈旧自适应信任区域

Hugging Face Daily Papers 论文

摘要

引入了陈旧自适应信任区域(SAT),通过根据陈旧性自适应控制更新间隔来稳定异步强化学习。在基于Qwen3-30B-A3B-Base的解耦异步强化学习设置上进行了评估,取得了改进的结果。

异步强化学习通过将轨迹生成与优化解耦来提高吞吐量,但陈旧性是不可避免的副产品,并且会因策略延迟、引擎延迟和混合专家路由而加剧。从信任区域的角度来看,这种不匹配至关重要:训练-推理散度决定了有限时域界限中的近似误差,而PPO裁剪仅对采样到的外向更新进行门控,充当采样代理而非全策略约束。因此,在陈旧轨迹最关键的异步机制中,高陈旧性更新仍然受到弱控制。 我们引入了陈旧自适应信任区域(SAT),它使用分离的采样对数比作为实用的陈旧性代理,通过基于陈旧性的核缩放识别每个批次内的高不匹配尾部,并仅收缩名义PPO区间的符号选择端点。这在普通令牌上保留了基线行为,同时对新拦截的外向带施加更保守的更新。我们证明了相对于PPO的局部区间包含性和逐点悲观性,展示了自适应规则如何在异质陈旧性下重塑更新几何。 我们在基于Qwen3-30B-A3B-Base的解耦异步强化学习设置中评估了SAT,使用SGLang作为推理引擎,Megatron用于训练。在此设置下,SAT-GSPO w/ R3在AIME24 avg@8上取得了最佳观察结果,在滞后1时达到35.83,在滞后8时达到34.79,而SAT-GSPO在滞后1时达到34.17。自适应裁剪和路由重放作为互补的稳定器,分别针对不匹配尾部和路由不一致性。总体而言,将裁剪间隔与陈旧性异质性对齐可以有效稳定异步强化学习。
查看原文
查看缓存全文

缓存时间: 2026/07/22 06:41

论文页面 - 老旧但稳定:面向异步强化学习稳定性的陈旧自适应信任域

来源:https://huggingface.co/papers/2607.18722 发布于 7月21日

·

提交者 https://huggingface.co/zli12321

LZX (https://huggingface.co/zli12321) 于 7月22日

摘要

异步强化学习通过将 rollout 生成与优化解耦来提高吞吐量,但陈旧性是不可避免的副产品,且会因策略滞后、引擎延迟和混合专家路由而加剧。从信任域的角度来看,这种不匹配至关重要:训练-推理差异决定了无限时域边界中的近似误差,而 PPO 裁剪仅对采样到的外向更新进行门控,充当采样代理而非完整的策略约束。因此,在异步机制中,高陈旧性更新仍然受到弱控制,而陈旧 rollout 最需要关注。我们引入了陈旧自适应信任域(SAT),它使用分离的采样对数比作为实用的陈旧性代理,通过基于陈旧性的核缩放识别每个批次内的高不匹配尾部,并仅收缩名义 PPO 区间中经符号选择的端点。这保留了普通 token 上的基线行为,同时对新截获的外向带施加更保守的更新。我们证明了局部区间包含性和相对于 PPO 的逐点保守性,展示了自适应规则如何在异质陈旧性下重塑更新几何。我们在基于 Qwen3-30B-A3B-Base 构建的解耦异步 RL 设置中评估了 SAT,使用 SGLang 作为推理引擎,Megatron 用于训练。在此设置中,SAT-GSPO w/ R3 达到了最佳观察到的 AIME24 avg@8,在 lag1 时为 35.83,在 lag8 时为 34.79,而 SAT-GSPO 在 lag1 时达到 34.17。自适应裁剪和路由重放分别作为针对不匹配尾部和路由不一致性的互补稳定器。总体而言,将裁剪区间与陈旧性异质性对齐有效稳定了异步 RL。

查看 arXiv 页面 (https://arxiv.org/abs/2607.18722) 查看 PDF (https://arxiv.org/pdf/2607.18722) GitHub9 (https://github.com/jyyang26/SAT) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18722)

引用该论文的模型0

无模型链接此论文

请在模型的 README.md 中引用 arxiv.org/abs/2607.18722 以从此页面链接。

引用该论文的数据集0

无数据集链接此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2607.18722 以从此页面链接。

引用该论文的空间0

无空间链接此论文

请在空间的 README.md 中引用 arxiv.org/abs/2607.18722 以从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

Z.ai的稳定异步强化学习(13分钟阅读)

TLDR AI

本文介绍了单rollout异步优化(SAO)技术,用于解决LLM后训练中异步RL的稳定性和异策略挑战,并证明SAO在智能体编码和推理基准测试上持续优于GRPO。

信任区域Q伴随匹配

Hugging Face Daily Papers

信任区域Q伴随匹配(TRQAM)通过投影对偶下降自适应控制路径空间KL散度,解决了离线策略强化学习中的不稳定性问题,从而实现对预训练流策略的稳定微调。该方法在50个OGBench任务上持续优于先前方法,在离线强化学习中达到68%的成功率,而最强基线仅为46%。

信任域逆强化学习:利用局部策略更新进行显式对偶上升

arXiv cs.LG

本文介绍了信任域逆强化学习(TRIRL),这是一种结合了单调对偶改进与高效局部策略更新的方法,其性能优于最先进的模仿学习方法。该方法通过使用信任域约束,解决了逆强化学习中稳定性与计算成本之间的权衡问题。

通过自适应安全约束实现非平稳环境下的安全持续强化学习

arXiv cs.LG

提出LILAC+框架,用于非平稳环境下的安全持续强化学习,该框架采用三种自适应安全机制:基于上下文的安全约束、适应速度约束和预算到状态的安全执行。在模拟驾驶环境中的评估表明,在分布偏移下,该框架减少了安全违规,同时保持了竞争性的性能。

TeamTR:多智能体LLM协调的信任域微调

arXiv cs.LG

本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。