WarpSAC: 通过重新思考探索与利用,迈向可扩展的非策略强化学习的顶峰
摘要
提出 WarpSAC,一种感知环境的非策略强化学习算法,该算法根据数据可用性调整稳定器,在 CPU 规模和 GPU 并行环境中显著提高了性能,优于 FlashSAC。
查看缓存全文
缓存时间: 2026/08/27 07:20
论文页面 - WarpSAC:通过重新思考探索与利用实现可扩展离策略强化学习的巅峰
来源:https://huggingface.co/papers/2608.24479 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
离策略强化学习稳定器的效果随数据可用性的变化而变化,这促使了与数据环境感知算法的产生,该类算法能够自适应调整归一化和Q函数裁剪策略,从而提升在CPU与GPU并行训练中的效率。
大规模并行模拟改变了离策略强化学习(https://huggingface.co/papers?q=off-policy%20reinforcement%20learning)训练所处的数据环境,这对为数据有限的回放缓冲区(https://huggingface.co/papers?q=replay)设计的稳定器构成了挑战。通过在八个基准测试系列上的控制实验,我们表明这些稳定器依赖于数据环境:参数归一化(https://huggingface.co/papers?q=parameter%20normalization)在回放缓冲区(https://huggingface.co/papers?q=replay)覆盖范围窄时有所帮助,但当数据充足时会限制值函数拟合;而裁剪双Q学习(https://huggingface.co/papers?q=clipped%20double-Q)在高通量操作任务中可以被放宽。基于年龄偏好的回放缓冲区权重分配(https://huggingface.co/papers?q=Age-biased%20replay%20weighting)在各种数据环境下都能提高学习效率,尤其是在网络容量有限的情况下。基于这些发现,我们提出了WarpSAC(https://huggingface.co/papers?q=WarpSAC),一个与数据环境感知的离策略强化学习算法族。WarpSAC(https://huggingface.co/papers?q=WarpSAC)使用样本权重衰减(https://huggingface.co/papers?q=Sample%20Weight%20Decay)以实现高效的利用,并提供了两个变体:WarpSAC(https://huggingface.co/papers?q=WarpSAC)-L(归一化开启,裁剪双Q学习(https://huggingface.co/papers?q=clipped%20double-Q)),适用于数据有限的CPU规模训练;以及WarpSAC(https://huggingface.co/papers?q=WarpSAC)-A(归一化关闭,单Q网络),适用于数据充足的GPU并行训练。在九个CPU规模环境中,WarpSAC(https://huggingface.co/papers?q=WarpSAC)相比FlashSAC将归一化分数-步AUC提高了4.5%;在十四个GPU并行环境中提高了23.1%。它将UnitreeG1TransportBox-v1的成功率从19.8%提升至96.4%,将MuJoCo Playground上的平均归一化墙钟时间AUC提高了19.1%,并且在Unitree G1上实现的sim-to-real(https://huggingface.co/papers?q=sim-to-real)部署速度比FlashSAC快36.4%。这些结果表明,可扩展的离策略强化学习应根据可用数据环境调整其稳定器。
查看 arXiv 页面 (https://arxiv.org/abs/2608.24479)查看 PDF (https://arxiv.org/pdf/2608.24479)项目页面 (https://wzhhasadream.github.io/WarpSAC)GitHub1 (https://github.com/wzhhasadream/warprl)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.24479)
在您的代理中获取此论文:
hf papers read 2608\.24479
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.24479 以从本页链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.24479 以从本页链接它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.24479 以从本页链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
Dreamer-SAC:在潜在世界模型中进行离策略学习以实现样本高效的自动驾驶
本文提出Dreamer-SAC,一种基于模型的强化学习框架,将递归状态空间世界模型与潜在空间中的软演员-评论家算法相结合,以实现样本高效的自动驾驶。该框架在需要更少的真实环境交互的情况下,优于DreamerV3、SAC和PPO基线。
SAPO:用于智能体强化学习的单次展开自回归策略优化
SAPO 是一种用于智能体强化学习的低内存、高计算效率框架,它在单个自回归骨干中共享策略和价值函数,在 ALFWorld 和 WebShop 的实验中表现优于 PPO 和 GRPO。
Warp RL: 重塑基础策略分布以适应动力学变化
Warp RL 用基于单调有理二次样条流的可逆状态条件变换替代强化学习中的加性残差修正,该变换作用于基础策略的动作分布,从而在动力学偏移下适应分布的形状、尺度和几何结构。在 ManiSkill3 操作任务中,Warp RL 与残差修正性能相当或更优,并在真实机器人插销任务中实现了任务完成速度提高 30%。
软自适应策略优化
SAPO引入了一个平滑、温度控制的门控机制,以自适应地减弱强化学习中的离策略更新,与使用硬裁剪的方法相比,提升了训练稳定性和性能。
学习探索:通过探索感知策略优化扩展代理推理
本文提出一种探索感知的强化学习框架,使LLM代理仅在不确定性高时自适应探索,从而提升在基于文本和基于GUI的基准测试上的性能。