WarpSAC: 通过重新思考探索与利用,迈向可扩展的非策略强化学习的顶峰

Hugging Face Daily Papers 论文

摘要

提出 WarpSAC,一种感知环境的非策略强化学习算法,该算法根据数据可用性调整稳定器,在 CPU 规模和 GPU 并行环境中显著提高了性能,优于 FlashSAC。

大规模并行模拟改变了非策略强化学习(RL)训练的数据环境,这对设计用于数据有限回放的稳定器提出了挑战。通过在八个基准测试族上进行受控实验,我们发现这些稳定器是数据环境依赖的:参数归一化有助于狭窄的回放覆盖,但在数据充足时会限制值拟合,而在高通量操作中,裁剪的双重Q可以放松。基于年龄的回放加权在各种环境中都提高了学习效率,尤其是在网络容量有限的情况下。 基于这些发现,我们提出了 WarpSAC,一个感知环境的非策略 RL 算法族。WarpSAC 使用样本权重衰减进行高效利用,并提供两个变体:WarpSAC-L(范数开启,裁剪双重Q)用于数据有限的 CPU 规模训练,和 WarpSAC-A(范数关闭,单一Q)用于数据充足的 GPU 并行训练。WarpSAC 在九个 CPU 规模环境中将归一化分数--步 AUC 提高了 4.5%,在十四个 GPU 并行环境中提高了 23.1%。它将 UnitreeG1TransportBox-v1 的成功率从 19.8% 提高到 96.4%,在 MuJoCo Playground 上将平均归一化墙时间 AUC 提高了 19.1%,并在 Unitree G1 上实现了比 FlashSAC 快 36.4% 的模拟到真实部署。这些结果表明,可扩展的非策略 RL 应该根据可用数据环境调整其稳定器。
查看原文
查看缓存全文

缓存时间: 2026/08/27 07:20

论文页面 - WarpSAC:通过重新思考探索与利用实现可扩展离策略强化学习的巅峰

来源:https://huggingface.co/papers/2608.24479 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

离策略强化学习稳定器的效果随数据可用性的变化而变化,这促使了与数据环境感知算法的产生,该类算法能够自适应调整归一化和Q函数裁剪策略,从而提升在CPU与GPU并行训练中的效率。

大规模并行模拟改变了离策略强化学习(https://huggingface.co/papers?q=off-policy%20reinforcement%20learning)训练所处的数据环境,这对为数据有限的回放缓冲区(https://huggingface.co/papers?q=replay)设计的稳定器构成了挑战。通过在八个基准测试系列上的控制实验,我们表明这些稳定器依赖于数据环境:参数归一化(https://huggingface.co/papers?q=parameter%20normalization)在回放缓冲区(https://huggingface.co/papers?q=replay)覆盖范围窄时有所帮助,但当数据充足时会限制值函数拟合;而裁剪双Q学习(https://huggingface.co/papers?q=clipped%20double-Q)在高通量操作任务中可以被放宽。基于年龄偏好的回放缓冲区权重分配(https://huggingface.co/papers?q=Age-biased%20replay%20weighting)在各种数据环境下都能提高学习效率,尤其是在网络容量有限的情况下。基于这些发现,我们提出了WarpSAC(https://huggingface.co/papers?q=WarpSAC),一个与数据环境感知的离策略强化学习算法族。WarpSAC(https://huggingface.co/papers?q=WarpSAC)使用样本权重衰减(https://huggingface.co/papers?q=Sample%20Weight%20Decay)以实现高效的利用,并提供了两个变体:WarpSAC(https://huggingface.co/papers?q=WarpSAC)-L(归一化开启,裁剪双Q学习(https://huggingface.co/papers?q=clipped%20double-Q)),适用于数据有限的CPU规模训练;以及WarpSAC(https://huggingface.co/papers?q=WarpSAC)-A(归一化关闭,单Q网络),适用于数据充足的GPU并行训练。在九个CPU规模环境中,WarpSAC(https://huggingface.co/papers?q=WarpSAC)相比FlashSAC将归一化分数-步AUC提高了4.5%;在十四个GPU并行环境中提高了23.1%。它将UnitreeG1TransportBox-v1的成功率从19.8%提升至96.4%,将MuJoCo Playground上的平均归一化墙钟时间AUC提高了19.1%,并且在Unitree G1上实现的sim-to-real(https://huggingface.co/papers?q=sim-to-real)部署速度比FlashSAC快36.4%。这些结果表明,可扩展的离策略强化学习应根据可用数据环境调整其稳定器。

查看 arXiv 页面 (https://arxiv.org/abs/2608.24479)查看 PDF (https://arxiv.org/pdf/2608.24479)项目页面 (https://wzhhasadream.github.io/WarpSAC)GitHub1 (https://github.com/wzhhasadream/warprl)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.24479)

在您的代理中获取此论文:

hf papers read 2608\.24479

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.24479 以从本页链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.24479 以从本页链接它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.24479 以从本页链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

Warp RL: 重塑基础策略分布以适应动力学变化

arXiv cs.LG

Warp RL 用基于单调有理二次样条流的可逆状态条件变换替代强化学习中的加性残差修正,该变换作用于基础策略的动作分布,从而在动力学偏移下适应分布的形状、尺度和几何结构。在 ManiSkill3 操作任务中,Warp RL 与残差修正性能相当或更优,并在真实机器人插销任务中实现了任务完成速度提高 30%。

软自适应策略优化

Papers with Code Trending

SAPO引入了一个平滑、温度控制的门控机制,以自适应地减弱强化学习中的离策略更新,与使用硬裁剪的方法相比,提升了训练稳定性和性能。