off-policy-rl

标签

Cards List
#off-policy-rl

WarpSAC: 通过重新思考探索与利用,迈向可扩展的非策略强化学习的顶峰

Hugging Face Daily Papers · 2026-08-25 缓存

提出 WarpSAC,一种感知环境的非策略强化学习算法,该算法根据数据可用性调整稳定器,在 CPU 规模和 GPU 并行环境中显著提高了性能,优于 FlashSAC。

0 人收藏 0 人点赞
#off-policy-rl

仅需8个令牌:通过辅助分支实现弱到强的离策略强化学习

arXiv cs.AI · 2026-07-21 缓存

提出了W2SPO,一种离策略强化学习方法,通过将来自较弱模型的短辅助片段注入目标模型轨迹,以多样化探索并改善推理,在数学基准测试上实现了更好的性能和训练加速。

0 人收藏 0 人点赞
#off-policy-rl

@svlevine: 一种使用扩散进行离策略强化学习的新方法:如果我们有离策略数据,我们需要找出扩散后期…

X AI KOLs Following · 2026-06-18 缓存

一种新的离策略强化学习方法,使用扩散模型,通过反转扩散过程来处理离策略数据。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈