标签
提出 WarpSAC,一种感知环境的非策略强化学习算法,该算法根据数据可用性调整稳定器,在 CPU 规模和 GPU 并行环境中显著提高了性能,优于 FlashSAC。
提出了W2SPO,一种离策略强化学习方法,通过将来自较弱模型的短辅助片段注入目标模型轨迹,以多样化探索并改善推理,在数学基准测试上实现了更好的性能和训练加速。
一种新的离策略强化学习方法,使用扩散模型,通过反转扩散过程来处理离策略数据。