benchmark-tasks

标签

Cards List
#benchmark-tasks

REFINEPPO: 通过迭代动作细化学习连续控制策略

arXiv cs.LG ↗ · 2026-09-21 缓存

RefinePPO 引入迭代动作细化以改进连续控制策略,在基准任务中达到与标准PPO相当或更优的性能,并且收敛更快。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈