multi-reward-rl

标签

Cards List
#multi-reward-rl

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

arXiv cs.LG · 5天前 缓存

SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.

0 人收藏 0 人点赞
#multi-reward-rl

Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL

arXiv cs.AI · 2026-08-03 缓存

This paper proposes PRISM, a multi-reward RL framework that decomposes policy space rather than mixing rewards, improving multi-reward optimization and enabling inference-time controllability. Experiments on reasoning and alignment tasks show it outperforms existing baselines.

0 人收藏 0 人点赞
← 返回首页

提交意见反馈