reward-model-free

Tag

Cards List
#reward-model-free

SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling

arXiv cs.LG · 6d ago Cached

Introduces SP3O, a novel reward-model-free, critic-free, gradient-based preference-based RL algorithm that leverages segment-level preferences, demonstrating improved performance in robotic control and LLM fine-tuning, especially for long-horizon tasks.

0 favorites 0 likes
← Back to home

Submit Feedback