vector-reward

Tag

Cards List
#vector-reward

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

Reddit r/LocalLLaMA · 2026-05-22 Cached

This paper introduces Vector Policy Optimization (VPO), a reinforcement learning algorithm that trains LLMs to produce diverse solutions by optimizing across multiple reward dimensions, significantly improving test-time search performance compared to scalar RL baselines.

0 favorites 0 likes
← Back to home

Submit Feedback