Tag
This paper proposes GUPO, a Gradient Uncertainty-aware Policy Optimization method that improves post-training of large language models by modeling gradient uncertainties using a Bayesian approach to handle conflicts among group gradients.