gradient-uncertainty

Tag

Cards List
#gradient-uncertainty

GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models

arXiv cs.LG · 6d ago Cached

This paper proposes GUPO, a Gradient Uncertainty-aware Policy Optimization method that improves post-training of large language models by modeling gradient uncertainties using a Bayesian approach to handle conflicts among group gradients.

0 favorites 0 likes
← Back to home

Submit Feedback