gradient-extrapolation

Tag

Cards List
#gradient-extrapolation

Gradient Extrapolation-Based Policy Optimization

arXiv cs.LG ↗ · 2026-05-11 Cached

The article introduces Gradient Extrapolation-Based Policy Optimization (GXPO), a method that approximates multi-step lookahead in RL training for LLMs using only three backward passes. It demonstrates improved reasoning performance on math benchmarks over standard GRPO while maintaining fixed active-phase costs.

0 favorites 0 likes
← Back to home

Submit Feedback