Tag
Presents a closed-form reduced-order model of GRPO training dynamics, reducing it to a damped oscillator and deriving predictions for stability, group-size invariance, and loss curvature. Validated across multiple models and benchmarks.
This paper presents a closed-form upper bound for admissible learning-rate steps in belief-space dynamics, providing a theoretical result for optimization in robotics or control.