gradient-dynamics

Tag

Cards List
#gradient-dynamics

A Gradient Perspective on RLVR Stability and Winner Advantage Policy Optimization

Hugging Face Daily Papers · 2026-06-15 Cached

This paper analyzes token-level gradient dynamics in RLVR training, revealing how advantage sign and token probability jointly affect update stability, and introduces Winner Advantage Policy Optimization (WAPO) which performs clipped updates only on positive-advantage completions to improve stability.

0 favorites 0 likes
#gradient-dynamics

Emergence of Frontier Superposition: M\"obius attractor and Cascade Supervision

arXiv cs.LG · 2026-05-20

This paper identifies a Möbius attractor and Cascade Supervision as key mechanisms for the emergence of superposition reasoning in transformers, closing a theoretical gap on gradient descent convergence for graph reachability tasks.

0 favorites 0 likes
← Back to home

Submit Feedback