stability-exploration

Tag

Cards List
#stability-exploration

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

Hugging Face Daily Papers · 2026-08-24 Cached

The paper introduces ERPO, a method that moves regularization from the action-side to the input-side by controlling query distribution, addressing the stability-exploration dilemma in LLM policy optimization, and showing improvements on mathematical reasoning benchmarks.

0 favorites 0 likes
← Back to home

Submit Feedback