proximal-policy-optimization

Tag

Cards List
#proximal-policy-optimization

Anticipatory Reinforcement Learning for Trajectory Tracking

arXiv cs.LG · 2026-07-07 Cached

This paper introduces a predictive formulation for deep reinforcement learning that augments the state space with future reference horizons to enable anticipatory control for trajectory tracking. Simulation results show significant error reduction, though zero-shot transfer to physical hardware reveals a sim-to-real gap.

0 favorites 0 likes
#proximal-policy-optimization

Integrating Physics-Informed Neural Networks for Safe Reinforcement Learning in a 1-DoF Helicopter System

arXiv cs.LG · 2026-07-07 Cached

This work-in-progress paper proposes embedding a differentiable physics model into the PPO actor loss function to penalize anticipated safety violations in reinforcement learning, evaluated on a simulated 1-DoF helicopter system. The physics-informed soft regularizations reduce constraint violations while maintaining reliable target tracking.

0 favorites 0 likes
#proximal-policy-optimization

EVOM: Agentic Meta-Evolution of Actor-Critic Architectures for Reinforcement Learning

arXiv cs.LG · 2026-06-26 Cached

Introduces EVOM, an agentic meta-evolution framework using an LLM-based design agent to automatically discover high-performance actor-critic architectures for reinforcement learning, outperforming manual baselines and prior methods on continuous control tasks.

0 favorites 0 likes
#proximal-policy-optimization

ESPO: Early-Stopping Proximal Policy Optimization

Hugging Face Daily Papers · 2026-05-28 Cached

ESPO introduces an early-stopping mechanism for reinforcement learning that detects and terminates failed reasoning trajectories in LLMs, improving mathematical reasoning performance while reducing compute by over 20%.

0 favorites 0 likes
← Back to home

Submit Feedback