group-policy-optimization

Tag

Cards List
#group-policy-optimization

Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

arXiv cs.LG · 2026-07-28 Cached

Proposes Progress-conditioned Group Policy Optimization (ProGPO) to overcome credit assignment issues in long-horizon agentic tasks by using first-visit observation coverage when all group samples fail, improving performance on ALFWorld and WebShop.

0 favorites 0 likes
#group-policy-optimization

Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning

arXiv cs.AI · 2026-07-07 Cached

ProGPO is a learned-critic-free method for step-level advantage estimation in group-based RL for LLM agents, using exact-prefix action comparisons and rollout-based state potentials to improve credit assignment on long-horizon tasks. Experiments on ALFWorld and WebShop with Qwen2.5 models show it outperforms existing agentic RL baselines.

0 favorites 0 likes
← Back to home

Submit Feedback