rl-optimization

Tag

Cards List
#rl-optimization

SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

arXiv cs.AI ↗ · 20h ago Cached

SLCA-GRPO introduces Segment-Locked Credit Assignment to improve reinforcement learning for tool-calling agents by decoupling advantage estimation and using hierarchical rewards, leading to faster convergence and higher accuracy.

0 favorites 0 likes
← Back to home

Submit Feedback