hierarchical-policy-optimization

Tag

Cards List
#hierarchical-policy-optimization

AdaSR: Adaptive Streaming Reasoning with Hierarchical Relative Policy Optimization

arXiv cs.CL · 2026-06-15 Cached

Proposes AdaSR, a framework enabling reasoning models to process streaming inputs adaptively, and HRPO, a hierarchical reinforcement learning method to optimize thinking allocation for accuracy-efficiency trade-offs.

0 favorites 0 likes
← Back to home

Submit Feedback