structure-aware-reward

Tag

Cards List
#structure-aware-reward

Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward

arXiv cs.AI · 2026-06-01 Cached

DecomposeR introduces a planner-centric reinforcement learning framework that represents research plans as typed DAGs, enabling finer-grained optimization of planning and execution for deep research tasks, achieving 5.1–8.0 point improvements over open baselines.

0 favorites 0 likes
← Back to home

Submit Feedback