Tag
The paper proposes belief-shift branching for tree-structured reinforcement learning to enhance step-level credit assignment, demonstrating improved performance in mathematical and coding benchmarks.