Tag
This paper proposes a two-level hierarchical reinforcement learning framework called ToSCA for conversational agents, which uses DQN and PPO with a dual-granularity reward mechanism to improve strategy determination and response quality in multi-turn conversations.