Tag
SPACE 通过从成功轨迹归纳两层参数化技能,将子技能边界作为动作块监督,训练长程 LLM Agent 自适应输出可变长原子动作序列;在 ALFWorld 和 ScienceWorld 上成功率提升 7.0%–31.3%,决策轮次最多降低 78.9%。
This paper proposes a two-level hierarchical reinforcement learning framework called ToSCA for conversational agents, which uses DQN and PPO with a dual-granularity reward mechanism to improve strategy determination and response quality in multi-turn conversations.
Rich Sutton discusses the common mistake of relying on one-step predictions in AI research, advocating for temporally abstract models using options and GVFs.