标签
SPACE 通过从成功轨迹归纳两层参数化技能,将子技能边界作为动作块监督,训练长程 LLM Agent 自适应输出可变长原子动作序列;在 ALFWorld 和 ScienceWorld 上成功率提升 7.0%–31.3%,决策轮次最多降低 78.9%。
本文提出了一种名为ToSCA的两层层次化强化学习框架,用于会话智能体。该框架结合DQN和PPO,并采用双粒度奖励机制,以提升多轮对话中的策略判定和响应质量。
Rich Sutton 讨论了在人工智能研究中依赖一步预测的常见错误,并提倡使用选项和GVF的时间抽象模型。