multi-turn-agentic

标签

Cards List
#multi-turn-agentic

RTPO:用于稳定智能体强化学习训练的反序回合策略优化

arXiv cs.AI · 11小时前 缓存

论文提出了反序回合策略优化(RTPO)来稳定多轮智能体强化学习训练,通过将展开组织为反序树并按反序执行回合级更新,展示了相较于基线的改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈